Các trợ lý AI ngày nay đang làm được nhiều việc hơn rất nhiều so với việc trả lời câu hỏi. Với Gemini, Google liên tục mở rộng khả năng của công cụ này bằng cách kết nối AI với các dịch vụ và công nghệ trong hệ sinh thái của hãng.
Tùy thiết bị, tài khoản, gói dịch vụ và khu vực, người dùng có thể trải nghiệm nhiều tính năng khác nhau. Dưới đây là 5 khả năng đáng chú ý của Gemini.
Tạo một bài hát từ ý tưởng
Bạn có một ý tưởng thú vị nhưng không biết sáng tác nhạc? Các công nghệ tạo nhạc AI của Google đang giúp rút ngắn đáng kể khoảng cách từ một câu mô tả đến sản phẩm âm thanh.
Người dùng có thể đưa ra chủ đề, phong cách hoặc cảm xúc mong muốn để AI tạo nội dung âm nhạc tương ứng. Hình ảnh, video hay một câu chuyện cũng có thể trở thành chất liệu để phát triển ý tưởng.

Chẳng hạn, từ yêu cầu về một ca khúc pop vui nhộn kể lại tuần đầu tiên của năm học, AI có thể phát triển thành sản phẩm âm thanh thay vì chỉ dừng ở việc gợi ý lời bài hát.
Tuy nhiên, khả năng sử dụng các công cụ tạo nhạc có thể khác nhau tùy tài khoản và khu vực.
“Lục” Google Photos bằng câu lệnh
Nếu Google Photos chứa hàng nghìn bức ảnh, việc tìm lại chính xác một khoảnh khắc từ vài năm trước đôi khi chẳng khác nào... mò kim đáy bể.
Khi được kết nối và cấp quyền phù hợp, Gemini có thể hỗ trợ tìm kiếm ảnh dựa trên người, địa điểm, đồ vật hoặc bối cảnh. Thay vì nhớ chính xác ngày chụp, người dùng có thể mô tả bức ảnh mình muốn tìm.
Gemini còn có khả năng trả lời một số câu hỏi dựa trên nội dung xuất hiện trong thư viện ảnh. Điều này giúp việc tìm lại những kỷ niệm cũ trở nên tự nhiên hơn so với cách tìm kiếm bằng từ khóa truyền thống.
Đổi lại, đây cũng là tính năng cần được sử dụng thận trọng. Kho ảnh cá nhân có thể chứa nhiều thông tin riêng tư, vì vậy người dùng nên kiểm tra kỹ những quyền truy cập mình cấp cho AI.
Biến tài liệu thành nội dung giống podcast
Một tài liệu dài hàng chục trang có thể khiến nhiều người... ngại ngay từ lúc nhìn thấy. Với tính năng Audio Overview, nội dung có thể được chuyển thành cuộc trao đổi bằng giọng nói giữa các nhân vật AI.
Thay vì đọc nguyên văn từng đoạn, AI có thể trao đổi và giải thích những nội dung nổi bật theo phong cách gần giống một chương trình podcast.

Tính năng này có thể hữu ích với tài liệu học tập, báo cáo nghiên cứu hoặc những nội dung dài cần nắm nhanh ý chính. Người dùng có thêm lựa chọn nghe nội dung khi đang di chuyển hoặc không thuận tiện nhìn màn hình.
Dù vậy, với tài liệu quan trọng, Audio Overview nên được xem là công cụ hỗ trợ tiếp cận nội dung chứ không thay thế hoàn toàn việc đọc và kiểm tra nguồn gốc.
Tạo phiên bản kỹ thuật số của chính mình
Một hướng phát triển đáng chú ý khác của AI tạo sinh là khả năng sử dụng đặc điểm khuôn mặt và giọng nói để xây dựng avatar kỹ thuật số.
Người dùng có thể ghi hình khuôn mặt, chuyển động và giọng nói theo hướng dẫn để hệ thống tạo dữ liệu phục vụ việc xây dựng nhân vật AI. Phiên bản kỹ thuật số này sau đó có thể được sử dụng trong một số nội dung sáng tạo.
Nghe khá giống một phiên bản của chính mình bước vào thế giới số, nhưng tính năng này cũng đòi hỏi người dùng đặc biệt chú ý đến quyền riêng tư. Khuôn mặt và giọng nói đều là những dữ liệu cá nhân quan trọng, vì vậy cần tìm hiểu rõ cách dữ liệu được thu thập, sử dụng và quản lý trước khi trải nghiệm.
Tìm nhanh thông tin trong video YouTube
Một video dài 30 phút nhưng bạn chỉ cần tìm đúng vài phút hướng dẫn quan trọng? Việc Gemini kết nối với YouTube có thể giúp giải quyết tình huống này.
Người dùng có thể đưa liên kết một video YouTube công khai và yêu cầu AI tóm tắt nội dung, tìm một thông tin cụ thể hoặc liệt kê các bước được người nói hướng dẫn.
Ví dụ, với một video hướng dẫn sử dụng thiết bị, thay vì xem lại toàn bộ, người dùng có thể hỏi AI những cài đặt nào được người trình bày khuyến nghị hoặc yêu cầu tổng hợp các bước xử lý một lỗi cụ thể.
Khả năng này đặc biệt hữu ích với video học tập, hướng dẫn hoặc những nội dung dài. Tuy nhiên, kết quả AI đưa ra vẫn nên được đối chiếu với video gốc nếu thông tin có tính quan trọng.
AI ngày càng vượt khỏi ô chat
Những tính năng trên cho thấy trợ lý AI đang dần vượt ra khỏi mô hình quen thuộc là “đặt câu hỏi - nhận câu trả lời”. AI có thể kết nối với ảnh, video, tài liệu, âm thanh và nhiều loại dữ liệu khác để hỗ trợ người dùng trong học tập, sáng tạo và giải trí.
Càng nhiều khả năng đồng nghĩa AI càng có thể tiếp cận nhiều dữ liệu cá nhân hơn. Vì vậy, bên cạnh việc khám phá những tính năng mới, người dùng cũng cần chú ý đến quyền truy cập, thông tin riêng tư và kiểm chứng nội dung do AI tạo ra.









