Gemini 3.5 Transcribe là model chuyển giọng nói thành văn bản (speech-to-text) mới nhất của Google, ra mắt bản public preview trong Gemini API ngày 26/8/2026, tự động nhận và tách hơn 85 ngôn ngữ với tỷ lệ lỗi từ (WER) chỉ 2,6% trên file ghi âm sẵn.
Thay vì trả ra một chuỗi chữ thô, Gemini 3.5 Transcribe biến âm thanh trực tiếp thành văn bản đã làm sạch, bỏ từ đệm và định dạng gọn gàng. Nhờ đó model phù hợp cho biên bản họp, phụ đề, trợ lý giọng nói và mọi luồng làm việc cần chữ chính xác từ tiếng nói.

Gemini 3.5 Transcribe là gì
Gemini 3.5 Transcribe là một họ endpoint chuyên biệt cho tác vụ nhận dạng tiếng nói, được Google tách riêng khỏi các model Gemini đa năng. Google mô tả đây là model speech-to-text chính xác nhất của hãng tính đến thời điểm ra mắt.
Điểm khác biệt cốt lõi nằm ở cách xử lý. Các hệ nhận dạng tiếng nói truyền thống thường vấp khi gặp tạp âm nền, thuật ngữ chuyên ngành hay câu nói vấp váp.
Model chuyển âm thanh thô thẳng thành văn bản đã định dạng, xử lý được cả tình huống người nói tự sửa lời như “gặp nhau thứ Ba, à không, thứ Tư”.
Model tự động loại bỏ các từ đệm “à”, “ừm”, “ờ” ở kết quả cuối và tự chấm câu, viết hoa hợp lý. Nhờ đó bản chép ra gần với văn bản hoàn chỉnh hơn là một chuỗi ghi âm thô cần biên tập lại nhiều.
Theo Google, model đạt WER 2,6% ở chế độ xử lý file ghi âm sẵn và 4,0% ở chế độ streaming thời gian thực, đo bởi Artificial Analysis trên nhiều điều kiện thực tế gồm cả tạp âm nền. Cùng đơn vị này ghi nhận thời gian ra bản chép cuối cải thiện khoảng 70% so với model Chirp 3 trước đó.

Tính năng nổi bật của Gemini 3.5 Transcribe
Model gói nhiều khả năng vốn phải ghép từ nhiều công cụ rời vào chung một API. Dưới đây là những tính năng đáng chú ý nhất tính đến 31/8/2026, theo tài liệu chính thức của Google.
- Đa ngôn ngữ tự động: nhận và tách hơn 85 ngôn ngữ mà không cần khai báo trước, gồm nhiều biến thể tiếng Anh, tiếng Trung phổ thông, Tây Ban Nha, Ả Rập, Hindi.
- Phân biệt người nói (diarization): ở chế độ file, model gán lời cho tối đa 8 người nói khác nhau, hữu ích cho biên bản họp và ghi âm phỏng vấn.
- Dấu thời gian theo từ: mỗi từ có mốc thời gian riêng, thuận tiện làm phụ đề và tra cứu đoạn âm thanh.
- Từ vựng riêng: nạp tối đa 1.000 thuật ngữ tùy chỉnh (tên riêng, tên sản phẩm, từ chuyên ngành) để model chép đúng.
- Làm sạch văn bản: tự bỏ từ đệm, xử lý câu tự sửa và định dạng đầu ra thành văn bản gọn.
Trên FLEURS, một bộ đánh giá đa ngôn ngữ phổ biến, Google báo cáo WER 5,04% ở chế độ non-streaming và 5,50% ở chế độ streaming.
Các con số này cao hơn mức 2,6%/4,0% ở điều kiện tổng hợp, cho thấy độ khó khác nhau giữa các tập kiểm thử. Vì vậy khi đánh giá cho tiếng Việt, bạn nên tự đo trên dữ liệu thật của mình.
Cách dùng Gemini 3.5 Transcribe: hai endpoint và bảng giá
Model này không phải một endpoint duy nhất mà là một cặp, phục vụ hai kiểu bài toán khác nhau. Chọn đúng endpoint quyết định cả tính năng bạn có lẫn chi phí phải trả.
Endpoint file (gemini-3.5-transcribe): gọi qua Interactions API, dành cho âm thanh ghi sẵn như file họp, log cuộc gọi. Hỗ trợ tối đa 1 giờ audio mỗi lần, rút còn 30 phút khi bật diarization hoặc dấu thời gian. Đây là nơi có phân biệt người nói và mốc thời gian theo từ.
Endpoint live (gemini-3.5-transcribe-live): gọi qua Live API, streaming hai chiều liên tục với độ trễ dưới một giây, mỗi phiên tối đa 10 phút. Phù hợp cho trợ lý giọng nói và phụ đề trực tiếp, nhưng không hỗ trợ diarization.
| Tiêu chí | gemini-3.5-transcribe (file) | gemini-3.5-transcribe-live |
|---|---|---|
| API gọi qua | Interactions API | Live API (WebSocket) |
| Giới hạn | Tối đa 1 giờ/lần (30 phút nếu bật diarization) | 10 phút mỗi phiên |
| Phân biệt người nói | Có, tối đa 8 người | Không |
| Dấu thời gian theo từ | Có | Không |
| Từ vựng riêng | Tối đa 1.000 thuật ngữ | Tối đa 1.000 thuật ngữ |
| Giá blended (ước tính) | ~0,005 USD/phút audio | ~0,009 USD/phút audio |
Về chi tiết giá, trang pricing của Gemini API tách input và output. Bản file tính khoảng 0,003 USD/phút audio đầu vào cộng 0,002 USD/phút chữ đầu ra, tương đương mức blended ~0,005 USD/phút.
Bản live tính khoảng 0,005 USD/phút đầu vào cộng 0,004 USD/phút đầu ra, tương đương ~0,009 USD/phút. Đây là ước tính dựa trên giả định số token của Google nên chi phí thật sẽ dao động theo độ dài lời nói.
Vì sao Gemini 3.5 Transcribe quan trọng với người làm nội dung
Với đội marketing và SEO, giọng nói là kho nội dung chưa khai thác hết: podcast, webinar, video, cuộc gọi bán hàng, phỏng vấn khách hàng. Một model chép chính xác, đa ngôn ngữ và rẻ giúp biến kho âm thanh đó thành văn bản có thể tìm kiếm, cắt ghép và tái sử dụng.
Bản chép sạch còn là nguyên liệu tốt cho SEO và GEO. Từ một video, bạn có thể dựng transcript làm phụ đề, viết lại thành bài blog, trích câu hỏi cho FAQ, hoặc tạo dữ liệu có cấu trúc để AI dễ trích dẫn thương hiệu. WER thấp nghĩa là ít công biên tập tay hơn cho mỗi phút âm thanh.
Vì model tự bỏ từ đệm và định dạng sẵn, khoảng cách từ “file ghi âm” đến “bản nháp đăng được” ngắn lại rõ. Đây là điểm khiến công cụ này đáng thử cho quy trình sản xuất nội dung quy mô lớn.
Thương hiệu của bạn có xuất hiện khi khách hàng hỏi AI? Kiểm tra miễn phí mức độ hiển thị trên ChatGPT, Gemini và Perplexity chỉ trong vài phút.

Ứng dụng Gemini 3.5 Transcribe cho marketing và SEO
Dưới đây là những cách dùng thực tế mà đội nội dung có thể triển khai ngay khi tích hợp Gemini 3.5 Transcribe vào quy trình.
- Repurpose video và podcast: chép toàn bộ tập, rồi cắt thành bài blog, bản tin email và caption mạng xã hội từ một nguồn duy nhất.
- Phụ đề đa ngôn ngữ: dùng dấu thời gian theo từ để dựng file phụ đề, mở rộng video sang thị trường nói ngôn ngữ khác.
- Biên bản họp và phỏng vấn: diarization tối đa 8 người giúp gán đúng ai nói gì, tiết kiệm giờ ghi chép thủ công.
- Voice agent và tổng đài: endpoint live cho phép chép realtime, làm nền cho chatbot giọng nói và phân tích cuộc gọi.
- Dữ liệu cho GEO: transcript làm giàu trang bằng câu hỏi, câu trả lời thật của khách, tăng cơ hội được AI trích dẫn.
Model đang được Google đưa dần vào nhiều sản phẩm quen thuộc: Gboard (tính năng Rambler), Gemini Live, Docs, Keep, Gmail, ứng dụng Gemini trên macOS và Google Antigravity; Chrome sẽ có sau. Điều này nghĩa là ngay cả khi chưa tự code, người dùng vẫn chạm tới công nghệ này qua các app hằng ngày.

Gemini 3.5 Transcribe tại thị trường Việt Nam — góc nhìn TOS
Ở Việt Nam, nhu cầu chép giọng nói song ngữ Việt – Anh đang tăng nhanh cùng làn sóng podcast, hội thảo và bán hàng qua video.
Gemini 3.5 Transcribe hỗ trợ hơn 85 ngôn ngữ, nhưng TOS luôn khuyến nghị đo WER trên chính dữ liệu tiếng Việt của bạn trước khi cam kết, vì giọng vùng miền và thuật ngữ ngành có thể khác xa tập benchmark tổng hợp.
Cách TOS triển khai là answer-first: lấy transcript làm nguyên liệu, xây entity thương hiệu và bộ câu hỏi thật, rồi đo mức hiển thị bằng AI Visibility Check theo từng giai đoạn GEO.
Một lưu ý thực chiến mà các bài định nghĩa thường bỏ qua: hãy nạp danh sách từ vựng riêng (tên thương hiệu, sản phẩm) ngay từ đầu để tránh sai chính tả tên riêng — thứ ảnh hưởng trực tiếp tới cách AI nhận diện thương hiệu bạn.
Câu hỏi thường gặp
Gemini 3.5 Transcribe có hỗ trợ tiếng Việt không?
Có. Model tự nhận và tách hơn 85 ngôn ngữ, trong đó có tiếng Việt. Tuy nhiên độ chính xác thực tế phụ thuộc chất lượng âm thanh và giọng vùng miền, nên bạn nên tự kiểm thử trên dữ liệu riêng.
Gemini 3.5 Transcribe giá bao nhiêu?
Tính đến 31/8/2026, bản file có giá blended ước tính khoảng 0,005 USD/phút audio, bản live khoảng 0,009 USD/phút. Con số cuối tùy độ dài lời nói và số token thực tế, nên hãy xem trang pricing chính thức để tính chi phí dự án.
Khác nhau giữa endpoint file và live là gì?
Endpoint file xử lý âm thanh ghi sẵn tới 1 giờ, có phân biệt người nói và dấu thời gian. Endpoint live chép thời gian thực với độ trễ dưới một giây, mỗi phiên 10 phút, nhưng không có diarization. Chọn theo bài toán realtime hay hậu kỳ.
Gemini 3.5 Transcribe chính xác đến đâu?
Google báo cáo WER 2,6% với file ghi sẵn và 4,0% với streaming ở điều kiện tổng hợp, đo bởi Artificial Analysis. Trên bộ FLEURS, con số là 5,04% và 5,50%. Đây là mức rất cạnh tranh nhưng vẫn nên đối chiếu với dữ liệu của bạn.
Có thể dùng Gemini 3.5 Transcribe ở đâu ngay bây giờ?
Nhà phát triển dùng bản public preview qua Gemini API, Google AI Studio và Google Antigravity. Người dùng cuối gặp công nghệ này trong Gboard Rambler, Gemini Live, Docs, ứng dụng Gemini trên macOS; Chrome sẽ được bổ sung sau.
Gemini 3.5 Transcribe có bỏ được từ đệm không?
Có. Model tự loại các từ đệm như “à”, “ừm”, xử lý câu tự sửa lời và định dạng lại văn bản, nên bản chép ra gần với văn bản hoàn chỉnh, giảm công biên tập thủ công.
Nguồn tham khảo
- Google — Intelligent transcription with Gemini 3.5 Transcribe (blog.google)
- Google AI for Developers — Gemini 3.5 Transcribe docs
- 9to5Google — Google launches Gemini 3.5 Transcribe
Tối ưu hiển thị thương hiệu trên AI cùng TOS
Model chép giọng nói như Gemini 3.5 Transcribe mở ra kho nội dung mới, nhưng để thương hiệu được AI nhắc tới đúng cách, bạn cần chiến lược GEO/AEO bài bản. TOS giúp bạn biến transcript, blog và dữ liệu thật thành lợi thế hiển thị trên ChatGPT, Gemini và Perplexity. Xem thêm về AI Visibility Check và các bài viết trong blog TOS.
Nhận tư vấn giải pháp GEO/AEO từ TOS
Nhận bài SEO & AI mới mỗi ngày
Chắt lọc, thực chiến, không spam. Nhận bài mới cùng hàng nghìn marketer đọc TOS mỗi ngày.