ElevenLabs là gì? ElevenLabs là nền tảng AI âm thanh chuyển văn bản thành giọng nói tự nhiên, nhân bản giọng, lồng tiếng video, chuyển giọng nói thành văn bản, tạo nhạc và xây dựng trợ lý hội thoại bằng giọng nói. Công ty được thành lập năm 2022 và hiện hỗ trợ hơn 70 ngôn ngữ, trong đó có tiếng Việt.
Với người làm nội dung, ElevenLabs rút ngắn đáng kể thời gian thu âm: một kịch bản video, một bài blog hay một bài giảng có thể thành file âm thanh chỉ sau vài phút. Với doanh nghiệp, đây còn là hạ tầng để dựng tổng đài AI và sản phẩm có giao diện giọng nói.
Bài viết này TOS tổng hợp từ tài liệu chính thức của hãng, tính đến tháng 9/2026: các model đang dùng, bảng giá từng gói, cách bắt đầu, những điều cần lưu ý và góc nhìn riêng cho thị trường Việt Nam. Nếu bạn đang tìm thêm lựa chọn khác, hãy xem danh sách công cụ AI mà TOS đã tổng hợp.

ElevenLabs là gì và do ai phát triển?
ElevenLabs là công ty nghiên cứu và sản phẩm AI về âm thanh, do Mati Staniszewski và Piotr Dabkowski sáng lập năm 2022. Sản phẩm đầu tiên là công cụ chuyển văn bản thành giọng nói (Text to Speech), sau đó mở rộng sang nhân bản giọng, lồng tiếng, nhận dạng giọng nói, hiệu ứng âm thanh, âm nhạc và trợ lý hội thoại.
Ngày 4/2/2026, hãng công bố vòng gọi vốn Series D trị giá 500 triệu USD do Sequoia Capital dẫn dắt, định giá công ty ở mức 11 tỷ USD. Cũng theo thông báo này, doanh thu định kỳ hằng năm của ElevenLabs đã vượt 330 triệu USD khi khép lại năm 2025.
Hiện hãng chia sản phẩm thành ba nhóm: ElevenCreative dành cho nhà sáng tạo và marketer, ElevenAgents dành cho doanh nghiệp xây trợ lý hội thoại, và ElevenAPI dành cho lập trình viên tích hợp giọng nói vào ứng dụng riêng.
ElevenLabs hoạt động như thế nào?
Lõi của ElevenLabs là các mô hình học sâu được huấn luyện trên dữ liệu giọng nói, có khả năng đọc ngữ cảnh để quyết định ngữ điệu, nhịp nghỉ và cảm xúc. Bạn nhập văn bản, chọn giọng và model, hệ thống trả về file âm thanh. Theo tài liệu model chính thức, các model đọc văn bản đang được hỗ trợ gồm:
| Model | Số ngôn ngữ | Điểm đáng chú ý | Tiếng Việt |
|---|---|---|---|
| Eleven v3 | 70+ | Biểu cảm nhất, hỗ trợ audio tag và hội thoại nhiều nhân vật; tối đa 5.000 ký tự mỗi lần | Có |
| Eleven v3 Conversational | 70+ | Độ trễ khoảng 280 ms, dành cho ứng dụng thời gian thực | Có |
| Eleven Flash v2.5 | 32 | Độ trễ khoảng 75 ms, tối đa 40.000 ký tự, giá mỗi ký tự thấp hơn 50% | Có |
| Eleven Multilingual v2 | 29 | Ổn định nhất với nội dung dài, tối đa 10.000 ký tự | Không có trong danh sách |
Điểm làm Eleven v3 khác biệt là audio tag: bạn chèn các thẻ như [laughs], [whispers] hay [excited] vào kịch bản để điều khiển cảm xúc của giọng đọc. Hai dòng Turbo v2 và Turbo v2.5 đã được hãng đánh dấu ngừng phát triển, nên dự án mới không nên chọn hai model này.
Các tính năng nổi bật của ElevenLabs
Text to Speech và thư viện giọng đọc
Ngoài giọng mặc định, thư viện Voice Library có hơn 3.000 giọng do cộng đồng chia sẻ. Bạn cũng có thể dùng Voice Design để mô tả bằng lời một giọng chưa từng tồn tại, ví dụ giọng nữ trung niên ấm áp. File xuất hỗ trợ MP3, PCM, Opus và một số định dạng dành cho tổng đài.
Voice Cloning: Instant và Professional
Instant Voice Cloning tạo bản sao giọng gần như tức thì từ 1–2 phút ghi âm sạch, có từ gói Starter. Professional Voice Cloning cần 30–180 phút ghi âm, thời gian tinh chỉnh thường mất 3–6 giờ, yêu cầu gói Creator trở lên và buộc bạn đọc câu xác minh để chứng minh đó là giọng của chính mình.
Cần lưu ý: Theo tài liệu của hãng, bản sao Professional hiện chưa được tối ưu hoàn toàn cho Eleven v3. Nếu muốn dùng v3 với giọng riêng, bạn nên thử bản sao Instant hoặc giọng tạo bằng Voice Design trước.
Dubbing: lồng tiếng video đa ngôn ngữ
Dubbing dịch và lồng tiếng video sang ngôn ngữ khác trong khi vẫn giữ chất giọng của người nói gốc. Hệ thống tự tách tối đa 32 người nói trong một file, có hỗ trợ tiếng Việt. Trong ứng dụng, mỗi file tải lên tối đa 1 GB và 180 phút. Đây là cách nhanh để đưa video tiếng Việt ra thị trường quốc tế.
Scribe: chuyển giọng nói thành văn bản
Scribe v2 là model nhận dạng giọng nói hiện hành với hơn 90 ngôn ngữ. Tiếng Việt được hãng xếp vào nhóm độ chính xác cao nhất, với tỷ lệ lỗi từ không quá 5%. Scribe phân biệt tối đa 32 người nói, gắn mốc thời gian từng từ, nhận file đến 3 GB hoặc 10 giờ. Bản Realtime có độ trễ khoảng 150 ms.
ElevenAgents: trợ lý hội thoại bằng giọng nói
ElevenAgents (trước đây gọi là Conversational AI) ghép bốn thành phần: nhận dạng giọng nói, mô hình ngôn ngữ do bạn chọn, giọng đọc độ trễ thấp và một model riêng xử lý lượt lời để cuộc trò chuyện liền mạch.
Trợ lý có thể tra cứu tài liệu nội bộ, gọi API bên ngoài và triển khai trên web, ứng dụng di động hoặc tổng đài điện thoại.
Eleven Music, hiệu ứng âm thanh và Voice Changer
Eleven Music tạo bản nhạc từ mô tả bằng chữ, độ dài từ 3 giây đến 5 phút, model mới nhất là Music v2.5. Hãng cho biết nhạc tạo ra dùng được cho hầu hết mục đích thương mại, tuỳ theo gói.
Bên cạnh đó còn có Sound Effects tạo hiệu ứng âm thanh và Voice Changer đổi giọng mà vẫn giữ cảm xúc, tiếng cười, tiếng thì thầm của bản thu gốc.

Bảng giá ElevenLabs tính đến tháng 9/2026
ElevenLabs tính phí theo credit. Với Text to Speech, thông thường 1 ký tự tốn 1 credit; các model Flash tốn từ 0,5 đến 1 credit mỗi ký tự. Bảng dưới đây lấy từ trang giá chính thức, phần quy đổi tạm tính theo tỷ giá khoảng 26.000 đồng/USD.
| Gói | Giá/tháng | Credit/tháng | Điểm chính |
|---|---|---|---|
| Free | 0 USD | 10.000 | Text to Speech, Scribe, hiệu ứng âm thanh, Voice Design, Music; 3 dự án Studio; không có giấy phép thương mại |
| Starter | 6 USD (khoảng 156.000 đồng) | 30.000 | Giấy phép thương mại, Instant Voice Cloning, Dubbing Studio, 20 dự án Studio |
| Creator | 22 USD (khoảng 572.000 đồng) | 121.000 | Thêm Professional Voice Cloning; tháng đầu đang giảm 50% còn 11 USD |
| Pro | 99 USD (khoảng 2,6 triệu đồng) | 600.000 | Âm thanh 192 kbps, xuất PCM 44,1 kHz qua API |
| Scale | 299 USD (khoảng 7,8 triệu đồng) | 1,8 triệu | 3 chỗ ngồi làm việc nhóm, 3 bản sao Professional |
| Business | 990 USD (khoảng 25,7 triệu đồng) | 6 triệu | 10 chỗ ngồi, 10 bản sao Professional, TTS độ trễ thấp từ 5 cent/phút |
| Enterprise | Liên hệ | Tuỳ chỉnh | SSO, cam kết SLA, thoả thuận xử lý dữ liệu riêng |
Hai chi tiết giúp bạn tính toán chi phí: thanh toán theo năm chỉ phải trả 10 tháng, và credit chưa dùng được cộng dồn tối đa hai tháng, không vượt quá hai lần hạn mức của gói. Giá và ưu đãi có thể thay đổi, bạn nên kiểm tra lại trang giá trước khi đăng ký.
Để dễ hình dung, tài liệu của hãng ước tính 5.000 ký tự tương đương khoảng 5 phút âm thanh. Như vậy gói Free đủ cho chừng 10 phút mỗi tháng với model tiêu chuẩn, còn gói Creator vào khoảng hai giờ. Dùng Flash v2.5, con số này có thể cao hơn vì mỗi ký tự tốn ít credit hơn.
Nội dung âm thanh và video của bạn đã được AI nhắc đến chưa? TOS giúp doanh nghiệp đo lường và tối ưu mức độ hiện diện trên ChatGPT, Gemini, Perplexity và Google AI Mode.
Hướng dẫn bắt đầu dùng ElevenLabs
Bạn có thể tạo file giọng đọc tiếng Việt đầu tiên trong khoảng mười phút theo các bước sau:
- Tạo tài khoản tại elevenlabs.io và bắt đầu với gói Free để thử chất lượng giọng trước khi trả phí.
- Mở Text to Speech, chọn model Eleven v3 hoặc Flash v2.5. Đây là hai dòng có tiếng Việt trong danh sách ngôn ngữ; Multilingual v2 thì không.
- Chọn giọng trong Voice Library. Hãy lọc theo ngôn ngữ và nghe thử vài giọng với cùng một đoạn văn để so sánh.
- Dán kịch bản, viết số và từ viết tắt thành chữ đầy đủ, ngắt câu rõ ràng. Với v3, thêm audio tag ở những chỗ cần cảm xúc.
- Tạo và nghe lại. Nếu ngữ điệu chưa ổn, chỉnh mức Stability (Creative, Natural hoặc Robust) rồi tạo lại đoạn đó thay vì cả bài.
- Tải file và nâng lên gói Starter trở lên nếu nội dung phục vụ mục đích thương mại.
Mẹo nhỏ: chất lượng đầu ra phụ thuộc nhiều vào kịch bản. Bạn có thể dùng chatbot để viết lại bài blog thành văn nói trước khi đưa vào ElevenLabs; bộ prompt ChatGPT cho marketing và SEO của TOS có sẵn nhiều mẫu để tham khảo.
Ưu điểm và những điều cần lưu ý
Ưu điểm
- Giọng đọc giàu cảm xúc, điều khiển được bằng audio tag thay vì phải chỉnh thông số kỹ thuật.
- Một tài khoản bao trọn chuỗi âm thanh: đọc, nhân bản giọng, lồng tiếng, phiên âm, nhạc và hiệu ứng.
- Có gói Free để thử và gói trả phí khởi điểm 6 USD/tháng, phù hợp cá nhân và nhóm nhỏ.
- API và ElevenAgents cho phép mở rộng từ sản xuất nội dung sang sản phẩm, tổng đài.
Điều cần lưu ý
- Gói Free không kèm giấy phép thương mại, vì vậy video quảng cáo hay kênh có bật kiếm tiền cần gói trả phí.
- Tiếng Việt không có ở mọi model. Nếu chọn nhầm Multilingual v2, kết quả đọc tiếng Việt sẽ không như mong đợi.
- Eleven v3 giới hạn 5.000 ký tự mỗi lần tạo, nên nội dung dài cần chia đoạn hoặc dùng Studio.
- Hạn mức credit của gói được dùng cho nhiều tính năng, do đó lồng tiếng hay tạo nhạc thường xuyên sẽ làm credit hết nhanh hơn dự tính.
Về an toàn, chính sách của ElevenLabs chặn việc nhân bản giọng người nổi tiếng và các giọng rủi ro cao, có khả năng truy vết nội dung về tài khoản đã tạo ra nó, áp dụng chuẩn C2PA và cung cấp công cụ kiểm tra một đoạn âm thanh có phải do ElevenLabs tạo hay không.
So sánh ElevenLabs với các lựa chọn khác
Bảng dưới đây chỉ nêu những điểm TOS đã đối chiếu trên tài liệu chính thức của từng hãng. Giá của ba dịch vụ còn lại thay đổi theo cách tính riêng, bạn nên xem trực tiếp trang giá của họ.
| Tiêu chí | ElevenLabs | OpenAI TTS | Google Cloud TTS | Vbee AIVoice |
|---|---|---|---|---|
| Hình thức | Ứng dụng web và API | Chỉ API | Chỉ API trên Google Cloud | Ứng dụng web và API |
| Tiếng Việt | Có ở v3 và Flash v2.5 | Có trong danh sách ngôn ngữ của gpt-4o-mini-tts | Có mã vi-VN ở dòng Chirp 3 HD | Trọng tâm, có giọng ba miền Bắc, Trung, Nam |
| Giọng riêng | Instant và Professional Voice Cloning | Custom voice, cần bản ghi đồng ý của người nói | Có sản phẩm Instant Custom Voice riêng | Có nhân bản giọng |
| Phù hợp với | Nhà sáng tạo, marketer, đội sản phẩm cần giọng biểu cảm | Lập trình viên đã dùng hệ sinh thái OpenAI | Doanh nghiệp đã chạy hạ tầng Google Cloud | Đơn vị ưu tiên giọng vùng miền và hỗ trợ trong nước |
Một điểm đáng chú ý ở OpenAI TTS là chính sách yêu cầu thông báo rõ cho người nghe rằng giọng đọc do AI tạo ra. Còn Vbee, doanh nghiệp có trụ sở tại Hà Nội, là lựa chọn nên cân nhắc khi bạn cần giọng địa phương đặc trưng hoặc hợp đồng, hoá đơn trong nước.
ElevenLabs tại thị trường Việt Nam — góc nhìn TOS
Hỗ trợ tiếng Việt. Tiếng Việt có mặt ở cả ba mảng quan trọng: đọc (Eleven v3, Flash v2.5), phiên âm (Scribe v2 với tỷ lệ lỗi từ không quá 5%) và lồng tiếng. Tuy vậy, tên riêng, từ mượn tiếng Anh và số liệu vẫn nên được nghe kiểm tra trước khi xuất bản, vì đây là những chỗ giọng AI dễ đọc chệch.
Thanh toán. Giá niêm yết bằng USD và thanh toán trực tuyến, nên bạn cần chuẩn bị phương thức thanh toán quốc tế. Doanh nghiệp cần chứng từ kế toán nên trao đổi trước với bộ phận tài chính, hoặc liên hệ đội kinh doanh của hãng khi dùng từ gói Business trở lên.

Ứng dụng thực tế cho marketer và người làm SEO. TOS thấy ba hướng mang lại giá trị rõ nhất cho doanh nghiệp Việt:
- Tái sử dụng nội dung: biến bài blog trụ cột thành bản audio hoặc video ngắn có giọng đọc, mở thêm điểm chạm trên YouTube, TikTok và podcast.
- Biến âm thanh thành văn bản: dùng Scribe phiên âm webinar, phỏng vấn chuyên gia, video sản phẩm rồi biên tập thành bài viết. Văn bản là thứ công cụ tìm kiếm và mô hình AI đọc được dễ nhất.
- Bản địa hoá hai chiều: lồng tiếng video tiếng Việt sang tiếng Anh cho thị trường xuất khẩu, hoặc đưa tài liệu đào tạo nước ngoài về tiếng Việt.
Hướng thứ hai gắn trực tiếp với GEO. Khi kiến thức chuyên môn của doanh nghiệp chỉ nằm trong video và buổi nói chuyện, các trợ lý AI gần như không có gì để trích dẫn. Phiên âm, biên tập và xuất bản thành nội dung có cấu trúc là bước nền để cải thiện AI Share of Voice của thương hiệu.
Dù vậy, giọng AI chỉ là lớp trình bày. Nội dung vẫn cần chuyên môn thật, ví dụ thật và người chịu trách nhiệm biên tập, đúng với nguyên tắc TOS áp dụng khi triển khai AI SEO. Sản xuất hàng loạt audio từ văn bản sơ sài không giúp thương hiệu đáng tin hơn trong mắt người nghe lẫn công cụ tìm kiếm.
Cần lưu ý: Giọng nói là dữ liệu gắn với một con người cụ thể. Trước khi nhân bản giọng của nhân viên, diễn giả hay KOL, doanh nghiệp nên có văn bản đồng ý nêu rõ phạm vi và thời hạn sử dụng, đồng thời rà soát quy định về bảo vệ dữ liệu cá nhân tại Việt Nam.
Câu hỏi thường gặp về ElevenLabs
ElevenLabs có miễn phí không?
Có. Gói Free cấp 10.000 credit mỗi tháng, đủ cho khoảng 10 phút giọng đọc với model tiêu chuẩn, kèm Scribe, hiệu ứng âm thanh, Voice Design, Music và 3 dự án Studio. Gói này không bao gồm giấy phép thương mại, nên chỉ phù hợp để thử nghiệm hoặc dùng cho mục đích cá nhân.
ElevenLabs có đọc được tiếng Việt không?
Có. Theo tài liệu chính thức tính đến tháng 9/2026, tiếng Việt nằm trong danh sách ngôn ngữ của Eleven v3, Eleven v3 Conversational và Flash v2.5. Model Multilingual v2 không liệt kê tiếng Việt. Ngoài ra, Scribe v2 nhận dạng tiếng Việt ở nhóm chính xác cao nhất và Dubbing cũng hỗ trợ tiếng Việt.
Dùng giọng ElevenLabs cho video kiếm tiền được không?
Được, với điều kiện bạn dùng gói trả phí. Giấy phép thương mại có từ gói Starter 6 USD/tháng trở lên. Nội dung tạo bằng gói Free không kèm quyền này. Bạn cũng cần tuân thủ chính sách của nền tảng đăng tải, chẳng hạn quy định gắn nhãn nội dung do AI tạo nếu nền tảng yêu cầu.
Instant và Professional Voice Cloning khác nhau thế nào?
Instant chỉ cần 1–2 phút ghi âm và có kết quả gần như ngay, phù hợp thử nghiệm nhanh. Professional cần 30–180 phút ghi âm, mất khoảng 3–6 giờ tinh chỉnh, yêu cầu gói Creator trở lên cùng bước xác minh giọng, đổi lại bản sao sát với giọng gốc hơn, nhất là với chất giọng đặc trưng.
Credit của ElevenLabs được tính ra sao?
Với Text to Speech, thông thường mỗi ký tự tốn 1 credit, riêng các model Flash tốn từ 0,5 đến 1 credit. Các tính năng khác như lồng tiếng hay tạo nhạc có mức quy đổi riêng, được nêu trên trang giá. Credit chưa dùng được cộng dồn tối đa hai tháng, không vượt quá hai lần hạn mức gói.
ElevenLabs có an toàn không, có bị lạm dụng để giả giọng?
Hãng áp dụng nhiều lớp bảo vệ: chặn nhân bản giọng người nổi tiếng, yêu cầu xác minh khi tạo bản sao Professional, kiểm duyệt bằng AI lẫn con người, truy vết nội dung về tài khoản tạo ra. Người dùng vẫn cần tự bảo đảm có sự đồng ý của chủ giọng nói.
Kết luận
ElevenLabs đã đi từ một công cụ đọc văn bản thành nền tảng âm thanh AI khá đầy đủ, và tiếng Việt đã có ở những model quan trọng nhất. Cá nhân có thể bắt đầu với gói Free hoặc Starter. Với doanh nghiệp, giá trị nằm ở việc gắn giọng nói vào quy trình nội dung và chăm sóc khách hàng có kiểm soát.
Khi nội dung của bạn xuất hiện ở nhiều định dạng hơn, câu hỏi tiếp theo là các trợ lý AI và công cụ tìm kiếm AI có đang nhắc đến thương hiệu hay không. Đó là phần việc TOS có thể đồng hành cùng bạn.
Thương hiệu của bạn có xuất hiện khi khách hàng hỏi AI? TOS giúp doanh nghiệp đo lường và tối ưu mức độ hiện diện trên ChatGPT, Gemini, Perplexity và Google AI Mode.
Nhận bài SEO & AI mới mỗi ngày
Chắt lọc, thực chiến, không spam. Nhận bài mới cùng hàng nghìn marketer đọc TOS mỗi ngày.