Model AI mở 2026 đang bước vào một làn sóng công bố dồn dập trong tháng 7: DeepSeek V4, Tencent HunYuan 3.0, Kimi K3, Qwen3.8-Max cho tới lời hẹn của Mistral. Nhưng với người làm nội dung, SEO và doanh nghiệp, câu hỏi cốt lõi không phải “model nào nhiều nghìn tỷ tham số nhất”, mà là cái nào thật sự tải và tự-host được ngay, cái nào mới chỉ là công bố, preview hay tuyên bố marketing. Bài viết phân loại rõ theo trạng thái trọng số (weights) và giấy phép, kèm góc nhìn chi phí token và ý nghĩa cho GEO. Số liệu tính đến 26/07/2026.
Làn sóng model AI mở 2026 gồm những gì?
Phần lớn các công bố dồn vào quanh sự kiện WAIC Thượng Hải giữa – cuối tháng 7/2026, với các phòng lab Trung Quốc (DeepSeek, Moonshot, Tencent, Alibaba) dẫn sóng, còn phương Tây có Mistral chuẩn bị đối trọng. Điểm chung là kiến trúc MoE (Mixture-of-Experts): tổng tham số rất lớn nhưng chỉ một phần nhỏ được kích hoạt cho mỗi token.
Với doanh nghiệp, ranh giới quan trọng nhất không nằm ở con số, mà ở mức độ “mở” thật sự: “mở weights” (tải được trọng số về tự chạy) khác với “mở nguồn hoàn toàn” (mở cả dữ liệu và mã huấn luyện), và một model “công bố” chưa chắc đã “tải được”. Vì thế bài viết chia làn sóng này thành hai nhóm: nhóm đã có trọng số công khai, và nhóm mới ở dạng công bố hoặc preview.
Nhóm ✅ tải được ngay: DeepSeek V4 và HunYuan 3.0
DeepSeek V4 — open-weight, giấy phép MIT
DeepSeek V4 là lựa chọn đáng tin nhất ở thời điểm này: trọng số đã công khai trên HuggingFace (deepseek-ai/DeepSeek-V4-Pro và bản -Flash) dưới giấy phép MIT — rất thoáng cho mục đích thương mại. Đây là model MoE với bản Pro 1.6T tổng / 49B active và bản Flash 284B tổng / 13B active, context khoảng 1 triệu token. Lưu ý model này chỉ xử lý văn bản (text-only), không đa phương thức.
Bản preview có từ 24/04/2026; bản chính thức cùng cơ chế giá API theo “giờ cao/thấp điểm” dự kiến ra giữa tháng 7/2026 (đến 26/07 chưa xác minh đã áp đúng lịch). Về hiệu năng, model card bản Base ghi các chỉ số đáng tin: MMLU 90.1, HumanEval 76.8, GSM8K 92.6. Nên tránh trích số của biến thể “V4-Pro-Max” vì bản này chưa phát hành, chưa kiểm chứng.
Tencent HunYuan 3.0 (Hy3) — Apache 2.0, mở hoàn toàn trọng số
HunYuan 3.0 phát hành bản đầy đủ ngày 06/07/2026, trọng số mở hoàn toàn trên HuggingFace (tencent/Hy3) và ModelScope, có cả bản FP8 và GGUF tiện cho tự-host. Đây là MoE 295B tổng / 21B active (“295B A21B”), 192 experts chọn top-8, context 256K, và cũng text-only. Giấy phép Apache 2.0 thoáng cho thương mại là điểm cộng lớn.
Về benchmark, các nguồn hiện chưa nhất quán nên chỉ nên đánh giá định tính rằng Hy3 “được xem là mạnh về code và tác vụ agent”, chứ không nên chốt con số cụ thể hay so “ngang GPT-5.5/Opus 4.8” như sự thật. Dù vậy, việc mở trọng số đầy đủ kèm bản lượng tử hóa khiến Hy3 là ứng viên tự-host thực tế ngay hôm nay.
Nhóm ⏳ mới công bố / preview: Kimi K3, Qwen3.8-Max, Mistral
Kimi K3 (Moonshot AI) — công bố rồi, weights hẹn 27/07
Kimi K3 được Moonshot AI công bố ngày 16–17/07/2026 và được nhiều nguồn uy tín (CNBC, Bloomberg, Forbes, TechCrunch, VentureBeat) đưa tin. Tuy nhiên, trọng số đầy đủ mới được hẹn phát hành 27/07/2026; đến 26/07 chưa có repo Kimi-K3 trên HuggingFace (mới nhất vẫn là Kimi-K2.7), nghĩa là chưa tự-host được. Thông số công bố: khoảng 2.8T tổng (TechCrunch dè dặt 2–3T), MoE 896 experts (active khoảng 50B nên đọc dè dặt), context 1M, có đầu vào đa phương thức.
Cần thận trọng với xếp hạng: các thứ hạng như “#2 Vals”, “#1 Frontend Code Arena” hay “vượt Claude Fable 5” đều là số liệu tiền phát hành hoặc tự công bố, chưa có kiểm chứng độc lập; chính hãng cũng thừa nhận vẫn kém các model top của Mỹ. Nhãn “model mở lớn nhất từ trước tới nay” nên hiểu là một tuyên bố marketing. Nếu muốn tìm hiểu sâu về dòng model này, bạn có thể xem thêm bài Kimi K3 là gì.
Alibaba Qwen3.8-Max — mới có bản preview qua API
Alibaba công bố Qwen3.8-Max-Preview ngày 19/07/2026 tại WAIC, nhưng hiện chưa mở weights, không có giấy phép, không model card và không benchmark chính thức — chỉ dùng được qua API. Các phát biểu như “2.4T tham số”, “chỉ sau Fable 5” hay “vượt Qwen3.7-Max” đều là tuyên bố của Alibaba trên mạng xã hội, chưa kiểm chứng; số active params không được công bố. Với doanh nghiệp cần tự-host, đây mới là bản preview để chờ open-weights.
Mistral — mới ở mức teaser
Về phía phương Tây, CEO Arthur Mensch đã teaser đầu tháng 7/2026 một dòng MoE “fat but sparse” (tổng lớn, active thấp), lớn hơn Mistral Large 3. Tuy nhiên chưa có tên, tham số, context, giấy phép, benchmark hay repo HuggingFace; mới chỉ ở dạng early access cho đối tác. Nói cách khác, đây là tín hiệu đối trọng đang được chuẩn bị chứ chưa phải sản phẩm có thể đánh giá.
Bảng so sánh nhanh các model AI mở 2026
Số liệu tính đến 26/07/2026. Ô chưa chắc chắn để “—”.
Model
Loại / hãng
Tổng / Active
Context
License
Weights (tải được?)
Ghi chú
DeepSeek V4-Pro
MoE / DeepSeek
1.6T / 49B
~1M
MIT
✅ Có (HuggingFace)
Text-only; bản chính thức & giá cao/thấp điểm dự kiến giữa T7/2026
DeepSeek V4-Flash
MoE / DeepSeek
284B / 13B
~1M
MIT
✅ Có (HuggingFace)
Text-only; bản nhẹ, chi phí thấp hơn
HunYuan 3.0 (Hy3)
MoE / Tencent
295B / 21B
256K
Apache 2.0
✅ Có (HF/ModelScope, FP8+GGUF)
Text-only; phát hành 06/07/2026
Kimi K3
MoE / Moonshot
~2.8T / ~50B
1M
—
⏳ Hẹn 27/07/2026
Đa phương thức; xếp hạng tự công bố, chưa kiểm chứng
Qwen3.8-Max
MoE / Alibaba
2.4T (tuyên bố) / —
—
—
⚠️ Chỉ API preview
Chưa mở weights, không model card/benchmark chính thức
Mistral (MoE mới)
MoE / Mistral
—
—
—
⚠️ Teaser
Chưa có tên/thông số; mới early access đối tác
Chọn model AI mở thế nào cho nội dung / doanh nghiệp?
Điểm kỹ thuật quan trọng nhất khi tính chi phí: với MoE, chi phí phục vụ phụ thuộc vào số tham số active chứ không phải tổng. Một model “1.6T” nghe rất lớn, nhưng nếu chỉ kích hoạt 49B mỗi token thì chi phí và tốc độ suy luận gần với model vài chục tỷ tham số hơn. Đừng để con số tổng gây choáng — hãy nhìn active params và bản lượng tử hóa (FP8, GGUF) khi ước lượng hạ tầng.
Tiếp theo là giấy phép thương mại. DeepSeek V4 (MIT) và HunYuan 3.0 (Apache 2.0) đều thoáng, phù hợp tích hợp vào quy trình sản xuất nội dung. Với model mới chỉ có preview API (Qwen3.8-Max) hay teaser (Mistral), bạn phụ thuộc nhà cung cấp và điều khoản có thể đổi — nên coi là để thử nghiệm.
Cuối cùng là tự-host hay dùng API. Tự-host một model open-weight như DeepSeek V4 hoặc Hy3 cho bạn quyền kiểm soát dữ liệu, chi phí cố định và không lo bị đổi phiên bản, đổi lại cần đầu tư GPU và vận hành. Dùng API thì nhanh, không cần hạ tầng, nhưng chịu chi phí theo token và rủi ro thay đổi từ nhà cung cấp. Nếu quy trình nội dung cần khối lượng lớn và ổn định, một model text-only mở weights thường là bài toán chi phí tốt hơn. Muốn đối chiếu với các model đóng, xem thêm bài so sánh GPT, Claude, Gemini 2026.
Với GEO (Generative Engine Optimization), làn sóng model mở có ý nghĩa trực tiếp: khi ngày càng nhiều hệ thống trả lời dựa trên model mở, nội dung của bạn cần được cấu trúc để dễ được trích dẫn. Sản xuất nội dung mới là một nửa; nửa còn lại là làm nội dung xuất hiện trong câu trả lời của AI. Bạn có thể tự đánh giá mức độ hiển thị với công cụ kiểm tra AI Visibility.
Câu hỏi thường gặp
Model AI mở 2026 nào tải và tự-host được ngay hôm nay?
Tính đến 26/07/2026, hai lựa chọn có trọng số công khai và giấy phép thương mại rõ ràng là DeepSeek V4 (MIT) và Tencent HunYuan 3.0 (Apache 2.0). Cả hai đều là text-only và có sẵn trên HuggingFace.
Kimi K3 đã tải được chưa?
Chưa. Kimi K3 được công bố ngày 16–17/07/2026 nhưng trọng số đầy đủ mới được hẹn phát hành 27/07/2026; đến 26/07 chưa có repo Kimi-K3 trên HuggingFace, nên chưa thể tự-host.
Tổng tham số càng lớn thì chi phí càng cao đúng không?
Không hẳn. Với MoE, chi phí phục vụ phụ thuộc vào số tham số active mỗi token, không phải tổng. Ví dụ DeepSeek V4-Pro có 1.6T tổng nhưng chỉ 49B active, nên chi phí gần với một model vài chục tỷ tham số hơn.
Qwen3.8-Max có phải model mở không?
Hiện chưa. Alibaba mới ra Qwen3.8-Max-Preview dùng qua API, chưa mở weights, chưa có giấy phép, model card hay benchmark chính thức. Các con số như 2.4T tham số là tuyên bố của hãng, chưa kiểm chứng.
Làn sóng model AI mở 2026 rất sôi động, nhưng đừng đánh đồng “công bố” với “dùng được”. Nếu cần triển khai ngay, DeepSeek V4 và HunYuan 3.0 là hai lựa chọn open-weight thực tế nhất; Kimi K3, Qwen3.8-Max và Mistral vẫn nên theo dõi thêm. Dù chọn model nào, giá trị cuối cùng nằm ở việc nội dung có được AI trích dẫn hay không — đó là bài toán GEO/AEO mà TOS đồng hành cùng doanh nghiệp.