0

Đánh giá Qwen3.8-Max: Mô hình open-weight 2.4T của Alibaba

Qwen3.8-Max của Alibaba, ra mắt ngày 3/8/2026, là mô hình 2,4 nghìn tỷ tham số đầu tiên thuộc dòng Max mà công ty công bố sẽ mở mã nguồn, đạt 86,1 điểm trên OSWorld-Verified, vượt qua cả GPT-5.6 Sol Max (83,2) và Claude Fable 5 (85,0).

Tóm tắt các điểm chính

Qwen3.8-Max là tuyên bố của Alibaba về việc mô hình mở trọng số có thể cạnh tranh đến đâu: dẫn đầu OSWorld-Verified và PaperBench trước cả Fable 5 lẫn GPT-5.6 Sol Max, với một mô hình có thể tự host và định giá 2 USD/6 USD, đây là kiểu động thái gây áp lực lên toàn bộ tầng độc quyền về chi phí trên mỗi tác vụ agentic.

  • Qwen3.8-Max là mô hình mixture-of-experts (MoE) với 2,4 nghìn tỷ tham số tổng, chỉ kích hoạt khoảng 95 tỷ tham số mỗi lượt suy luận, context window 1M token, hỗ trợ đầu vào văn bản, hình ảnh và video.
  • Mô hình đạt điểm PaperBench cao nhất từng được công bố là 93,0, vượt GPT-5.6 Sol (90,5) và Claude Fable 5 (88,8).
  • Giá API là 2,00 USD/triệu input token và 6,00 USD/triệu output token, tổng cộng 8 USD, chưa bằng một phần ba mức 30 USD của Claude Opus 5 và chưa bằng một phần tư mức 35 USD của GPT-5.6 Sol chế độ Standard.
  • Trong một demo tự động hóa dài 16 ngày liên tục không có con người can thiệp, Qwen3.8-Max xây dựng một CLI harness tự tiến hóa, tích lũy 265 commit, 127 pull request và 151 issue.
  • Qwen3.8-Max vẫn thua Claude Fable 5 trên SWE-bench Pro (67,7 so với 80,0), đây là điểm yếu rõ ràng nhất trong bộ benchmark.

Infinity đánh giá: Nếu đang xây agent vận hành giao diện thực tế hoặc tái tạo pipeline nghiên cứu, Qwen3.8-Max đáng để thử nghiệm nghiêm túc, đặc biệt khi trọng số được phát hành và có thể tự host. Nếu công việc thuần về kỹ thuật phần mềm chuyên nghiệp trên các GitHub issue phức tạp, Fable 5 vẫn dẫn đầu SWE-bench Pro, nên chạy thử cả hai trước khi quyết định.

Qwen3.8-Max là mô hình gì?

Qwen3.8-Max là mô hình mạnh nhất trong dòng Qwen, kiến trúc MoE thưa với 2,4 nghìn tỷ tham số tổng và khoảng 95 tỷ tham số hoạt động mỗi lượt suy luận. Mô hình được xây dựng trên nền tảng kiến trúc của Qwen 3.5, nhắm cụ thể vào bốn hướng: coding, công việc thực tế, tác vụ dài hạn (long-horizon), và agent đa phương thức.

Qwen3.8-Max Architecture

Thay đổi cấu trúc lớn nhất so với Qwen3.7-Max nằm ở quy mô và cam kết mở trọng số (open-weight). Qwen chưa từng công bố trọng số cho một mô hình cấp Max trước đây, và cả Qwen3.8-Max lẫn Qwen3.8-27B nhỏ hơn dự kiến xuất hiện trên Hugging Face và ModelScope trong tuần sau khi ra mắt. Alibaba chưa công bố loại giấy phép cụ thể, nên chưa rõ liệu mô hình sẽ đi theo giấy phép mở như Apache 2.0 hay một giấy phép tùy chỉnh hạn chế hơn.

Tin tức đáng chú ý nhất trên mặt benchmark là khả năng vận hành máy tính dạng agentic. Trên OSWorld-Verified, benchmark đo mức độ tin cậy của một agent khi vận hành môi trường desktop thực tế, Qwen3.8-Max dẫn đầu mọi mô hình độc quyền mà Qwen đưa vào so sánh. Đối với một mô hình có thể tự host, đây là một đề xuất thực sự khác biệt so với các bản mở trọng số thông thường vốn thường tụt lại một thế hệ so với frontier.

Qwen3.8-Max có gì mới?

Chủ đề xuyên suốt của Qwen3.8-Max là khả năng tự chủ trên các khung thời gian dài: mô hình không tuân theo một kế hoạch cố định mà tự sửa lỗi qua các vòng phản hồi trong suốt nhiều ngày làm việc liên tục. Bốn tính năng nổi bật nhất:

Coding tự động nhiều ngày liên tục

Qwen3.8-Max có thể đưa một dự án coding từ một thư mục trống đến một sản phẩm hoàn chỉnh qua nhiều ngày làm việc liên tục mà không cần con người can thiệp. Demo tiêu biểu của công ty chạy khoảng 16 ngày vận hành tự động hoàn toàn, xây dựng một CLI harness tự tiến hóa, tích lũy 265 commit, 127 pull request và 151 issue.

Cơ chế vận hành là một vòng phản hồi: yêu cầu đi vào dưới dạng GitHub issue, agent nhận và thực thi, sau đó kích hoạt build, unit test, end-to-end test và CI check trước khi merge. Đây là minh chứng cho một mô hình được thiết kế để vận hành pipeline kỹ thuật không giám sát, thay vì chỉ trả lời câu hỏi code một lần.

Lưu ý cần thiết: Đây là demo do chính nhà cung cấp thực hiện. Một lần chạy tự động 16 ngày trong môi trường có kiểm soát không giống với việc để mô hình tự vận hành trên một monorepo sản xuất thực tế.

Tái tạo nghiên cứu và tự cải thiện

Qwen3.8-Max có thể đọc một bài báo nghiên cứu, tái tạo lại thí nghiệm bằng code từ đầu, rồi thử vượt qua chính phương pháp gốc. Trong ví dụ của Qwen, mô hình làm việc khoảng 5 ngày (khoảng 125 giờ), viết khoảng 7.600 dòng code, thực hiện hơn 1.100 hành động, và chạy 33 vòng huấn luyện GPU mà không có code khởi điểm nào được cung cấp trước.

Mô hình trước tiên tái tạo lại 6 phát hiện chính của bài báo, sau đó chạy một vòng lặp tự cải thiện gồm đặt giả thuyết, viết code, chạy GPU và phân tích, xuyên suốt 4 vòng và 18 ý tưởng. Phương pháp cuối cùng mô hình tự nghĩ ra vượt qua chính phương pháp gốc của bài báo 2,71 điểm trên AIME24, một benchmark toán học cấp thi đấu.

Dynamic Workflows: điều phối agent song song

Dynamic Workflows cho phép Qwen3.8-Max lập kế hoạch một tác vụ theo chương trình và phân phối số lượng lớn sub-agent chạy song song. Trong một demo nghiên cứu định lượng (quant-research), mô hình phân rã 6 mô tả factor ngắn thành 50 hướng nghiên cứu mỗi mô tả, phân phối khoảng 330 sub-agent, và hoàn thành khoảng 6.000 lượt backtest, đồng thời tự điều chỉnh workflow giữa chừng.

Điểm khác biệt so với một script cố định là mô hình hành động dựa trên bằng chứng: khi phát hiện tín hiệu overfitting, mô hình tự loại bỏ các factor dư thừa theo từng vòng; khi phương pháp ensembling ba mô hình tỏ ra kém ổn định hơn cách tổng hợp theo hướng cố định trên tập dữ liệu nhỏ, mô hình tự chuyển sang khung tiếp cận khác. Các factor được chọn đạt tỷ số Sharpe vượt trội từ 0,64 đến 1,48, một kết quả cụ thể có thể kiểm chứng chứ không chỉ là cảm tính.

Thị giác như một vòng phản hồi, không chỉ là đầu vào

Qwen3.8-Max sử dụng thị giác xuyên suốt quá trình thực thi, không chỉ để đọc đầu vào. Trong lúc thực hiện tác vụ, mô hình tự kiểm tra output trung gian của chính nó, phát hiện các vấn đề như giao diện bị lệch hoặc đối tượng quay sai hướng, rồi điều chỉnh kế hoạch để sửa.

Về phía đầu vào, mô hình xử lý được PDF hơn 200 trang gồm văn bản, biểu đồ và bố cục, xử lý được video dài hơn 100 giờ bằng cách xây dựng một video memory graph ghi lại con người, sự kiện và mốc thời gian. Qwen cũng phát hành Qwen-MM-Plugins, một thư viện mở rộng harness bổ sung xử lý hình ảnh, video, bộ nhớ đa phương thức và khả năng dùng công cụ thị giác cho các framework agent hiện có.

Kiểm soát mức độ reasoning

Qwen3.8-Max cung cấp tham số reasoning_effort để cân đối giữa chi phí và độ sâu suy luận, với ba mức: xhigh (mặc định) cho tác vụ phức tạp cần phân tích kỹ, medium cân bằng độ chính xác và tốc độ, low tối ưu cho tốc độ và chi phí. Đáng lưu ý: một người dùng trên r/LocalLLaMA ghi nhận rằng các mô hình Qwen có xu hướng suy luận quá mức cần thiết, và DeepSeek V4 Flash tốn ít thời gian suy luận hơn ngay cả khi cho ra chất lượng thấp hơn. Nếu khối lượng công việc nhạy cảm về độ trễ, nên chuyển sang mức low thay vì mặc định dùng xhigh.

Bộ benchmark của Qwen3.8-Max cho thấy gì?

Bộ benchmark của Qwen nghiêng mạnh về khả năng thực thi dài hạn thay vì các bài kiểm tra tĩnh, phù hợp với định vị của mô hình. Xuyên suốt các bảng công bố, Qwen3.8-Max dẫn đầu hoặc cạnh tranh mạnh ở khả năng vận hành máy tính dạng agentic, tái tạo nghiên cứu và coding, trong khi vẫn thua GPT-5.6 Sol Max và Fable 5 ở một số eval kỹ thuật phần mềm.

Benchmark (nhóm) Qwen 3.8 Max Qwen 3.7 Max Opus 4.8 Fable 5 GPT-5.6 Sol (max)
SWE-Pro (kỹ thuật phần mềm) 67,7 60,6 69,2 80,0 64,6
TerminalBench-2.1 (terminal agent) 86,6 74,5 84,6 84,6 88,8
PaperBench (tái tạo nghiên cứu) 93,0 64,8 80,3 88,8 90,5
OSWorld-Verified (vận hành máy tính agentic) 86,1 73,3 83,4 85,0 83,2
Agents' Last Exam (tác vụ dài hạn) 52,4 31,1 45,1 - 53,6
MobileWorld (thao tác mobile agentic) 77,8 51,2 67,5 85,5 76,9

Ghi chú: một số benchmark có điểm số kép (dạng không dùng python / có dùng python), và dấu gạch ngang chỉ những trường hợp mô hình không được kiểm thử hoặc điểm bị loại khỏi bảng công bố.

OSWorld-Verified

Qwen3.8-Max đạt 86,1 trên OSWorld-Verified, vượt Fable 5 (85,0), GPT-5.6 Sol Max (83,2) và Gemini 3.1 Pro (76,2). Benchmark này đo mức độ tin cậy của một agent vận hành máy tính khi thao tác qua các giao diện thực tế và hoàn thành tác vụ nhiều bước. Với những ai đang xây agent điều khiển ứng dụng thật thay vì chỉ gọi API, đây là con số quan trọng nhất. Qwen3.7-Max chỉ đạt 73,3 ở benchmark này, nên bước nhảy trong cùng dòng sản phẩm là đáng kể.

PaperBench

Trên PaperBench, Qwen3.8-Max đạt 93,0, điểm cao nhất từng được công bố, vượt GPT-5.6 Sol ở mức 90,5 và Fable 5 ở mức 88,8. PaperBench đo khả năng tái tạo thí nghiệm của một bài báo nghiên cứu bằng code, khớp trực tiếp với demo tái tạo nghiên cứu 5 ngày đã nêu ở trên. Đây là khoảng cách lớn so với Qwen3.7-Max ở mức 64,8.

Terminal-Bench 2.1

Qwen3.8-Max đạt 86,6 trên Terminal-Bench 2.1, nằm giữa GPT-5.6 Sol ở mức 88,8 và mức 84,6 mà cả Opus 4.8 lẫn Fable 5 cùng đạt được. Đây là cải thiện thực sự so với mức 74,5 của Qwen3.7-Max, đưa một mô hình mở trọng số đến gần nhóm điểm số độc quyền cao nhất trong công việc agentic dòng lệnh.

SWE-bench Pro

Đây là nơi Qwen3.8-Max tụt lại: mô hình đạt 67,7 trên SWE-bench Pro, thua Fable 5 ở mức 80,0 và Opus 4.8 ở mức 69,2, dù vẫn vượt GPT-5.6 Sol ở mức 64,6. SWE-bench Pro đo khả năng giải quyết các GitHub issue thực tế trong codebase chuyên nghiệp. Đây là điểm yếu thực sự của mô hình. Khi Infinity đánh giá Grok 4.5 trước đó, Fable 5 cũng dẫn đầu SWE-Bench Pro ở mức 80,4, cho thấy mô hình của Anthropic vẫn là đối thủ cần vượt qua trên chính eval này.

GPQA Diamond và năng lực tổng quát

Trên GPQA Diamond, benchmark reasoning khoa học cấp sau đại học, Qwen3.8-Max đạt 92,6, ngang bằng Fable 5 (92,6) và chỉ kém GPT-5.6 Sol ở mức 94,1. Mô hình cũng dẫn đầu ở IFBench (khả năng tuân theo hướng dẫn) với 82,8, HealthBench với 60,2 và PRBench-Finance với 58,3. Mô hình vẫn tụt lại ở bài kiểm tra reasoning khó nhất, Humanity's Last Exam, đạt 43,6 so với 53,3 của Fable 5.

GPQA Comparison

Qwen3.8-Max có giá bao nhiêu và truy cập ở đâu?

Qwen3.8-Max hiện đã khả dụng qua QwenCloud với API model ID qwen3.8-max, hỗ trợ endpoint tương thích OpenAI lẫn giao diện tương thích Anthropic, nên có thể trỏ Claude Code hoặc Codex vào mô hình này với thay đổi cấu hình tối thiểu.

Mức giá nằm ở tầng trung và thấp hơn các mô hình độc quyền hàng đầu của Mỹ mà Qwen so sánh:

  • Input: 2,00 USD trên 1 triệu token
  • Output: 6,00 USD trên 1 triệu token
  • Implicit caching: 0,25 USD trên 1 triệu token

Tổng 8 USD này chưa bằng một phần ba mức 30 USD của Claude Opus 5 và chưa bằng một phần tư mức 35 USD của GPT-5.6 Sol chế độ Standard. Mức giá này khớp với Grok 4.5, cũng định giá 2 USD/6 USD. Trọng số mở của cả Qwen3.8-Max lẫn Qwen3.8-27B dự kiến xuất hiện trên Hugging Face và ModelScope trong tuần sau khi ra mắt, dù điều khoản giấy phép hiện vẫn chưa được công bố công khai.

Kết luận

Các lưu ý vẫn cần thiết: demo coding tự động 16 ngày và tái tạo nghiên cứu 5 ngày là showcase do chính nhà cung cấp thực hiện, không phải tái lập độc lập, và giấy phép cho trọng số sắp phát hành vẫn chưa được công bố. Trên r/LocalLLaMA, cuộc tranh luận thú vị hơn lại xoay quanh phiên bản nhỏ hơn Qwen3.8-27B, với nhiều bình luận hào hứng hơn về việc nén trí tuệ vào một GPU tiêu dùng đơn lẻ, thay vì một mô hình khổng lồ 2,4 nghìn tỷ tham số mà chỉ một số ít hệ thống mới chạy được.

Câu hỏi thường gặp

Qwen3.8-Max so với Qwen3.7-Max cải thiện ra sao?

Qwen3.8-Max cải thiện đáng kể so với Qwen3.7-Max ở mọi mặt: 86,1 so với 73,3 trên OSWorld-Verified, 93,0 so với 64,8 trên PaperBench, và 86,6 so với 74,5 trên Terminal-Bench 2.1. Đây cũng là mô hình cấp Max đầu tiên của Qwen dự kiến mở trọng số, trong khi Qwen3.7-Max chỉ khả dụng qua API.

Có thể truy cập Qwen3.8-Max ở đâu?

Qwen3.8-Max hiện khả dụng qua QwenCloud với API model ID qwen3.8-max, hỗ trợ endpoint tương thích OpenAI lẫn giao diện tương thích Anthropic, nên hoạt động được với các công cụ như Claude Code, Codex và Qwen Code. Trọng số mở dự kiến phát hành trên Hugging Face và ModelScope trong tuần sau.

Qwen3.8-Max có giá bao nhiêu?

Qwen3.8-Max có giá 2,00 USD trên 1 triệu input token và 6,00 USD trên 1 triệu output token, với implicit caching 0,25 USD trên 1 triệu token. Tổng 8 USD này chưa bằng một phần ba mức 30 USD của Claude Opus 5 và chưa bằng một phần tư mức 35 USD của GPT-5.6 Sol chế độ Standard.

Qwen3.8-Max có phải mã nguồn mở không?

Alibaba cho biết trọng số của Qwen3.8-Max và phiên bản nhỏ hơn Qwen3.8-27B sẽ phát hành trong tuần sau khi ra mắt, đánh dấu lần đầu tiên một mô hình cấp Max của Qwen có thể tự host. Công ty chưa công bố loại giấy phép cụ thể, nên chưa rõ liệu sẽ là giấy phép mở như Apache 2.0 hay giấy phép tùy chỉnh hạn chế hơn.

Qwen3.8-Max mạnh nhất ở điểm nào?

Qwen3.8-Max mạnh nhất ở khả năng vận hành máy tính dạng agentic và công việc tự động dài hạn, dẫn đầu OSWorld-Verified (86,1) và PaperBench (93,0). Mô hình vượt trội trong các lượt chạy coding nhiều ngày, tái tạo và cải thiện bài báo nghiên cứu, và điều phối sub-agent song song qua Dynamic Workflows. Mô hình yếu hơn ở việc giải quyết issue kỹ thuật phần mềm chuyên nghiệp, nơi Fable 5 dẫn đầu SWE-bench Pro.

Nguồn: Infinity - đơn vị cung cấp giải pháp Digital Marketing tích hợp cho doanh nghiệp — từ thiết kế website chuẩn SEO & UX/UI, dịch vụ AI SEO (GEO/AEO), PR Digital, sáng tạo nội dung số, quảng cáo trực tuyến (SEM/Ads) đến phân tích dữ liệu Marketing. Với nền tảng nghiên cứu và dữ liệu thực chiến, chúng tôi giúp doanh nghiệp xây dựng chiến lược thương hiệu bền vững và tăng trưởng có hệ thống trong kỷ nguyên AI.


All rights reserved

Viblo
Hãy đăng ký một tài khoản Viblo để nhận được nhiều bài viết thú vị hơn.
Đăng kí