0

Grok 4.6: tính năng, benchmark, giá và so sánh với Sol, Opus 5, Fable 5

SpaceXAI ra mắt Grok 4.6 ngày 12/8/2026, chỉ hơn một tháng sau Grok 4.5, đạt 61 điểm trên Artificial Analysis Intelligence Index ở chế độ effort cao nhất, ngang bằng GPT-5.6 Sol nhưng giá output chỉ bằng một phần năm.

Những điểm chính

  • Ở chế độ effort cao, Grok 4.6 đạt 61 điểm trên Artificial Analysis Intelligence Index, ngang bằng số với Sol ở mức max và kém Opus 5 ở mức max 2 điểm.
  • Giá input và output cơ bản giữ nguyên ở mức 2 USD và 6 USD trên 1 triệu token, nhưng giá cached input, độ trễ token đầu tiên và chi phí trên mỗi tác vụ đo được đều tăng so với Grok 4.5.
  • Trên AA-Briefcase, Grok dùng ít lượt và ít input token hơn Opus 5, trong khi Sol dẫn đầu các bài test terminal, còn Sonnet 5 cung cấp context gấp đôi mà không tính phụ phí prompt dài.
  • Thời gian đến token trả lời đầu tiên tăng từ 14,62 giây trên Grok 4.5 lên 40,44 giây, trong khi chi phí trên mỗi tác vụ tăng từ 0,36 USD lên 0,84 USD.
  • Grok 4.6 khả dụng qua API SpaceXAI, Cursor, Grok Build, các gateway bên thứ ba (OpenRouter, Vercel, Cloudflare, Google Cloud Vertex AI) và các công cụ coding khác (GitHub Copilot, VS Code, JetBrains, Xcode, Eclipse).

Grok 4.6 là mô hình gì?

Grok 4.6 là mô hình reasoning độc quyền của SpaceXAI, với context window 500.000 token qua API nhưng chỉ 256.000 token bên trong Cursor.

Thông số Grok 4.6
Context window 500.000 token (API); 256.000 token trong Cursor
Input / output Nhận văn bản và ảnh; chỉ trả ra văn bản
Mức reasoning effort Low, medium, high (mặc định), xhigh
Knowledge cutoff 1/2/2026
Công cụ Function calling, web search, X search, code execution, collections search (RAG), remote MCP
Giá tiêu chuẩn 2 USD/triệu input token, 0,50 USD cached, 6 USD/triệu output token
Giá long-context 4 USD/1 USD/12 USD khi prompt đạt 200.000 token, áp dụng cho toàn bộ request

SpacexAI vẫn chưa công bố số lượng tham số cho cả hai mô hình. Con số 1,5 nghìn tỷ xuất hiện trong một số báo cáo không đến từ SpaceXAI, nên đây không phải một thông số đã được xác nhận.

Grok 4.6 có gì mới?

SpaceXAI cho biết đây không phải một mô hình huấn luyện mới từ đầu, mà là Grok 4.5 được huấn luyện thêm, với sự chú ý bổ sung vào các tác vụ agent AI. Các thay đổi được công bố rơi vào ba nhóm: agent chạy dài hơn, xây dựng giao diện web trực quan, và post-training.

Tác vụ agent dài hơn

SpaceXAI cho biết Grok 4.6 giữ đúng hướng trong các tác vụ dài với nhiều bước, như nghiên cứu, làm việc xuyên suốt một codebase, và xây dựng một ứng dụng. Mô hình được ghi nhận là kiểm tra lại công việc thường xuyên hơn thay vì làm mọi thứ trong một lượt duy nhất. Thử nghiệm nội bộ của GitHub cũng ghi nhận Grok 4.6 duy trì reasoning và dùng tool tốt hơn xuyên suốt các tác vụ dài.

API có các tính năng gắn với tuyên bố này: Grok 4.6 có thể stream tóm tắt reasoning, điều Grok 4.5 không cung cấp, và xAI khuyến nghị context compaction với một prompt_cache_key cố định cho các vòng lặp agent dài. Compaction rút gọn lịch sử trước đó thành một mục, nhưng vẫn tốn token, và request phải vừa trong context window trước khi compaction chạy.

Phát triển web trực quan và tương tác

SpaceXAI và Cursor đều ghi nhận các lần thử đầu tiên tốt hơn trên dự án trực quan. Trong một thử nghiệm bên ngoài, Grok 4.6 xây lại một trang sản phẩm iPod Mini cũ thành một site 3D với bánh xe màu hoạt động được và hiệu ứng cuộn. Demo hoạt động, nhưng một bài test không thể chứng minh cho tuyên bố rộng hơn.

Grok 4.6 được post-train như thế nào?

SpaceXAI chạy nhiều lượt huấn luyện hơn so với Grok 4.5, dùng ví dụ reasoning và ví dụ kỹ thuật do AI tạo ra, loại bỏ các ví dụ kém bằng kiểm tra dựa trên mô hình, sau đó dùng reinforcement learning cho coding, tác vụ văn phòng, phát triển web, tinh chỉnh kernel và thiết kế computer. SpaceXAI cũng cho biết Grok 4.5 tự tạo ra các ví dụ huấn luyện mới xuyên suốt nhiều cài đặt reasoning và chủ đề khác nhau. Công ty quy công cho việc huấn luyện nhiều hơn và chọn lọc dữ liệu chặt chẽ hơn, không phải một kiến trúc mới. Các đội bên ngoài không thể kiểm tra những chi tiết này, đây là báo cáo của chính công ty, chưa được kiểm chứng độc lập.

Grok 4.6 đạt điểm benchmark như thế nào?

Bảng ra mắt của SpaceXAI cho thấy điểm số tăng ở đâu, nhưng điểm của đối thủ là "kết quả tốt nhất tự công bố hoặc công khai", không phải mọi mô hình được chạy dưới cùng một thiết lập.

Benchmark Grok 4.6 (high) Grok 4.5 (high) GPT-5.6 Sol (max) Claude Fable 5 (max)
AA Intelligence Index 61 56 61 62
GDPVal-AA v2 (Elo) 1.753 1.526 1.728 1.741
DeepSWE 1.1 65,9% 54,0% 73,0% 70,0%
Terminal-Bench 3.0 26,0% 15,7% 34,6% 34,1%
APEX-Agents 57,5% 47,1% 56,7% 59,2%
CursorBench v3.2 69,9% 66,7% 67,2% 70,5%

Grok 4.6 cải thiện so với Grok 4.5 xuyên suốt toàn bộ bảng. Khoảng cách lớn nhất của Sol xuất hiện trên DeepSWE và Terminal-Bench, trong khi Fable dẫn đầu 3 dòng. Ngay cả bảng của chính SpaceXAI cũng không chỉ ra một người chiến thắng duy nhất.

Kết quả benchmark độc lập

Artificial Analysis tự chạy Intelligence Index của họ trên sáu mô hình trong so sánh này, kết quả gần với con số của SpaceXAI nhưng không giống hệt. Biểu đồ đặt Grok ngang hàng với Sol về trí tuệ, nhưng thấp hơn nhiều về giá pha trộn. Artificial Analysis tính giá này theo tỷ lệ 7:2:1 giữa cached input, uncached input và output. Chi phí trên mỗi tác vụ index hoàn thành cho thấy cùng khoảng cách: 0,84 USD cho Grok, 1,23 USD cho Sol, và 2,34 USD cho Opus 5.

Grok 4.6 so với năm đối thủ tiên phong

Thời gian đến token trả lời đầu tiên tăng từ 14,62 giây trên Grok 4.5 lên 40,44 giây, trong khi chi phí trên mỗi tác vụ tăng từ 0,36 USD lên 0,84 USD. Grok 4.6 dùng nhiều hơn khoảng 20% output token trên cùng bài test, nên giá niêm yết không đổi không đồng nghĩa chi phí tác vụ không đổi.

So với GPT-5.6 Sol và Claude Sonnet 5, Grok 4.6 gửi token trả lời đầu tiên nhanh hơn. Sol ở mức max effort mất 213,52 giây, và Sonnet 5 mất 184,48 giây, so với 40,44 giây của Grok. Grok chỉ trông chậm khi đặt cạnh các mô hình độ trễ thấp hơn như Gemini 3.7 Flash.

Infinity lưu ý: các so sánh benchmark này hữu ích để tìm điểm mạnh tương đối, nhưng không phải một bảng xếp hạng đáng tin cậy xuyên mô hình. Mức reasoning effort thay đổi cả điểm số lẫn thời gian phản hồi: GPT-5.6 Sol đạt 57 ở mức high và 61 ở mức max. Tên benchmark cũng có thể chỉ các phiên bản khác nhau, nên Terminal-Bench 3.0 của xAI và Terminal-Bench 2.1 của Artificial Analysis không thể so sánh trực tiếp.

Grok 4.6 thay đổi gì so với Grok 4.5?

Với người dùng Grok 4.5, câu hỏi không phải liệu 4.6 có "tốt hơn" một cách trừu tượng, mà liệu điểm số cao hơn có bù đắp được hồ sơ độ trễ và mức dùng token khác đi hay không.

Chỉ số Grok 4.5 (high) Grok 4.6 (high)
AA Intelligence Index 56 61
Chi phí trên mỗi tác vụ index 0,36 USD 0,84 USD
Thời gian đến token trả lời đầu tiên 14,62 giây 40,44 giây
Giá cached input 0,30 USD/triệu 0,50 USD/triệu
Output token dùng để chạy index 60 triệu 72 triệu
Giá input/output cơ bản 2 USD/6 USD 2 USD/6 USD (không đổi)

Tuy nhiên "giá không đổi" chỉ mô tả mức giá niêm yết cơ bản. Một thay đổi khác quan trọng với người dùng Grok 4.5 hiện tại: giá cached input tăng 67%, từ 0,30 USD lên 0,50 USD trên 1 triệu token. Mức giá cache cao hơn này nới rộng thêm khoảng cách giữa giá niêm yết và chi phí thực tế của một tác vụ hoàn thành.

Grok 4.6 so với GPT-5.6 Sol, Claude Sonnet 5, Opus 5 và Fable 5 khác nhau ra sao?

Điểm số Intelligence Index ngang nhau che giấu một sự phân hóa rõ ràng: Sol dẫn trước Grok 7,1 điểm trên DeepSWE và 8,6 điểm trên Terminal-Bench, khiến coding nặng về terminal là thế mạnh rõ nhất của Sol, trong khi Grok đạt điểm cao hơn ở ba dòng tác vụ còn lại.

Thử nghiệm riêng của OpenAI mở rộng kết quả terminal đó sang duyệt web và computer use, vẫn là bằng chứng do nhà cung cấp chọn lọc chứ không phải một so sánh có kiểm soát, nhưng chỉ cùng một hướng: thế mạnh lớn nhất của Sol là công việc phụ thuộc vào terminal, trình duyệt, hoặc các lượt gọi tool lặp lại. OpenAI cũng giới thiệu trước một chế độ Ultrafast cho Sol mà họ nói chạy nhanh hơn tới 14 lần, chưa có giá công bố nên chưa nằm trong so sánh chi phí.

Grok 4.6 khởi điểm ở 2 USD input và 6 USD output trên 1 triệu token. Giá tiêu chuẩn của Sol là 5 USD input và 30 USD output, gấp năm lần giá output của Grok. Trên 272.000 token, Sol tăng gấp đôi giá input và nâng output lên 45 USD. Điều đó không có nghĩa mọi tác vụ Grok đều rẻ hơn năm lần, vì mức dùng reasoning token, tỷ lệ cache hit và số lượt vẫn thay đổi hóa đơn cuối cùng.

Sonnet 5 và Grok 4.6 đều khởi điểm ở 2 USD trên 1 triệu input token, dễ so sánh giá. Sonnet 5 có context window 1 triệu token mặc định, gấp đôi mức 500.000 của Grok, không có giá cao hơn cho prompt dài. Output có giá 10 USD trên 1 triệu so với 6 USD của Grok. Hai ngày trước khi Grok 4.6 ra mắt, Anthropic đã cố định mức giá 2 USD/10 USD vĩnh viễn và bỏ kế hoạch tăng lên 3 USD/15 USD. Trên chỉ số Artificial Analysis, Sonnet 5 đạt 55 điểm ở mức max effort, kém Grok 4.6 6 điểm, dùng 300 triệu output token cho bài test so với 72 triệu của Grok, đưa chi phí trên mỗi tác vụ lên 1,72 USD.

Opus 5, với giá 5 USD input và 25 USD output, dẫn đầu chỉ số ở mức 63 điểm. Fable 5, giá 10 USD input và 50 USD output, đạt 62 điểm, dù điểm số này cần một lưu ý: Artificial Analysis ghi nhận các lần fallback an toàn trên một số prompt khó hơn, nên điểm số phản ánh mô hình như người dùng thực tế có thể dùng, không phải một phiên bản không giới hạn mà Anthropic không cung cấp.

Trên benchmark AA-Briefcase đo tác vụ agent dài, Grok 4.6 hoàn thành trong khoảng 53 lượt và dùng 0,5 tỷ input token. Opus 5 mất khoảng 103 lượt và 2 tỷ token. Điều này không cho thấy Grok là mô hình mạnh hơn tổng thể, chỉ cho thấy Grok dùng ít bước và ít input token hơn trên bộ test này, trong khi Claude dẫn đầu ở các bài test khác đã nêu.

Grok 4.6 có giá bao nhiêu?

Ngưỡng prompt 200.000 token là phần đáng chú ý nhất: nó chuyển toàn bộ token trong request lên tầng giá cao hơn.

Hạng mục Mức phí
Input token, prompt dưới 200K 2,00 USD/triệu
Cached input, prompt dưới 200K 0,50 USD/triệu
Output token, prompt dưới 200K 6,00 USD/triệu
Input/cached/output (trên 200K) 4,00 USD/1,00 USD/12,00 USD
Xử lý nhanh hoặc ưu tiên 2 lần giá tiêu chuẩn
Web search, X search, code execution 5 USD trên 1.000 lượt gọi

Phí công cụ tách biệt với phí token. Một request tìm kiếm web rồi chạy code có thể phát sinh cả hai loại phí công cụ trước khi văn bản cuối cùng được tính phí. Không có tên mô hình grok-4.6-fast riêng biệt. API trực tiếp có tùy chọn priority tính phí 2 lần khi phản hồi xác nhận đã dùng priority. Cursor hiển thị một lựa chọn "Grok 4.6 (Fast)" riêng với cùng mức giá 2 lần.

Có thể truy cập Grok 4.6 ở đâu?

Grok 4.6 khả dụng chính thức qua API SpaceXAI, Cursor, Grok Build, các gateway bên thứ ba (OpenRouter, Vercel, Cloudflare, Google Cloud Vertex AI), và các công cụ coding khác (GitHub Copilot, VS Code, JetBrains, Xcode, Eclipse). Việc triển khai bao phủ các gói Pro, Pro+, Max, Business và Enterprise. Admin của Business và Enterprise phải tự bật mô hình vì mặc định tắt. Grok 4.6 không được hỗ trợ trên Batch API của SpaceXAI, nên không có tùy chọn batch giảm giá.

Một chi tiết doanh nghiệp đáng lưu ý: phản hồi mặc định có trạng thái (stateful), và SpaceXAI cho biết lịch sử được lưu trong 30 ngày. Dưới chế độ Zero Data Retention, các đội không thể dùng chuỗi phản hồi đã lưu hay completion trì hoãn, xAI chỉ ra encrypted reasoning replay và WebSocket Responses như phương án thay thế. Mỗi phản hồi gồm một header cho biết ZDR có đang hoạt động hay không.

Tuần ra mắt của Grok 4.6 có gì đáng chú ý?

Điều đáng chú ý nhất trong tuần đó là tốc độ các đợt ra mắt mô hình và thỏa thuận phân phối tập trung quanh Grok 4.6. Grok Bot đặt tông cho cả tuần trước khi mô hình ra mắt, agent cloud beta sớm này được đóng gói cùng SuperGrok Heavy giá 300 USD/tháng hoặc Cursor Ultra giá 200 USD/tháng thay vì bán riêng, gắn quyền truy cập với các gói cao cấp. Grok 4.6 sau đó mang cùng trọng tâm agent vào API, Cursor và Grok Build.

Việc Google ra mắt Gemini 3.7 Flash và OpenAI giới thiệu trước GPT-5.6 Sol Ultrafast khiến tuần đó thêm dày đặc. Cùng lúc, việc Copilot triển khai và Cursor gia nhập SpaceX mở rộng khả năng phân phối của Grok. Cursor truy nguyên quá trình này về quan hệ đối tác với SpaceXAI từ đầu năm, và đóng khung động thái này quanh việc tiếp cận GPU của SpaceX hơn là điểm số mô hình.

Khi nào nên dùng Grok 4.6?

Grok 4.6 phù hợp cho công việc mà giá API và tác vụ agent dài quan trọng hơn độ trễ token đầu tiên. Đây là lựa chọn kém phù hợp hơn khi điểm terminal cao hơn của Sol hoặc context window lớn hơn của Sonnet 5 khớp sát hơn với tác vụ.

Grok 4.6 phù hợp khi:

  • Giá API là ràng buộc chính, vì mô hình rẻ hơn Sol, Opus 5 và Fable 5 cả về giá niêm yết lẫn chi phí trên mỗi tác vụ.
  • Công việc là tác vụ agent dài, nhiều bước, nơi hiệu quả về số lượt (ít lượt và ít input token hơn Opus 5 trên AA-Briefcase) mang lại lợi ích.
  • Tác vụ là công việc tri thức hoặc reasoning pháp lý, nơi Grok dẫn đầu bảng benchmark.
  • Độ trễ token đầu tiên không quan trọng, vì khởi động chậm chỉ là nhiễu trong một lượt chạy dài.

Có thể có lựa chọn tốt hơn khi:

  • Công việc nặng về coding terminal → GPT-5.6 Sol (điểm DeepSWE và Terminal-Bench cao hơn).
  • Tác vụ cần context window lớn → Claude Sonnet 5 (context 1M, không phụ phí prompt dài).
  • Muốn độ trễ thấp nhất cho tương tác trực tiếp → Gemini 3.7 Flash.
  • Chỉ mua theo trí tuệ cao cấp nhất → Opus 5 (63) hoặc Fable 5 (62) dẫn đầu chỉ số.

Kết luận

Grok 4.6 rơi vào một vị trí giữa khó xử: tăng 5 điểm chỉ số nhưng vẫn dưới giá niêm yết của Sol và Opus 5, đồng thời khởi động chậm hơn và tốn nhiều chi phí hơn trên mỗi tác vụ đo được so với Grok 4.5. "Cùng giá, mô hình tốt hơn" chỉ nói được một nửa câu chuyện của lần ra mắt này.

Điều Infinity vẫn muốn thấy là một lượt chạy nhiều giờ nơi codebase, công cụ và hướng dẫn liên tục thay đổi. Cursor và GitHub Copilot hiện đã cung cấp bối cảnh đó. Nếu tỷ lệ sửa lỗi và thất bại vẫn thấp trong môi trường đó, tuyên bố về huấn luyện agent sẽ có bằng chứng vượt ra ngoài một bài test cố định. Nếu không, mức tăng 5 điểm vẫn chỉ dừng lại ở đó.

Câu hỏi thường gặp

Grok 4.6 có thay thế Grok 4.5 không?

Chưa chính thức. SpaceXAI chưa công bố ngày ngừng hỗ trợ Grok 4.5, và mô hình này vẫn được liệt kê trên cả API lẫn Cursor. Hiện chưa có việc bắt buộc chuyển sang 4.6.

Có thể tự host Grok 4.6 không?

Không. Không có trọng số mở và không có số lượng tham số công bố, nên không có gì để tải về và chạy trên phần cứng riêng. Mọi kênh truy cập, kể cả API trực tiếp, đều đi qua hạ tầng của SpaceXAI hoặc một đối tác bán lại.

GitHub Copilot tính phí Grok 4.6 như thế nào?

Copilot quy đổi việc dùng Grok 4.6 thành GitHub AI Credits theo giá niêm yết của nhà cung cấp, một cent tương đương một credit. Các gợi ý hoàn thành code và next-edit thông thường không tính vào AI Credits. Việc dùng mô hình trong chat hoặc tác vụ agent theo quy tắc sử dụng của Copilot.

Grok 4.6 có khả dụng ở EU không?

Có, nhưng xử lý tại Mỹ. Người dùng EU truy cập được Grok 4.6 (nền tảng Grok 4.5 dùng chung đã vượt qua EU AI Act và mở cho người dùng EU từ tháng 7, 4.6 khả dụng trong Cursor khắp EU), nhưng không có lưu trữ dữ liệu tại EU. Trang mô hình của xAI chỉ liệt kê us-east-1 và us-west-2, nên request chạy tại Mỹ.

Grok 4.6 có hoạt động với chế độ lưu trữ dữ liệu tại Mỹ của Cursor không?

Grok 4.6 hiện khả dụng trong Cursor (có trang mô hình riêng), nhưng chế độ lưu trữ dữ liệu chỉ tại Mỹ là tính năng Enterprise chỉ bao phủ các mô hình được hỗ trợ với một số ngoại lệ, nên cần xác nhận 4.6 có trong danh sách mô hình được hỗ trợ hiện tại của Cursor trước khi dựa vào tính năng này.

Nguồn: Infinity - đơn vị cung cấp giải pháp Digital Marketing tích hợp cho doanh nghiệp — từ thiết kế website chuẩn SEO & UX/UI, dịch vụ AI SEO (GEO/AEO), PR Digital, sáng tạo nội dung số, quảng cáo trực tuyến (SEM/Ads) đến phân tích dữ liệu Marketing. Với nền tảng nghiên cứu và dữ liệu thực chiến, chúng tôi giúp doanh nghiệp xây dựng chiến lược thương hiệu bền vững và tăng trưởng có hệ thống trong kỷ nguyên AI.


All rights reserved

Viblo
Hãy đăng ký một tài khoản Viblo để nhận được nhiều bài viết thú vị hơn.
Đăng kí