0

Claude Opus 5 ra mắt: Phân tích benchmark, giá và so sánh với Fable 5, GPT-5.6

Anthropic vừa có một mô hình đứng thứ hai hoàn toàn mới, Claude Opus 5, được tiếp thị là trí tuệ tiệm cận frontier nhưng chỉ bằng một nửa giá của Claude Fable 5.

Đáng chú ý hơn, Opus 5 thực sự vượt qua Fable 5 trên một số benchmark coding và công việc tri thức, bao gồm Frontier-Bench và GDPval-AA, chỉ đứng sau Mythos 5 vốn chưa được phổ biến rộng rãi.

Tóm tắt các điểm chính

  • Claude Opus 5 ra mắt ngày 24/7/2026, giá 5 USD/25 USD mỗi triệu token (input/output), bằng một nửa giá Fable 5
  • Trên GDPval-AA v2, Opus 5 đạt 1.861 điểm Elo, vượt cả Fable 5 (1.747) lẫn Opus 4.8 (1.593 ở v2)
  • Trên ARC-AGI-3, Opus 5 nhảy vọt từ 1,5% của Opus 4.8 lên 30,2%, mức tăng gấp khoảng 20 lần
  • Chỉ số audit hành vi lệch chuẩn (misaligned-behavior) của Opus 5 đạt 2,3 điểm, mức tốt nhất từ trước đến nay của Anthropic
  • Opus 5 vẫn thua Mythos 5 riêng ở các tác vụ cybersecurity

Claude Opus 5 là gì?

Opus 5 là bản phát hành mới nhất trong tầng Opus của Anthropic, đứng dưới Mythos về năng lực tổng thể nhưng trên Sonnet và Haiku. Anthropic mô tả mô hình mới là "chu đáo và chủ động", đồng thời cho biết mô hình được xây dựng cho việc sử dụng hàng ngày, với một kỹ sư AI, điều này đồng nghĩa mô hình đủ hiệu quả để chạy liên tục.

Trên các đánh giá coding và công việc tri thức như Frontier-Bench và GDPval-AA, Anthropic cho biết Opus 5 hiện là state-of-the-art trong số các mô hình của công ty, dù vẫn thua Mythos 5 riêng ở các tác vụ cybersecurity.

Claude Opus 5 có gì mới?

Hai điểm nổi bật nhất trong cách Anthropic mô tả điểm mới của Opus 5: xu hướng hoàn thành tác vụ đến cùng thay vì dừng lại ở một câu trả lời có vẻ hợp lý, và bước nhảy về chất lượng output hình ảnh.

Opus 5 có tính kiên trì agentic ra sao?

Thay đổi định tính lớn nhất của Opus 5 là sự sẵn sàng tiếp tục làm việc cho đến khi tác vụ thực sự thành công. Anthropic đưa ra một số ví dụ minh họa: khi được giao một bản vẽ chi tiết máy nhưng không có cách xem trực tiếp, Opus 5 tự viết một pipeline computer-vision để trích xuất hình học từ pixel thô. Khi được yêu cầu sửa một lỗi thực tế trong một package manager mã nguồn mở phổ biến, Opus 5 tìm và sửa đúng nguyên nhân gốc, thay vì chỉ vá tạm. Một kỹ sư tại một công ty giao dịch được cho là đã dùng Opus 5 để xây dựng một luồng dữ liệu thị trường cho một sàn giao dịch mới chỉ trong một phiên làm việc duy nhất, bao gồm cả việc tự viết bộ test harness để xác thực logic phân tích dữ liệu.

Infinity nhận thấy chính sự sẵn sàng tiếp tục lặp lại thay vì dừng ở câu trả lời có vẻ hợp lý là yếu tố dường như đang thúc đẩy bước nhảy của Opus 5 trên các benchmark agentic như Frontier-Bench.

Opus 5 cải thiện output hình ảnh như thế nào?

Anthropic cũng đánh dấu Opus 5 có khả năng tạo ra output hình ảnh mạnh hơn đáng kể so với các mô hình trước đó, dẫn chứng bằng ví dụ về một hình ảnh trực quan hóa kiểu hầm gió (wind-tunnel) mô phỏng luồng khí qua các vật thể khí động học, như một chiếc ô tô. Đây là một ví dụ thuyết phục, và là tin tốt nếu công việc của người dùng liên quan đến việc xây dựng sơ đồ dạng generative.

Claude Opus 5 đạt điểm bao nhiêu trên các benchmark của chính Anthropic?

Trên SWE-bench Verified, Opus 5 đạt 96,0%, cao nhất trong số các mô hình Anthropic từng công bố, vượt cả Fable 5 (95,0%). Bảng dưới đây chỉ bao gồm các mô hình của chính Anthropic, "chưa công bố" nghĩa là mô hình đó không xuất hiện trên benchmark cụ thể đó ở đợt phát hành liên quan, không có nghĩa là đạt điểm 0.

Benchmark Haiku 4.5 Sonnet 4.6 Opus 4.7 Opus 4.8 Sonnet 5 Fable 5 Opus 5
SWE-bench Verified 73,3% 79,6% 87,6% 88,6% 95,0% 96,0%
SWE-bench Pro 58,1% 64,3% 69,2% 63,2% 80,3% 79,2%
Terminal-Bench 2.1 41% 67,0% 69,4% (2.0) 74,6% 80,4% 88,0% chưa công bố
Frontier-Bench v0.1 18,7% 33,7% 43,3%
GDPval-AA v2 (Elo, /2000) 1.753 (v1) 1.593 (v2) 1.618 (v2) 1.747 (v2) 1.861 (v2)
Audit hành vi lệch chuẩn (thấp hơn = tốt hơn) chưa công bố chưa công bố chưa công bố 2,3 (tốt nhất từ trước đến nay)
Giá (USD/triệu token in/out) 1/5 3/15 5/25 5/25 2-3/10-15 10/50 5/25

Opus 5 so với Fable 5 khác biệt ra sao?

Opus 5 thực sự vượt qua chính người anh em đắt tiền hơn của mình trên Frontier-Bench v0.1 (43,3% so với 33,7%) và GDPval-AA v2 (1.861 so với 1.747), trong khi giá chỉ bằng một nửa Fable 5.

Opus 5 so với Opus 4.8 khác biệt ra sao?

Đây là bước nhảy thế hệ rõ ràng nhất: Opus 5 vượt qua phiên bản tiền nhiệm trên ARC-AGI-3, tăng từ 1,5% lên 30,2%, và Frontier-Bench v0.1 tăng hơn gấp đôi (43,3% so với 18,7%). Đáng lưu ý, Opus 4.8 chỉ mới được phát hành cách đây hai tháng.

ARC-AGI-3 Comparison

Frontier-Bench v0.1 Comparison

Claude Opus 5 so với các mô hình đối thủ ra sao?

So sánh dưới đây được tổng hợp trực tiếp từ các thông báo phát hành mô hình của Anthropic, OpenAI và Google. Chỉ những dòng có đủ mô hình công bố điểm số có thể so sánh được mới được đưa vào, các benchmark chỉ được báo cáo dưới dạng tuyên bố tương đối mơ hồ đã bị loại bỏ.

Nhóm Benchmark Claude Opus 5 GPT-5.6 Sol GPT-5.6 Sol Ultra GPT-5.6 Terra GPT-5.6 Luna GPT-5.5 Gemini 3.6 Flash Gemini 3.5 Flash-Lite Gemini 3.5 Flash Gemini 3.1 Pro Preview
Công việc tri thức GDPval-AA v2 (Elo) 1861 1736 1593 1591,8 1493,7 1421 1348,8 962,3
Coding SWE-Bench Pro 79,2% 64,6% 63,4% 62,7% 59,4% 54,2% 54,2%
Coding DeepSWE v1.1 68,8% 72,7% 69,6% 67,2% 67% 49% 37% 11,8%
Coding Terminal-Bench 2.1 88,8% 91,9% 87,4% 84,7% 85,6% 54% 70,7%
Coding Frontier-Bench v0.1 43,3% 37,5%
Computer Use BrowseComp 90,8% 90,4% 92,2% 87,5% 83,3% 84,4% 85,9%
Computer Use OSWorld 2.0 70,6% 62,6% 50,2% 45,6% 47,5%
Reasoning trừu tượng ARC-AGI-3 30,2% 7,78% 0,8% 0,18% 0,43% 0,42%
Tool Use AutomationBench 26,0% 18,1% 15,2% 14,9% 12,9% 14,5%

Infinity lưu ý: Mọi con số ở đây đều tự công bố bởi chính phòng lab phát hành mô hình, chạy trên harness đánh giá, cấu hình prompt, và trong một số trường hợp là mức effort hoặc reasoning riêng của phòng lab đó. Đây là lý do các con số nên được đọc như một tham chiếu tương đối, không phải một so sánh hoàn toàn thuần nhất.

Opus 5 so với GPT-5.6 Sol khác biệt ra sao?

Opus 5 dẫn đầu ở các tác vụ reasoning khó hơn, mới lạ hơn (ARC-AGI-3, Frontier-Bench, AutomationBench), trong khi GPT-5.6 Sol nhỉnh hơn trên các benchmark coding đã được thiết lập lâu như SWE-Bench Pro và DeepSWE. Điều này gợi ý Opus 5 có thể có lợi thế ở các bài toán mở, ít khuôn mẫu, trong khi Sol tỏ ra mạnh ở các tác vụ coding được định nghĩa rõ ràng và huấn luyện chuyên sâu.

Opus 5 so với Gemini 3.6 Flash khác biệt ra sao?

Đợt phát hành gần đây của Gemini tập trung vào các mô hình tầng Flash, ưu tiên hiệu quả chi phí hơn là một flagship frontier, nên phần lớn các dòng hoặc không có dữ liệu Gemini, hoặc chỉ có số liệu Flash/Flash-Lite kém xa cả Opus 5 lẫn GPT-5.6. So sánh này nói nhiều về hạng mục sản phẩm hơn là về năng lực frontier thực sự của Google.

Opus 5 so với GPT-5.6 khác biệt ra sao?

Ở những chỗ hai flagship trùng lặp, Opus 5 dẫn đầu về reasoning mới lạ và tác vụ agentic (ARC-AGI-3, BrowseComp, OSWorld 2.0, AutomationBench), trong khi GPT-5.6 Sol nhỉnh hơn ở coding dài hơi (DeepSWE). Sol Ultra, Terra và Luna chủ yếu xuất hiện ở các benchmark coding riêng biệt nơi Opus 5 chưa công bố điểm, nên đây thực chất là "một flagship của Anthropic so với cả họ mô hình của OpenAI", chứ không phải một so sánh đơn thuần một-đối-một.

Claude Opus 5 có giá bao nhiêu và khả dụng ở đâu?

Opus 5 đã khả dụng ngay hôm nay trên các nền tảng của Claude, với mức giá bằng đúng phiên bản tiền nhiệm: 5 USD mỗi triệu token input, 25 USD mỗi triệu token output. Fast mode chạy với tốc độ gấp khoảng 2,5 lần mặc định, giá gấp đôi mức giá cơ bản của Opus 5 trên Claude Platform (hoặc qua usage credit trong Claude Code), cùng cấu trúc như Opus 4.8.

Lập trình viên truy cập mô hình qua API với model string claude-opus-5.

Hai tính năng liên quan cũng ra mắt ở dạng beta cùng đợt với Opus 5:

  • Thay đổi công cụ giữa cuộc hội thoại trên Claude Platform, cho phép lập trình viên đổi công cụ khả dụng cho Claude giữa chừng mà không làm mất hiệu lực prompt cache.
  • Fallback tự động: Các request bị đánh dấu bởi bộ phân loại an toàn trên Opus 5 hoặc Fable 5 giờ có thể được định tuyến tự động sang một mô hình khả dụng khác thay vì bị chặn hoàn toàn, giúp lưu lượng API tiếp tục chảy đến mô hình tốt nhất khả dụng theo mặc định.

Như các bản Opus trước, Opus 5 không có yêu cầu lưu trữ dữ liệu bắt buộc đối với truy cập thông thường.

Kết luận

Anthropic đang tập trung mạnh vào việc cải thiện nhanh chóng năng lực và hiệu quả mô hình. Lần này, công ty đã thu hẹp khoảng cách với chính mô hình tốt nhất trước đó của mình, Fable 5, ở mức giá thấp hơn đáng kể, đồng thời báo cáo chỉ số alignment tốt nhất từ trước đến nay.

Infinity đánh giá câu hỏi tiếp theo đáng theo dõi là dòng Haiku, mô hình lâu đời nhất của Anthropic, vẫn đang chờ một bản nâng cấp lên thế hệ 5. Đây là một phỏng đoán hợp lý về bước đi kế tiếp, dù Anthropic vẫn luôn có khả năng tạo bất ngờ.

Nguồn: Infinity - đơn vị cung cấp giải pháp Digital Marketing tích hợp cho doanh nghiệp — từ thiết kế website chuẩn SEO & UX/UI, dịch vụ AI SEO (GEO/AEO), PR Digital, sáng tạo nội dung số, quảng cáo trực tuyến (SEM/Ads) đến phân tích dữ liệu Marketing. Với nền tảng nghiên cứu và dữ liệu thực chiến, chúng tôi giúp doanh nghiệp xây dựng chiến lược thương hiệu bền vững và tăng trưởng có hệ thống trong kỷ nguyên AI.


All Rights Reserved

Viblo
Let's register a Viblo Account to get more interesting posts.