Inkling - Mô hình open-weights 975B từ Thinking Machines (Mira Murati)
Inkling là mô hình open-weights đầu tiên của Thinking Machines, phòng lab do cựu CTO OpenAI Mira Murati sáng lập, ra mắt ngày 15/7/2026 với kiến trúc Mixture-of-Experts 975 tỷ tham số tổng và 41 tỷ tham số hoạt động mỗi token.
Khác với các mô hình flagship từ OpenAI, Anthropic hay Google, Inkling cung cấp đầy đủ weight để tải về, cho phép lập trình viên chỉnh sửa trực tiếp thay vì chỉ gọi qua API tính phí theo lượt.
Tóm tắt các điểm chính
- Inkling ra mắt ngày 15/7/2026, có cửa sổ ngữ cảnh 1 triệu token, pretrain trên 45.000 tỷ token văn bản, hình ảnh, âm thanh và video
- Trên Terminal Bench 2.1, Inkling chỉ dùng bằng một phần ba lượng token của NVIDIA Nemotron 3 Ultra để đạt hiệu năng coding tương đương
- Inkling đạt điểm FORTRESS 78,0%, cao nhất trong nhóm mô hình open-weights được Thinking Machines so sánh
- Thinking Machines công khai thừa nhận Inkling không phải mô hình mạnh nhất hiện có, dù mở hay đóng
- Giá sau chiết khấu 50%: 1,87 USD/triệu token input, 4,68 USD/triệu token output ở context 64K
Inkling là gì?
Inkling là mô hình transformer Mixture-of-Experts (MoE) open-weights với 975 tỷ tham số tổng và 41 tỷ tham số hoạt động mỗi token, được định vị là base model đa năng cho việc fine-tune hơn là một chatbot đứng đầu bảng xếp hạng. Đây là bản phát hành đầu tiên trong một dòng sản phẩm đã được lên kế hoạch, ra mắt ngày 15/7/2026 cùng bản preview của một mô hình nhỏ hơn, Inkling-Small.
Mục tiêu thiết kế là độ bao phủ rộng. Thinking Machines huấn luyện Inkling trên các tác vụ agentic, reasoning, coding, tuân theo chỉ dẫn, tính chính xác thông tin (factuality), thị giác và âm thanh, thay vì tối ưu cho một lĩnh vực duy nhất. Điều này quan trọng vì công ty đặt cược rằng các tổ chức sẽ fine-tune mô hình trên dữ liệu riêng của họ, và một base model bao phủ rộng thích ứng với nhiều workflow hơn một mô hình chuyên biệt hẹp.
Tuyên bố năng lực nổi bật nhất của Inkling nằm ở hiệu suất token, không phải điểm số benchmark cao nhất. Trên Terminal Bench 2.1, Thinking Machines báo cáo Inkling chỉ tiêu tốn bằng một phần ba lượng token của NVIDIA Nemotron 3 Ultra để đạt hiệu năng coding tương đương. Với một mô hình có thể được chạy hàng triệu lần trong các workflow dài, đường cong chi phí token này quan trọng hơn một điểm số đơn lẻ ở mức effort tối đa.
Inkling được xây dựng như thế nào?
Kiến trúc MoE của Inkling phần lớn theo hướng DeepSeek-V3, với 256 expert được định tuyến, 2 expert dùng chung, và 6 expert được kích hoạt mỗi token, sử dụng sigmoid router với cơ chế cân bằng tải không cần auxiliary loss.
Thinking Machines xen kẽ sliding-window attention và global attention theo tỷ lệ 5:1, dùng relative positional embedding thay vì RoPE, cho kết quả ngoại suy tốt hơn với chuỗi dài. Quá trình pretrain chạy trên 45.000 tỷ token đa phương thức, dùng optimizer lai: Muon cho các ma trận trọng số lớn và Adam cho các tham số còn lại.
Post-training khởi động bằng một lượng nhỏ SFT trên dữ liệu tổng hợp từ các mô hình open-weights khác, bao gồm Kimi K2.5, sau đó là reinforcement learning bất đồng bộ quy mô lớn, mở rộng tới hơn 30 triệu rollout qua hai lượt chạy liên tục.
Inkling có những tính năng nổi bật nào?
Điểm khác biệt của Inkling nằm ít hơn ở năng lực thuần túy và nhiều hơn ở cách mô hình được thiết kế để tùy biến và kiểm soát.
Điều chỉnh mức độ "thinking effort" ra sao?
Inkling cho phép đặt mức "thinking effort" để đánh đổi giữa độ kỹ lưỡng với chi phí token và độ trễ. Người dùng có thể đẩy effort lên 0,99 để đạt hiệu năng tối đa cho bài toán khó, hoặc hạ xuống thấp cho tác vụ khối lượng lớn nơi tốc độ và chi phí quan trọng hơn.
Đây là hành vi được huấn luyện, không phải một lớp wrapper bên ngoài. Trong quá trình reinforcement learning quy mô lớn, Thinking Machines thay đổi mức effort theo từng sample bằng cách chỉnh system message và điều chỉnh chi phí mỗi token, nhờ đó mô hình học được cách phân bổ ngân sách token khác nhau cho từng rollout. Mức effort có thể truyền vào trực tiếp từ trong một coding harness hay agent harness.
Infinity đánh giá đây là tính năng đáng chú ý nhất với người triển khai production. Độ trễ thường là yếu tố ràng buộc chính với các công cụ tương tác thời gian thực, và khả năng kiểm soát độ trễ theo từng request mà không cần đổi mô hình mang lại giá trị thực chất.
Inkling xử lý input đa phương thức native ra sao?
Inkling suy luận native trên văn bản, hình ảnh và âm thanh, với các thành phần đa phương thức được huấn luyện từ đầu trên dữ liệu tổng quát. Mô hình có thể phiên âm giọng nói, làm theo chỉ dẫn bằng lời nói, trả lời câu hỏi về bản ghi âm, mô tả hình ảnh, và suy luận trên biểu đồ, sơ đồ.
Kiến trúc này không dùng encoder riêng. Âm thanh được đưa vào dưới dạng dMel spectrogram, hình ảnh được mã hóa thành các patch 40x40 pixel qua một hMLP bốn lớp, cả hai đi qua một lớp embedding nhẹ để xử lý cùng với token văn bản. Ở khía cạnh thị giác, Inkling có thể gọi một công cụ Python để zoom và crop trong lúc suy luận, kết hợp suy luận thị giác và suy luận dựa trên code trong cùng một lượt xử lý.
Lưu ý: Input là đa phương thức, nhưng output trong bộ công cụ hiện tại chỉ ở dạng văn bản. Nếu use case cần mô hình tạo trực tiếp hình ảnh hoặc âm thanh, Inkling không đáp ứng được yêu cầu này.
Inkling có khả năng thừa nhận sự bất định như thế nào?
Inkling được huấn luyện để thể hiện đúng mức độ tự tin, bao gồm việc trả lời "tôi không biết" khi khả năng cao là sai, một nhóm năng lực Thinking Machines gọi là "epistemics" của mô hình. Công ty huấn luyện khả năng hiệu chỉnh (calibration) này bằng reinforcement learning dựa trên các quy tắc chấm điểm chuẩn (proper scoring rules), áp dụng trên một kho dữ liệu lớn các câu hỏi thực tế đã có đáp án xác định.
Quá trình post-training dùng hai bộ chấm tự động: một rubric grader kiểm tra câu trả lời theo danh sách tiêu chí của một câu trả lời tốt, và một claims grader xác minh từng tuyên bố dữ kiện thông qua tìm kiếm web dạng agentic. Claims grader phạt các tuyên bố không được xác minh, giúp giảm hallucination thay vì chỉ thưởng cho khả năng ghi nhớ.
Infinity nhận thấy giá trị của cơ chế này nằm ở chỗ một mô hình tự tin ở mọi câu trả lời sẽ buộc người dùng phải kiểm tra lại toàn bộ. Trên ForecastBench Brier Index không dùng search, Inkling đạt 61,1 điểm, ngang bằng Grok 4.3 và vượt qua GPT-5.5 (59,1) cùng Gemini 3.1 Pro (54,6).
Inkling an toàn đến mức nào so với các mô hình open-weights khác?
Inkling đạt điểm FORTRESS 78,0%, mức an toàn đối kháng cao nhất trong nhóm mô hình open-weights mà Thinking Machines so sánh. FORTRESS kiểm tra khả năng từ chối các yêu cầu liên quan đến vũ khí và bạo lực, cùng với các truy vấn trông giống nhưng vô hại, nên điểm cao đồng nghĩa mô hình từ chối đúng yêu cầu độc hại mà không từ chối quá đà với yêu cầu an toàn.
| Mô hình | Điểm FORTRESS |
|---|---|
| Inkling | 78,0% |
| Nemotron 3 Ultra | 77,6% |
| GLM 5.2 | 65,6% |
| Kimi K2.5 | 54,1% |
| DeepSeek V4 Pro | 36,0% |
Inkling cũng đạt 98,6% trên StrongREJECT, bài test từ chối các yêu cầu độc hại rõ ràng, ngang tầm với các mô hình mở và đóng khác.
Câu hỏi còn để ngỏ là điều gì xảy ra sau khi fine-tune. Thinking Machines cho biết vẫn đang nghiên cứu hành vi an toàn thay đổi ra sao khi khách hàng fine-tune trên Tinker, đây là mối lo ngại thực chất với bất kỳ mô hình nào cho phép tải weight về.
Inkling đạt điểm bao nhiêu trên các benchmark?
Inkling nằm ở nhóm giữa trong số các mô hình open-weights: vượt Nemotron 3 Ultra và Kimi K2.5 trên phần lớn bài test reasoning và coding, nhưng thua GLM 5.2 và Kimi K2.6 trên những bài khó nhất. So với các mô hình frontier đóng như GPT-5.6 Sol, Gemini 3.1 Pro và Claude Fable 5, Inkling liên tục ở phía sau. Toàn bộ điểm số dưới đây được báo cáo ở mức effort 0,99.

SWE-Bench Verified và Terminal Bench 2.1 cho kết quả gì?
Trên Terminal Bench 2.1, Inkling đạt 63,8% ở harness tốt nhất, vượt Nemotron 3 Ultra (56,4%) và Kimi K2.5 (51,3%), nhưng thua khá xa GLM 5.2 (82,7%) và GPT-5.6 Sol (89,5%). Đây chính là nơi tuyên bố về hiệu suất token phát huy tác dụng: Inkling đạt hiệu năng coding tương đương Nemotron 3 Ultra nhưng chỉ dùng khoảng một phần ba lượng token.
Humanity's Last Exam và GPQA Diamond cho kết quả gì?
Humanity's Last Exam (HLE) là benchmark reasoning khó và bao phủ rộng. Inkling đạt 29,7% khi chỉ dùng văn bản và 46,0% khi có công cụ hỗ trợ, vượt Nemotron 3 Ultra (26,6% / 37,4%) nhưng thua GLM 5.2 (40,1% / 54,7%) và các mô hình đóng, với GPT-5.6 Sol đạt 47,2% ở chế độ chỉ văn bản.
GPQA Diamond kiểm tra các câu hỏi khoa học trình độ sau đại học.
Inkling chính xác về mặt dữ kiện đến đâu?
Inkling đạt 43,9% trên SimpleQA Verified, vượt Nemotron 3 Ultra (32,4%) và Kimi K2.5 (36,9%), nhưng thua xa Gemini 3.1 Pro (77,3%) và GPT-5.6 Sol (71,6%). Khả năng ghi nhớ dữ kiện thuần túy không phải thế mạnh của mô hình này.
Điểm Inkling thực sự nổi bật là AA Omniscience, benchmark thưởng cho việc biết rõ những gì mình không biết. Inkling đạt điểm dương 2,1, trong khi nhiều mô hình mở khác rơi vào điểm âm: Kimi K2.5 đạt -8,0, DeepSeek V4 Pro đạt -10,0, Nemotron 3 Ultra đạt -1,0. Khoảng cách này phản ánh hiệu quả của quá trình huấn luyện calibration.
Inkling xử lý đa phương thức tốt đến đâu?
Trên MMMU Pro (Standard 10), benchmark suy luận thị giác, Inkling đạt 73,5%, thua Kimi K2.6 (79,0%) và Gemini 3.1 Pro (82,0%). Trên Charxiv RQ đo khả năng suy luận biểu đồ, Inkling đạt 78,1%, tăng lên 82,0% khi được phép dùng công cụ Python.
Về âm thanh, Inkling đạt 91,4% trên VoiceBench, 77,2% trên MMAU và 56,6% trên Audio MC, đưa mô hình vào nhóm các mô hình open-weights xử lý âm thanh mạnh nhất. Gemini 3.1 Pro vẫn dẫn đầu cả ba benchmark này, với 94,3%, 82,5% và 66,8% tương ứng.
Inkling có giá bao nhiêu và truy cập ở đâu?
Inkling khả dụng để fine-tune trên Tinker ngay từ hôm nay, với hai lựa chọn context length 64K và 256K token, và full weight có sẵn trên Hugging Face ở cả hai dạng checkpoint gốc và checkpoint NVFP4 cho inference trên NVIDIA Blackwell.
Thinking Machines đang áp dụng mức chiết khấu 50% trong thời gian giới hạn, giá đầy đủ được công bố trong tài liệu chính thức. Với mức chiết khấu này, giá theo mỗi triệu token như sau:
| Cấu hình | Input/prefill | Output | Training |
|---|---|---|---|
| Standard (context 64K) | 1,87 USD (0,374 USD nếu cache) | 4,68 USD | 5,61 USD |
| Extended (context 256K) | 3,74 USD (0,748 USD nếu cache) | 9,36 USD | 11,23 USD |
Lưu ý: Trong khi Tinker tăng giá cho phần lớn mô hình khác từ ngày 17/7, mức giá của Inkling được giữ nguyên, không chịu đợt tăng này. Phí lưu trữ tiêu chuẩn trên nền tảng vẫn áp dụng ở mức 0,10 USD/GB mỗi tháng cho việc fine-tune.
Hỗ trợ triển khai khá rộng. Các checkpoint đã fine-tune có thể chạy qua API trên TogetherAI, Fireworks, Modal, Databricks và Baseten, hỗ trợ inference mã nguồn mở trên SGLang, vLLM và llama.cpp, cùng một giao diện chat tích hợp tìm kiếm web trong Inkling Playground, miễn phí trong thời gian giới hạn.
Inkling và Inkling-Small khác nhau ra sao?
Cùng với Inkling, Thinking Machines giới thiệu bản preview Inkling-Small, một MoE 276 tỷ tham số với 12 tỷ tham số hoạt động, so với 41 tỷ của mô hình đầy đủ. Inkling-Small đạt điểm ngang bằng hoặc vượt mô hình lớn hơn trên một số benchmark, nhờ cải thiện dữ liệu và công thức pretrain riêng cho mô hình nhỏ.
| Benchmark | Inkling-Small | Inkling |
|---|---|---|
| HLE (có công cụ) | 46,6% | 46,0% |
| GPQA Diamond | 88,3% | 87,2% |
| IFBench | 83,4% | 79,8% |
| SimpleQA Verified | 20,9% | 43,9% |
| Terminal Bench 2.1 | 52,7% | 63,8% |
Infinity nhận thấy Inkling-Small đánh đổi khả năng ghi nhớ dữ kiện và coding agentic khó để lấy chi phí và độ trễ thấp hơn, phù hợp với các workload như chấm điểm, sinh dữ liệu tổng hợp, và coding khối lượng lớn. Full weight của Inkling-Small sẽ được phát hành khi quá trình kiểm thử hoàn tất.
Kết luận
Inkling là một tuyên bố về chiến lược nhiều hơn là một chiến thắng trên bảng xếp hạng. Thinking Machines đặt cược rằng các tổ chức sẵn sàng fine-tune và sở hữu một mô hình riêng sẽ nhận được giá trị lớn hơn so với việc gọi một mô hình frontier đóng theo lượt tính phí, và Inkling chính là base model công ty đưa ra cho canh bạc đó.
Infinity đánh giá sự thẳng thắn của Thinking Machines là điểm đáng chú ý. Công ty công khai thừa nhận Inkling không phải mô hình mạnh nhất, điều hiếm gặp ở một đợt ra mắt sản phẩm, và benchmark cũng xác nhận điều đó: Inkling thua GLM 5.2 và Kimi K2.6 trên các bài test coding và reasoning khó nhất, đồng thời tụt khá xa so với các mô hình đóng như GPT-5.6 Sol và Gemini 3.1 Pro.
Thay vào đó, mô hình mang lại độ bao phủ rộng, input đa phương thức native, câu trả lời được hiệu chỉnh tốt, khả năng kiểm soát thinking effort, và điểm an toàn đối kháng FORTRESS cao nhất trong nhóm mô hình open-weights được so sánh.
Nếu cần điểm số cao nhất trên một benchmark đơn lẻ, Inkling không phải lựa chọn phù hợp. Nếu cần một base model open-weights để fine-tune trên dữ liệu riêng, với khả năng calibration và an toàn tốt sẵn có, đây là một lựa chọn hợp lý, dù giá theo token và độ dài phản hồi mặc định vẫn là điều cần theo dõi với các triển khai khối lượng lớn.
All Rights Reserved