Muse Glimmer: Mô hình agentic 30B chạy trên GPU 24GB từ Meta
Meta Superintelligence Labs ra mắt Muse Glimmer ngày 10/8/2026, một mô hình agentic 30 tỷ tham số chạy được trên một GPU tiêu dùng 24GB duy nhất, dẫn đầu nhóm kích thước tương đương trên MCP-Atlas với 75,5 điểm, vượt xa Qwen3.6-27B (62,5) và Gemma4-31B (54,2).
Tóm tắt các điểm chính
- Muse Glimmer là mô hình mở trọng số theo giấy phép Apache 2.0, trọng số được lượng tử hóa còn dưới 20GB, vừa trong bộ nhớ 24GB hoặc 32GB.
- Trên MCP-Atlas, benchmark đo khả năng điều phối tool call qua Model Context Protocol, Muse Glimmer đạt 75,5, dẫn đầu nhóm kích thước tương đương.
- Mô hình vẫn thua Qwen3.6-27B trên OSWorld-Verified (65,9 so với 75,6) và Terminal-Bench 2.1 (51,7 so với 60,7), hai benchmark đo khả năng vận hành máy tính và làm việc dòng lệnh.
- Không có audio input hay output, video chỉ được xử lý dưới dạng từng khung hình riêng lẻ chứ không phải hiểu video thực sự.
- Không có API do Meta host, người dùng phải tự host hoặc dùng nhà cung cấp bên thứ ba như Together AI, Fireworks AI, OpenRouter.
Muse Glimmer là mô hình gì?
Muse Glimmer là mô hình dense 30 tỷ tham số của Meta Superintelligence Labs, được tối ưu cho quy trình agent cục bộ thay vì chat host trên cloud. Mô hình được định vị là phiên bản nhỏ hơn, chưng cất từ một mô hình teacher nội bộ lớn hơn tên Muse Spark, và Meta nói rõ Muse Glimmer không đạt định nghĩa "Frontier AI" của công ty.

Điểm mới ở đây nằm ở mục tiêu triển khai. Phần lớn mô hình agentic mạnh cỡ này mặc định có cả một trung tâm dữ liệu phía sau, nhưng Muse Glimmer được xây để chạy offline trên một GPU tiêu dùng duy nhất. Meta nén trọng số xuống độ chính xác khoảng 4-bit, đưa mô hình ngôn ngữ xuống dưới 20GB để vừa trong khung bộ nhớ 24GB hoặc 32GB với dư khoảng trống.
Con số benchmark đáng chú ý nhất là MCP-Atlas, một benchmark agentic tổng quát, nơi Muse Glimmer đạt 75,5 so với 62,5 của Qwen3.6-27B và 54,2 của Gemma4-31B. Với một mô hình có thể chạy mà không cần kết nối internet, việc dẫn đầu nhóm kích thước tương đương về khả năng điều phối agentic chính là trọng tâm của lần ra mắt này.
Muse Glimmer có những tính năng chính nào?
Muse Glimmer được xây dựng xoay quanh việc chạy agent cá nhân cục bộ, nên các tính năng tập trung vào hoàn thành tác vụ, dùng tool và duy trì phản hồi trên phần cứng giới hạn.
Chạy một agent đầy đủ ở chế độ offline
Có thể giao cho Muse Glimmer một tác vụ nhiều bước để mô hình tự lập kế hoạch, gọi tool, kiểm tra kết quả của chính mình và phục hồi sau lỗi mà không cần kết nối mạng. Alexandr Wang, Chief AI Officer của Meta, cho biết mô hình vận hành như một agent đầy đủ năng lực và giữ được độ tin cậy agentic chỉ với 24GB VRAM.
Với người dùng thực tế, điều này thay đổi nơi một agent có thể tồn tại. Một mô hình soạn email, sắp xếp lại file, hoặc phân loại lịch cần quyền truy cập sâu vào ngữ cảnh cá nhân, và việc giữ ngữ cảnh đó trên chính thiết bị tạo ra một thế đứng về quyền riêng tư khác hẳn so với việc gửi dữ liệu đó lên một API cloud.
Gọi tool đáng tin cậy kèm phục hồi sau lỗi
Muse Glimmer gọi tool theo schema chính xác xuyên suốt các quy trình dài, và khi một lượt gọi thất bại hoặc trả về kết quả bất ngờ, mô hình được huấn luyện để chẩn đoán lỗi và thử lại thay vì dừng hẳn. Đây là hành vi phục hồi sau lỗi, chính là khác biệt giữa một agent hoàn thành tác vụ và một agent bị kẹt giữa chừng. Mô hình hoạt động được với OpenClaw và các mô hình điều phối agentic khác, nên không bị khóa vào một scaffold duy nhất.
Đọc screenshot, biểu đồ và tài liệu
Thông qua một perception encoder chuyên biệt, Muse Glimmer nhận đầu vào xen kẽ văn bản và hình ảnh, cho phép agent diễn giải một screenshot lỗi, một biểu đồ doanh số, hoặc một hóa đơn được scan cùng lúc với cuộc hội thoại. Đây là mô hình nhận văn bản và hình ảnh, chỉ trả ra văn bản.
Giới hạn thực sự: Không có audio input hay output, và video chỉ được xử lý dưới dạng từng khung hình riêng lẻ thay vì hiểu video thực sự. Nếu quy trình làm việc cần xem một bản ghi màn hình từ đầu đến cuối, đây không phải mô hình phù hợp.
Kiểm soát mức độ reasoning
Muse Glimmer hỗ trợ nhiều mức độ reasoning khác nhau, cho phép đánh đổi chất lượng lấy tốc độ tùy theo tác vụ. Một agent đổi tên file nhanh không cần mức độ cân nhắc như một phiên debug nhiều bước, và khả năng điều chỉnh điều này ngay trên thiết bị giúp giữ độ trễ ở mức hợp lý. Mô hình cũng được huấn luyện trên dữ liệu từ hơn 100 ngôn ngữ, dù Meta lưu ý chưa đánh giá đầy đủ trên tất cả ngôn ngữ này, và chất lượng có thể giảm ngoài nhóm ngôn ngữ được hỗ trợ mạnh.
Muse Glimmer đạt điểm benchmark như thế nào so với Qwen3.6-27B và Gemma4-31B?
Muse Glimmer dẫn đầu nhóm kích thước tương đương ở các benchmark agentic tổng quát, nhưng vẫn tụt lại so với Qwen3.6-27B ở một số tác vụ computer-use và terminal.
| Benchmark | Muse Glimmer-30B | Qwen3.6-27B | Gemma4-31B |
|---|---|---|---|
| MCP-Atlas | 75,5 | 62,5 | 54,2 |
| DeepSearch QA | 74,6 | 71,1 | 61,7 |
| OSWorld-Verified | 65,9 | 75,6 | 58,5 |
| SWE-Bench Verified | 76,0 | 77,2 | 66,6 |
| Terminal-Bench 2.1 | 51,7 | 60,7 | 43,4 |
| AIME 2026 | 94,7 | 94,1 | 89,2 |
| GPQA Diamond | 83,5 | 84,2 | 85,7 |
| MMMU Pro | 74 | 75 | 73 |
MCP-Atlas và khả năng agentic tổng quát
MCP-Atlas đo mức độ mô hình điều phối tool call qua Model Context Protocol, và Muse Glimmer đạt 75,5 so với 62,5 của Qwen3.6-27B và 54,2 của Gemma4-31B. Trên DeepSearch QA, benchmark đo khả năng truy xuất thông tin nhiều bước, Muse Glimmer đạt 74,6, nhỉnh hơn 71,1 của Qwen3.6-27B và vượt xa 61,7 của Gemma4-31B.
Bức tranh không đồng nhất hoàn toàn: trên OSWorld-Verified, benchmark kiểm tra agent vận hành máy tính trong môi trường desktop thực tế, Muse Glimmer đạt 65,9 trong khi Qwen3.6-27B dẫn đầu ở mức 75,6, khiến Qwen là lựa chọn mạnh hơn cho agent điều khiển màn hình.
SWE-Bench và coding agentic
SWE-Bench Verified đo khả năng giải quyết GitHub issue thực tế bằng cách viết và debug code. Muse Glimmer đạt 76,0, gần với 77,2 của Qwen3.6-27B và vượt 66,6 của Gemma4-31B. Trên Terminal-Bench 2.1, kiểm tra khả năng hoàn thành tác vụ dòng lệnh, Muse Glimmer tụt lại ở mức 51,7 so với 60,7 của Qwen3.6-27B.
Reasoning: AIME 2026 và GPQA Diamond
AIME 2026 là benchmark toán học cấp thi đấu, và Muse Glimmer đạt 94,7, nhỉnh hơn 94,1 của Qwen3.6-27B và vượt 89,2 của Gemma4-31B, một kết quả mạnh cho một mô hình nhỏ cỡ này. Trên GPQA Diamond, bộ câu hỏi khoa học cấp sau đại học, Muse Glimmer đạt 83,5 trong khi Gemma4-31B dẫn đầu ở mức 85,7, và Qwen3.6-27B ở mức 84,2. Trên Humanity's Last Exam (dạng văn bản, không dùng tool), Muse Glimmer đạt 22,0, nhỉnh thua cả hai đối thủ.
Đa phương thức: MMMU Pro và Charxiv
MMMU Pro kiểm tra reasoning đa phương thức trên ảnh và văn bản ở độ khó cấp sau đại học, và ba mô hình gần như ngang nhau: Muse Glimmer 74, Qwen3.6-27B 75, Gemma4-31B 73. Trên Charxiv Reasoning, kiểm tra khả năng diễn giải biểu đồ, Muse Glimmer đạt 78,8, nhỉnh hơn đôi chút so với cả hai đối thủ. Tuyên bố về thế mạnh trên ScreenSpot Pro của Meta không hoàn toàn đúng: Muse Glimmer đạt 75,4 trong khi Qwen3.6-27B dẫn đầu ở 76,1.
Độ an toàn: CI Memories và Siren AgentDojo
Trên CI Memories, đo tỷ lệ vi phạm quyền riêng tư (thấp hơn là tốt hơn), Muse Glimmer ghi nhận tỷ lệ 26,4 so với 12,1 sạch hơn nhiều của Gemma4-31B và 53,4 của Qwen3.6-27B. Muse Glimmer nằm giữa hai đối thủ ở chỉ số này, an toàn hơn Qwen nhưng vẫn kém xa Gemma. Trên Siren AgentDojo, đo khả năng chống lại tấn công prompt-injection, Muse Glimmer có tỷ lệ tấn công thành công 28,4 với utility 94,2, so với 25,6 của Gemma4-31B và 40,3 của Qwen3.6-27B.

Muse Glimmer có giá bao nhiêu và truy cập ở đâu?
Muse Glimmer được phân phối dưới dạng trọng số mở theo giấy phép Apache 2.0, và không có API do Meta host, nghĩa là không có mức giá tính theo token nào từ Meta, chi phí chỉ nằm ở hạ tầng và tự host.
Có thể chạy Muse Glimmer qua nhiều hướng:
- Tải trọng số trực tiếp từ Hugging Face
- Chạy cục bộ qua Ollama, LM Studio hoặc Unsloth
- Deploy trên các framework edge gồm llama.cpp, ExecuTorch và MLX
- Phục vụ ở quy mô lớn với vLLM và SGLang
- Dùng nhà cung cấp bên thứ ba host sẵn như Together AI, Fireworks AI và OpenRouter
- Fine-tune thêm bằng TorchTitan của PyTorch
Meta đang hợp tác với AMD, Arm, Dell, Intel và NVIDIA để tối ưu hiệu năng trên nhiều thiết bị. Mục tiêu phần cứng thực tế là một máy 24GB hoặc 32GB: Meta ghi nhận bản K-Quant-17GB kết hợp bộ drafter DFlash đã lượng tử hóa tăng tốc độ giải mã lên 3,1 lần trên RTX 5090, 1,8 lần trên M5 Max và 1,5 lần trên M4 Max.
Kết luận
Muse Glimmer là một canh bạc có chủ đích của Meta vào agent cục bộ, riêng tư, mở trọng số, thay vì thêm một mô hình flagship cloud khác. Bằng cách giới hạn ở 30B và phát hành trọng số lượng tử hóa vừa trên một GPU tiêu dùng duy nhất, Meta nhắm vào một ngách mà phần lớn phòng lab bỏ qua: nhà phát triển muốn một agent chạy offline với ngữ cảnh cá nhân không bao giờ rời khỏi thiết bị.
Câu chuyện benchmark không hoàn toàn nghiêng về một phía: Qwen3.6-27B vẫn dẫn đầu trên OSWorld-Verified và Terminal-Bench 2.1, còn Gemma4-31B sạch hơn på CI Memories, và một số reviewer mô tả Muse Glimmer chậm và dễ vỡ khi gần chạm trần bộ nhớ. Nhưng việc dẫn đầu nhóm kích thước tương đương trên MCP-Atlas và DeepSearch QA, cùng giấy phép Apache 2.0 dễ dãi, khiến đây là một lựa chọn nghiêm túc cho bất kỳ ai đang xây agent cục bộ.
Các lưu ý cần nhớ: Không có audio, video chỉ xử lý dưới dạng khung hình, độ bao phủ ngôn ngữ không đồng đều, và benchmark hiện chỉ đến từ nhà cung cấp, chưa có tái lập độc lập. Nếu quy trình làm việc nhạy cảm về quyền riêng tư hoặc thực sự cần chạy không cần mạng, Muse Glimmer đáng để tải về và thử nghiệm song song với Qwen3.6 på chính phần cứng của mình.
Câu hỏi thường gặp
Muse Glimmer so với Muse Spark của Meta khác nhau thế nào?
Muse Glimmer là phiên bản nhỏ hơn, chưng cất từ Muse Spark, mô hình được Meta dùng làm teacher trong quá trình huấn luyện. Meta nói rõ Muse Glimmer không đạt định nghĩa Frontier AI và yếu hơn Muse Spark, nhưng được xây để triển khai cục bộ trên phần cứng tiêu dùng, điều Muse Spark không làm được.
Có thể tải và chạy Muse Glimmer ở đâu?
Trọng số mở của Muse Glimmer nằm trên Hugging Face tại huggingface.co/meta-models/Muse-Glimmer-30B. Có thể chạy cục bộ qua Ollama, LM Studio hoặc Unsloth, deploy bằng llama.cpp, ExecuTorch hoặc MLX, phục vụ bằng vLLM hoặc SGLang, hoặc dùng nhà cung cấp host sẵn như Together AI, Fireworks AI và OpenRouter.
Muse Glimmer có giá bao nhiêu?
Muse Glimmer miễn phí tải về theo giấy phép Apache 2.0, và không có API do Meta host. Chi phí duy nhất là hạ tầng và tự host (một GPU hoặc Mac 24GB hoặc 32GB), hoặc mức phí mà nhà cung cấp bên thứ ba tính khi phục vụ mô hình này.
Cần phần cứng gì để chạy Muse Glimmer cục bộ?
Meta lượng tử hóa mô hình xuống độ chính xác khoảng 4-bit, thu nhỏ còn dưới 20GB để vừa trong khung bộ nhớ 24GB hoặc 32GB cùng với KV cache, image encoder và bộ drafter speculative decoding. Meta đã xác nhận trên MacBook M4 Max, M5 Max và RTX 5090, nơi speculative decoding DFlash tăng tốc độ giải mã tới 3,1 lần.
Muse Glimmer có những giới hạn chính nào?
Muse Glimmer chỉ nhận đầu vào văn bản và hình ảnh, đầu ra chỉ văn bản, không có audio vào hay ra, và video chỉ được xử lý dưới dạng từng khung hình riêng lẻ. Mô hình chưa được đánh giá på toàn bộ hơn 100 ngôn ngữ huấn luyện, suy luận lượng tử hóa có thể khác đôi chút so với độ chính xác đầy đủ trong một số trường hợp biên, và reviewer mô tả mô hình chậm và dễ vỡ khi gần chạm trần bộ nhớ. Mô hình không dành cho người dùng dưới 18 tuổi.
Nguồn: Infinity - đơn vị cung cấp giải pháp Digital Marketing tích hợp cho doanh nghiệp — từ thiết kế website chuẩn SEO & UX/UI, dịch vụ AI SEO (GEO/AEO), PR Digital, sáng tạo nội dung số, quảng cáo trực tuyến (SEM/Ads) đến phân tích dữ liệu Marketing. Với nền tảng nghiên cứu và dữ liệu thực chiến, chúng tôi giúp doanh nghiệp xây dựng chiến lược thương hiệu bền vững và tăng trưởng có hệ thống trong kỷ nguyên AI.
All rights reserved