NVIDIA Nemotron 3.5 Lightning: Mô hình MoE 30B với 3B active, tốc độ gấp 4 lần
NVIDIA Nemotron 3.5 Lightning, ra mắt ngày 11/8/2026, là mô hình mixture-of-experts (MoE) mở 30 tỷ tham số với 3 tỷ tham số hoạt động, được xây riêng cho lớp thực thi khối lượng lớn của các agent hoạt động liên tục, đạt tốc độ output gấp tới 4 lần các mô hình cùng kích thước.
Tóm tắt các điểm chính
- NVIDIA công bố Lightning hoàn thành 10.000 tác vụ nhanh hơn 30% so với Qwen3.6-35B ở độ chính xác tương đương.
- Benchmark chính (BF16): SWE-bench Verified 51,56, PinchBench 85,37, GPQA Diamond 75,44, MMLU Pro 81,94.
- Mô hình phát hành theo giấy phép mở OpenMDW-1.1, kèm trọng số, dữ liệu huấn luyện và recipe, chạy được từ Jetson đến DGX Spark đến trung tâm dữ liệu.
- NeMo Switchyard, thư viện định tuyến công việc, gửi phần lập kế hoạch lên các mô hình frontier như Nemotron 3 Ultra, còn phần thực thi xuống Lightning.
- Giá qua DeepInfra là 0,05 USD trên 1 triệu input token và 0,20 USD trên 1 triệu output token, có sẵn ngay ngày ra mắt không cần cấp GPU riêng.
Nemotron 3.5 Lightning là mô hình gì?
Nemotron 3.5 Lightning là thành viên nhỏ nhất trong dòng mô hình mở Nemotron 3 của NVIDIA, được xây riêng cho việc thực thi độ trễ thấp, khối lượng lớn trong các agent tự động. Mô hình dùng kiến trúc lai Mamba-2 kết hợp MoE và attention, tổng 30 tỷ tham số với 3 tỷ tham số hoạt động mỗi token, hỗ trợ context length lên tới 1M token.

Thiết kế MoE chính là điều giúp mô hình nhanh: một router gửi mỗi token chỉ đến một vài trong số nhiều "chuyên gia" (expert), nên chỉ một phần nhỏ tham số chạy trên mỗi token. Điều này mang lại năng lực tương đương một mô hình dense lớn hơn nhưng với chi phí tính toán của một mô hình nhỏ, cùng cách đánh đổi mà Qwen3.6-35B-A3B áp dụng với 3 tỷ tham số hoạt động.
Tuyên bố lớn nhất từ NVIDIA mang tính vị trí hơn là một điểm số đơn lẻ: trên Artificial Analysis Intelligence Index, chỉ số tổng hợp 9 đánh giá xuyên suốt tác vụ agentic, coding, reasoning khoa học và trí tuệ tổng quát, Lightning nằm trên đường Pareto về độ chính xác và tốc độ đối với các mô hình mở nhỏ. Nói cách đơn giản, không mô hình nào cùng kích thước vừa chính xác hơn vừa nhanh hơn cùng lúc.
Nemotron 3.5 Lightning có gì mới?
Mọi tính năng ở đây đều phục vụ một mục tiêu: chạy công việc thường nhật của một agent thật nhanh mà không làm mô hình sụt giảm độ chính xác.
Chạy agent trên phần cứng cục bộ
Vì mô hình đủ nhỏ để deploy trên NVIDIA DGX Spark, GeForce RTX 5090 hoặc Jetson, có thể chạy khối lượng công việc agentic trên desktop mà không cần trung tâm dữ liệu. NVIDIA hợp tác cùng EXO Labs để đo hiệu năng Lightning trên DGX Spark, ghi nhận mô hình nằm trên đường Pareto cho các mô hình mở nhỏ trên bảng xếp hạng local.ai của EXO Labs.
Với người dùng thực tế, điều này nghĩa là một agent hoạt động liên tục xử lý tool call và xác minh kết quả có thể chạy trên chính phần cứng đã có sẵn. Mô hình cũng có thể phục vụ qua LM Studio, llama.cpp, Ollama và Unsloth, nên hệ sinh thái công cụ cục bộ đã trưởng thành ngay từ lúc ra mắt.
Định tuyến công việc thực thi xuống, lập kế hoạch lên với NeMo Switchyard
NVIDIA phát hành NeMo Switchyard song song với mô hình, một thư viện định tuyến mỗi request đến mô hình hiệu quả nhất có thể xử lý nó. Switchyard đưa Nemotron 3.5 Lightning vào làm một điểm đến định tuyến bên cạnh các mô hình mở và đóng khác, để việc lập kế hoạch định tuyến lên một mô hình frontier như Nemotron 3 Ultra trong khi việc thực thi định tuyến xuống Lightning.
Lợi ích thực tế nằm ở hiệu quả token. Thay vì trả giá mô hình frontier để chạy một lượt git pull, xác minh output tool, hoặc định dạng kết quả, các lượt gọi đó rơi vào mô hình rẻ, còn mô hình đắt được dành riêng cho các bước lập kế hoạch khó, chi phối chất lượng nhưng không chiếm khối lượng lớn.
Tùy chỉnh sẵn sàng ngay từ đầu
Mô hình nhỏ fine-tune nhanh hơn, rẻ hơn và trên phần cứng khiêm tốn hơn so với mô hình lớn, và Lightning được xây để thích ứng với một công việc cụ thể. NVIDIA phát hành trọng số, dữ liệu huấn luyện và recipe theo giấy phép OpenMDW-1.1, có thể fine-tune bằng LoRA hoặc full SFT dùng NeMo Automodel và NeMo Megatron Bridge, hoặc chạy reinforcement learning với NeMo RL và NeMo Gym.
Bản phát hành cũng bao gồm Nemotron-RL Agentic Terminal Pivot, một bộ dữ liệu RL agentic mở dùng để huấn luyện một phần hành vi coding-agent. MindStudio ghi nhận việc fine-tune đối tác hoàn thành trong dưới 3 giờ với khoảng 100 USD, mức chi phí thích ứng chỉ hợp lý với một mô hình kích thước này.
Speculative decoding cho throughput cao hơn
Lightning tạo nhiều token mỗi bước qua speculative decoding, nơi một mô hình draft đề xuất token rồi được xem xét hiệu quả. Mô hình trải qua một giai đoạn pretraining riêng để tích hợp multi-token prediction (MTP), theo sau là giai đoạn tăng cường MTP, cùng cách tiếp cận dùng ở Nemotron 3 Super và Ultra.
Ngoài MTP, NVIDIA cung cấp thêm hai mô hình draft: DSpark được khuyến nghị cho DGX Spark và khối lượng công việc trung tâm dữ liệu concurrency thấp, còn MTP phù hợp concurrency trung bình đến cao, và một mô hình draft DFlash cũng được cung cấp để benchmark xem loại nào hoạt động tốt nhất cho mô hình phục vụ của mình.
Nemotron 3.5 Lightning đạt benchmark bao nhiêu?
NVIDIA công bố điểm cho cả hai checkpoint BF16 và NVFP4, hai loại này gần như tương đương ở phần lớn tác vụ, điều quan trọng vì NVFP4 chính là checkpoint lượng tử hóa sẽ thực sự được deploy. Các con số dưới đây đến từ model card và blog ra mắt chính thức của NVIDIA, chưa có tái lập độc lập từ bên thứ ba tại thời điểm viết bài.

SWE-bench Verified
Lightning đạt 51,56 (BF16) và 52,80 (NVFP4) trên SWE-bench Verified, benchmark đo khả năng giải quyết GitHub issue thực tế bằng cách tạo ra một bản patch code hoạt động được. Với một mô hình MoE 30B chỉ có 3B tham số hoạt động, vượt qua mốc 50% trên benchmark này là kết quả vững chắc, ủng hộ trực tiếp use case coding-agent. SWE-bench Multilingual thấp hơn ở mức 39,33 (BF16), điều dễ hiểu vì bộ codebase đa ngôn ngữ khó hơn.
PinchBench và hiệu quả tác vụ
Trên PinchBench, Lightning đạt 85,37 (BF16) và 83,43 (NVFP4), và OpenRouter ghi nhận mô hình hoàn thành 10.000 tác vụ nhanh hơn 30% so với Qwen3.6-35B ở độ chính xác tương đương. Đây là benchmark bám sát nhất luận điểm thực sự của mô hình, vì hiệu quả agent nằm ở tốc độ hoàn thành công việc hữu ích, không phải tốc độ tạo token thô.
So sánh với Qwen3.6 đáng để dừng lại: khi đánh giá Qwen3.6-35B-A3B trước đó, Infinity ghi nhận 3B tham số hoạt động cùng hiệu năng SWE-bench và Terminal-Bench mạnh, nên việc NVIDIA chọn mô hình này làm mốc so sánh là một cuộc so tài công bằng trong cùng nhóm kích thước.
GPQA Diamond và reasoning
Lightning đạt 75,44 (BF16) trên GPQA Diamond không dùng tool, bộ câu hỏi khoa học cấp sau đại học được viết để khó ngay cả với người không chuyên dùng web. Đây là con số mạnh cho một mô hình nhỏ, dù model card nói rõ Lightning không được định vị là một engine reasoning.
Humanity's Last Exam (chỉ văn bản, không dùng tool) kể mặt còn lại của câu chuyện ở mức 11,72 (BF16), và SciCode chỉ đạt 32,60. Các điểm số thấp này khớp với cách NVIDIA định vị: đây là mô hình thực thi, còn reasoning mở khó nên được định tuyến đến một mô hình frontier thay thế.
Agentic và tuân theo hướng dẫn
Terminal-Bench 2.1 đạt 24,58 (BF16) và BrowseComp đạt 36,97, trong khi IFBench (loose) đạt 71,88, cho thấy mô hình tuân theo hướng dẫn có cấu trúc đáng tin cậy. Kiến thức tổng quát cũng vững, với MMLU Pro đạt 81,94 (BF16) và 81,62 (NVFP4), khoảng cách không đáng kể xác nhận checkpoint lượng tử hóa an toàn để deploy.
Nemotron 3.5 Lightning so với Qwen3.6-35B-A3B khác nhau ở đâu?
Cả hai đều là mô hình MoE với 3B tham số hoạt động, nhắm vào coding và khối lượng công việc agentic, nên đặt cạnh nhau là cách rõ nhất để thấy vị trí của Lightning.
| Thuộc tính | Nemotron 3.5 Lightning | Qwen3.6-35B-A3B |
|---|---|---|
| Tham số tổng / hoạt động | 30B / 3B | 35B / 3B |
| Context window | Lên tới 1M token | 262K token |
| SWE-bench Verified | 51,56 (BF16) | Mạnh (theo đánh giá của Infinity) |
| Giấy phép | OpenMDW-1.1 (mở) | Mở |
| Định vị | Lớp thực thi của agent | Coding, reasoning, context dài |
Nemotron 3.5 Lightning có giá bao nhiêu và truy cập ở đâu?
Có thể thử Nemotron 3.5 Lightning trên build.nvidia.com hoặc qua OpenRouter, và tải trọng số từ Hugging Face và ModelScope. Mô hình cung cấp endpoint tương thích OpenAI qua NVIDIA NIM, gồm /v1/chat/completions, /v1/completions và /v1/responses, nên tích hợp được vào pipeline agentic hiện có mà không cần viết lại.
Giá host thay đổi theo nhà cung cấp:
- DeepInfra: 0,05 USD trên 1 triệu input token và 0,20 USD trên 1 triệu output token, khả dụng ngay ngày ra mắt, không cần cấp GPU riêng.
- OpenRouter: Tầng miễn phí niêm yết 0 USD input và 0 USD output, nhưng lưu ý dù route này hỗ trợ context window 1M token, nó áp giới hạn tối đa 65.536 token cho phần output.
- Tự host: Miễn phí theo giấy phép OpenMDW-1.1, deploy được qua vLLM, SGLang và TensorRT-LLM.
Lưu ý: Giới hạn của OpenRouter đáng lưu ý: context length 1M token là năng lực của mô hình, nhưng giới hạn thực tế nhận được phụ thuộc vào nhà cung cấp và route cụ thể, nên cần kiểm tra endpoint trước khi giả định có đủ toàn bộ window.
Kết luận
Nemotron 3.5 Lightning là một canh bạc cụ thể của NVIDIA: tương lai của agent trong môi trường sản xuất là một hệ thống nhiều mô hình, nơi một mô hình thực thi rẻ xử lý khối lượng lớn còn một mô hình frontier xử lý lập kế hoạch. Việc phát hành NeMo Switchyard cùng lúc chính là dấu hiệu, vì mô hình này chỉ thực sự có ý nghĩa khi có thể định tuyến công việc đến nó một cách thông minh.
Điều đáng chú ý nhất là sự trung thực về phạm vi: NVIDIA không giả vờ đây là một mô hình reasoning, và benchmark ủng hộ điều đó, mạnh trên SWE-bench Verified (51,56) và PinchBench (85,37), khiêm tốn trên Humanity's Last Exam (11,72). Nếu khối lượng công việc là tool call, xác minh và định dạng trên các agent hoạt động liên tục, đây chính là sự đánh đổi phù hợp.
Việc phát hành mở theo OpenMDW-1.1 kèm trọng số, dữ liệu và recipe, cộng một checkpoint đủ nhỏ để chạy trên DGX Spark, khiến mô hình này thực sự hữu ích cho các đội muốn fine-tune và tự host thay vì trả tiền theo token. Lưu ý chính: mọi con số benchmark hiện tại đều do nhà cung cấp công bố, nên cần chờ tái lập độc lập trước khi coi các tuyên bố tốc độ gấp 4 lần và hoàn thành nhanh hơn 30% là đã được xác nhận chắc chắn.
Câu hỏi thường gặp
Nemotron 3.5 Lightning so với các mô hình Nemotron khác thế nào?
Nemotron 3.5 Lightning là thành viên nhỏ nhất trong dòng Nemotron 3 của NVIDIA, được xây cho thực thi khối lượng lớn, độ trễ thấp thay vì lập kế hoạch phức tạp. Các mô hình frontier như Nemotron 3 Ultra xử lý điều phối và reasoning khó, còn Lightning xử lý các việc thực thi thường nhật như tool call, xác minh và định dạng. NeMo Switchyard định tuyến công việc giữa chúng, lập kế hoạch đi lên, thực thi đi xuống.
Có thể truy cập Nemotron 3.5 Lightning ở đâu?
Có thể thử trên build.nvidia.com hoặc qua OpenRouter, và tải trọng số từ Hugging Face và ModelScope. Mô hình khả dụng ngay ngày ra mắt trên các nhà cung cấp host bao gồm DeepInfra, và tự host được qua vLLM, SGLang và TensorRT-LLM. Các công cụ cục bộ như LM Studio, llama.cpp, Ollama và Unsloth cũng được hỗ trợ.
Chi tiết giá của Nemotron 3.5 Lightning là bao nhiêu?
DeepInfra niêm yết 0,05 USD trên 1 triệu input token và 0,20 USD trên 1 triệu output token. OpenRouter cung cấp tầng miễn phí với 0 USD input và 0 USD output, giới hạn tối đa 65.536 token trên route đó. Mô hình cũng miễn phí để tự host theo giấy phép OpenMDW-1.1.
Nemotron 3.5 Lightning phù hợp nhất để dùng cho việc gì?
Mô hình được xây cho lớp thực thi của các agent tự động hoạt động dài hạn: tool call, xác minh kết quả, truy xuất, định dạng, tóm tắt và phân loại. NVIDIA và các đối tác nói rõ mô hình không nhằm cho chat mở hoặc reasoning sâu, những việc đó nên được định tuyến đến một mô hình frontier thay thế.
Nemotron 3.5 Lightning có phải mã nguồn mở không?
Có. NVIDIA phát hành trọng số, dữ liệu huấn luyện và recipe theo giấy phép OpenMDW-1.1, được mô tả là dễ dãi và sẵn sàng cho sử dụng thương mại. Mô hình đi kèm cả checkpoint BF16 lẫn NVFP4 đã lượng tử hóa, cùng một bộ dữ liệu RL agentic mở gọi là Nemotron-RL Agentic Terminal Pivot.
Nguồn: Infinity - đơn vị cung cấp giải pháp Digital Marketing tích hợp cho doanh nghiệp — từ thiết kế website chuẩn SEO & UX/UI, dịch vụ AI SEO (GEO/AEO), PR Digital, sáng tạo nội dung số, quảng cáo trực tuyến (SEM/Ads) đến phân tích dữ liệu Marketing. Với nền tảng nghiên cứu và dữ liệu thực chiến, chúng tôi giúp doanh nghiệp xây dựng chiến lược thương hiệu bền vững và tăng trưởng có hệ thống trong kỷ nguyên AI.
All rights reserved