Google ra mắt Gemini 3.6 Flash, 3.5 Flash-Lite và Cyber
Google ra mắt cùng lúc ba mô hình Gemini vào ngày 21/7/2026, chia sẻ chung một mục tiêu: làm được nhiều việc hơn với ít token hơn.
Infinity phân tích bộ ba Gemini 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber, và nhận thấy đây không phải ba đợt ra mắt độc lập, mà là một lần điều chỉnh toàn bộ tầng Flash cho workload agentic quy mô lớn, trong khi các mô hình tham vọng hơn như 3.5 Pro và Gemini 4 vẫn đang được giữ lại.
Tóm tắt các điểm chính
- Ba mô hình ra mắt cùng ngày 21/7/2026: 3.6 Flash (đa dụng), 3.5 Flash-Lite (tốc độ và giá rẻ), 3.5 Flash Cyber (chuyên biệt an ninh mạng)
- 3.6 Flash giảm 17% lượng output token so với 3.5 Flash trên Artificial Analysis Index, một số eval riêng lẻ như DeepSWE giảm tới 65%
- 3.5 Flash-Lite đạt tốc độ 350 output token mỗi giây, giá 0,30 USD/triệu token input và 2,50 USD/triệu token output, rẻ nhất trong dòng 3.5
- Trên GDM-MRCR v2 đo long-context, 3.6 Flash đạt 91,8%, vượt xa mọi mô hình khác trong bảng so sánh, kể cả Claude Sonnet 5 (71,6%)
- 3.5 Flash Cyber chỉ khả dụng cho chính phủ và đối tác tin cậy qua chương trình pilot CodeMender, chưa công bố giá công khai
Gemini 3.6 Flash là gì?
Gemini 3.6 Flash là trung tâm của đợt ra mắt này, mô hình Google muốn người dùng mặc định lựa chọn cho coding, công việc tri thức và mọi tác vụ đa phương thức. Theo Artificial Analysis Index, 3.6 Flash giảm 17% lượng output token so với 3.5 Flash, và Google báo cáo mức giảm lên tới 65% trên một số eval riêng lẻ như DeepSWE. Một phần mức giảm này đến từ việc mô hình thông minh hơn nên nói ít hơn. Phần còn lại đến từ việc đi đến kết luận qua ít bước reasoning và ít lượt gọi công cụ hơn, đây là loại cải thiện khác biệt và khó "làm giả" hơn.
3.6 Flash nhận input dạng văn bản, hình ảnh, video, âm thanh và PDF, chạy cửa sổ ngữ cảnh 1 triệu token với giới hạn output 64.000 token. Tính năng computer use hiện được tích hợp sẵn vào cả Gemini API lẫn Gemini Enterprise, cùng với function calling, structured output và search-as-a-tool.
So sánh Gemini 3.6 Flash so với Gemini 3.5 Flash
So với phiên bản tiền nhiệm của chính mình, mức nhảy vọt gần như xuất hiện ở mọi mặt: DeepSWE tăng gần gấp đôi, MLE-Bench tăng từ 49,7% lên 63,9%, hiệu năng long-context trên GDM-MRCR v2 cải thiện hai chữ số phần trăm.
Gemini 3.5 Flash-Lite là gì?
3.5 Flash-Lite không cố gắng trở thành mô hình thông minh nhất trong dòng sản phẩm. Đây là mô hình nhanh nhất, đạt 350 output token mỗi giây, và rẻ nhất, ở mức 0,30 USD/triệu token input và 2,50 USD/triệu token output.
Nếu workload có khối lượng lớn và nhạy cảm với độ trễ, ví dụ tìm kiếm agentic, xử lý tài liệu hàng loạt, hoặc bất kỳ tác vụ nào chạy hàng nghìn lần mỗi ngày, khoảng cách chất lượng mà các mô hình khác mang lại thường không đáng với chi phí bỏ ra để thu hẹp khoảng cách đó. Đây chính là canh bạc mà Flash-Lite đang đặt cược.
Lập trình viên có thể chỉnh mức thinking lên hoặc xuống theo từng job: mức minimal hoặc low cho việc thực thi rẻ, nhanh, khối lượng lớn, hoặc mức cao hơn cho công việc subagent nhiều bước thực sự cần suy luận qua vấn đề.
3.5 Flash-Lite thậm chí không cố cạnh tranh về chất lượng. Mô hình này đặt cược rằng với phần lớn workload agentic, chất lượng vượt qua một ngưỡng nhất định không còn quan trọng bằng tốc độ và chi phí nữa. Điều này có lẽ đúng trong đa số trường hợp. Đây cũng là kiểu đặt cược trông có vẻ hiển nhiên đúng cho đến khi một agent đưa ra một quyết định sai mà một mô hình thông minh hơn đã không mắc phải.
So sánh Gemini 3.5 Flash-Lite so với Gemini 3.1 Flash-Lite
So với phiên bản tiền nhiệm 3.1 Flash-Lite, khoảng cách không hề nhỏ: Terminal-Bench 2.1 tăng từ 31% lên 54%, GDM-MRCR v2 từ 60,1% lên 72,2%, GDPVal-AA v2 từ 642 lên 1140.
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|
| Terminal-Bench 2.1 | 54% | 31% |
| GDM-MRCR v2 (long context) | 72,2% | 60,1% |
| GDPVal-AA v2 (Elo) | 1140 | 642 |
So sánh đáng chú ý hơn thực ra là so sánh theo chiều đi lên. Trên một số eval agentic và coding, 3.5 Flash-Lite hiện vượt hẳn Gemini 3 Flash cũ hơn và lớn hơn: SWE-Bench Pro (54,2% so với 49,6%), OSWorld-Verified (74,0% so với 65,1%). Nếu điều này duy trì đúng trên workload thực tế của người dùng, đây là một khoản cắt giảm chi phí thuần túy mà không kèm theo bất kỳ thiệt hại chất lượng nào.
Gemini 3.5 Flash Cyber là gì?
Cuối cùng là Cyber, mô hình mà phần lớn người đọc bài này sẽ không bao giờ được chạm tới. Đây là bản 3.5 Flash được fine-tune chuyên biệt để tìm và vá lỗ hổng bảo mật, triển khai bên trong hệ thống CodeMender của Google, nơi nhiều agent dùng model Cyber phối hợp với nhau và trả về một báo cáo tổng hợp duy nhất.
Google cho biết mô hình này cạnh tranh được với các mô hình quy mô frontier trên CyberGym, một benchmark an ninh mạng được sử dụng rộng rãi, dù có kích thước nhỏ hơn nhiều. Đây có thể là câu chuyện về hiệu suất đáng chú ý nhất trong toàn bộ đợt ra mắt này, nếu con số này được xác nhận đúng thực tế.
Khả năng truy cập bị giới hạn cho chính phủ và các đối tác tin cậy thông qua chương trình pilot của CodeMender. Chưa có giá công khai, chưa có ngày phát hành đại trà.
Cyber hoàn toàn không nằm trên bất kỳ bảng xếp hạng nào. Đây là một công cụ hẹp, xây dựng cho một công việc duy nhất, chỉ mở cho những người mà Google tin tưởng có thể sử dụng một cách có trách nhiệm, điều này tự nó đã nói lên mức độ nghiêm túc mà Google dành cho rủi ro phát hiện lỗ hổng, không kém gì phần nói về an toàn ở trên.
Gemini 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber đạt điểm bao nhiêu trên benchmark?
Trên GDM-MRCR v2 đo long-context ở 128k, Gemini 3.6 Flash đạt 91,8%, vượt xa mọi mô hình khác trong bảng so sánh, kể cả Claude Sonnet 5 (71,6%) và GPT-5.6 Luna (74,8%).
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Gemini 3.1 Pro | GPT-5.6 Luna | Grok 4.5 | Claude Sonnet 5 |
|---|---|---|---|---|---|---|
| Giá input ($/1M) | 1,50 | 1,50 | 2,00 | 1,00 | 2,00 | 3,00 |
| Giá output ($/1M) | 7,50 | 9,00 | 12,00 | 6,00 | 6,00 | 15,00 |
| SWE-Bench Pro | 58,7% | 55,1% | 54,2% | 62,7% | 64,7% | 63,2% |
| DeepSWE v1.1 | 49% | 37% | 12% | 67% | 54% | 54% |
| Terminal-Bench 2.1 | 78,0% | 76,2% | 73,8% | 84,7% | 83,3% | 80,4% |
| MLE-Bench | 63,9% | 49,7% | 42,6% | 47,6% | 43,2% | 66,9% |
| OSWorld-Verified | 83,0% | 78,4% | 76,2% | 72,6% | — | 81,2% |
| GDPVal-AA v2 (Elo) | 1421 | 1349 | 965 | 1584 | 1535 | 1607 |
| CharXiv Reasoning (không công cụ) | 85,2% | 84,2% | 83,3% | 82,7% | 81,6% | 77,0% |
| GDM-MRCR v2, 128k | 91,8% | 77,3% | 84,9% | 74,8% | 81,4% | 71,6% |
So với đối thủ bên ngoài, kết quả là một trận hòa chia phần. GPT-5.6 Luna và Grok 4.5 dẫn đầu trên các benchmark nặng về coding như SWE-Bench Pro, DeepSWE, và đây là một khoảng cách thực chất nếu workload của người dùng thực sự thiên về coding chứ không chỉ liên quan gián tiếp đến coding. Claude Sonnet 5 dẫn đầu về công việc tri thức và MLE-Bench.
Infinity nhận thấy nơi 3.6 Flash thực sự thắng thế là truy xuất long-context và suy luận dựa trên biểu đồ, với khoảng cách đủ lớn để không còn là một cuộc đua sít sao, đồng thời mô hình này có giá output thấp hơn mọi mô hình khác trong bảng, ngoại trừ GPT-5.6 Luna và Grok 4.5.
Bộ ba mô hình mới của Google khả dụng ở đâu, giá bao nhiêu?
3.6 Flash và 3.5 Flash-Lite đã hoạt động ngay hôm nay, khả dụng trên Gemini API, Google AI Studio, Android Studio, và riêng 3.6 Flash còn có mặt trên Google Antigravity. Khách hàng doanh nghiệp tiếp cận cả hai mô hình qua Gemini Enterprise Agent Platform, với 3.6 Flash cũng có mặt trong ứng dụng Gemini Enterprise. Ở phía người dùng phổ thông, cả hai mô hình đều có trong ứng dụng Gemini, và Flash-Lite đang bắt đầu xuất hiện trong chế độ AI Mode của Google Search.
| Mô hình | Giá input | Giá output |
|---|---|---|
| Gemini 3.6 Flash | 1,50 USD/triệu token | 7,50 USD/triệu token |
| Gemini 3.5 Flash-Lite | 0,30 USD/triệu token | 2,50 USD/triệu token |
| Gemini 3.5 Flash Cyber | Chưa công bố giá công khai, giới hạn trong chương trình pilot CodeMender | Chưa công bố giá công khai, giới hạn trong chương trình pilot CodeMender |
Mỗi mô hình trong ba mô hình mới nằm ở một điểm khác nhau trên đường cong chi phí-năng lực. 3.6 Flash là bản nâng cấp đa dụng, Flash-Lite đánh đổi chất lượng để lấy tốc độ và giá, còn Cyber là công cụ bảo mật chuyên biệt mà phần lớn người dùng sẽ không bao giờ được tiếp cận trực tiếp.
Không mô hình nào trong ba mô hình này cố gắng đứng đầu mọi bảng xếp hạng, và đây có lẽ là lựa chọn đúng đắn. 3.6 Flash nhường sân cho GPT-5.6 Luna và Grok 4.5 trên các benchmark coding, và nhường cho Claude Sonnet 5 về công việc tri thức, để đổi lấy một bước nhảy hiệu suất thực chất so với chính phiên bản tiền nhiệm và vị trí dẫn đầu rõ rệt về truy xuất long-context.
Gemini 3.6 Flash có những cơ chế an toàn nào?
3.6 Flash ra mắt với cơ chế Frontier Safety được tăng cường quanh nguy cơ lạm dụng CBRN và tấn công mạng, theo ngôn ngữ tiêu chuẩn mà các phòng lab thường dùng để mô tả nỗ lực khiến việc jailbreak khó hơn mà không làm mô hình trở nên khó chịu khi dùng. Đây là điểm cân bằng mà mọi phòng lab đều tuyên bố đã đạt được, dù các bình luận trên X luôn kể một câu chuyện khác.
Việc giới hạn triển khai của Cyber thực chất phản ánh cùng một bản năng đó, chỉ áp dụng theo cách khác. Thay vì cố gắng tinh chỉnh an toàn cho một mô hình chuyên tìm lỗ hổng để phát hành rộng rãi, Google đơn giản là không phát hành rộng rãi mô hình đó.
Điều gì tiếp theo cho Gemini: lộ trình 3.5 Pro và Gemini 4?
3.5 Pro vẫn đang trong giai đoạn thử nghiệm với đối tác, Google cho biết sẽ phát hành đại trà khi đã sẵn sàng. Đáng chú ý hơn, Google xác nhận đã bắt đầu pretrain Gemini 4, gọi đây là lượt pretrain tham vọng nhất từ trước đến nay của công ty.
Kết luận
Gộp lại, đợt ra mắt này ít giống ba lần công bố riêng lẻ, mà giống một lần Google điều chỉnh toàn bộ tầng Flash cho workload agentic ở quy mô lớn, trong khi vẫn giữ lại các mô hình thực sự tham vọng, 3.5 Pro và Gemini 4, cho đến khi chúng sẵn sàng.
Nguồn: Infinity - đơn vị cung cấp giải pháp Digital Marketing tích hợp cho doanh nghiệp — từ thiết kế website chuẩn SEO & UX/UI, dịch vụ AI SEO (GEO/AEO), PR Digital, sáng tạo nội dung số, quảng cáo trực tuyến (SEM/Ads) đến phân tích dữ liệu Marketing. Với nền tảng nghiên cứu và dữ liệu thực chiến, chúng tôi giúp doanh nghiệp xây dựng chiến lược thương hiệu bền vững và tăng trưởng có hệ thống trong kỷ nguyên AI.
All Rights Reserved