Ngày 13/8/2026, Google chính thức ra mắt Gemini 3.7 Flash - chỉ đúng ba tuần sau khi tung ra Gemini 3.6 Flash. Đây là tốc độ lặp phiên bản nhanh hiếm thấy trong ngành AI, và nó cho thấy Google đang dồn lực để giữ vị thế trước Anthropic (Claude) và OpenAI (GPT) ở phân khúc mô hình "workhorse" - tức các mô hình chi phí thấp nhưng đủ mạnh để chạy khối lượng công việc lớn.

Lưu ý: hiện tại Google vẫn chưa công bố lịch ra mắt Gemini 3.5 Pro - phiên bản cao cấp mà giới đầu tư đang theo dõi sát để đánh giá năng lực của DeepMind so với các đối thủ.

Gemini 3.7 Flash là gì?

Đây là bản nâng cấp của dòng Flash, được Google định vị là mô hình chi phí thấp dành cho doanh nghiệp muốn xây dựng AI agent - hệ thống có thể tự lập kế hoạch, gọi công cụ phần mềm, và hoàn thành quy trình nhiều bước với ít sự can thiệp của con người. Trọng tâm của bản cập nhật lần này nằm ở ba mảng:

  • Lập trình phần mềm: gỡ lỗi, xử lý vấn đề, tạo mã sẵn sàng triển khai
  • Phát triển web (WebDev): tạo giao diện và ứng dụng tương tác hoàn chỉnh chỉ với vài câu lệnh
  • Tự động hóa doanh nghiệp: xử lý tài liệu phức tạp (tài chính, pháp lý) và vận hành quy trình nhiều bước

Một điểm đáng chú ý là mô hình phân bổ nhiều "thời gian suy nghĩ" hơn cho các tác vụ nhiều bước trước khi hành động, giúp giảm sai sót cần con người can thiệp sửa lại.

Bảng điểm benchmark: mạnh ở đâu, yếu ở đâu

Google công bố một loạt benchmark so sánh Gemini 3.7 Flash với chính nó thế hệ trước (3.6 Flash) cũng như với Claude Sonnet 5 và GPT-5.6 Terra. Bức tranh tổng thể khá đa chiều, không phải "thắng tuyệt đối":

Benchmark Gemini 3.7 Flash Claude Sonnet 5 GPT-5.6 Terra
FrontierCode 1.1 (chất lượng code) 43.6% 42.7% 41.3%
DeepSWE v1.1 (kỹ thuật phần mềm dài hạn) 65.3% 54.0% 69.6%
Code Arena / WebDev (Elo) 1588 1541 1523
Terminal-bench 2.1 85.8% - 87.4%
AutomationBench (tự động hóa DN) 30.4% (từ 17.0%) - -
Agent's Last Exam (đa bước, đa phương thức) 26.3% 33.3% -
GDPVal-AA v2 (công việc tri thức tổng hợp) 1,525 1,598 1,578
Artificial Analysis Intelligence Index 56 55 57

Nguồn: số liệu Google công bố và tổng hợp độc lập từ Artificial Analysis, VentureBeat, DataCamp.

Vài điểm rút ra:

  • Lập trình và web dev là nơi Gemini 3.7 Flash tỏa sáng nhất - dẫn đầu ở FrontierCode và Code Arena, kể cả so với các mô hình đắt tiền hơn nhiều.
  • Agent phức tạp, đa bước vẫn là điểm yếu tương đối: Claude Sonnet 5 vượt trội ở Agent's Last Exam và GDPVal-AA (công việc tri thức tổng hợp), còn GPT-5.6 Terra vượt trội ở các tác vụ dùng máy tính/terminal (OSWorld, Terminal-bench).
  • Ngữ cảnh dài là thế mạnh rõ rệt: với cửa sổ ngữ cảnh 1 triệu token, Gemini 3.7 Flash đạt độ chính xác truy xuất cao nhất trong nhóm so sánh ở mức 128k token.
  • Một số chuyên gia độc lập lưu ý rằng các benchmark do Google công bố mới chỉ so sánh nội bộ giữa 3.7 Flash và 3.6 Flash một cách đầy đủ; phần so sánh chéo với GPT/Claude dựa nhiều vào cách Google chọn hiển thị, nên nên xem đây là điểm khởi đầu để tự kiểm chứng hơn là kết luận cuối cùng.

Giá: đây mới là "vũ khí" thực sự

Điểm gây chú ý nhất không hẳn là benchmark, mà là mức giá. Gemini 3.7 Flash giữ nguyên mức giá giới thiệu của bản 3.6 Flash:

  • Input: 0,75 USD / triệu token
  • Output: 3,75 USD / triệu token
  • Áp dụng đến hết năm 2026, sau đó tăng lên 1,50 USD / 7,50 USD

So sánh với các đối thủ cùng thời điểm:

  • Claude Sonnet 5: 2,00 USD input / 10,00 USD output
  • GPT-5.6 Terra: 2,00 USD input / 12,00 USD output
  • Muse Spark 1.2: 1,25 USD input / 4,25 USD output

Nói cách khác, Gemini 3.7 Flash rẻ hơn Claude Sonnet 5 và GPT-5.6 Terra khoảng 2,5–3 lần, trong khi vẫn cạnh tranh sòng phẳng ở các tác vụ lập trình. Đây chính là chiến lược "cuộc chiến giá cả" mà Google theo đuổi: không cần thắng tuyệt đối mọi benchmark, chỉ cần đạt hiệu năng đủ tốt với chi phí thấp hơn hẳn để chiếm thị phần ở các ứng dụng vận hành khối lượng lớn (agent chạy 24/7, xử lý hàng loạt tài liệu...).

Ứng dụng thực tế được Google trình diễn

Tại sự kiện ra mắt, Google giới thiệu vài trường hợp minh họa đáng chú ý:

  • Tạo game 3D từ văn bản: chỉ cần một đoạn mô tả ngắn, mô hình dựng khung game 3D chơi được, kết hợp với Nano Banana để sinh nhân vật, vật phẩm, kết cấu theo thời gian thực.
  • Trợ lý cá nhân rà soát công việc: quét Gmail và Google Drive để tổng hợp việc cần làm trong 30 ngày tới (lịch hẹn, hạn chót, thanh toán, đặt chỗ...), sắp xếp theo mức ưu tiên, nhóm việc có thể làm cùng lúc, và soạn sẵn email phản hồi - nhưng không tự gửi đi. Mô hình còn dẫn ngược về nguồn gốc thông tin (email/tài liệu gốc) để người dùng tự kiểm chứng thay vì phụ thuộc hoàn toàn vào bản tóm tắt.

Cách tiếp cận này phản ánh xu hướng chung của ngành: các hãng AI lớn (Google, OpenAI, Anthropic) đang chuyển trọng tâm từ "mô hình trả lời câu hỏi giỏi" sang "mô hình có thể lập kế hoạch, dùng công cụ, và hoàn thành quy trình việc thật với ít giám sát của con người".

Gemini 3.7 Flash có phù hợp với bạn không?

  • Nên cân nhắc nếu: bạn cần một mô hình chi phí thấp để chạy ở quy mô lớn - coding agent, tự động hóa quy trình doanh nghiệp, xử lý tài liệu dài, hoặc ứng dụng web dev cần tốc độ ra sản phẩm nhanh.
  • Nên cân nhắc lựa chọn khác nếu: bài toán của bạn đòi hỏi suy luận agent đa bước phức tạp, thao tác giao diện máy tính (computer-use), hoặc công việc tri thức tổng hợp yêu cầu độ chính xác cao nhất - ở các mảng này Claude Sonnet 5 và GPT-5.6 Terra vẫn đang dẫn trước.

Kết luận

Gemini 3.7 Flash không phải là bước đột phá kiểu "vượt mặt toàn diện" mọi đối thủ, mà là một nước đi chiến lược rõ ràng: tối ưu chi phí trên mỗi đơn vị năng lực, đặc biệt mạnh ở lập trình và phát triển web, trong khi vẫn còn khoảng cách với các mô hình cao cấp hơn ở tác vụ agent phức tạp. Với chu kỳ ra mắt chỉ ba tuần sau bản trước, Google đang cho thấy tốc độ lặp sản phẩm chưa từng có - và đặt áp lực giá đáng kể lên toàn ngành. Điều này khiến giới quan sát càng tò mò: liệu Gemini 3.5 Pro, mô hình cao cấp còn đang "giấu mặt", sẽ mang đến điều gì khi ra mắt.