Grok 4.6: Ngày phát hành, giá, benchmark và điểm mới
Grok 4.6 đã ra mắt: xem giá API thực tế, điểm benchmark với GPT-5.6 và Claude Opus 5, giới hạn ngữ cảnh và có đáng chuyển đổi không.
Long Nguyen
Lập trình viên Fullstack · Kỹ sư AI · Nhà nghiên cứu
xAI (hiện hoạt động dưới công ty mẹ SpaceXAI) đã phát hành Grok 4.6 vào ngày 12 tháng 8 năm 2026. Thông điệp chính khá đơn giản: đây là một bước tiến đáng kể so với Grok 4.5 về khả năng lập trình và thực hiện tác vụ dạng agent, trong khi giá API vẫn giữ nguyên. Tuy nhiên, nhận định này có chính xác hay không còn phụ thuộc vào con số bạn xem xét — vì vậy dưới đây là phân tích chi tiết, không tô hồng theo không khí ngày ra mắt.
Grok 4.6 là gì?
Grok 4.6 là mô hình ngôn ngữ frontier mới nhất của xAI, được phát triển bằng cách tinh chỉnh nền tảng 1,5 nghìn tỷ tham số từng vận hành Grok 4.5, thay vì xây dựng một mô hình cơ sở lớn hơn. Phần lớn cải tiến đến từ post-training (huấn luyện sau), bao gồm supervised fine-tuning và reinforcement learning được nâng cấp, cùng bộ khung lập trình “Grok Build” của xAI, dùng để huấn luyện mô hình với các tác vụ lập trình thực tế.
Đây là một lựa chọn chiến lược đáng chú ý. Thay vì tăng số lượng tham số, xAI đang thử nghiệm xem chỉ riêng post-training có thể đưa một mô hình tiến xa đến đâu — và các điểm số ban đầu cho thấy câu trả lời là “khá xa”.
Mô hình hỗ trợ đầu vào văn bản và hình ảnh, đầu ra chỉ bằng văn bản, cửa sổ ngữ cảnh 500.000 token, function calling, structured outputs và khả năng tùy chỉnh mức độ suy luận. Hiện bạn có thể sử dụng mô hình thông qua xAI API, Grok Build, Cursor, Grok Bot, OpenRouter, Vercel và Cloudflare.
Benchmark Grok 4.6: Thứ hạng thực tế ra sao?
Trên Artificial Analysis Intelligence Index — một trong những bảng tổng hợp benchmark độc lập được trích dẫn rộng rãi — Grok 4.6 đạt 61 điểm, gần ngang GPT-5.6 Sol và cao hơn Grok 4.5 khoảng 5 điểm. Kết quả này đưa Grok 4.6 đứng ngay sau Claude Opus 5 và Fable 5 của Anthropic, hai mô hình hiện giữ hai vị trí đầu trên cùng chỉ số.
Một số điểm cụ thể đáng lưu ý:
- Grok 4.6 dẫn đầu ở CursorBench, FrontierCode và AA-Briefcase, nhưng vẫn kém GPT-5.6 Sol trên DeepSWE cùng một số bài đánh giá chuyên biệt về lập trình khác.
- Trong các tác vụ agent, Grok 4.6 được cho là hoàn thành quy trình nhiều bước phức tạp trong khoảng 53 bước, so với khoảng 103 bước của Claude Opus 5 — với chi phí cho mỗi tác vụ thấp hơn đáng kể.
- Một số người thử nghiệm ban đầu báo cáo điểm ELO gần 1753 trong các sàn đấu đối đầu giữa các mô hình, dù LMSYS Chatbot Arena và Artificial Analysis vẫn chưa xác nhận độc lập ngay sau thời điểm ra mắt.
Điểm cần thẳng thắn lưu ý: phần lớn đây là kết quả do nhà cung cấp báo cáo hoặc tự lựa chọn. xAI cho biết các so sánh với bên thứ ba sử dụng điểm số công khai tốt nhất của các mô hình cạnh tranh, đồng nghĩa điều kiện kiểm thử, thiết lập suy luận và quyền truy cập công cụ có thể không giống nhau hoàn toàn. Hãy xem các con số này là chỉ báo về xu hướng, không phải thứ hạng cuối cùng đã được xác lập.
Giá Grok 4.6: Phần mà hầu hết so sánh đều tính sai
Mức giá API được công bố là 2 USD cho mỗi triệu token đầu vào và 6 USD cho mỗi triệu token đầu ra — không đổi so với Grok 4.5, đồng thời rẻ hơn khoảng 60% so với Claude Opus 5 (5/25 USD) hoặc GPT-5.6 Sol (5/30 USD) theo giá niêm yết.
Tuy nhiên, mức 2/6 USD này chỉ áp dụng cho prompt dưới 200.000 token. Khi một yêu cầu vượt ngưỡng đó, mức giá ngữ cảnh dài của xAI sẽ được áp dụng và tăng gấp đôi — lên 4 USD cho mỗi triệu token đầu vào và 12 USD cho mỗi triệu token đầu ra. Quan trọng là mức giá cao hơn áp dụng cho toàn bộ token trong yêu cầu, không chỉ phần token vượt ngưỡng.
| Tiêu chuẩn (dưới 200K token) | Ngữ cảnh dài (từ 200K token) | |
|---|---|---|
| Đầu vào | 2 USD / 1 triệu token | 4 USD / 1 triệu token |
| Đầu vào được lưu trong bộ nhớ đệm | 0,50 USD / 1 triệu token | 1 USD / 1 triệu token |
| Đầu ra | 6 USD / 1 triệu token | 12 USD / 1 triệu token |
Giá đầu vào được lưu trong bộ nhớ đệm cũng âm thầm tăng từ 0,30 lên 0,50 USD cho mỗi triệu token ở gói tiêu chuẩn so với Grok 4.5 — một chi tiết không xuất hiện trong thông báo ra mắt. Nếu khối lượng công việc của bạn dựa nhiều vào tài liệu dài hoặc kho mã nguồn lớn, hãy tính riêng chi phí theo gói ngữ cảnh dài trước khi mặc định rằng cách nói “bằng một nửa giá các mô hình frontier” áp dụng cho trường hợp của mình.
Với người dùng cá nhân, Grok vẫn có thể được sử dụng thông qua X/Grok Bot theo các gói phân tầng, trong đó gói cao cấp SuperGrok Heavy có giá khoảng 300 USD/tháng.
Grok 4.6 so với GPT-5.6 Sol và Claude Opus 5
Dưới đây là cách ba mô hình này hiện được xếp hạng dựa trên dữ liệu công khai:
| Mô hình | Artificial Analysis Intelligence Index | Giá đầu vào / đầu ra (mỗi 1 triệu token) | Cửa sổ ngữ cảnh |
|---|---|---|---|
| Grok 4.6 | 61 | 2 USD / 6 USD | 500K |
| GPT-5.6 Sol | 61 | 5 USD / 30 USD | — |
| Claude Opus 5 | ~63–65 (xếp hạng #1) | 5 USD / 25 USD | — |
Grok 4.6 ngang bằng GPT-5.6 Sol về điểm trí tuệ tổng thể nhưng có giá thấp hơn đáng kể, đồng thời cũng nhỉnh hơn mô hình open-weight Kimi K3. Claude Opus 5 và Fable 5 vẫn dẫn đầu chỉ số tổng thể, vì vậy “mô hình tốt nhất” và “mô hình đáng tiền nhất” hiện chưa phải cùng một đáp án — lựa chọn nào phù hợp còn tùy khối lượng công việc của bạn nhạy cảm với chi phí hay ưu tiên hiệu năng tối đa.
Grok 4.6 có đáng để chuyển sang không?
Nếu đang cân nhắc chuyển một khối lượng công việc sang Grok 4.6, dưới đây là một số điểm thực tế cần lưu ý:
- Quy trình lập trình và tác vụ agent là nơi thể hiện rõ nhất nâng cấp lần này — bộ khung Grok Build của xAI được huấn luyện riêng với các tác vụ lập trình thực tế, còn hiệu quả về số bước trong các benchmark agent là khác biệt có thể đo lường được.
- Các trường hợp sử dụng nhạy cảm với chi phí, có khối lượng lớn hưởng lợi nhiều nhất từ chênh lệch giá, miễn là bạn vẫn ở dưới ngưỡng 200K token của gói ngữ cảnh dài.
- Khối lượng công việc với tài liệu dài hoặc codebase lớn cần được tính riêng theo gói ngữ cảnh dài — mức giá tăng gấp đôi áp dụng hồi tố cho toàn bộ yêu cầu, khiến phép tính chi phí thay đổi rất nhanh.
- Triển khai cho doanh nghiệp và các lĩnh vực chịu quy định nên cân nhắc lịch sử của nhà cung cấp bên cạnh điểm benchmark; các đội ngũ mua sắm đánh giá bất kỳ mô hình nào thường không chỉ nhìn vào năng lực thô mà còn xem xét khả năng quản trị và hồ sơ độ tin cậy.
Tiếp theo: Grok 4.7
xAI đã phát tín hiệu rằng một mô hình lớn hơn với 2,1 nghìn tỷ tham số — Grok 4.7 — dự kiến sẽ xuất hiện trong vài tuần sau khi Grok 4.6 ra mắt, còn Grok 5 được nhắm đến trước cuối năm 2026. Nếu tiến độ này được duy trì, Grok 4.6 có thể chỉ tồn tại trong thời gian tương đối ngắn thay vì giữ vị trí mô hình chủ lực của xAI lâu dài. Đây là điều đáng cân nhắc nếu bạn đang xây dựng hạ tầng xoay quanh một phiên bản mô hình cụ thể, thay vì dùng một API endpoint mà xAI sẽ tiếp tục nâng cấp ở phía sau.
CÂU HỎI THƯỜNG GẶP
Câu hỏi thường gặp
Grok 4.6 được phát hành khi nào?
Ngày 12 tháng 8 năm 2026, trên xAI API, Grok Build, Cursor và Grok Bot.
Giá API của Grok 4.6 là bao nhiêu?
2 USD cho mỗi triệu token đầu vào và 6 USD cho mỗi triệu token đầu ra đối với prompt dưới 200.000 token. Trên ngưỡng này, giá tăng gấp đôi lên 4/12 USD cho mỗi triệu token trên toàn bộ yêu cầu.
Cửa sổ ngữ cảnh của Grok 4.6 là bao nhiêu?
500.000 token, trong đó mức giá ngữ cảnh dài được áp dụng khi vượt quá 200.000 token.
Grok 4.6 có tốt hơn GPT-5.6 Sol không?
Hai mô hình gần như ngang nhau trên Artificial Analysis Intelligence Index, cùng đạt khoảng 61 điểm. Grok 4.6 có giá thấp hơn đáng kể và hiệu quả hơn về số bước trong các tác vụ agent, trong khi GPT-5.6 Sol dẫn đầu ở một số benchmark lập trình chuyên biệt như DeepSWE.
Grok 4.6 có tốt hơn Claude Opus 5 không?
Không — Claude Opus 5 hiện xếp hạng cao hơn trên Intelligence Index, nhưng Grok 4.6 rẻ hơn đáng kể trên mỗi token. Điều này khiến Grok 4.6 trở nên hấp dẫn hơn với các khối lượng công việc nhạy cảm về chi phí hoặc có tần suất sử dụng cao.