Năng lực mô hình

So sánh mô hình theo tám chiều, từ trí tuệ đến chi phí sử dụng và khả năng phản hồi.

01

Trí tuệ tổng thể

So sánh năng lực tổng thể về suy luận, lập trình và công việc tri thức.

© Artificial Analysis · 2026-09-27Intelligence Index v4.3.2
Càng cao càng tốt. Chỉ số tổng hợp 10 bài đánh giá, là điểm so sánh chứ không phải tỷ lệ hoàn thành tác vụ.

Diễn giải biểu đồ

Trong nhóm này, Opus 5.5 dẫn đầu với 58; Fable 5.1 và GPT-6 Astra cùng làm tròn thành 53. Cần giữ nguyên thiết lập suy luận khi so sánh.

02

Đánh giá chuyên biệt

Xem riêng lập trình, suy luận, kiến thức thực tế, ngữ cảnh dài và suy luận hình ảnh.

Mở 19 biểu đồ đánh giá19 bài đánh giá · thang đo riêng

Diễn giải biểu đồ

Mô hình dẫn đầu thay đổi theo tác vụ: xem Terminal-Bench và SciCode cho lập trình, AA-LCR cho ngữ cảnh dài, MMMU-Pro cho suy luận hình ảnh.

03

Agent xử lý công việc tri thức

Đánh giá khả năng agent biến yêu cầu phức tạp thành sản phẩm hữu ích.

© Artificial Analysis · 2026-09-27AA-Briefcase v1.1 · Elo
Càng cao càng tốt. AA-Briefcase tổng hợp tỷ lệ đạt tiêu chí, chất lượng phân tích và trình bày. Công cụ và cấu hình agent ảnh hưởng kết quả.

Diễn giải biểu đồ

Trong nhóm này, Opus 5.5 đạt 1822 Elo, tiếp theo là Fable 5.1 với 1678 và Grok 4.7 với 1657.

04

Năng lực và chi phí

Tìm năng lực cần thiết với chi phí mỗi tác vụ hợp lý.

© Artificial Analysis · 2026-09-27Chỉ số trí tuệ · USD/tác vụ · thang log
Chi phí là chi phí tác vụ đánh giá có trọng số, gồm mức dùng token. Trục ngang dùng thang log. Đây không phải giá API của trang này.

Diễn giải biểu đồ

Vùng trên bên trái kết hợp năng lực cao và chi phí thấp. Đường biên chấm giúp nhận diện lựa chọn hiệu quả trong nhóm mô hình.

05

Hiệu quả token

Xem lượng token suy luận và trả lời tiêu thụ cho mỗi tác vụ đánh giá.

© Artificial Analysis · 2026-09-27Token đầu ra có trọng số/tác vụ
Dùng ít token có thể giảm chi phí và thời gian chờ, nhưng không chứng minh chất lượng tốt hơn. Hãy đối chiếu chỉ số trí tuệ và giá token.

Diễn giải biểu đồ

Opus 5.5 dùng khoảng 119k token đầu ra mỗi tác vụ, so với 31k của GPT-6 Sol. Token suy luận chiếm tỷ trọng lớn.

06

Dung lượng ngữ cảnh

So sánh dung lượng dành cho tài liệu, mã nguồn và lịch sử hội thoại.

© Artificial Analysis · 2026-09-27Cửa sổ ngữ cảnh · token
Cửa sổ lớn hơn là giới hạn dung lượng, không chứng minh khả năng hiểu tốt hơn. Kiểm tra AA-LCR và giới hạn đầu vào/đầu ra của nhà cung cấp.

Diễn giải biểu đồ

Nhiều mô hình trong nhóm có ngữ cảnh khoảng 1M token; Grok 4.7 hiển thị 500k và Mistral Medium 3.5 là 256k.

07

Tốc độ đầu ra

So sánh tốc độ văn bản xuất hiện sau khi bắt đầu tạo.

© Artificial Analysis · 2026-09-27Token đầu ra/giây · đầu vào 10k token · một yêu cầu
Càng cao càng tốt. Tốc độ không gồm thời gian chờ trước đầu ra; đây không phải tổng thời gian tác vụ hay cam kết thông lượng của trang.

Diễn giải biểu đồ

Trong nhóm này, Gemini 3.5 Flash-Lite đạt 337 token/giây và Gemini 3.8 Flash ở mức high đạt 285 token/giây. Đầu ra nhanh hỗ trợ truyền câu trả lời dài.

08

Thời gian đến câu trả lời đầu tiên

Đo thời gian chờ trước khi người dùng nhận token trả lời đầu tiên.

© Artificial Analysis · 2026-09-27Giây · gồm thời gian suy nghĩ · đầu vào 10k token · một yêu cầu
Càng thấp càng tốt. Chỉ số gồm thời gian suy luận và khác thời gian đến token đầu tiên. So sánh cùng mức suy luận và nhà cung cấp API.

Diễn giải biểu đồ

Grok 4.7 ở mức xhigh hiển thị 54,4 giây, còn GPT-6 Astra ở mức max là 292,2 giây. Thời gian suy nghĩ có thể chiếm phần lớn thời gian chờ.

Biểu đồ giữ nguyên nhóm mô hình và thiết lập suy luận của nguồn. Mô hình hoặc số liệu thiếu không có nghĩa là điểm bằng không.

Biểu đồ gốc: Artificial Analysis. Diễn giải chỉ là hướng dẫn biên tập; hãy kiểm chứng lựa chọn quan trọng bằng tác vụ của bạn.