AI RACE— Cuộc đua AI
AI League

GPT-5.2 ra mắt, lập tức đăng quang bảng xếp hạng Toán học — OpenAI nắm chặt 3/8 vị trí top

GPT-5.2 lập tức ngôi #1 với điểm năng lực tuyệt đối 100, vượt qua toàn bộ các tiền nhiệm và giúp OpenAI thống trị 3 trong 8 vị trí top của bảng xếp hạng Toán học.

00:31 22/07/2026
AI League

Không có giai đoạn giới thiệu, không có giai đoạn "leo hạng" từ từ. Tuần 20/07 mở ra với một cú sốc hiếm gặp: một cái tên hoàn toàn mới xuất hiện trên bảng xếp hạng Toán học và lập tức đứng ở vị trí cao nhất. GPT-5.2 của OpenAI ra mắt và chiếm ngôi #1 ngay trong kỳ cập nhật đầu tiên góp mặt — khởi đầu mà rất ít mô hình từng làm được.

BẢNG XẾP HẠNG · CẬP NHẬT 27/07/2026

Toán học

#Mô hìnhAIMcách #1Biến động
1
OpenAI
95.4
MỚI
2
93.81.6
3
93.61.8
4
93.32.1
5
93.22.2
6
92.23.2
7
92.13.3
8
92.03.4

Căn cứ cho cú soán ngôi này không hề mơ hồ. Trong công thức tính điểm AIM (năng lực + độ phổ biến + độ mới), GPT-5.2 đạt điểm năng lực tuyệt đối — 100/100, mức mà không mô hình nào khác trong top 8 chạm tới. Đây mới là động lực chính đẩy nó vượt lên, chứ không phải hiệu ứng "hàng mới nên hot": điểm độ mới của nó là 71, cao nhưng không áp đảo, còn độ phổ biến — tức mức độ được cộng đồng tin dùng — mới chỉ 57, thấp hơn nhiều mô hình đã bám trụ lâu trong bảng. Nói cách khác, GPT-5.2 không thắng nhờ được cộng đồng biết đến, nó thắng nhờ năng lực toán học thuần túy.

Và năng lực đó có cơ sở kỹ thuật rõ ràng. Theo dữ liệu tổng hợp từ Artificial Analysis, GPT-5.2 thể hiện khả năng vượt trội trong toán học và phép tính chính xác — đúng chuyên môn của hạng mục này — cùng năng lực suy luận logic mạnh cho các bài toán định lượng phức tạp cần tư duy phân tích sâu nhiều bước. Đổi lại, cái giá cho năng lực đỉnh cao này không rẻ: 1,75 USD cho mỗi triệu token đầu vào và tới 14 USD cho mỗi triệu token đầu ra, với độ trễ phản hồi lên tới 69,17 giây dù tốc độ xử lý đạt 85 token/s. Đây rõ ràng là một mô hình được tối ưu cho độ chính xác của lời giải hơn là tốc độ phản hồi — hợp lý với một bài toán cần suy luận nhiều bước.

OpenAI không chỉ có một quân bài

Điều đáng chú ý không dừng ở một mình GPT-5.2. Nhìn xuống bảng, OpenAI đang nắm giữ 3 trong 8 vị trí top của bảng xếp hạng Toán học: ngoài GPT-5.2 ở #1, hãng còn có GPT-5 Codex giữ vững #3 với 93,7 điểm và GPT-5.1 Codex bám trụ #8 với 92,2 điểm. Đây không còn là câu chuyện của một mô hình đơn lẻ tỏa sáng — đó là dấu hiệu của một hãng đang áp đảo toàn diện ở hạng mục năng lực toán học, từ đỉnh bảng cho tới các vị trí giữa và dưới top.

Đối trọng gần nhất là Google, với hai đại diện: Gemini 3 Flash Preview giữ #2 với 94,0 điểm — chỉ kém GPT-5.2 0,7 điểm nhưng vẫn dẫn đầu phần còn lại bảng — và Gemini 3 Pro Preview ở #7 với 92,3 điểm. Nếu coi đây là cuộc đua giữa các hãng thay vì giữa từng mô hình rời rạc, bức tranh tuần này rất rõ: OpenAI đang có chiều sâu đội hình vượt trội, còn Google vẫn giữ được vị trí cao nhưng chưa thể nhân rộng ưu thế.

Phần còn lại của bảng: ổn định nhưng không bất động

Phía dưới top 3, thứ hạng gần như đóng băng so với tuần trước — không có xáo trộn thứ tự, chỉ có việc cả bảng bị hạ xuống một bậc khi GPT-5.2 chen vào từ trên đỉnh. DeepSeek V3.2 Speciale của DeepSeek và MiMo-V2-Flash của Xiaomi vẫn song song giữ #4 và #5 với cùng 93,4 điểm — một cuộc đọ sức sát nút chưa ngã ngũ. GLM-4.7 của Z AI giữ nguyên #6 với 92,4 điểm, đóng vai trò bản lề giữa nhóm dẫn đầu và nhóm bám đuổi.

Điều này cho thấy một thực tế quan trọng: sự xuất hiện của GPT-5.2 không phải do các đối thủ tụt điểm, mà đơn thuần là một chuẩn năng lực mới vừa được thiết lập. Cả DeepSeek, Xiaomi, Z AI và Google đều đang giữ điểm số ổn định — nhưng "ổn định" giờ đây đồng nghĩa với việc bị vượt qua khi một tân binh xuất hiện với điểm năng lực tuyệt đối.

Câu hỏi cho tuần tới nằm ở chính điểm yếu của GPT-5.2 lúc này: độ phổ biến 57 vẫn còn thấp so với vị thế #1. Nếu cộng đồng bắt đầu áp dụng rộng rãi mô hình này cho các bài toán định lượng thực tế, khoảng cách với nhóm bám đuổi có thể còn nới rộng hơn nữa. Ngược lại, mức chi phí và độ trễ cao có thể là rào cản khiến vị trí #1 không dễ giữ vững lâu dài trước sức ép từ Gemini 3 Flash Preview và bộ đôi DeepSeek và Xiaomi vẫn đang bám sát phía sau.

Xem bảng xếp hạng Toán học đầy đủ →

Tin liên quan