Tin tức AISố chữ 4578Thời gian đọc12 phút

Nemotron của NVIDIA đạt 535.4 điểm ở các bài IOI 2026, cao hơn mọi thí sinh chính thức

NVIDIA cho biết Nemotron-3-Ultra-CC đạt 535.4/600 ở IOI 2026, cao hơn mức 498.27 của người đứng đầu, trong một lần chạy trực tiếp không chính thức.

Mục lục · 11
  1. 1. Điểm số 535.4 có ý nghĩa gì
  2. 2. Hệ thống không chỉ là một phản hồi từ mô hình đơn lẻ
  3. 3. NVIDIA đánh đổi độ chính xác một mẫu lấy thông lượng
  4. 4. Điều gì đã được xác nhận và điều gì vẫn chưa được kiểm chứng
  5. Câu hỏi thường gặp
  6. Nemotron có thắng IOI 2026 không?
  7. Điểm chính thức cao nhất của con người là bao nhiêu?
  8. Mô hình có quyền truy cập internet không?
  9. Mô hình có bị giới hạn một câu trả lời cho mỗi bài không?
  10. Các nhà nghiên cứu có thể tái lập kết quả ngay bây giờ không?
  11. Tham khảo nguồn

Các nhà nghiên cứu NVIDIA cho biết một phiên bản Nemotron được tinh chỉnh cho thi đấu đã đạt 535.4 trên 600 điểm ở bộ đề International Olympiad in Informatics 2026. Con số này cao hơn 174.28 điểm so với ngưỡng huy chương vàng chính thức và cao hơn 37.13 điểm so với thí sinh con người có điểm số cao nhất.

Kết quả được tạo ra trong thời gian diễn ra cuộc thi, trước khi các bài toán được công bố, dưới cùng hai phiên thi năm giờ, các hạn chế về internet, nền tảng chấm điểm và giới hạn nộp bài áp dụng cho thí sinh. NVIDIA cho biết đây là hệ thống AI đầu tiên được biết đến đã đạt điểm cao hơn người dẫn đầu là con người trên một bộ đề IOI.

Tuy nhiên, đây không phải bài dự thi chính thức. Bài báo của NVIDIA mô tả rõ thí nghiệm là một “điểm chuẩn không chính thức, không giám sát” và cho biết lần chạy không được IOI giám sát. Mô hình không xuất hiện trong bảng xếp hạng chính thức và không nhận huy chương.

1. Điểm số 535.4 có ý nghĩa gì

IOI 2026 được tổ chức tại Tashkent, Uzbekistan, từ ngày 9 tháng 8 đến ngày 16 tháng 8. 375 thí sinh của cuộc thi đại diện cho 92 thành viên IOI. Trong cuộc thi, người tham gia đối mặt với sáu bài toán thuật toán—ba bài mỗi ngày thi—với điểm tối đa 100 cho mỗi bài.

Kết quả chính thức xếp Qiwen Xu của Trung Quốc đứng đầu với 498.27 điểm. Ba mươi hai thí sinh đạt ngưỡng huy chương vàng 361.12 điểm, trong khi các ngưỡng huy chương bạc và đồng lần lượt là 303.28 và 228.80.

Do đó, mức 535.4 mà NVIDIA báo cáo sẽ xếp trên mọi thí sinh nếu được đưa vào bảng điểm. Con số này tương ứng 89.2% tổng điểm tối đa có thể đạt được, so với 83.05% của người chiến thắng chính thức.

So sánh này có ý nghĩa vì thí nghiệm là một lần chạy dự báo thay vì chạy hồi cứu trên một điểm chuẩn công khai. Theo báo cáo kỹ thuật, NVIDIA vận hành hệ thống khi cuộc thi đang diễn ra và trước khi sáu bài được công bố. Điều này giảm mạnh rủi ro mô hình đã ghi nhớ các bài toán cụ thể từ dữ liệu huấn luyện.

Các điều kiện cũng được đối sánh ở một số khía cạnh khác. Mô hình không có quyền truy cập internet nhưng có thể thực thi mã cục bộ. Mô hình dùng hệ thống chấm điểm của cuộc thi và bị giới hạn 50 lần nộp cho mỗi bài, trong đó các lần nộp nhìn chung bị giới hạn một lần mỗi phút. Quy định chính thức cũng cung cấp cho thí sinh điểm ở cấp độ bài con sau mỗi lần nộp, và mô hình nhận cùng loại phản hồi đó.

Có một ranh giới quan trọng về xác minh. Bài đăng X của NVIDIA nói điểm số được “chấm bởi đội ngũ IOI”, nhưng bài báo đi kèm nói lần chạy của mô hình không được IOI giám sát. Bảng điểm chính thức xác nhận độc lập điểm số của con người và các ngưỡng huy chương, chứ không xác nhận mức 535.4 của mô hình. Vì vậy, cách mô tả công bằng nhất là đây là điểm số do NVIDIA báo cáo, thu được qua nền tảng chấm điểm chính thức, thay vì một kết quả thi đấu được IOI chứng nhận.

2. Hệ thống không chỉ là một phản hồi từ mô hình đơn lẻ

Hệ thống trực tiếp được xây dựng xoay quanh Nemotron-3-Ultra-CC, một bản điều chỉnh cho lập trình thi đấu của Nemotron-3-Ultra-550B-A55B từ NVIDIA. Mô hình mixture-of-experts nền tảng có tổng cộng 550 tỷ tham số và kích hoạt 55 tỷ tham số cho mỗi token.

Dự án hậu huấn luyện rộng hơn của NVIDIA bắt đầu với một kho dữ liệu gồm 22,000 bài toán lập trình lấy từ 16 nhóm cuộc thi và nền tảng trực tuyến trải dài khoảng hai thập kỷ. Các nhà nghiên cứu đóng gói bài toán thành các môi trường có thể thực thi, chứa đề bài, ràng buộc, kiểm thử và lời giải tham chiếu, sau đó loại bỏ các môi trường cho kết quả không nhất quán.

Với mô hình Ultra-CC tổng quát, các nhà nghiên cứu đã tạo ra 477,642 vết fine-tuning có giám sát. Mô hình Nemotron-3-Nano-CC nhỏ hơn với 30 tỷ tham số nhận 1.2 triệu vết cộng với học tăng cường, nhưng NVIDIA không áp dụng giai đoạn học tăng cường cho lập trình thi đấu đối với Ultra do chi phí tính toán.

Biến thể trực tiếp tại IOI 2026 sử dụng một bước điều chỉnh bổ sung dành riêng cho cuộc thi. NVIDIA đánh giá GLM-5.2 và DeepSeek-V4-Flash như các mô hình giáo viên khả dĩ trên các bài IOI 2025. GLM-5.2 đạt 66.0% với độ dài sinh trung bình 85,927 token, so với 55.3% và 120,456 token của DeepSeek-V4-Flash. Một biến thể Ultra-CC được huấn luyện bằng GLM sau đó đạt 59.4% trên các bài 2025, so với 50.7% của phiên bản được huấn luyện bằng DeepSeek, nên NVIDIA chọn dữ liệu GLM-5.2 cho hệ thống trực tiếp.

Thành phần quyết định là GenCorrect, một quy trình suy luận biến phản hồi ở cấp độ bài con từ trình chấm thành một quá trình tìm kiếm lặp. Trong mỗi vòng đầu tiên trong bốn vòng, hệ thống sinh tối đa 200 chương trình ứng viên cho mỗi bài, loại bỏ các đầu ra không hợp lệ, phân cụm các chương trình còn lại để tạo đa dạng về hành vi và chọn mười đại diện để nộp.

Điểm từ các lần nộp đó cho biết những bài con nào đã được giải. Vòng tiếp theo sau đó nhận kết quả bài con tích lũy và chọn các lời giải trước đó nhằm duy trì các bài con đã hoàn thành, nhắm đến những bài chưa giải quyết và giữ tính đa dạng. Thiết kế này khai thác một đặc điểm quan trọng của cách chấm IOI: điểm cuối cùng của thí sinh cho mỗi bài con là điểm cao nhất đạt được qua tất cả lần nộp, nên các chương trình sau có thể theo đuổi những phần khác nhau của một bài mà không xóa tiến độ trước đó.

Ở vòng thứ năm và cuối cùng, NVIDIA mở rộng nhóm từ 200 lên 1,000 lời giải ứng viên cho mỗi bài, nhưng vẫn chỉ nộp mười. Hệ thống tạo 50 trình sinh và trình kiểm tra dữ liệu kiểm thử theo từng bài, lọc chúng để thu được 100 đầu vào kiểm thử hợp lệ, thực thi các chương trình ứng viên cục bộ và dùng một script chấm điểm do mô hình tạo ra để xếp hạng chúng. Qua năm vòng, quy trình có thể tạo tối đa 1,800 chương trình cho mỗi bài trong khi vẫn tuân thủ giới hạn chính thức 50 lần nộp được chấm.

3. NVIDIA đánh đổi độ chính xác một mẫu lấy thông lượng

Triển khai trực tiếp sử dụng mức phân bổ đỉnh 760 GPU NVIDIA GB300. Quy mô phần cứng đó khiến kết quả là một phép so sánh dưới các quy tắc về thời gian và số lần nộp được đối sánh, chứ không phải một cuộc thi với nguồn lực ngang bằng giữa một thiếu niên và một phiên bản mô hình đơn lẻ.

Để đưa các lô ứng viên lớn vào khung thời gian thi, NVIDIA lượng tử hóa Ultra-CC thành NVFP4 và dùng bộ đệm key-value FP8 với dự đoán đa token đặt là năm. Trên tập phát triển IOI 2025, cấu hình này tạo ra 736.8 token mỗi giây trên mỗi GPU—gấp 3.7 lần tốc độ 199.1 token của đường cơ sở BF16.

Lượng tử hóa làm giảm độ chính xác một mẫu. Cấu hình được chọn đạt 52.8% trên IOI 2025 ở Score@1, so với 59.4% của BF16, giảm 6.6 điểm phần trăm. NVIDIA chấp nhận đánh đổi đó vì GenCorrect phụ thuộc vào việc sinh và kiểm thử một nhóm lời giải lớn hơn nhiều trong một phiên cố định năm giờ.

Các thí nghiệm trước đó cho thấy lý do. Trên bộ đề 2025, mô hình Ultra-CC tổng quát trung bình đạt 343.9 điểm sau vòng GenCorrect đầu tiên và 502.0 sau năm vòng, tăng 158.1 điểm nhờ lấy mẫu và sửa lỗi lặp. Hệ thống Nano-CC nhỏ hơn tăng từ 360.6 lên 468.2 qua cùng năm vòng.

Vì vậy, kết quả không cho thấy một lần hoàn thành không hỗ trợ của mô hình đã vượt qua thí sinh xuất sắc nhất. Nó cho thấy một hệ thống lấy mô hình làm trung tâm—kết hợp huấn luyện chuyên biệt, sinh song song, biên dịch, phân cụm, kiểm thử tổng hợp, phản hồi từ trình chấm chính thức và phần cứng đáng kể—có thể chuyển đổi một lượng lớn tính toán suy luận thành điểm số cao hơn dưới các ràng buộc bên ngoài của cuộc thi.

4. Điều gì đã được xác nhận và điều gì vẫn chưa được kiểm chứng

Các hồ sơ IOI chính thức xác nhận định dạng sáu bài, tổng điểm tối đa 600, ngưỡng vàng 361.12 và điểm dẫn đầu 498.27 của Qiwen Xu. Báo cáo kỹ thuật của NVIDIA cung cấp điểm số mô hình, điều kiện triển khai và chi tiết hệ thống.

Bài báo chỉ báo cáo một lần thử trực tiếp. Sau cuộc thi, NVIDIA chạy pipeline GenCorrect tiêu chuẩn thêm năm lần, thu được trung bình 521.72 và khoảng từ 495.0 đến 545.8. Điểm trực tiếp cao hơn trung bình đó 13.68 điểm nhưng vẫn nằm trong khoảng quan sát được. Tối đa bốn trong số các điểm cuối đó có thể đã vượt điểm số cao nhất của con người, trong khi mức tối thiểu được báo cáo sẽ thấp hơn 3.27 điểm; NVIDIA không công bố từng điểm số riêng lẻ.

Báo cáo được gửi lên arXiv vào ngày 2 tháng 9 năm 2026 và là bản in trước thay vì một công bố được phản biện. Các tác giả thừa nhận phương pháp đòi hỏi lượng tính toán đáng kể cho huấn luyện và suy luận, rằng học tăng cường ở quy mô Ultra vượt ngoài ngân sách của họ, và rằng các phát hiện có thể không khái quát hóa ngoài lập trình thi đấu.

Khả năng tái lập cũng chưa đầy đủ. NVIDIA cho biết họ dự định phát hành checkpoint cuộc thi cùng các thành phần suy luận và đánh giá có thể chạy qua NeMo Skills, nhưng bài báo nói kho dữ liệu huấn luyện đầy đủ không thể được phân phối lại do các hạn chế của bên thứ ba. Cho đến khi checkpoint và các recipe được cung cấp, các nhà nghiên cứu bên ngoài không thể tái lập độc lập toàn bộ hệ thống trực tiếp chỉ từ báo cáo.

Với các nhà phát triển, hàm ý kỹ thuật rõ ràng nhất hẹp hơn “AI đánh bại lập trình viên”. Thí nghiệm chứng minh rằng phản hồi chấm điểm có thể được dùng làm tín hiệu mạnh tại thời điểm kiểm thử: tạo nhiều chương trình khác biệt, chọn một tập nộp giới hạn, quan sát những bài con nào vượt qua và phân bổ tính toán sau đó cho các khoảng trống còn lại. Nó cũng định lượng cách thông lượng suy luận có thể quan trọng hơn độ chính xác của một phản hồi đơn lẻ khi một tác vụ cho phép tương tác lặp lại, có chấm điểm với một bộ đánh giá.

Câu hỏi thường gặp

Nemotron có thắng IOI 2026 không?

Không. Đây không phải thí sinh chính thức, không xuất hiện trong bảng xếp hạng và không nhận huy chương. NVIDIA báo cáo rằng lần chạy trực tiếp không chính thức của họ đạt điểm cao hơn mọi thí sinh chính thức.

Điểm chính thức cao nhất của con người là bao nhiêu?

Qiwen Xu của Trung Quốc đứng đầu với 498.27 trên 600. Điểm số mô hình do NVIDIA báo cáo là 535.4.

Mô hình có quyền truy cập internet không?

Không, theo báo cáo của NVIDIA. Mô hình có thể chạy mã cục bộ và truy cập nền tảng chấm điểm của cuộc thi, phù hợp với các hạn chế liên quan của cuộc thi.

Mô hình có bị giới hạn một câu trả lời cho mỗi bài không?

Không. GenCorrect sinh hàng trăm chương trình ứng viên và dùng tối đa 50 lần nộp chính thức cho mỗi bài qua năm vòng.

Các nhà nghiên cứu có thể tái lập kết quả ngay bây giờ không?

Chưa hoàn toàn. NVIDIA cho biết họ dự định phát hành checkpoint và các recipe có thể chạy, nhưng kho dữ liệu huấn luyện đầy đủ sẽ không được phân phối do các hạn chế của bên thứ ba.

Tham khảo nguồn

Share

Chia sẻ bài viết