AIRA3 của Meta xếp thứ tám trong Thử thách Nemotron với 4.182 đội của NVIDIA
Meta cho biết AIRA3 đã giành huy chương vàng Kaggle khi tự chủ tinh chỉnh mô hình suy luận Nemotron-3-Nano-30B của NVIDIA.
Mục lục · 12
- 1. Một cuộc thi trực tiếp đưa hệ thống nghiên cứu của Meta đối đầu với hàng nghìn đội
- 2. Thử thách Nemotron thực sự đo lường điều gì
- 3. AIRA3 sử dụng nhiều mô hình và coding harness
- 4. AIRA3 mở rộng công trình trước đó của Meta về tác tử nghiên cứu như thế nào
- 5. Kết quả này xác lập điều gì — và điều gì vẫn chưa được kiểm chứng
- Câu hỏi thường gặp
- AIRA3 là gì?
- AIRA3 có chiến thắng cuộc thi của NVIDIA không?
- Những mô hình nào vận hành bài nộp trực tiếp?
- AIRA3 đã thay đổi gì trong Nemotron?
- AIRA3 có được cung cấp công khai không?
- Tham khảo nguồn
1. Một cuộc thi trực tiếp đưa hệ thống nghiên cứu của Meta đối đầu với hàng nghìn đội
Meta cho biết hệ thống nghiên cứu tự chủ AIRA₃ của họ xếp thứ tám trong Nemotron Model Reasoning Challenge của NVIDIA, giành huy chương vàng Kaggle trong số 4.182 đội.
Kết quả này đến từ một cuộc thi trực tiếp, thay vì một benchmark hồi cứu do Meta xây dựng. Hồ sơ Kaggle cho thấy thử thách diễn ra từ ngày 16 tháng 3 đến ngày 15 tháng 6 năm 2026, thu hút 5.223 người tham gia và nhận 71.743 bài nộp. Meta đưa AIRA₃ vào cuộc thi vào tháng 6 và cho biết kết quả cuối cùng được đánh giá bằng cùng bộ kiểm thử riêng tư dùng để xếp hạng các đối thủ khác.
Vị trí thứ tám không phải là chiến thắng cuộc thi: bảy đội xếp trên AIRA₃, và giải thưởng tiền mặt của Kaggle chỉ dành cho ba vị trí đầu. “Vàng” đề cập đến hạng huy chương của nền tảng. Sự khác biệt này quan trọng vì việc mô tả AIRA₃ là “đánh bại 4.000 đội” đã bỏ qua cả các bài dự thi xếp hạng cao hơn lẫn khác biệt giữa huy chương và vị trí đầu tiên.
Ngay cả với lưu ý đó, thứ hạng này vẫn cung cấp bằng chứng mạnh hơn một bản trình diễn nội bộ. Mô hình mục tiêu, định dạng bài nộp, quy trình đánh giá và hạn chót đều do NVIDIA và Kaggle thiết lập. Meta có thể tối ưu theo nhiệm vụ đã công bố, nhưng không kiểm soát môi trường chấm điểm cuối cùng.
Meta diễn giải kết quả này là bằng chứng rằng AIRA₃ có thể cải thiện một năng lực mô hình cụ thể ở mức tương đương các chuyên gia con người. Thứ hạng ủng hộ nhận định hẹp hơn rằng hệ thống đã tạo ra một bài nộp tinh chỉnh có tính cạnh tranh cao. Bản thân nó không xác lập năng lực khoa học tổng quát hoặc sự tương đương với các nhà nghiên cứu con người trong những công việc mở.
2. Thử thách Nemotron thực sự đo lường điều gì
Cuộc thi yêu cầu người tham gia cải thiện độ chính xác suy luận của NVIDIA-Nemotron-3-Nano-30B trong khi vẫn giữ nguyên mô hình cơ sở. Bài nộp bắt buộc là một adapter thích ứng hạng thấp tương thích, hay LoRA, với hạng tối đa là 32.
Ràng buộc đó khiến cuộc thi trở thành một bài toán cải thiện mô hình có mục tiêu, thay vì tìm kiếm mô hình ngôn ngữ không bị giới hạn mạnh nhất. Người tham gia có thể thay đổi dữ liệu huấn luyện, chiến lược prompt, pipeline dữ liệu tổng hợp, phương pháp học tăng cường hoặc quy trình tinh chỉnh nhẹ, nhưng adapter cuối cùng phải chạy trên mô hình và ngăn xếp đánh giá do NVIDIA chỉ định.
Báo cáo kỹ thuật của NVIDIA mô tả Nemotron 3 Nano là mô hình mixture-of-experts lai Mamba-Transformer. Mô hình có tổng cộng 31,6 tỷ tham số, trong đó 3,2 tỷ tham số được kích hoạt trong mỗi lượt truyền xuôi, hoặc khoảng 3,6 tỷ khi bao gồm embeddings.
Theo bài viết công khai của đội chiến thắng, tập huấn luyện được cung cấp gồm 9.500 bài toán có nhãn, bao phủ thao tác bit, phương trình số, cryptarithm, mật mã văn bản, hệ thống chữ số, chuyển đổi đơn vị và trọng lực. Mỗi prompt đưa ra các ví dụ về một phép biến đổi chưa biết và yêu cầu mô hình suy ra quy tắc trước khi trả lời một trường hợp mới.
Kaggle tải từng adapter được nộp bằng công cụ suy luận vLLM. Câu trả lời chủ yếu được trích xuất từ biểu thức LaTeX \boxed{} và được tính là đúng khi khớp chính xác với chuỗi tham chiếu hoặc nằm trong sai số tương đối \(10^{-2}\). Điểm cuối cùng là tỷ lệ câu trả lời đúng.
Cấu hình suy luận cố định bao gồm độ dài mô hình 8.192 token, tối đa 7.680 token được sinh, nhiệt độ bằng 0 và top_p đặt ở 1.0. Các kiểm soát này giảm khác biệt do hành vi lấy mẫu gây ra và tập trung việc xếp hạng vào những gì mỗi adapter đã học được.
Bộ kiểm thử riêng tư hạn chế việc tối ưu trực tiếp theo các đáp án cuối cùng, nhưng không tạo ra một thí nghiệm có kiểm soát giữa con người và AI. Các đội Kaggle có thể sử dụng ngân sách tính toán, tài nguyên bên ngoài và công cụ tự động khác nhau, và một số bài nộp bản thân chúng có thể đã phụ thuộc nhiều vào AI. Vì vậy, bảng xếp hạng so sánh các hệ thống và quy trình làm việc hoàn chỉnh, không phải các nhà nghiên cứu cá nhân không được hỗ trợ trong điều kiện phòng thí nghiệm giống hệt nhau.
3. AIRA3 sử dụng nhiều mô hình và coding harness
Meta cho biết AIRA₃ không phụ thuộc vào một tác tử đơn lẻ hoặc một bộ điều khiển trung tâm. Hệ thống vận hành nhiều tác tử tồn tại lâu trong các môi trường cô lập, trong đó mỗi tác tử kết hợp một mô hình ngôn ngữ với một coding harness.
Các tác tử phối hợp không đồng bộ qua hai cơ chế dùng chung. Một diễn đàn chứa các giả thuyết, phát hiện thực nghiệm và thảo luận, trong khi một hệ thống tệp dùng chung lưu trữ các hiện vật của lời giải. Từng tác tử quyết định nên khảo sát hoặc mở rộng những phát hiện nào khi thông tin được tích lũy.
Thiết kế này nhằm giúp các phát hiện hữu ích tồn tại vượt qua cửa sổ ngữ cảnh hoặc thời gian chạy của một tác tử. Một thí nghiệm do một cặp mô hình và harness thực hiện có thể trở thành đầu vào cho cặp khác, cho phép công việc về sau xây dựng trên các kết quả trước đó thay vì khởi động lại việc tìm kiếm một cách độc lập.
Đối với cuộc thi Nemotron trực tiếp, Meta sử dụng một ensemble kết hợp GPT 5.5 với OpenCode và Claude 4.8 với Claude Code. Do đó, kết quả thứ tám thuộc về toàn bộ quy trình AIRA₃, không phải một mô hình ngôn ngữ nền tảng duy nhất.
Meta cũng báo cáo một số đánh giá sau cuộc thi trên cùng bộ kiểm thử riêng tư. Một cấu hình dùng Muse Spark 1.2 với MuseCode đạt mức hiệu năng mà Meta mô tả là huy chương vàng. Muse Spark 1.1 với OpenCode và GLM 5.2 với OpenCode đạt phạm vi huy chương bạc.
Các kết quả hậu kiểm đó là bằng chứng hữu ích rằng cơ chế điều phối có thể hoạt động với các tổ hợp mô hình và harness khác nhau, nhưng chúng không phải các thứ hạng trực tiếp bổ sung. Chỉ ensemble GPT 5.5 và Claude 4.8 nhận được thứ hạng thứ tám được báo cáo trong thời gian cuộc thi.
4. AIRA3 mở rộng công trình trước đó của Meta về tác tử nghiên cứu như thế nào
AIRA₃ tiếp nối hệ thống AIRA₂ mà Meta công bố vào tháng 4 năm 2026. Dự án trước đó tập trung vào ba nút thắt của nghiên cứu học máy tự chủ: thông lượng thực nghiệm hạn chế, tín hiệu xác thực không đáng tin cậy trong các quá trình tìm kiếm dài và hành vi bị giới hạn của các toán tử mô hình cố định, một lượt.
AIRA₂ giải quyết các vấn đề đó bằng một nhóm worker đa GPU không đồng bộ, giao thức Hidden Consistent Evaluation và các tác tử ReAct có khả năng tương tác để xác định phạm vi và gỡ lỗi công việc của mình.
Meta báo cáo AIRA₂ đạt thứ hạng percentile trung bình 81.5 sau 24 giờ và 83.1 sau 72 giờ trên MLE-bench-30, so với 72.7 của baseline mạnh nhất. Trên bộ AIRS-Bench riêng biệt, AIRA₂ vượt trạng thái nghệ thuật của con người được nêu ra ở sáu trong số 20 nhiệm vụ.
Thông báo AIRA₃ chuyển việc đánh giá từ các benchmark nghiên cứu được chọn sang một cuộc thi đang diễn ra với hạn chót bên ngoài và chấm điểm riêng tư. Thiết kế diễn đàn và hệ thống tệp của nó cũng nhấn mạnh sự cộng tác giữa các tác tử bền vững, thay vì chỉ trình bày các worker song song như một cách tăng thông lượng thực nghiệm.
Meta chưa công bố bài báo AIRA₃, bản phát hành mã nguồn hoặc báo cáo kỹ thuật chi tiết. Thông báo không tiết lộ số lượng tác tử, tổng chi phí tính toán, công thức huấn luyện, số lượng thí nghiệm, mức can thiệp của các nhà nghiên cứu Meta hoặc một ablation tách riêng giá trị của tri thức dùng chung khỏi giá trị của việc chạy nhiều thử nghiệm hơn. Vì vậy, hiện chưa thể tái tạo quy trình xếp thứ tám hoặc xác định thành phần nào đóng góp nhiều nhất.
5. Kết quả này xác lập điều gì — và điều gì vẫn chưa được kiểm chứng
Kết quả thực tế rõ ràng nhất là một quy trình nghiên cứu tự chủ đã tạo ra lời giải top 10 cho một bài toán huấn luyện mô hình bị ràng buộc dưới đánh giá bên ngoài. Đối với các nhà phát triển xây dựng tác tử nghiên cứu, điều này cho thấy một quy trình có khả năng quản lý việc tạo dữ liệu, thử nghiệm, tinh chỉnh và lựa chọn đủ tốt để cạnh tranh với các đội Kaggle giàu kinh nghiệm.
Kết quả này không cho thấy AIRA₃ đã độc lập chọn một câu hỏi nghiên cứu giá trị, thiết kế việc đánh giá hoặc cải thiện các mô hình tác tử nền tảng của chính nó. Hệ thống tối ưu một năng lực đã được xác định trước của một mô hình Nemotron riêng biệt theo một mục tiêu cuộc thi đã biết. Mô tả điều này là tự cải thiện đệ quy sẽ vượt quá bằng chứng hiện có.
Meta cho biết cùng hệ thống có thể chuyển đổi giữa các lĩnh vực chỉ bằng cách thay đổi đặc tả nhiệm vụ. Họ báo cáo giảm 27% độ trễ cho các GPU kernel sản xuất trong một benchmark nội bộ và hiệu năng cấp vàng trong Deep Past Challenge của Kaggle, liên quan đến việc dịch tiếng Akkad Cổ Assyria phiên âm sang tiếng Anh.
Cuộc thi Deep Past được Kaggle ghi nhận độc lập, nhưng Meta chưa cung cấp một mục bảng xếp hạng AIRA₃ có thể nhận diện, điểm số hoặc bài viết kỹ thuật cho lần chạy đó. Con số GPU kernel cũng là nội bộ và không có workload, baseline, cấu hình phần cứng hoặc phương pháp đo lường được tiết lộ. Do đó, cả hai kết quả nên được xem là các kiểm thử chuyển giao do Meta báo cáo, thay vì bằng chứng có thể tái tạo độc lập.
Đối với các công ty đang đánh giá hệ thống nghiên cứu tự chủ, thứ hạng Nemotron xác lập hiệu năng nhiệm vụ cạnh tranh nhưng vẫn để ngỏ vấn đề chi phí và hiệu quả. Nếu không có dữ liệu sử dụng tính toán, hồ sơ giám sát của con người và các so sánh có kiểm soát với tác tử song song độc lập, kết quả này không thể cho thấy liệu AIRA₃ có tiết kiệm hơn một đội chuyên gia hay liệu các cơ chế phối hợp dùng chung của nó có vượt trội hơn một lượng tìm kiếm không điều phối tương đương hay không.
Câu hỏi thường gặp
AIRA3 là gì?
AIRA₃ là hệ thống nghiên cứu AI tự chủ của Meta. Meta mô tả hệ thống này là nhiều cặp mô hình và coding harness chạy dài hạn, làm việc trong các môi trường cô lập và phối hợp thông qua một diễn đàn cùng hệ thống tệp dùng chung.
AIRA3 có chiến thắng cuộc thi của NVIDIA không?
Không. Hệ thống xếp thứ tám và giành huy chương vàng Kaggle. Bảy đội xếp hạng cao hơn, trong khi các giải thưởng thứ hạng của cuộc thi chỉ áp dụng cho ba vị trí đầu.
Những mô hình nào vận hành bài nộp trực tiếp?
Meta cho biết bài dự thi trực tiếp kết hợp GPT 5.5 chạy với OpenCode và Claude 4.8 chạy với Claude Code.
AIRA3 đã thay đổi gì trong Nemotron?
Hệ thống tạo ra một adapter LoRA, với hạng bị giới hạn ở 32, cho mô hình cơ sở Nemotron-3-Nano-30B của NVIDIA. Cuộc thi đo lường liệu mô hình đã thích ứng có trả lời chính xác hơn các bài toán suy luận có cấu trúc hay không.
AIRA3 có được cung cấp công khai không?
Thông báo của Meta không cung cấp bản phát hành mã nguồn AIRA₃, hệ thống có thể tải xuống hoặc bài báo kỹ thuật đầy đủ. Quy trình huấn luyện chính xác và yêu cầu tính toán của hệ thống vẫn chưa được tiết lộ.
Tham khảo nguồn
- AI tại Meta: Kết quả Kaggle của AIRA₃ và chuỗi thông báo
- Kaggle: NVIDIA Nemotron Model Reasoning Challenge
- Kaggle: Lời giải xếp hạng nhất của thử thách Nemotron
- Meta AI: AIRA₂ — Vượt qua các nút thắt trong tác tử nghiên cứu AI
- Các nhà nghiên cứu NVIDIA: Báo cáo kỹ thuật Nemotron 3 Nano
- Kaggle: Deep Past Challenge — Dịch tiếng Akkad sang tiếng Anh
Share