Новости ИИЗнаков 8949Время чтения23 мин

Первые бенчмарки Jalapeño от OpenAI заявляют о меньшей задержке и более высокой эффективности, чем у Nvidia

OpenAI заявляет, что её инференс-чип Jalapeño превосходит системы Nvidia GB200 и GB300 по задержке и производительности на ватт в ранних тестах InferenceX.

25 августа 2026 года OpenAI опубликовала первые измеренные результаты производительности Jalapeño — своего кастомного ИИ-чипа для инференса. На трёх публичных языковых моделях компания сообщила о в 1.5–1.9 раза более высокой пиковой пропускной способности на ватт и в 1.7–3.6 раза меньшей сквозной задержке, чем у систем Nvidia, использованных для сравнения.

Эти результаты выводят Jalapeño за рамки прогнозов, представленных OpenAI и Broadcom при анонсе процессора 24 июня. На тот момент инженерные образцы работали на целевой частоте и с целевым энергопотреблением, но OpenAI не публиковала детальных показателей производительности. Новые тесты охватывают GPT‑OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T.

Jalapeño пока остаётся предсерийным оборудованием, а не продуктом, доступным клиентам. OpenAI планирует к концу 2026 года начать развёртывание ограниченного числа систем в собственной инфраструктуре, параллельно завершая производственную квалификацию, улучшая программный стек и проверяя больше типов нагрузок.

1. Что показывают первые бенчмарки Jalapeño

OpenAI тестировала Jalapeño с помощью InferenceX — публичного набора SemiAnalysis для измерения систем обслуживания языковых моделей. В отличие от одного теоретического показателя вычислительной мощности, эти тесты исследуют соотношение между пропускной способностью и задержкой, которую ощущает каждый пользователь.

В опубликованных сравнениях использовалась номинальная нагрузка из 8,000 входных токенов и 1,000 выходных токенов с предсказанием одного токена. OpenAI нормализовала производительность по опубликованной номинальной мощности корпуса каждого ускорителя: 700 ватт для Jalapeño, 1,200 ватт для Nvidia GB200 и 1,400 ватт для GB300. OpenAI заявила, что измеренное устойчивое энергопотребление Jalapeño во время тестируемых нагрузок оставалось на уровне 550 ватт или ниже.

На GPT‑OSS 120B Jalapeño сравнивали с GB200. OpenAI сообщила приблизительно о 85,448 смешанных токенах в секунду на киловатт при пиковой пропускной способности против 44,960 у системы Nvidia — преимущество в 1.9 раза. Сквозная задержка составила 1.03 секунды вместо 1.80 секунды, а минимальный интервал между генерируемыми токенами — 0.69 миллисекунды против 1.87 миллисекунды.

Для сравнения DeepSeek R1 670B использовался GB300. Jalapeño выдал 19,641 смешанный токен в секунду на киловатт при пиковой пропускной способности против 11,781, то есть примерно в 1.7 раза больше. Сообщаемая сквозная задержка составила 1.65 секунды против 5.99 секунды, а минимальный интервал между токенами — 1.43 миллисекунды вместо 5.90 миллисекунды.

Для Kimi K2.5 1T, также протестированной против GB300, Jalapeño достиг 18,195 смешанных токенов в секунду на киловатт по сравнению с 11,862. Сквозная задержка составила 1.56 секунды вместо 5.31 секунды, а минимальный интервал между токенами сократился с 5.48 миллисекунды до 1.44 миллисекунды.

OpenAI также представила значительный прирост пропускной способности, когда каждая система ограничивалась точкой лучшего времени между токенами предыдущего конкурента. Эти показатели достигли 53.7 раза для GPT‑OSS, 104.3 раза для DeepSeek R1 и 56.1 раза для Kimi K2.5. Это измерения при сопоставимой интерактивности в конкретных рабочих точках, а не заявления о том, что любая нагрузка Jalapeño работает в десятки раз быстрее.

Во всём более широком диапазоне тестов OpenAI оценила преимущество Jalapeño для высокоинтерактивных нагрузок в 2.1–4.1 раза. Чип оказался на фронте Парето «пропускная способность на киловатт» для всех трёх моделей, то есть ни одна из сравниваемых конфигураций не предлагала одновременно большую пропускную способность и меньшую задержку.

2. Результаты многообещающие, но это ещё не полная производственная валидация

SemiAnalysis разработала InferenceX и наблюдала за запусками Jalapeño вместе с инженерами OpenAI в лаборатории компании. Она подтвердила, что протестированные модели показали результаты оценки GSM8K, сопоставимые с полученными на оборудовании Nvidia, что снижает риск того, что скорость была достигнута за счёт незаметного ухудшения вывода моделей.

Однако SemiAnalysis подчеркнула, что «все цифры предоставлены нам OpenAI». Её аналитики наблюдали за запусками, но не выполняли весь набор InferenceX независимо. Они также ещё не видели результатов Jalapeño в AgentX — более новом бенчмарке, разработанном для агентных нагрузок с длинным контекстом и несколькими ходами.

Это различие важно, поскольку опубликованные тесты с 8K входных и 1K выходных токенов не полностью задействуют производственные компоненты, такие как маршрутизаторы запросов, кэши префиксов, системы управления кэшем и инфраструктуру выгрузки. Производительность на тщательно оптимизированной нагрузке с одним ходом может не переноситься напрямую на работающий сервис, обрабатывающий изменяющиеся промпты, устойчивый трафик и многошаговых агентов.

Поколение систем для сравнения также требует контекста. GPT‑OSS измерялась против GB200, тогда как более крупные модели DeepSeek и Kimi сравнивались с GB300. SemiAnalysis утверждает, что более новая платформа Nvidia Vera Rubin является более релевантным конкурентным ориентиром, поскольку и Rubin, и Jalapeño используют память класса HBM4 и находятся на относительно ранних этапах разработки программного обеспечения.

Таким образом, тесты устанавливают, что работающие инженерные образцы Jalapeño могут эффективно запускать несколько крупных неприоритетарных семейств моделей. Они ещё не устанавливают надёжность на уровне парка систем, совокупную стоимость владения или производительность при производственном трафике ChatGPT и API.

3. Как Jalapeño нацелен одновременно на задержку и пропускную способность

Jalapeño — это ускоритель только для инференса, а не чип для обучения новых базовых моделей. OpenAI разработала его вместе с Broadcom с учётом различных фаз обслуживания языковой модели.

Во время prefill система обрабатывает промпт пользователя, поэтому вычислительная мощность становится центральным ограничением. Во время decode она генерирует ответ токен за токеном, что сильнее нагружает пропускную способность памяти. Перемещение состояния модели между процессорами может создавать ещё одно узкое место, особенно когда запрос охватывает несколько чипов.

OpenAI заявляет, что Jalapeño сокращает эти перемещения, по возможности сохраняя состояние модели — включая кэш ключей и значений, используемый при генерации, — локально. Вычисления, память и сеть координируются в рамках большого связанного домена, позволяя одному и тому же пулу ускорителей обрабатывать и prefill, и decode, вместо того чтобы навсегда закреплять эти фазы за отдельным оборудованием.

Эта архитектура призвана сохранять эффективность при изменении соотношения нагрузок. Сервис, ориентированный на пакетную обработку, может отдавать приоритет общей пропускной способности, тогда как интерактивному агенту может требоваться быстрая генерация токенов, поскольку задержки накапливаются при последовательных вызовах инструментов и шагах рассуждения.

Broadcom предоставила экспертизу в реализации кремния, соединениях и сетях, включая технологию Tomahawk. Celestica участвует в интеграции плат, стоек и систем. OpenAI остаётся ответственной за архитектуру и решения на стыке программного и аппаратного обеспечения, сформированные её нагрузками ChatGPT, Codex и API.

Компания не объявляла о планах продавать чипы или системы Jalapeño. Руководитель направления аппаратного обеспечения OpenAI Ричард Хо сообщил Axios, что внутренний спрос уже слишком велик, чтобы компания могла рассматривать поставки внешним покупателям. Поэтому разработчики будут сталкиваться с Jalapeño косвенно — через сервисы OpenAI, а не как с приобретаемым ускорителем.

4. ИИ участвовал и в проектировании чипа, и в запуске программного обеспечения

OpenAI заявляет, что ИИ-инструменты непосредственно участвовали в разработке Jalapeño. От первоначального проектирования до передачи проекта в производство компания завершила этап проектирования чипа за девять месяцев. SemiAnalysis оценивает более широкий срок — от первоначального найма команды до tape-out — примерно в 16 месяцев, поэтому эти две цифры описывают разные точки отсчёта, а не обязательно противоречащие друг другу графики.

Модели использовались для исследования вариантов реализации, сокращения циклов проектирования и верификации, а также оптимизации арифметических схем. OpenAI также структурировала процессор как предсказуемую цель программирования, построенную вокруг локальных тензоров, явной коммуникации и синхронизации, что позволяет ИИ-системам помогать размещать и планировать работу на оборудовании.

Используя Codex с GPT‑Astra, инженерная команда за два месяца довела до высокой производительности GPT‑OSS, DeepSeek R1 и Kimi K2.5 — ни одна из которых не входила в первоначальный производственный план Jalapeño. Для отдельных блоков внимания и mixture-of-experts в GPT‑OSS реализации, сгенерированные ИИ, работали в 1.5–1.8 раза быстрее существующего кода, написанного экспертами-людьми. OpenAI явно ограничивает этот результат указанными блоками; это не ускорение всей модели.

OpenAI ожидает ограниченных развёртываний Jalapeño к концу 2026 года и более широких мощностей в течение 2027 года. Дизайн второго поколения уже находится на продвинутой стадии разработки, а работа над третьим поколением началась.

Компания не заменяет своих внешних поставщиков. Она заявляет, что Nvidia и другие партнёры продолжат поставлять ускорители для обучения и инференса, поскольку одного Jalapeño недостаточно для удовлетворения её потребностей в вычислительных ресурсах. Ближайшая операционная проверка заключается в том, сможет ли OpenAI воспроизвести лабораторный выигрыш в эффективности после производственной квалификации и развёртывания полных стоек при смешанном клиентском трафике.

Частые вопросы

Что такое OpenAI Jalapeño?

Jalapeño — первый кастомный ИИ-ускоритель OpenAI. Он был совместно разработан с Broadcom специально для инференса языковых моделей, а не для обучения моделей.

Jalapeño быстрее чипов Nvidia?

В опубликованных OpenAI тестах InferenceX Jalapeño показал более высокую пиковую пропускную способность на киловатт и меньшую задержку, чем сравниваемые конфигурации GB200 и GB300. Результаты получены на инженерных образцах и пока не являются полными производственными бенчмарками.

Какие модели тестировались?

OpenAI протестировала GPT‑OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T с использованием номинальных нагрузок из 8,000 входных токенов и 1,000 выходных токенов.

Могут ли разработчики купить или арендовать оборудование Jalapeño?

Нет. OpenAI заявляет, что не планирует продавать чип, поскольку ей необходима доступная мощность для собственной инфраструктуры. Разработчики могут в конечном итоге получить выгоду через продукты и API, размещаемые OpenAI.

Когда Jalapeño начнёт работать в сервисе?

OpenAI планирует начать ограниченное внутреннее развёртывание к концу 2026 года. Производственная квалификация, разработка программного обеспечения и тестирование на дополнительных моделях всё ещё продолжаются.

Источники

Share

Поделиться статьёй