OpenAI представила собственный чип для логического вывода Jalapeño. Это первая подобная разработка компании, и она нацелена на то, чтобы модели ИИ работали быстрее и при этом потребляли меньше энергии.

Основная идея — решить классическую проблему: обычно в таких системах приходится выбирать между высокой пропускной способностью и низкой задержкой. Jalapeño же пытается совместить и то, и другое. Для этого состояние модели, включая так называемый кэш ключ-значений, который используется при генерации ответов, размещено как можно ближе к вычислительным блокам. Сетевая архитектура тоже встроена в чип, что сокращает объем передаваемых между компонентами данных и уменьшает простои в ожидании.
Компания протестировала чип на трех открытых моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. По сравнению с аналогичными коммерческими системами, результаты выглядят заметно. По производительности на ватт при пиковой нагрузке Jalapeño показал преимущество в 1,5–1,9 раза. Сквозная задержка снизилась в 1,7–3,6 раза. А в сценариях с активным взаимодействием — то есть там, где требуется частая смена запросов и ответов, — отрыв оказался еще больше: от 2,1 до 4,1 раза.
Номинальная мощность чипа заявлена на уровне 700 Вт, однако в ходе тестов фактическое потребление не превышало 550 Вт. Сравнение проводилось с использованием открытого бенчмарка InferenceX от SemiAnalysis.
При этом сам Jalapeño проектировался не вручную: OpenAI использовала собственные модели ИИ для оптимизации схем, проверки решений и сокращения циклов разработки. От начальной идеи до готового чипа команда дошла за девять месяцев, а еще за два месяца с помощью Codex и GPT-Astra адаптировала под новую архитектуру три модели с открытым кодом, которые изначально не входили в план. В частности, для отдельных блоков внимания и механизмов «смеси экспертов» реализации, предложенные ИИ, работали в 1,5–1,8 раза быстрее, чем ранее написанные экспертами.
На самой большой из протестированных моделей — Kimi K2.5 1T — пиковая эффективность на ватт оказалась в 1,5 раза выше, а задержка — в 3,4 раза ниже, чем у эталонной системы.
OpenAI планирует начать внедрение Jalapeño в собственную инфраструктуру к концу 2026 года. При этом компания подчеркивает, что это лишь первое поколение: разработка следующих версий уже идет. В перспективе чип должен помочь обслуживать более сложные модели при меньших затратах оборудования и энергии — особенно это актуально для ИИ-агентов, которые выполняют длинные многошаговые цепочки рассуждений, где каждая миллисекунда задержки может суммироваться в ощутимое время ожидания для пользователя.
Читайте также:
SpaceX запустит чипы NVIDIA для космических ЦОД в конце 2027 года
TSMC начнет массовый выпуск 1,6-нм чипов A16 в четвертом квартале 2026 года
В России разработан новый метод производства отказоустойчивых чипов для дата-центров