OpenAI показала первые результаты бенчмарков чипа Jalapeño для ИИ-инференса

/ ТехнологииНовости / Технологии

Во вторник на конференции Hot Chips компания OpenAI представила более детальный обзор чипа Jalapeño, включая первые результаты бенчмарков новой системы. В тесте InferenceX от SemiAnalysis Jalapeño показал больше токенов на пользователя и большую пропускную способность на киловатт, чем доступные в настоящее время самые производительные процессоры для инференса.

«Суть в том, что результаты демонстрируют очень и очень значительный прирост производительности по сравнению с передовыми решениями», — заявил Ричард Хо, глава аппаратного подразделения OpenAI, в ходе пресс-колла. «Jalapeño может обслуживать больше задач ИИ на единицу мощности, одновременно быстрее возвращая ответы. Это очень эффективно для обслуживания большого числа клиентов, но также обеспечивает низкую задержку».

Примечательно, что сравнение проводилось с системой Nvidia Blackwell, однако к моменту полномасштабного развертывания Jalapeño конкуренты могут значительно продвинуться вперед. Хо оценил, что Jalapeño будет развернут в конце 2026 года «в очень небольших объемах», а более значительное развертывание произойдет в 2027 году.

Впервые анонсированный в октябре прошлого года, Jalapeño был разработан OpenAI в тесном сотрудничестве с Broadcom, при этом собственные модели OpenAI помогали в процессе разработки. Компания планирует сделать Jalapeño мультигенерационной платформой, что позволит разрабатывать продукты ИИ, модели, чипы и память в едином ключе.

Благодаря такому комплексному подходу OpenAI смогла решить конкретные этапы процесса инференса, которые часто вызывают задержки. В частности, Jalapeño спроектирован так, чтобы минимизировать задержки на этапах предварительного заполнения (prefill) и коммуникации, которые, по словам OpenAI, часто являются узкими местами.

«Мы разработали Jalapeño для минимизации перемещения данных и задержек связи», — говорится в сообщении компании, представляющем результаты. «Это означает, что состояние модели, включая KV-кэш, используемый при генерации ответа, может быть явно размещено и сохранено локально, в то время как система активирует правильную комбинацию вычислений, памяти и сети для каждого этапа инференса».

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.


0 комментариев

Оставить комментарий


Все комментарии - Технологии