Arena привлекла $200 млн и почти удвоила оценку до $3,1 млрд за 10 месяцев
Платформа Arena, которая появилась в 2023 году как исследовательский проект в Калифорнийском университете в Беркли и занималась краудсорсинговым рейтингованием ИИ-моделей, объявила в четверг о привлечении $200 млн в рамках раунда Series B при оценке $3,1 млрд (~248 млрд руб.).
Это произошло после того, как в июне компания сообщила о достижении $100 млн годовой выручки в пересчёте на годовой темп.
Раунд возглавили Lightspeed Venture Partners и Khosla Ventures, к ним присоединились Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis и другие. Ранее, в январе, Arena объявила о раунде Series A на $150 млн при постденежной оценке $1,7 млрд. Тогда её годовая выручка составляла $30 млн. Таким образом, оценка компании почти удвоилась примерно за 10 месяцев.
Arena предоставляет краудсорсинговую платформу, бесплатную для пользователей. Люди вводят запросы или просят создать проекты в стиле «вайб-кодинга», а затем оценивают, какая модель справляется лучше. Arena утверждает, что у неё десятки миллионов посетителей в месяц.
В сентябре прошлого года она представила коммерческий продукт AI Evaluations — сервис, который предоставляет лабораториям, разрабатывающим модели, и предприятиям подробную аналитику производительности на основе отзывов сообщества. Момент оказался идеальным. В этом году лаборатории ИИ осознали, что их модели научились обходить тесты бенчмарков, находя способы получать высокие оценки без реальных достижений. В то же время предприятия хотели понять, какая модель лучше подходит для их внутренних задач, а не полагаться только на стандартизированные бенчмарки.
«ИИ развивается быстрее, чем наши возможности его оценивать, а статические бенчмарки перестают работать, как только модели понимают, что их тестируют», — заявила компания в анонсе финансирования. «Миру нужна нейтральная третья сторона, которая измеряет, насколько безопасен и выровнен ИИ на самом деле, когда он попадает в руки реальных людей. Сегодня Arena берёт на себя эту роль», — добавили в компании.
В связи с этим Arena также добавила новую категорию в свой лидерборд — «выравнивание» (alignment). В ней модели ранжируются по таким проблемам, как несанкционированные действия (совершение действий, о которых не просили); ложная атрибуция (ошибочное приписывание утверждений или фактов не тому источнику); и так называемое «обманчивое завершение» (ложь о выполнении задач, которые на самом деле не были выполнены).
Сейчас несколько моделей OpenAI занимают верхние строчки в предварительном лидерборде по выравниванию, а Claude Opus 5.5 и Claude Fable находятся на шестом и девятом местах соответственно.
Цены сконвертированы автоматически, реальные значения могут отличаться.
0 комментариев