Стартап Vals с поддержкой Andreessen Horowitz хочет стать золотым стандартом бенчмаркинга ИИ

Бенчмаркинг стал отраслевой нормой: ИИ-компании используют его для подтверждения возможностей своих моделей, а когда метрики оказываются в их пользу — для выделения на фоне конкурентов и рекламы своего превосходства. Иными словами, хорошие бенчмарки почти всегда означают хороший PR.

Проблема в том, что компании научились обходить старые системы бенчмаркинга, многие из которых устарели и не рассчитаны на измерение возможностей современных моделей.

Стартап Vals, основанный в 2024 году, намерен исправить эту несовершенную систему. Менее чем за два года компания стала заметным игроком в tech-индустрии: сначала привлекла посевной раунд под руководством 8VC и Bloomberg Beta, а в прошлом месяце после периода быстрого роста привлекла $40 млн (~3 200 000 руб.) в раунде A под руководством Andreessen Horowitz.

25-летний сооснователь компании Райан Кришнан ранее стажировался в Palantir, а во время учёбы в Стэнфорде работал в Microsoft и в знаменитой лаборатории искусственного интеллекта университета. По его словам, Vals родилась из наблюдений за тем, как бенчмаркинг отстаёт от прогресса отрасли, которую он призван измерять.

«Мы видели, как на рынок быстро выходило множество новых, очень способных моделей, а академические бенчмарки не поспевали за этим передовым рубежом», — говорит Кришнан. По его мнению, поскольку ИИ интегрируется во все сферы общества, бенчмарки должны проверять, что модели действительно умеют то, что обещают компании.

На прошлой неделе молодой основатель провёл экскурсию по двухэтажному офису компании на Фолсом-стрит в Сан-Франциско — старому кирпичному зданию, которое век назад служило частью большой пивоварни. Теперь вместо пива здесь размещаются стартапы, стремящиеся построить будущее tech-индустрии.

«Исторически оценка проводилась для измерения интеллекта очень абстрактным образом, — говорит Кришнан. — Мол, знают ли модели достаточно информации, чтобы сдать экзамен вроде адвокатского».

Здесь Vals пытается отличаться. Многие системы бенчмаркинга предлагают публично доступные тесты — это позволяет компании натренировать модель на них, что, по сути, является списыванием на экзамене. Vals же не раскрывает конкретные тестовые материалы. Вместо измерения общих знаний ИИ-модели компания оценивает их способность выполнять сложные задачи в конкретных отраслях — юриспруденции, финансах, программировании.

«Мы на самом деле смотрим, каковы реальные эффекты от моделей, — говорит Кришнан. — Способны ли они выполнять работу, дающую продукт того же качества, что и у человека, в каждой предметной области?»

Идея — проверять не только положительные результаты, но и отрицательные. Цель — проанализировать, «если бы эти модели вырвались на свободу в мире, каковы были бы негативные последствия».

Возможности, которые измеряет Vals, растут. Помимо традиционных отраслей стартап продвигается в более специфические области. «У нас есть бенчмарк по рекурсивному самоулучшению. Мы работаем в сферах психического здоровья, кибербезопасности, биобезопасности и даже права вооружённых конфликтов — проверяем, как модели применяют Женевскую конвенцию», — делится Кришнан.

Компании платят Vals за тестирование своих моделей — концепция может показаться странной. Зачем платить, чтобы узнать, что модель работает плохо? Но эффективное измерение помогает компаниям устранять проблемы и улучшаться со временем. Кришнан сравнивает их модель монетизации с тем, как студент платит College Board за сдачу SAT.

В свою очередь, такие оценки становятся ключевым фактором принятия решений для компаний, выбирающих новые ИИ-модели.

Стартап недавно сообщил, что его выручка сейчас в восемь раз выше, чем в прошлом году. Штат тоже растёт: начав год с восьми человек, Vals уже утроилась до команды из 25 сотрудников. По словам Кришнана, в планах — переезд в значительно больший офис и найм ещё 10–15 человек. Компания также недавно запустила программу по предоставлению оценки моделей федеральным агентствам.

Кришнан видит в системе бенчмаркинга своей компании будущее того, как ИИ-компании будут развивать бизнес и завоёвывать доверие публики.

«ИИ-компании начинают выходить на биржу. SpaceX провела IPO. Anthropic планирует позже в этом году. Подозреваю, что OpenAI скоро станет публичной. По мере того как ИИ-модели становятся ядром экономики и распространяются всё шире, типы бенчмарков и оценок, которые мы делаем, будут определять их использование и станут центральной частью того, как эти компании подают публичные документы или рассказывают о планируемых инвестициях в ИИ», — сказал он.

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.


0 комментариев

Оставить комментарий


Все комментарии - Технологии