Компания Vals, поддерживаемая Андреессеном Горовицем, стремится стать золотым стандартом бенчмаркинга искусственного интеллекта
Бенчмаркинг стал отраслевой нормой, с помощью которой компании, работающие с ИИ, проверяют возможности своих моделей и, когда показатели меняются в их пользу, выделяются на фоне конкурентов и рекламируют свое превосходство. Другими словами, хорошие бенчмаркинги в значительной степени всегда означают хороший пиар.
К сожалению, компании также придумали, как обойти устаревшие системы бенчмаркинга, многие из которых устарели и не предназначены для измерения возможностей современных моделей.
Стартап Vals, основанный в 2024 году, говорит, что его миссия - исправить эту очень несовершенную систему. Менее чем за два года компания зарекомендовала себя как заметный представитель в индустрии высоких технологий, и в прошлом году ей удалось выиграть стартовый раунд, который провели 8VC и Bloomberg Beta. Затем, в прошлом месяце, после периода быстрого роста, компания привлекла 40 миллионов долларов в рамках серии А под руководством Андреессена Горовица.
Райан Кришнан, 25-летний соучредитель компании, ранее проходил стажировку в Palantir, а будучи студентом Стэнфорда, работал в Microsoft и в широко известной школьной лаборатории искусственного интеллекта. Кришнан говорит, что идея Vals родилась из его собственных наблюдений о том, как бенчмаркинг отстает от достижений отрасли, для измерения которых он был разработан.
"Мы наблюдали, как на рынок быстро выходит множество новых, очень эффективных моделей, и академические стандарты не поспевали за этим стремительным прогрессом", - делится Кришнан. По словам Кришнана, поскольку искусственный интеллект интегрируется во все сферы жизни общества, действительно должны существовать критерии для проверки того, что модели могут делать то, что рекламируют компании.
На прошлой неделе молодой основатель показал мне двухэтажный офис своей компании на Фолсом-стрит в Сан—Франциско - старинное кирпичное здание, в котором столетие назад располагалась крупная пивоварня. Вместо промышленного производства пива в историческом здании теперь находится множество различных стартапов, стремящихся создать будущее технологической отрасли.
"Исторически сложилось так, что оценка интеллектуальных способностей проводилась очень абстрактно", - говорит мне Кришнан. "Например, знают ли модели достаточно информации, чтобы пройти тест, похожий на экзамен в адвокатуру?"
Здесь Vals стремится выделиться. В то время как многие системы бенчмаркинга предлагают общедоступные тесты (это может позволить компании обучить свою модель на основе этих тестов, что, возможно, приведет к списыванию на экзамене), Vals публично не раскрывает свои конкретные тестовые материалы. Вместо того чтобы измерять общие знания модели искусственного интеллекта, Vals также оценивает ее способность выполнять сложные задачи, связанные с конкретными отраслями, такими как юриспруденция, финансы и программирование.
"What we’re doing is actually looking at what are the real impacts of the models," said Krishnan. "Can they do work that produces a product of the same quality as a human within every domain?"
The idea is to check not just for positive outcomes but also for negative ones, he says. The hope is to analyze how, "if these models ran wild in the world, what the negative implications would be."
The capabilities that Vals is measuring are growing. In additional to more traditional industries, the startup continues to push into more unique terrain. "We have a benchmark on recursive self improvement. We’re doing some work in mental health, cybersecurity, biosecurity, and even law of armed conflict to models to understand how to apply the Geneva Convention," Krishnan shares.
Companies pay Vals to test their models, which can be an odd concept to wrap your head around. Why would a company pay to learn its model isn’t performing well? But having an effective measurement helps companies troubleshoot and improve over time. Krishnan compares their revenue model to how a student might pay the College Board to take the SAT.
In turn, these evaluations are becoming key decision-making factors for companies looking to acquire new AI models.
The startup recently revealed that its revenue is currently eight times what it was last year. Its staff is also growing. Vals, which started the year with only eight people, has already tripled to a team of 25. Krishnan said that as the startup grows, the plan is to relocate to a significantly bigger office, as well as to bring on an additional 10 to 15 people. The company also recently launched a program centered around providing model evaluations to federal agencies.
Krishnan sees his company’s system of benchmarking as the future of how AI companies think about growing their businesses and establishing public trust.
"AI companies are starting to go public. SpaceX went public. Anthropic is slated for later this year. I suspect OpenAI will be public soon. I think as AI models become a core part of the economy and are diffused more broadly, the types of benchmarks and evaluations that we do are going to drive their usage and be a central part of how these companies submit public filings or talk about the prospective investments they’re going to make in AI," he said.
>
