AI资讯 / 产业

产业 / 媒体

a16z领投4000万美元,Vals要做AI评测领域的权威标准

TechCrunch AI

AI模型评测正面临公信力危机——企业可以针对公开测试题库训练模型,让基准分数沦为营销工具而非真实能力的体现。成立于2024年的Vals AI正试图改变这一现状。该公司不公开具体测试内容,转而以法律、金融、编程等垂直行业的复杂真实任务来衡量模型能力,并同步评估模型在失控情境下可能带来的负面影响。今年,Vals完成了由Andreessen Horowitz领投的4000万美元A轮融资,此前已获8VC和Bloomberg Beta领投的种子轮。公司收入较去年增长八倍,团队从年初的8人扩张至25人,并已启动面向联邦政府机构的模型评测项目。联合创始人Rayan Krishnan认为,随着AI公司陆续上市,独立可信的评测报告将成为公开募股文件和投资决策的核心依据。

AI基准测试正在成为一场信任危机。当前,各大AI公司普遍依赖基准测试来验证模型能力、在竞争中脱颖而出,高分数几乎等同于免费的公关背书。然而,许多主流评测体系历史悠久,设计之初并非为了衡量现代大模型的实际能力。更棘手的是,企业已经摸索出针对公开题库进行定向训练的方法,使得基准分数的参考价值大打折扣。

Vals AI的25岁联合创始人Rayan Krishnan曾在斯坦福大学就读期间先后为Palantir、微软及斯坦福AI实验室工作。他在亲历行业快速迭代的过程中意识到,学术基准的更新速度远远跟不上模型能力的进化节奏。「我们看到大量能力极强的新模型快速涌入市场,而学术基准根本无法跟上这一前沿进展,」Krishnan表示。这一判断促使他在2024年创立了Vals。

与传统评测体系不同,Vals不公开具体测试题目,从根本上堵住了企业「刷题」的漏洞。更重要的是,Vals不再考察模型是否能通过类似律师资格考试的抽象知识测试,而是聚焦于模型在法律、金融、编程等真实业务场景中完成复杂任务的能力,核心问题是:模型能否在各个领域产出与人类同等质量的工作成果?

Vals的评测范围还在持续扩展,已延伸至递归自我改进、心理健康、网络安全、生物安全,乃至模型对《日内瓦公约》等武装冲突法律的理解与应用。Krishnan强调,评测不仅要捕捉正向能力,也要分析模型在无约束状态下可能产生的负面影响,这一双向视角使Vals的评测框架更具现实意义。

在商业模式上,Vals向AI公司收取评测费用,类似于学生向美国大学委员会缴纳SAT考试费。这些评测结果正日益成为企业采购AI模型时的关键决策依据。目前,Vals收入较去年同期增长八倍,团队规模从年初的8人扩张至25人,并计划再招募10至15名员工,同时迁入更大的办公场所。

Krishnan对Vals的长远定位有着清晰的判断。随着Anthropic、OpenAI等AI公司陆续筹备上市,独立可信的模型评测报告将不可避免地进入公开募股文件和投资者沟通材料。「当AI模型成为经济体系的核心组成部分并被更广泛地普及时,我们所做的评测将驱动模型的实际使用,并成为这些公司提交公开文件或讨论AI投资计划的核心内容,」他说。

要点

  • Vals AI完成由Andreessen Horowitz领投的4000万美元A轮融资,成立不足两年已成为AI评测领域的重要力量
  • 公司不公开测试题目,以法律、金融等垂直行业的真实复杂任务替代抽象知识考核,从根本上防止企业针对性刷题
  • 评测范围已扩展至递归自我改进、网络安全、生物安全及武装冲突法律等前沿高风险领域
  • 收入较去年增长八倍,团队从8人扩张至25人,并已启动面向联邦政府机构的评测项目
  • 随着AI公司陆续上市,独立评测报告有望成为公开募股文件和投资决策的标准化依据
查看原始来源

原始标题:Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarking

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。