文章摘要
法律AI公司Harvey联合创始人Gabe分享垂直领域AI竞争思路。指出破局关键在于借助前沿生态,要搭建专属评估基准、用领域专家引导合成数据生成、开源基准数据集进行生态建设,与多家新兴AI训练实验室合作后训练。还介绍模型上线评估与监控流程,以及降成本的前置步骤。同时提及面临的挑战,其思路对垂直AI团队有借鉴意义。

对于应用层AI公司来说,和顶级AI实验室正面竞争,似乎是一场资源完全不对等的游戏——头部团队手握顶尖研究人才、天量算力、海量数据与充足资金。但法律AI公司Harvey的联合创始人Gabe Pereyra分享的一套实战打法,为垂直领域AI玩家提供了全新的竞争思路。

Harvey成立仅四年,已在60个国家为顶级律所与企业法务团队提供服务,其创始人Gabe曾在DeepMind与Meta担任研究科学家。这家公司的案例极具代表性,它直面了所有垂直AI公司都会遇到的核心难题:客户的敏感法律数据受严格特权保护,无法用于模型训练;公开领域缺乏高质量的专业训练数据;同时还要与通用大模型竞争,且资源远不及头部实验室。Gabe将这种竞争局面总结为,头部实验室拥有更多资金、顶尖人才、算力基础设施和海量数据,而破局的关键在于借助前沿生态系统。

首先要搭建专属的评估基准,这是很多公司容易忽略的关键步骤。如果没有适配业务场景的评估标准,就无法有效训练模型,更谈不上将模型部署到生产环境。Harvey今年开源了三个自研数据集:第一个是LegalAgentBench,覆盖了顶级律所的各类复杂日常任务,包括起草复杂基金文件、案例法律研究等真实业务场景,而非简单的问答任务;第二个是合同谈判数据集,用于训练AI代理完成企业法务级别的合同谈判工作;第三个则是Gabe团队最为重视的大型尽职调查数据集,这是目前公开的最大规模强化学习环境之一,最大的数据室包含8000万个token,可用于研究超长上下文与复杂任务场景下的模型表现。

很多人会忽略自研benchmark的意义:通用评估基准无法准确反映模型在垂直业务中的真实表现。对于法律场景来说,顶级通用模型都难以完美还原真实的律所客户案件,而专属的评估基准本质上就是对业务问题的精确描述。

垂直AI公司最棘手的问题莫过于数据来源。Harvey的客户都是顶级律所,其业务数据受严格特权保护,不仅不能放入通用模型,甚至连Harvey自身的模型都无法使用这些数据训练。针对这个鸡生蛋的困局,Gabe提出的解决方案是用领域专家引导合成数据生成。

这一思路可以类比当下的氛围编程:工程师不再直接写代码,而是通过自然语言引导AI完成开发,Harvey则让内部的法律专家来引导数据生成。Gabe的弟弟本身就是Harvey的执业律师,也是公司早期员工,他在这一流程中积累了丰富经验,并培训了团队内的其他律师参与这项工作。

以尽职调查场景为例,真实的数据室往往包含上万份需要相互匹配、逻辑自洽的合同,而这类数据几乎没有公开来源。Harvey的解法是先制定评分标准,在数据中预设问题,比如合同之间存在矛盾、缺失关键条款等,再基于这套标准生成完整的数据室,随后借助Mercor和Snorkel这类工具让生成的合同更逼真。最终他们就能得到带有标准答案的训练数据集,可以清晰评估模型是否能发现预设的问题。这套方案解决了一开始无法向律所证明模型价值的死循环,如今可以先用合成数据验证可行性,再与律所展开深度合作。

Harvey选择将自研的基准数据集开源,这在当时曾引发争议。Gabe的解释非常务实:一个基准的好坏无法仅凭内部判断,只有让更多开发者使用、测试,才能发现其中的问题。这和他在Google Brain与DeepMind的工作经验一致,ImageNet、CIFAR这类经典数据集正是因为开放才得以不断完善。

更实际的价值在于,如今越来越多头部实验室在发布新模型时,会将Harvey的基准作为评测指标,这相当于让整个行业的顶尖模型帮助持续测试他们的基准框架。Gabe还提到,马斯克转发过他们的数据集后,也为团队带来了不少关注度。

有人质疑开源基准会让头部实验室直接刷榜,削弱竞争优势,但Gabe看得很清楚:真正的护城河并非这些公开的合成基准,而是帮助律所在自有私有数据上训练定制模型的能力。开源基准本质上是一种生态建设,既能让行业用上更专业的工具,也能吸引更多研究力量测试新方法,Harvey可以第一时间将成熟的新技术接入自身服务。从更深层的战略来看,开源基准也是在建立行业话语权,定义垂直领域的评估标准,这远比隐藏数据更有价值。

Harvey目前与多家新兴AI训练实验室合作开展后训练,也就是在预训练模型基础上进行针对性微调,合作方包括Fireworks、Base 10、N-gram、Trajectory、Applied Compute等。每家合作方的侧重点各不相同:比如和Fireworks合作训练GLM 5.1模型,以Claude系列作为顾问模型;和Trajectory合作优化NeMo-Megatron模型;和N-gram则聚焦企业搜索与律所知识库搭建。

很多人会问为什么不只选择一家合作方?Gabe的回答很直接:Harvey的研究项目数量远超内部团队的带宽,也比任何单一新兴实验室的能力范围更广。每家合作实验室在研究方向上都有各自的侧重与专长,与更多团队合作可以吸收更多技术经验。同时,当前开源模型的性能已经足够强大,后训练的价值正在显著提升——过去几年,对开源模型做后训练的意义不大,因为基础模型迭代太快,刚完成的微调很快就会被新版本的预训练模型覆盖,但如今GLM 5.2、NeMo-Megatron这类开源模型已经达到了前沿智能的水平,在法律垂直场景中通过后训练可以进一步强化性能。

Harvey的整体目标是打造专属的垂直模型,参考Cursor打造Composer的思路,将合成数据生成、第三方工具扩展、新兴实验室合作等积累的能力整合为一套可与闭源模型并行部署的专属系统。他们的目标并非超越通用大模型,而是在法律场景中打造可用的专业工具,这种垂直定位比追求通用最优更现实,也更容易落地。

很多人误以为应用层AI公司的模型服务只是调用模型接口,最多做一个聊天产品,但Harvey面临的现实要复杂得多:团队要在60个国家运营多条产品线,不同客户对模型有不同偏好,还需要在多个供应商之间做备份切换以保证服务水平协议。

Harvey搭建了一套完整的生产服务矩阵,需要同时维护多个模型家族的多个版本,在不同供应商之间做备份切换,如今还要将开源模型纳入统一管理。这套基础设施必须在开展后训练之前就搭建完成。

对于新模型的上线,Harvey有一套严格的评估流程:首先用LegalAgentBench做快速自动化测试,验证模型在法律任务中的基础水平;随后开展人工对比测试,将新模型与现有模型做并排对比;最后针对每个产品页面检查关键用户路径,因为有些模型在通用任务中表现优秀,但在特定产品场景中可能存在短板。模型上线后,团队还要建立持续监控机制,包括A/B测试、用户参与度跟踪、正常运行时间监控、token使用效率统计,以及Gabe口中的“愤怒的客户邮件”,也就是真实的用户反馈。

Gabe还给出了一个实用的前置步骤:在开展后训练之前,可以先做两件低成本的事。一是排查产品中是否有可以直接用开源模型替换闭源模型的模块,比如Harvey的部分生成引用的模块不需要最强的模型,换成GLM 5.2就能降低成本或提升性能;二是搭建模型路由系统,对于无法直接替换的场景,可以将特定类型的查询流量导向开源模型。完成这两步后,就能建立同时运行开源与闭源模型的基础能力,后续的后训练落地也会更顺畅。

有观众在问答环节问到,Harvey如何与Anthropic、OpenAI这类实验室竞争研究人才,毕竟头部实验室的薪酬包可能高达数亿美元。Gabe的回答很诚实:早期公司规模不足,无法在薪酬上与头部实验室竞争,但如今Harvey已经达到了可以参与人才竞争的体量。

不过他也给出了更乐观的判断:过去需要顶尖人才,不仅是因为后训练本身,还因为需要同时搭建训练与服务的基础设施,这对人才的要求极高。但如今Fireworks、Tinker这类API服务已经将训练与部署的基础设施标准化,不需要再从零开始搭建,这大大拓宽了可胜任该工作的人才范围。加上现在越来越多博士研究者不想去头部实验室,这个人才市场正在变得更易进入。这其实和之前提到的借助前沿生态的思路一致:不需要将所有能力都内置,当周边生态成熟后,可以将非核心能力外包给专业供应商,内部只需要保留真正具备差异化价值的团队。

演讲的最后,Gabe用《点球成金》的台词收尾:“如果我们用这个预算、这支队伍赢了,我们就改变了这个游戏。”他认为当下的前沿生态系统,为所有应用层公司提供了同样的机会。

点球成金的核心逻辑是,当资源不对等时,与其在对方擅长的领域正面硬拼,不如建立一套全新的评价体系,在其中建立自身优势。Harvey的做法正是如此:他们没有在算力上试图超越头部实验室,而是在法律垂直场景中建立了专属的评估标准、数据能力与模型服务体系,让通用大模型也必须在这个领域与他们一较高下。

Gabe也坦诚地分享了团队目前尚未解决的核心挑战。首先是数据分布偏差:合成数据虽然逼真,但和真实生产环境中的数据分布仍存在差距。Harvey生成的数据集偏向完整的尽职调查流程,但当前用户更多是用Harvey来写邮件或起草单段内容,由于无法使用客户的真实数据,这种分布差距很难弥合。其次是超长上下文管理:他们的尽职调查数据集最大的数据室包含8000万个token,现有模型在这种超长上下文场景下的表现仍有很大提升空间,如何训练模型适配这类复杂任务仍是开放问题。最后是持续学习的终极愿景:Harvey的最终目标不是打造最好的法律模型,而是帮助每家律所或企业客户根据自身业务定制迭代AI系统,每完成一个客户案件,系统就能变得更聪明,同时严格保护客户数据隐私。这既是技术挑战,也是运营挑战,更是AI领域的核心难题,三者叠加复杂度极高。

听完Gabe的分享,有几个值得关注的点。首先,评估基准的价值被严重低估了,很多AI团队都是先做产品再考虑评估,但Harvey的思路是先搭建基准,再训练模型,最后落地生产,这种顺序让每个环节都有清晰的信号来判断进展与问题,这对垂直AI团队极具借鉴意义。其次,借助前沿生态并非认输,而是更聪明的竞争方式。过去要搭建完整的AI服务需要像头部实验室一样自建所有基础设施,但如今各类开源模型、新兴训练实验室、标准化API工具都已经成熟,应用层公司只需要找准自身的核心价值——垂直领域的数据、评估标准与专业知识,就能将外部资源用到极致。第三,“做最好的通用模型”或许并非正确的目标,Harvey没有试图超越通用大模型,而是在垂直场景中打造可用的专业工具,这种超垂直的路线在当下更容易找到真实价值,也更容易建立难以复制的护城河。最后,持续学习的愿景如果能够实现,将成为极强的竞争壁垒:每个客户的使用都会为系统积累数据,系统越用越好,就越难被替代,这种飞轮效应一旦启动,后进者的追赶成本会呈指数级上升,这才是AI时代真正的护城河。

以上内容不代表本平台立场,仅供读者参考