ARTICLE SIGNAL

前大模型专家创办AI职业培训,高质量数据引爆AI变现

AI,AI资讯,大模型,人工智能,深入解读前MiniMax与OpenAI成员创业项目,聚焦AI职业培训与高质量专业数据,探讨LLM如何通过专家工作流走向真实工作场景,加速AGI变现进程。

type
status
date
slug
summary
tags
category
icon
password
网址
让AI学会进入真实工作场景。
最近,OpenAI前员工Andrew Ho离职创业的消息在AI圈里传开。
大模型已经吃进海量文本,代码能力也被持续训练,很多模型在公开评测里的成绩越来越高。
Andrew Ho仍然认为,模型的能力带有很强的尖峰特征。某些题目做得很好,换到真实工作里,面对信息的不完整、目标的不断变化等任务,模型依旧容易失去稳定性。
他尤其提到了一个问题。大量能够创造经济价值的工作,并没有被现有数据产品充分覆盖。
它们能解出很难的编程题,能把一种语言的代码转写成另一种语言,进入需要人类反复判断、耐心清理产出的软件工程现场,可靠度就会打折扣。
于是,他在OpenAI待了八个月后,曾参与过GeneBench和GeneBench Pro这类生物医学评测项目,离职便创办了一家专门生产高质量强化学习数据的公司。
在同一时期,另一支有中国大模型公司经历的团队也在做相似的事情。
这家公司叫Copula Lab,由两名前MiniMax核心成员创办,已经获得第一轮一线机构投资支持,目前对应千万美元级估值
不过目前的产品体系、客户网络和组织能力搭建的早期阶段。
一个人准备进入公司工作,学校里学到的知识属于基础部分。面对一份具体职业,他要逐渐熟悉工作任务和行业判断方式,也要理解一份合格成果长什么样。
练习过程中得到的评价,会帮助他继续修正自己的工作方法。AI进入专业工作,同样需要大量类似的训练材料。
Copula Lab想提供的正是这一类东西。希望把这类复杂任务整理成模型可以反复训练、评测和继续迭代的数据与环境。
Copula Lab创始人梁丽此前作为MiniMax Agent产品负责人。她在2021年进入腾讯管理培训生项目,2024年加入MiniMax,后来负责Agent业务,管理超过20人的团队,并直接向CEO和COO汇报。
她从零搭建了MiniMax内部的Agent Benchmark,2026年年初带动Agent业务实现五倍营收增长,GMV达到八位数。
(右)蔡佳人
另一位蔡佳人,曾在语雀(Yuque)、支付宝做过开发,在此之前作为MiniMax开发者社区负责人,也做过后训练工程师,从零搭建了vibe benchmark,主导推动了M2系列在编程能力上的后训练迭代。
并且牵头对接过Andon Labs的Vending Bench、LMArena、Vals AI的Vals Index、Artificial Analysis、Terminal Bench等多家外部评测机构,负责M2、M2.1、M2.5三个版本的国际开源发布。
大模型准备承担更多工作之后,模型公司会更关心具体的失败位置。围绕这些薄弱环节产生的数据,会直接影响后续能力提升。
编程之后,下一个战场,是模型进入高经济价值、高门槛专业工作流程的能力,前沿实验室的后训练正在从静态问答、偏好标注和单轮任务,转向可交互、可验证、可规模化的专家工作流环境。
公司把自己的产品分成四条线。
第一条是基准,用来定义行业里高影响力的评测标准,建立品牌,也打开采购渠道,评测本身要建立在真实的经济任务上。
第二条是专家强化学习环境,把高价值、长周期、半开放的任务变成一整套RL环境,里面包含任务定义、专家轨迹、自动打分函数、评分细则和标准交付物。
第三条是专家工作流数据,通过AI引导的访谈和多位专家交叉质检,把经过验证的专家判断沉淀成结构化数据,模型可以从中学习,也可以被审计和评测。
第四条是反模式数据集,专门标注模型在长链条专业任务里容易出错的地方,比如事实引用不准、数字前后不一致等。
支撑这四条产品线的,是一张专家网络。标准的标注流程做不出专家级的信号,因为标注员自己没有干过这份工作。
目前公开展示的专家网络集中在金融领域,招募对象包括投行、全球私募股权基金、对冲基金、量化机构、资产管理公司、卖方研究和四大审计事务所的从业者。
他们通过深入访谈和多位专家交叉质检,把财务报表分析、盈利建模、估值方法和交易逻辑背后的判断依据,转化成可以用于训练和评测的推理数据。
这一部分可以直接用Copula Lab已经公布的两个案例来说明。
第一个是GDPval,Copula Lab做的这一版按中国官方的GDP产业结构做权重,任务筛选还叠加了知识工作密度这一层过滤。
这个基准称作衡量AI对中国劳动力市场影响的先行指标。
原版GDPval诞生时,行业内的说法是前沿模型已经能在一半以上的任务里逼近甚至超过行业专家的产出质量,换成中国产业结构做权重之后,这个结论还需要更多轮测试才能验证。
第二个是WebDev,用来测试Agent写前端代码的能力。
以往类似的测试,比如LMArena旗下的WebDev Arena,主要看代码运行结果,让匿名模型生成的两个网页放在一起,交给用户投票选出更好的那一个;
一家名叫Design Arena的团队做的同样是靠海量真实用户投票,给AI生成的网页、图片、视频、音频和界面设计打分,近期也是拿到接近八百万美元的种子轮融资,年化经常性收入已经到了六千万美元级别。
这套机制在过去两年里积累了大量真实用户的判断数据,也逐渐从单纯的代码对战,演化成更强调完整工程能力的综合评测。
Copula Lab让专家从多个维度给出评分,包括布局、字体、色彩、动效和场景契合度,还专门提出了一个概念叫反AI味,用来识别那些技术上没问题、审美和交互上处处透着模型痕迹的产出。
这些做过前沿模型的团队走出来创业的人,开始集中关注高质量数据、强化学习数据、专业工作流、训练环境和基准测试。
这背后有一个变化正在发生。
此前大家最缺的是大量数据,接下来越来越缺的是AI以前没学过、互联网里又很难直接找到的工作经验。
Andrew Ho预测,未来几年前沿实验室在这类专业数据上的采购投入可能超过一千亿美元。
这类公司的出现,也从另一个角度说明一件事,模型能力的边界,正在从算法和算力,慢慢转移到谁能拿到最稀缺、最贴近真实工作现场的那批数据。
大模型公司不会为每一个行业亲自建立完整专家网络,也很难同时覆盖所有工作类型。专业数据公司如果能够稳定产出模型实验室需要的训练材料,就有机会成为模型后训练供应链的一部分。
Copula Lab正在押注这个位置。2026年的AI行业已经越来越关心模型执行工作的能力。
代码、深度研究、浏览器操作、办公任务都在快速进入产品。用户交给AI的任务长度也在增加。
任务变长之后,单纯会聊天的价值会降低,稳定完成工作会变得更重要。职业培训这个词听起来带着一点玩笑感,背后的问题很现实。
当AI准备承担一份工作时,它需要的不只有知识。
它还要理解工作如何展开,知道什么结果达到行业标准,并在复杂环境里经过反复练习,逐渐减少必须避免的错误。
这些内容很难通过继续抓取网页自然获得。模型越来越接近工作之后,训练数据开始离网页更远,离人类专家更近。
下一阶段的竞争里,模型参数和算力仍然重要。高质量专业数据的获取速度与训练环境的现实程度,也会影响模型进入实际工作的速度。
对于普通用户来说,这件事可能表现得非常简单。
有一天,我们交给AI一份复杂工作时,不再需要花大量时间检查它有没有在某个环节犯下低级错误。AI对职业的理解,也会建立在大量接近现实任务的训练之中。
如果把这个过程类比成人类进入职场,Copula Lab做的事情确实很像职业培训。
这一次,坐进培训室里的学员变成了AI。
文章来自于微信公众号 “虾蛄AI”,作者 “虾蛄AI”
Loading...

没有找到文章