ARTICLE SIGNAL
逼近Claude!中国黑马27B大模型崛起与AI变现新路径
深入解读中国黑马万衍27B大模型如何逼近Claude,探索AI,大模型,人工智能在网络安全与真实业务中的应用。获取最新AI资讯,AI新闻,了解AGI前沿动态。
type
status
date
slug
summary
tags
category
icon
password
网址
最近的AI新闻圈被一则消息引爆。就在不久前的高盛科技大会上,英伟达CEO黄仁勋抛出了一个引人深思的观点:“网络安全,很可能是AI的下一个杀手级应用。” 与此同时,openai宣布其“自动化AI研究实习生”正式上岗,标志着AI Agent正在深度介入复杂的人类工作。
然而,在巨头们疯狂抢跑的背景下,最让人意外的突破却来自一张极具含金量的榜单。一支不到十人的中国小团队——万衍(Vera Praxis),凭借其训练的27B大模型Feyospace,在CyberGym评测中成功与openai、Anthropic等国际巨头同榜,甚至逼近了claude的顶尖水平。如果你想随时掌握这类前沿的AI资讯,欢迎访问专业的AI门户网站 AIGC导航,获取第一手行业动态。
本文将深入解读这家中国黑马的技术突破,并探讨他们如何通过真实业务场景,走出一条独特的AI变现与模型进化之路。
小团队的大突破:27B模型惊艳CyberGym
CyberGym并非普通的跑分测试,而是一个让人工智能在真实软件环境里复现漏洞的高难度评测。它要求模型不仅要理解代码,还要构造触发漏洞的测试,并根据运行反馈不断调整。这考验的是LLM(大型语言模型)将分析、行动与验证无缝连接的综合能力。
截至近期数据,万衍的Feyospace-v1在该榜单上的漏洞复现成功率达到了惊人的63.0%,这一成绩极为接近Claude Sonnet 4.6的65.2%。在过去,这类高难度榜单的前列长期被资本雄厚的巨头垄断。万衍的突破证明了,通过面向安全场景的专业化后训练,百亿参数级别的“小模型”完全能够在垂直领域爆发出惊人的能量。
专家经验转化为AI能力:Kreator方法的启示
万衍之所以能取得如此成绩,核心在于他们掌握了将“人类专家经验”转化为“模型可学习知识”的秘诀。在处理复杂的浏览器引擎漏洞时,模型往往会卡在某个特定的运行条件上。此时,安全专家会介入,补充关键的判断。
万衍团队并未简单地把最终答案喂给模型,而是采用了一种名为Kreator的方法。这种方法将专家的洞见、推理过程以及行动记录完整保留下来。因为专家往往依靠隐性直觉,而模型需要清晰、可复现的中间步骤。这就好比我们在编写高质量的提示词(Prompt)时,需要给模型提供思维链(CoT)一样。Kreator方法不仅记录“做了什么”,更保留了“为什么这样做”,让专家的一次关键判断,成为模型学习一整类问题的起点。
真实业务驱动:构建大模型持续进化的飞轮
比跑分更令人兴奋的,是万衍的商业逻辑。在探讨AI变现的今天,很多公司陷入了“拿着锤子找钉子”的窘境。而万衍选择亲自下场,布局App、音频、安全和量化等真实业务。
他们的逻辑非常清晰:业务跑得越远,遇到的疑难杂症就越多;专家在解决这些问题时留下的高质量数据,反哺给模型进行训练;模型变得更强后,又能帮助业务挑战更难的工作,创造更大的经济价值。
例如,在量化研究中,策略想法需要与数据质量、风险约束共同接受检验;在音频业务中,创作过程对旋律和风格的判断能为音乐理解提供训练课题。万衍正在建设的Praxis OS,正是为了将这些真实经营中的目标、行动和结果,转化为持续推进模型研发的养料。这种将业务增长与模型进步相互绑定的“飞轮效应”,为整个人工智能行业提供了一个极具参考价值的范本。
产业协同与未来展望:迈向AGI的新范式
当chatGPT等通用大模型不断刷新能力上限时,垂直领域的专业模型如何保持竞争力?万衍给出的答案是:持续吸收通用模型的进步,同时将自己的研发集中在下一批重要、困难且尚未解决的真实业务问题上。
这种业务经营与模型研发深度结合的模式,正在成为产业的新趋势。这也与OpenAI等机构将研究人员、工程师和领域专家放在同一体系内的做法不谋而合。万衍的目标不仅是打造一个强大的安全模型,更是要建立一家在创造经济价值的同时,持续扩大模型能力边界的AI公司。
随着这种模式的成熟,我们有理由相信,通往AGI(通用人工智能)的道路不仅在实验室里,更在千千万万个真实的商业经营现场中。获取每日精选的AI日报和最前沿的行业深度解析,请持续关注 AIGC导航,与我们一起见证AI时代的每一次跃迁。
Loading...