ARTICLE SIGNAL
AI资讯:突破大模型瓶颈,EvoX如何重塑Agent自进化网络
AI,AI资讯,大模型,Agent,人工智能,EvoX,AI基础设施,AI新闻。随着大模型Scaling放缓,Agent自进化成为新趋势。本文深入探讨EvoX如何通过蜂群模式重塑生产力场景,助您把握AI变现机遇。
type
status
date
slug
summary
tags
category
icon
password
网址
2026年的夏天,藏着很多不一样的AI信号。
字节系的豆包飞书合并;阿里巴巴推出千问办公;腾讯WorkBuddy月活破2000万……
Agent正式进入生产力场景,开始直面长程任务和复杂指令。
随之而来的,是Agent 从底层出发的优化手段,越来越显示出必要性。
因此,A2A、AI4AI 相关赛道也在加速:前MetaAI研究总监田渊栋创立的Recursive拿到6.5亿美元融资,估值46.5亿美元;专注「AI优化AI基础设施」的Wafer也拿到了种子轮融资。
从硅谷到国内,顶尖的智力和资本,都在流向新型的Agent基础设施。
而EvoMap,一支来自深圳、不到20人的年轻团队,已经做出来在海外很有反响的一个产品。
官网:https://evomap.ai/
GitHub: EvoMap/AutoResearch
它的名字叫EvoX,接下来,大概会被更多人记住。
01
Agent 来到了十字路口
和身边朋友聊,EvoX的价值到底有多不一样;我们发现,得先理解现在大多数多 Agent 系统的问题出在哪。
今天的 Agent 任务系统基本有两种形态。
一种是把所有任务塞给一个 Agent,让它从头做到尾。
任务短的时候还行,任务一长,就会出现上下文截断、关键指令被淹没的问题。
第二种是更常见的「Agent Team 模式」:
一个主 Agent 负责拆任务,多个子 Agent 执行,最后子 Agent 把结果汇报给主 Agent 汇总。
看起来已经是多Agent了,但实际效果像传话游戏:每多传一层,就多一次出错的可能。
最后交付的,不一定是每个 Agent 做出来的最好结果,是主 Agent 在有限上下文里重新理解之后的结果。
这也是为什么 Sub-Agent 模式虽然调用了多个 Agent,执行成本甚至是三种模式中最高的,最终效果却仍然不理想。
多 Agent 真正的瓶颈从来不是数量,而是角色协作、多轮辩论和群体涌现的能力。
和几个清华朋友聊,有个共识:智能的基本单位,正在改变。
传统 LLM 的基本范式是:
Prompt → Context → Reasoning → Answer
而自进化 Agent 更接近:
Task → Action → Feedback → Experience → Reuse → Better Action
两者最大的区别,是后者开始形成一个真正意义上的 Experience Loop。
单纯堆参数的路径在放缓,真正的问题逐渐成了:怎么能充分发挥现有模型的智能,去优化那些在商业中发展停滞的老算法。
模型负责提供底层 intelligence,Agent 负责在真实环境里行动,而 Experience Network 则负责把大量 Agent 的行动结果组织起来。
所以从这个角度看,EvoMap 更像是在建立一个 Agent 的经验基础设施。
More than AI assistance. It's an agent matrix.
这个新的Agent自演化矩阵,说实话我挺期待的。
02
EvoMap交出的一份答卷
之前大家了解到EvoMap,很多是2月龙虾爆火那时候。
曾经在 Clawhub 上架了自进化 Evolver 被全网讨论,和OpenClaw创始人Peter多次交锋,并且推出了 A2A 平台 EvoMap。
从Claude Code到Codex,海外最牛的Agent产品,很多框架也都落在了EvoMap的射程范围内。几乎可以说是国内最有野心、最有想象力的AI团队之一了。
他们最新拿出的成果,就是EvoX。
EvoX让Agent的经验,像基因一样沉淀下来。
第一次教它,以后都不用再教。
更关键的是它的「蜂群模式」:大量Agent没有中心调度节点,平级连接,根据任务信号自主选择协作对象、灵活组队——就像大自然中的蚁群蜂群一样。
个体简单,群体智慧涌现,而且这已经是被实验验证有效的机制。
在563道逻辑、数学、物理题上,使用同一个模型(Claude Haiku 4.5),单Agent正确率只有26.29%,Sub-Agent模式38.54%,而EvoX蜂群模式达到了70.69%到70.87%。
同样的模型,只是改变了组织方式,结果差了整整一倍多。
他们还开源了一个叫AutoResearch的项目,让一群Agent协作完成从科研Idea到实验、分析、评审的完整闭环。
在SWE-bench Lite的Django修复任务中,AutoResearch把官方新增功能测试从2/7推进到7/7,同时保持203个回归测试全部通过。
失败本身成为下一轮的输入。
当别人还在论证方向时,EvoMap已经把第一个答案交了出来。
03
这套能力用在真实世界是什么样子
「AI优化AI」听起来很远,但落到真实场景里,其实每个人都看得懂。
比如外卖平台调度骑手。
今天的外卖平台用老算法分配订单,高峰期经常顾此失彼,骑手跑冤枉路、用户等餐久、平台成本高。
用AI去优化这套调度算法,让系统实时计算最优路线、动态调整派单策略,结果就是骑手少跑路、订单更快送达、平台每单成本下降……
最终可以实现三方都受益。
还有像医院问诊排号系统、大学生选课系统等等,背后都有一套老算法在运行,而AI可以比人类更快、更准地找到这套算法的优化空间。
当算法可以被AI 针对不同场景实时优化,那么距离AI自主优化Harness甚至模型也就更近了一步。
EvoMap做的事情,就是把「AI优化AI」从实验室,带到这些真实的产业场景里。
比如说,我想把杂乱并且变化的数据,整合成一个清晰的动态看板。
背后也是有多个虚拟项目,实时在发生变化,在看板上需要一套被AI优化过的算法,来完整呈现。
再比如,做一个可以调参数的宇宙模拟器。
我给到EvoX的指令很简单:
做一个宇宙模拟器,还原宇宙的形态,设定相关参数,可以手动调节,有光点、光晕等元素,星际穿越的感觉,输出html。
能看到它和一般的coding产品不一样,不是当成一次性任务直接开始写代码,是先编写完整文件、树立系统逻辑,确定更多审美偏好之后,才开始行动。
之前尝试过用当前最新、最牛的模型,还是没办法产出让人满意的效果。
EvoX出的这版效果,我就挺喜欢。
经常有一些要做网站的、做html格式动态呈现的任务,这也是之前我自己vibe coding经常搞的。
尝试了一下,做3D动态旋转效果的网站。
还是很简单的一句话指令。
这次我开启了蜂群模式,第一次尝试出现了失败,好在第二次就成功了。
最终完成的质量,水准不错。
六面体魔方,每个面都由图片组成,空间关系和旋转效果都符合预期。
之前用Opus 4.6,也可以实现,但是花了我非常久的时间,中间反复调试、改bug,让人只想放弃。
EvoX是在Agent的工作流里,加入了自优化、自分配,并行来处理复杂任务;所以很多中间琐碎的过程,帮我给承包了。
用在一些日常的复杂数据处理、多任务统筹安排分析等等场景,产出的完成度也很高。
在效率和效果上,比任何单独的大模型,明显有提升。
EvoX让我觉得,自进化这件事并不神秘,在日常的使用体验上优化是实打实的。
一群AI Agent自己去拆解问题、协作执行、沉淀经验,然后把这件事做快、做好、做便宜,而发出任务的我们可以更轻松。
用了以后会觉得,在EvoX,做任务可以很丝滑,而且越用越懂我。
04
写在最后
眼下,Agent的基础设施早就呼之欲出了。
大厂在铺路,顶尖科学家在押注,资本也在投票。
AI优化AI,用Agent服务Agent,为Agent打造新基建,每一个细分环节都有独角兽的机会。
而EvoMap,一支不到20人的深圳团队,已经把成果摆在了桌面上。
如果说模型的 Scaling,解决的是「一个大脑有多聪明」;
那么 Agent 的 Scaling 解决的则是「一个人能做多少事」;
而 EvoX 解决的可能是「AI自进化基础设施」,让整个 Agent 网络一起变得越来越会做事。
EvoX已经可以下载、体验,还有完全开源的AutoResearch的代码,在GitHub上可以读、可以跑。
比起现在,未来的EvoX,我会更期待。
文章来自于微信公众号 “AI异类弗兰克”,作者 “AI异类弗兰克”
Loading...