ARTICLE SIGNAL
Prime Agent刷爆ARC-AGI-3:RLM自我改进框架的突破与争议
AI资讯,AGI,大模型,Prime Agent框架,RLM递归语言模型,ARC-AGI-3评测,人工智能,AI新闻,LLM,前沿技术解读,AI门户,探索AI自我改进的潜力与过拟合争议。
type
status
date
slug
summary
tags
category
icon
password
网址
最近,人工智能圈被一款名为Prime Agent的开源智能体框架刷屏了。据官方消息,该框架在极具挑战性的ARC-AGI-3评测中,联合顶尖大模型拿下了高达95.5%的成绩,一举超越了人类专家基线。作为每日追踪最新AI资讯和AI新闻的从业者,我们深知ARC-AGI-3并非靠传统题海战术就能攻克的测试,它充满了陌生的抽象游戏和未知的规则。今天,我们将通过我们的AI门户(https://aigc.bar),为您深入解读这一AGI领域的最新突破,剖析其背后的RLM(递归语言模型)机制,并探讨其为何在开发者社区中引发了激烈的争议。
重构底层逻辑:Prime Agent为何如此强大?
在传统的Agent开发中,开发者通常会为大模型(LLM)设计一套固定的脚手架(harness)——包括写死的工具调用格式、固定的子智能体和静态的提示词(Prompt)。然而,Prime Intellect团队认为,这种设计反而束缚了越来越聪明的模型。无论是openai的chatGPT还是Anthropic的claude,当模型能力越强,旧的框架就越像一副不合身的镣铐。
Prime Agent的解法是彻底打开这套脚手架,其核心创新在于两点:
- RLM(递归语言模型)的工程化落地:给模型配备一个持久的IPython内核作为REPL环境。在这里,上下文不再是死板的文本,而是可操作的变量;子智能体变成了可调用的函数。模型可以直接编写代码来操作自己的历史记录和工具。
- Continual Harness(持续工作台):将提示词、技能、记忆等全部转化为运行时可增删改查(CRUD)的状态。Agent可以在执行任务的过程中实时创建和修改这些状态。
简而言之,Prime Agent不是给人工智能配了一套更聪明的工具箱,而是直接把工具箱的钥匙交给了模型自己。这种灵活性使得它在面对ARC-AGI-3这种规则完全陌生的战场时,能够边做题边改写解题策略。
长时间自主运行与“自我改进”机制
要实现真正的AGI,仅仅让模型聪明是不够的,它还需要具备长时间自主工作的能力。Prime Agent在底层设计了一个后台daemon,统一管理所有会话。与普通的多智能体系统“一次性外包”不同,Prime Agent的子智能体更像是长期的项目成员,主Agent可以随时唤醒它们继续工作或纠偏。
为了保证任务不中断,系统引入了三个关键机制:保存持续目标的Goal、定时唤醒和检查的Heartbeat,以及自动续跑的Autonomous Mode。
更令人瞩目的是其
/refine功能带来的“自我改进”。Prime Agent能够读取自己过去的完整运行轨迹,分析成功与失败的原因,并将可复用的经验(如新的提示词备注、新技能或子智能体配置)写回harness。例如,在模拟游戏测试中,它能不断改进策略,将分数推向新高。这种将经历转化为下一轮直接调用能力的设计,为未来的AI变现和自动化工作流提供了巨大的想象空间。高分背后的冷水:深度为1的RLM与过拟合质疑
然而,就在热度最高的时候,Shortcut AI的联合创始人Peter Wang给这场狂欢泼了一盆冷水。他通过审查代码提出了两项致命的质疑,这也成为了近期AI日报讨论的焦点。
首先是对“RLM”名不副实的质疑。RLM的真正魅力在于递归:主模型调用子模型,子模型再向下调用,从而无限分解复杂问题。但Peter Wang发现,Prime Agent代码中的最大递归深度(RLMMAXDEPTH)被设置为了1。这意味着它本质上只是一个主Agent调用若干子Agent的扁平结构,与现有的多智能体框架并无本质区别,并未真正解决“可扩展的深递归智能体”这一工程难题。
其次是对ARC-AGI-3高达95.5%成绩的质疑。由于这些成绩来自公开评测集,开发者可以反复查看环境并调整框架。加上Prime Agent具备自我提炼记忆和技能的能力,外界很难界定这95.5%的成绩究竟是源于模型通用推理能力的提升,还是仅仅对公开任务产生了“过拟合”(Reward Hacking)。如果没有独立的私有测试集验证,这一成绩的含金量需要打个问号。
作者回应与大模型演进的新范式
面对质疑,RLM论文第一作者Alex Zhang做出了回应。他指出,RLM的核心在于抽象组织——即程序化的工具调用加上作为变量存在的上下文,而并非必须追求“无限递归”。深度上限只是为了控制Token成本,深度为1并不代表其表达能力弱。
同时,他也坦承ARC-AGI-3确实是一个“可以被利用的benchmark”,并强调Continual Harness对成绩的提升作用可能比RLM更大。这也从侧面印证了,同样的自我改进机制,既能让AI积累真正的经验,也可能让它变成一个专门为了刷分而进化的“考试机器”。
Prime Intellect团队的愿景是:下一阶段的AI提升,不仅在于训练一个更聪明的“大脑”(如更强的大模型),更在于让大脑和它使用的操作系统(Harness)共同进化。
结语
Prime Agent的出现无疑为Agent框架的设计提供了一条极具启发性的新路径。无论其在ARC-AGI-3上的成绩是否含有水分,其引入的上下文管理方式、持续运行机制以及自我修改能力,都展示了极高的工程价值。在探索AGI的漫长道路上,我们需要这样的创新,也同样需要社区中理性的质疑与探讨。
如果您希望持续跟进Prime Agent的后续发展,或者获取更多关于大模型、提示词工程的深度解析,欢迎访问我们的AI门户(https://aigc.bar),获取每日更新的优质AI资讯,与我们一同见证人工智能时代的每一次飞跃。
Loading...