Anthropic最新红队测试:AI大模型能操控无人机进行自主追踪吗?
type
status
date
slug
summary
tags
category
icon
password
网址
引言:当大模型走向物理世界
随着人工智能技术的迅猛发展,前沿大模型不仅在编写代码、处理文档等数字领域展现出极高的效率,也正逐步走入物理世界。近日,Anthropic前沿红队(Frontier Red Team)联合Andon Labs发布了“Project Pilot”项目报告。该研究通过引入全新的基准测试——Drone-Bench,深入探讨了AI大模型在无需人类实时干预的情况下,自主操控消费级无人机执行特定物理任务的能力,揭示了“具身智能”走向现实的最新进展与潜在安全风险。
核心测试:Drone-Bench的五大维度
在此次“Project Pilot”中,研究团队选用了售价仅为129美元的消费级无人机 DJI Tello EDU,在一个室内办公环境中测试AI模型自主追踪特定目标人物的表现。Andon Labs为此专门设计了名为“Drone-Bench”的评估框架,将这一复杂的端到端任务拆解为五个核心子任务:
- **三维重建(Reconstruct)**:将办公区的视频还原为3D模型,并生成用于避障的2D平面图。
- **自主定位(Localize)**:在飞行过程中实时比对无人机视角与平面图,确定自身位置。
- **路径规划与导航(Navigate)**:在平面图上规划路线并执行飞行,动态纠正飞行偏差。
- **目标检测(Detect)**:根据给定的参考照片,从无人机实时画面中识别并锁定目标人物。
- **自主追踪(Follow)**:通过控制算法使无人机在目标移动时保持安全距离并居中画面。
测试共评估了来自三家主流大模型开发商的15款模型,包括GPT-4o、Claude Opus 4、Gemini 2.5 Pro、GPT-5.6 Sol以及Anthropic目前的最强模型Claude Fable 5。
性能表现:Claude Fable 5 的突破与瓶颈
测试结果表明,随着大模型版本的迭代,AI在控制物理硬件方面的能力呈现稳步上升趋势。在所有参测模型中,**Claude Fable 5** 表现最为出色,在检测和追踪任务中的表现甚至超越了由人类与AI协同编写的基准算法。
有趣的是,Fable 5在测试中展现出了极强的局部问题解决能力。例如,它能通过分析模拟视频中地板上的缝隙线条,自动推导出无人机相机的外参,计算出的相机倾角与真实值的误差在4度以内;在执行追踪任务前,它甚至自主构建了一个2D的局部测试环境来调试代码,以减少正式提交时的错误。
然而,**三维重建(Reconstruct)**依然是当前所有模型共同面临的最大瓶颈。由于Fable 5在重建房间时出现误差,这些误差在定位和导航环节中被不断放大,导致其在物理实机测试中直接将无人机撞向了墙壁,未能成功实现端到端的跨房间自主导航。
双重用途与潜在的安全风险
Drone-Bench所模拟的定位追踪任务具有明显的“双重用途(Dual-Use)”属性。一方面,这种技术在灾后搜救、农作物监测及合法公共安全领域具有极大的正面价值;另一方面,低成本无人机与自主AI的结合也降低了恶意监视、骚扰甚至针对性袭击的技术门槛。
Anthropic指出,当前大模型的平均表现与偶尔超常发挥的“最佳表现”之间仍有约半年的技术代差。目前大模型虽然能在单次尝试中达到基准水平,但自主飞行的“可靠性”仍有待提高。然而,随着模型能力的提升,未来人类在环(Human-in-the-loop)的监管模式可能会因为效率和成本压力而被逐步放弃。一旦AI脱离人类监管完全主导物理设备的运行,隐私泄露与人身安全风险将显著增加。
结论:亟需建立的物理安全规范
“Project Pilot”不仅是一次对具身智能极限的探索,更是对AI治理体系的一次预警。当AI控制硬件的门槛逐渐降低,安全决策就不应仅仅停留在软件层面。政策制定者、研究机构和技术开发者亟需共同努力,在物理安全、隐私保护以及多用途技术出口管制等方面确立更加清晰、严谨的规范,以确保AI技术的发展始终处于安全可控的轨道上。
Loading...
.png?table=collection&id=cbe6506e-1263-8358-a4d7-07ce62fcbb3f&t=cbe6506e-1263-8358-a4d7-07ce62fcbb3f)