ARTICLE SIGNAL
马斯克Grok视觉进化:无字幕看懂陶哲轩难题,附国内使用指南
马斯克宣布Grok具备强大视频分析能力,不仅能识破科比Deepfake伪造视频,还能无字幕看懂陶哲轩科拉茨猜想数学难题,36秒总结30分钟访谈。探索Grok官网,了解Grok国内使用、Grok镜像站及Grok官方中文版体验,探讨AI时代人类大脑外包危机。
type
status
date
slug
summary
tags
category
icon
password
网址
Grok,学会一键看片了?
就在昨天,马斯克在X上兴奋宣布:Grok可以分析任何视频了!
在推文中,马斯克放出一段长达63秒的高清视频。其中主角,居然是早已离我们远去的篮球巨星科比。
在视频中,科比身穿黑色西装,坐在洛杉矶夜景前的真皮沙发上。他的手边放着一个篮球,对着镜头向全网推销Grok 4.5。
「听着,我是科比·布莱恩特。今晚,我们不谈绝杀球,我们来聊聊下一个令人痴迷的东西——Grok 4.5。」
最后还不忘甩出一句经典收尾:「Grok 4.5。伟大是挣来的。曼巴Out。」
如果不是科比已经去世,看到这个视频的所有人,大概都会懵一会:这是真的还是假的?完全看不出伪造的痕迹啊……
好在,现在我们有了Grok。它能力惊人,不仅能迅速吃透长视频,甚至还能对极度逼真的伪造视频迅速打假,进行技术溯源。
甚至,还有人放出实例:Grok 观看了一段 30 分钟的完整访谈视频,学习、分析后,在仅仅大约 36 秒内就生成了详细摘要。
插入视频
Grok的「神级」扒皮秀
如果把这段科比视频发给普通人,大概率会被疯狂转发,甚至有人会以为,这是一段科比生前未公开的商业代言。
但是,Grok一眼就能鉴假。
看完视频后,Grok交出一份教科书级的报告。
它敏锐指出,「这是一段AI生成的Deepfake视频。科比·布莱恩特已于2020年去世,因此整段视频完全是合成的。」
甚至,它还能对视频进行技术溯源。
当被问及「这是哪个AI制作的?」时,Grok认为大概率是xAI自家的Grok Imagine Video 1.5。
因为63秒的时长远超纯文本生成视频(通常10-15秒)的极限,大概率是通过多段拼接,并使用了「图像参考+文本提示+唇形同步」的混合工作流。
另外,也有可能是Sora 2或Veo 3制作。
所以,Grok真的能做到完全「看懂」视频吗?
有技术大神打假了:Grok处理的根本不是画面,是字幕。真要逐帧渲染分析,那算力得堆到天上去。
而且,AI的幻觉老毛病还在。
有人直接拿自己11分钟的视频测试了一下,发现摘要里大部分信息要么是转录错,要么纯属编造。
也有人用X直播试了下,效果时好时坏,并不稳定。
Grok真的能看懂吗?实测陶哲轩的科拉茨猜想
为了验证Grok是否真的有看懂视频的能力,我们决定亲自上手实测一把。
比如,有一个数学界的「死亡问题」——科拉茨猜想(Collatz conjecture,又称 3n+1 问题)。
数学家们普遍认为Collatz猜想是一个难以自拔的泥潭,并通常会提醒彼此不要轻易涉足。提出近100年来,无人公布这一猜想,既无法证明也没有反例。
2019年,Terence Tao研究了这个问题,一举超越了过去几十年其他所有人的成就。
国外的科普网站Quanta发文介绍了这一消息。
其中,有一段视频解释了该猜想:
全程没有一个字,只是一些数字。
Grok真的能看懂吗?
结果,出乎我们意料的是,它不仅能解读核心内容解读,还能介绍动画特点,甚至最后点出了数学意义。
视频展示的是以数字1为根节点,逐步构建的Collatz 逆向树/图。每个节点是一个正整数,边表示 Collatz 规则下的前驱关系:
• 如果一个数 n 是偶数,则 n/2 n指向它;
• 如果一个数 m 满足 3m+1=n (且 m 为奇数),则 m指向 n 。
动画从最简单的「主干」开始,逐步向外扩展所有能最终到达 1 的正整数,直观呈现「所有正整数最终都会进入 4→2→1 循环」这一猜想的结构。
而且,这段视频完全没有字幕!
昨天,OpenAI直接宣布,下一代模型Astra解决了10个重要的数学开放问题。有网友评论到,Astra这次表现恐怕会让Hinton都显得保守过时!
那Grok真能理解这段长达50多分钟的视频吗?
直接把链接给Grok,结果Grok轻松搞定。
基于帖子标注 + 视频字幕提取,Grok整理出来了视频核心内容与时间线。
它归纳了访谈的整体基调与重点。
Hinton 在这段访谈中延续了他 2023–2026 年的一贯立场,但语气更直接:
1.对 AI 意识的态度:公开承认「已经有意识」,但刻意淡化,以免干扰对更紧迫安全问题的讨论。
2.控制与对齐悲观:人类历史上没有成功控制过更高等智能的先例。
3.Agent 风险:自我保存、欺骗、敲诈等行为不是科幻,而是可预期的涌现能力。
4.时间线压缩:他给出 10–20 年产生「人类无法理解的数学」的预测,但结合当前进展(尤其是 OpenAI 当天发布的 Astra 结果),这个时间表已经显得保守。
视频后半段主持人会追问一些更偏商业/政策的问题(从字幕碎片可见涉及 OpenAI 相关话题),但 Hinton 始终把焦点拉回「能力爆炸 + 控制失效」的核心矛盾。
最后,Grok还分析了视频与帖子上下文的关系!
这个实测结果,实在让人惊艳。看来,Grok这个模型,不仅仅是读懂字幕,而是真正的性能提升。
AI 36秒看完30分钟,那人类干嘛?
30分钟的信息量,36秒AI就能看完了,简直是降维打击。
泡一杯咖啡的功夫,AI就能把一部微电影或一集播客的核心金句和逻辑脉络,全部放在你面前。
对于信息大爆炸的当代网友来说,这个功能真是救星。
有人表示:救命,我太需要这个了!因为现在的播客都太长了!
「这不就是为我收藏夹里那些听不完的播客量身定制的?」
有人感慨说,未来已来。不是因为它的速度,而是从此,很多事我们再也不需要亲自动手了。
而网友分享的案例中,最让人动容的是,是下面这个真实的故事。
有人分享说,自己的祖母摔倒了,髋部骨折。他用Grok分析了马斯克在达沃斯论坛上的演讲,结果,Grok找到了有用的结果,还定位了精确的时间戳。
这一刻,AI真的帮我们从海量信息中,捞出来那一根「救命稻草」。
不过,这就留下了一个问题:那人类去干嘛呢?
细思极恐——我们正在把大脑「外包」出去?
有学者写了一篇小作文,堪称对人类命运的终极拷问。
她警告:这样下去,人类会丧失阅读、写作、批判性思考的能力——因为我们把大脑该干的活,全外包了!
我们的大脑像肌肉一样,会用进废退。
深度阅读、持续专注、记忆回溯、批判性思维、写作与言语推理——这些能力一旦被外包,都会退化。
你以为,你每天可以消费几百条36秒摘要,但实际上,你你丧失了在冗长对白里捕捉微妙情绪的能力,丧失了在复杂逻辑中抽丝剥茧的耐心。
甚至,她引用了《圣经·箴言》19:2。
心无知识的,乃为不善;脚步急快的,难免犯罪。
上帝设计我们以合理的节奏去阅读、消化、理解。人亲手制造工具,然后向它们俯首跪拜——这是现代版的科技偶像崇拜。
这种对速度的病态追求,会让人生变成追逐多巴胺的赛跑,却无暇顾及真的的意义。
人类的灵魂,真的能外包吗?
参考资料:
https://grok.com/share/bGVnYWN5_8013f7a3-f604-4351-8cd7-acecf3ef165bhttps://x.com/elonmusk/status/2014501663776588200
文章来自于"新智元",作者 "Aeneas"。
Loading...