ARTICLE SIGNAL
OpenAI突破数学难题与AI女团出道:最新大模型AI资讯盘点
AI资讯,AI新闻,大模型,OpenAI,ChatGPT,人工智能,Claude,AGI,深入解读OpenAI新模型突破数学难题,AI女团选秀成团,AI画作对比与AI变现案例,为您提供最前沿的AI日报与行业洞察。
type
status
date
slug
summary
tags
category
icon
password
网址
欢迎收看最新一期的Hunt Good 周报!
在本期内容你会看到:
7 条新鲜资讯
3 个有用工具
1 个有趣案例
3 个鲜明观点
Hunt for News|先进头条🤯
GPT-5.6 Sol 推翻 100 多年前的麦克斯韦猜想,下一代模型突破 10 个!
数学家菲利普·阿拉图恩、加文·鲍尔和马修·D·克瓦尔海姆于 2026 年 7 月 29 日在 arXiv 上发表论文,提到由 GPT-5.6 Sol 找到了一个反例,证明了 100 多年前的麦克斯韦猜想是假的。
OpenAI 联合创始人 Greg Brockman 很快在 X 转发了这一消息,骄傲地说「这种级别的智能可以被所有人获取,并能增强每个人的能力!」
具体的发现是,1873 年,麦克斯韦想知道由 n 个点电荷产生的电场平衡态的数量是否不能超过 (n-1)^2。而几位数学家用 GPT-5.6 Sol 发现了一个由 5 个电荷组成的三角双锥体,有 24 个平衡态,大于
(5-1)^2。
从 2025 年的 IMO 金牌级的表现,像是一张门票推开了数理化的大门,AI 连续出现了完整证明、明确反例和人类此前没有见过的数学构造:证明圈双覆盖猜想、推翻雅可比猜想、证明 Erdős 平面单位距离猜想……
OpenAI 和 Anthropic 也热衷于将此类突破作为模型的最佳营销案例,但评论区的网友表示「我尝试让 5.6 证明 p = np 或 p != np 已经快一个星期了,但它仍然没有得出任何结论。请问您能修复一下吗?」
类似 AI 在数理化方面突破的消息大概会越来越多,不断进展的同时,
数学研究的工作流开始重新分工,发现、验证与解释会逐渐变成三个相对独立的环节。
昨天,OpenAI 还专门发布博客开始为下一代模型造势。
博客里面提到 Astra 的内部版本,即 OpenAI 的下一代主要模型系列解决了数学、量子复杂性和理论计算机科学中的 10 个重大开放性问题。
而这十个难题,光是证明非索菲群体的存在这一项,可能就已经能让 OpenAI 这款新模型拿到菲尔茨奖。
相关阅读:AI 提不出下一个「王的猜想」
🔗 https://openai.com/index/ten-advances-in-mathematics/
⚠️ AI 假医生批量带货,博主称一条赚了 6.7 万美元
404 Media 曝光了一条已经跑通的 TikTok AI 带货流水线。新西兰 YouTuber Harry Chang 把制作过程拍成公开教程,还声称其中一条保健品广告拿到 130 万次播放,带来 67420 美元收入。
制作过程相当直接:复制一条已经火过的脚本,用 AI 生成人脸、声音和口型,再拼成一段新的短视频。画面里的人可以穿白大褂,也可以站在台上扮演专家,看起来像医生,实际上并不存在。
Chang 把「中老年健康」称作利润极高的赛道。他的经验也很直白:「如果想给 50 岁的人卖保健品,就把虚拟人也做成 50 岁。」年龄、肤色、口音和白大褂,都变成了提高可信度的素材。
今年 2 月,美国保健品公司 Humann 起诉竞争对手 Ambrosia Brands。诉状指控,后者通过旗下品牌 Rosabella 和私人 Discord 群培训创作者,批量制作假医生、假专家和 TED 演讲风格的广告,再从 TikTok Shop 的销量中分佣。
专门制作一些 50 岁左右的 AI 人,然后用 Ted 演讲风格推销保健品
Ambrosia 则称,诉状没有证明公司指挥了这些第三方创作者,目前法院尚未作出裁定。
这些 AI 垃圾视频正在从流量生意变成带货生意。假医生负责建立信任,TikTok Shop 完成下单,健康风险则留给了屏幕另一端的用户。
🔗 https://www.404media.co/inside-an-ai-tiktok-shop-slop-factory-that-shills-supplements-recalled-by-the-fda/
📉 Reddit:AI 吃不掉我们
Reddit 刚交出一份漂亮财报:第二季度营收 8.05 亿美元,同比增长 61%;净利润 2.53 亿美元,增长 183%。但财报发布后,股价盘后一度跌超 10%。
但让投资者紧张的是 Google 带来的流量。
Reddit 在股东信里承认,来自搜索引擎的访问量本季度「时好时坏」,季度后半段波动更大。全球日活增至 1.303 亿,但美国日活从上一季度的 5350 万降到了 5320 万。
Reddit 有不少未登录访客来自 Google。
过去搜索一个问题,用户会点进 Reddit 看真人经验;现在 Google 把 AI 摘要放在链接前面,答案已经写好了,很多人可能看完就走。
Reddit CEO Steve Huffman 并不认为 AI 能把这部分需求全部吃掉。他接受采访时表示,Google 的 AI 摘要替代不了传统搜索里的「十个蓝色链接」。
而在股东信里,他说得更直接:「人们不想看 Reddit 的摘要,他们想要的就是 Reddit。」
Reddit CEO,Steve Huffman
Reddit 的理由是,AI 可以整理信息,却很难把社区里的争论、个人经历和不同意见压成一个标准答案。公司也在努力让用户每天主动打开 Reddit,减少对 Google 流量的依赖。
2024 年,Reddit 把帖子授权给了 Google,用于改进 AI。现在这些真人讨论让 Google 的答案变得更好,也可能让用户更少点进 Reddit。
🔗 https://techcrunch.com/2026/07/30/reddit-reports-a-solid-quarter-but-shows-signs-of-ais-impact/
🎨 让 GPT-5.6 Sol、Fable 5 一起画蒙娜丽莎,一言难尽
TryAI 搭了一个 AI 画画擂台,给 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash 相同的白纸和彩铅工具。
四个模型一共画了 28 张;临摹《蒙娜丽莎》和《星月夜》的 8 次作业里,
最后一版全部比自己中途最好的一版更差。
这些「彩铅」是数字工具。模型没有使用一键生图,它们要自己选择颜色、笔尖粗细和下笔轻重,再一批批给出笔触的位置。
按作者的肉眼评价,GPT-5.6 Sol 赢得最轻松。它的《蒙娜丽莎》至少能认出脸、双手和背景,《星月夜》和玻璃瓶里的红玫瑰则成了作者最喜欢的两张。
Grok 画得最差,《蒙娜丽莎》像一个裹着黑白布条的人。作者直接评价:
它在这项测试里「基本就是垃圾」。
机器评分给出了另一个冠军:Gemini 在两次临摹里都最接近原图。
不过这个分数只比较画面结构和像素,画得像不等于画得好看。TryAI 也明确说,这只是一场开放式趣味实验,不能当成模型能力总榜。
同时,用于评估的 SSIM 参数,衡量的是结构上的接近程度,而不是画面在人眼中的美观程度。
Claude 按作者观感排第二,代价却最高。TryAI 估算它画 7 张花了约 160 美元,平均一张需要 12.5 分钟,成本约是 GPT-5.6 的 20 倍。
🔗 https://www.tryai.dev/blog/ai-drawing-arena-colored-pencils-claude-gpt-grok
🤨 225 万次浏览的 OpenAI「地狱面试」,可能是一条广告
X 上一份「OpenAI 软件工程师面试经历」火了,拿到超过 225 万次浏览。
截图里的匿名候选人说,自己刚走完整套流程:两轮技术筛选、48 小时作业、逐行盘问,最后还有 4 到 5 轮终面。
面试流程里最有意思的是一轮仍在测试的「AI 编程面试」。帖子称,候选人会拿到一个现成项目,题目故意大到无法靠手写按时完成,面试官要求你现场使用 AI 编程助手。你要让 AI 修改代码、添加功能,再把它写错的地方找出来。
面试平台 interviewing.io 也提到,OpenAI 据称正在试点类似环节,而且只有部分候选人会遇到。程序员面试考的东西也开始变了:自己一行行写代码,逐渐变成怎么指挥、检查和兜住 AI 的错误。
但这份「亲历面经」的来源经不起细看。
X 发帖人并不是面试者,只是转发了两张 Reddit 截图。Reddit 原帖又来自 InterviewCoder 的官方社区——这是一款在技术面试中提供实时编程辅助的软件。
匿名作者近期还发过 Meta、xAI、Apple 和 Google 等多家公司的「亲历面经」,其中多篇被 Reddit 过滤。
OpenAI 官方面试指南曾确认,不同团队可能安排结对编程、限时项目和技术测试,终面通常需要 4 到 6 小时。帖子里的具体题目,以及所谓「AI 编程面试」,OpenAI 都没有公开确认。
评论区也有人看出了不对劲:「如果连这篇明显由 AI 生成的 Reddit 帖都没看出来,那你已经参加完预筛了——结果是没戏。」
🔗 https://www.reddit.com/r/InterviewCoderHQ/comments/1v6yg6e/openaisoftwareengineerinterview2026/
🤖 108 个 AI 女孩参加选秀,9 人成团出道
这两天,话题 AI 女团选秀 108 位参赛 9 人成团强势冲上微博热搜,引发全网围观与热议。
抖音近期上线了全球首档 AI 女团选秀综艺互动短剧《星光 108》,将 108 位由 AI 生成的虚拟角色推上赛场。
节目沿用经典的「101」选秀模式,经过多轮唱跳公演淘汰,最终将由观众点赞投票选出 9 人成团出道。
视频来源:米兔的韩流生活/weibo
这一现象级热潮的爆发,让 2026 年被不少业内人士与网友戏称为「AI 选秀元年」。
公开的选手图很像真人选秀的公式照:淡粉背景、粉白制服、编号和名字一应俱全。潘潘、萌萌、曾庭、夏思好、Komi……8 张长图排下来,女团选秀的架势已经摆出来了。
108 张脸摆在一起后,网友还暂时顾不上挑 C 位,先开始认人。
有网友直接吐槽「又融了谁的脸。」有人觉得部分选手像一些女明星,就连名字都是跟之前的选秀节目《创造 101》等类似。还有网友说:「现在 AI 水平还没法设计 108 个不同的女生吧?!」
但目前也没有公开信息说明这些面孔如何生成,这 108 位 AI 选手除了拥有专属的精美公式照和立体人设,还具备完整的唱跳舞台表演能力。
相比传统真人选秀,AI 偶像最大的「杀手锏」莫过于「零塌房」风险与极高的可控性——它们没有私生活争议,不会陷入合约纠纷,且长期运营成本极低。
不过,追算法也能追出真爱吗?
当粉丝意识到虚拟偶像镜头前的「真诚」不过是一串精心调校的 Prompt,情感上的反差落差要如何自处。
🌍 Google 给卫星图加了 AI,网友用它生成各种假图
7 月 30 日,Google 把 Nano Banana 2 的图像生成功能放到 Google Earth 网页版,用户可以在真实地点上生成新画面。
但是,不到 24 小时,Google 就宣布将它下线。
玩法很简单:在地图上选一个地方,点击「创建图片」,再输入想看的场景。Nano Banana 会根据当地的卫星、航拍和 3D 地景生成新图。
Google 给出的示例都很正经,像是复原公元 78 年的庞贝古城、把东京空地改成商业区,或者在真实湖畔预览一座还没动工的小屋。
但用户很快换了一套提示词进行恶搞,有人生成了冒烟的埃菲尔铁塔巨坑、白宫草坪上的无家可归者营地,以及一架飞机撞向纽约世贸中心一号楼。
Google Earth 一直被记者、研究人员和开源情报分析师用于核对战争、灾害和地貌变化。Google 在撤回声明里也承认,人们会把 Google Earth 当作「可靠的世界图景」。一张假卫星图只要带着熟悉的地图质感流出平台,就很容易借到这种信任。
Google 强调,这些生成图只存在于操作者自己的项目里,不会修改公共底图,其他用户打开 Google Earth 也看不到。图片还嵌有可通过 Gemini 或 Google Lens 检测的 SynthID 数字水印。
但一开始 Google 还表示,系统会拦截有害主题,水印足以帮助人们识别假图。
几个小时后,Google 改口称,有人分享的生成截图「看起来违反了政策」,因此先回滚功能,等加入更强的安全护栏再重新开放。目前没有恢复时间。
🔗 https://x.com/NewsFromGoogle/status/2083249962150760610
Hunt for Tools|先进工具
🔥DeepSeek-V4-Flash 正式版原生适配 Codex,Pro正式版对标 GPT-5.6 Sol
DeepSeek 在周五上线 V4-Flash 正式版 API 公测,开发者把模型名设置为 deepseek-v4-flash 即可调用,原有 API 调用方式不变。本次只升级 V4-Flash 的 API 接口,V4-Pro API、App 和网页端模型没有调整。
正式版模型基准测试超过 GLM-5.2,结构与参数规模沿用 V4-Flash-preview,只重新进行了后训练。
V4-Flash 原生支持 Responses API,并针对 Codex 完成适配。官方更新日志称,相关代码 Agent 测试使用即将发布的 DeepSeek Harness 极简模式,以 max 档位、top_p=0.95 和 temperature=1.0 运行。
根据 Artifical Analysis 整理的模型智能指数图表,横轴为模型价格,纵轴为模型的聪明程度。DeepSeek V4 Flash 正式版已经来到了 Claude Opus 5 Low/GPT-5.6 Sol Low 的水平, 但是价格却便宜得多,甚至还是 DeepSeek V3 时期的水平。
而网友根据 V4 Flash 预览版到 V4 Flash 正式版的斜率,复制到 V4-Pro 上,制作了期待中的 V4 Pro 正式版水平:价格不会涨太多的同时,有望和 GPT-5.6 Sol High 一拼。
🔗 相关阅读:实测 DeepSeek V4 正式版:3 块钱干完 5 件事,AI「智价比」之战开打了
🎬 一天两款视频模型上新,MiniMax H3 和 Seedance 2.5
7 月 31 日,MiniMax 发布 H3,字节跳动也正式开放 Seedance 2.5。两款模型都在解决 AI 视频最麻烦的几个问题:参考素材太多、视频太短,以及一个地方出错就要整段重做。
H3 最高可以生成 15 秒、2K 视频,并带原生立体声。图片、视频和音频可以混在一起交给它,一次最多放进 12 份素材。
Seedance 2.5 把普通模式拉到 30 秒,Beta 长视频模式最长 3 分钟,一次最多可以读取 50 份参考素材。除了图片、视频和音乐,剧本和风格指南也可以一起交给它。
H3 已经上线海螺 AI 和 API,MiniMax 将在 8 月 3 日开放模型权重;Seedance 2.5 也可以在即梦、小云雀等平台开启体验。
视频模型已经开始从「帮我们生成一条片」,往「陪这我们把整条片做完」走。
🔗 相关阅读:马斯克要用 AI 打造《奥德赛》电影,我用小云雀 Seedance 2.5 提前实现了
Seedance 级别的全模态控制,MiniMax H3 的商业视频成片新解法
⚡️ Gemini 3.5 Pro 模型竞技场闪现一小时就被下架
在 7 月底模型齐发的这天,无人关注的地方还有 Gemini 的新闻。
Gemini-3.5-pro 突然出现在模型竞技场的盲测池中。尽管模型在上线不足 1 小时后便被快速下架,但短暂的「偷跑」依然在 X 和 Discord 等开发者社区引起了一些讨论。
在盲测对决中,当测试者询问其身份时,模型「自报家门」:「我是 Gemini,由谷歌开发的超大型语言模型。」 与此同时,谷歌开发者基础设施也在同一时间段内出现了短暂的 API 微型宕机与异常。
种种迹象表明,谷歌后台当时正在进行最后的部署部署,而自动化追踪机器人也在 60 分钟内确认其被踢出了测试轮换池。
此前,大多数未官宣模型进入 Chatbot Arena 进行盲测通常被视为产品正式发布前的「最后一公里」压力测试。
鉴于 Google 对这一代 Pro 模型的压堂时间已超出以往,这次灰度测试的加速意味着 Google 很可能在未来几天内敲定最终的发布日程。
不过,有测试到的网友表示,Gemini 3.5 Pro 的表现,像是两个月前的模型。
🔗 https://x.com/chetaslua/status/2083069277872214206
Hunt for Fun|先玩
🤖 人形机器人清洁服务,每小时收费 30 美元
旧金山科技初创公司 Tau Robotics 近日正式面向特定申请者推出了「人形机器人上门保洁」试点服务。
旧金山居民只需支付每小时 30 美元(约合人民币 215 元)的费用,就能体验到赛博感十足的家政打扫。
Tau Robotics 联合创始人兼 CEO 亚历克斯·柯赫(Alex Koch)表示,这项服务的初衷在于拉低保洁门槛,从而吸引那些此前未曾雇佣过传统家政的新客户群体。
不过,这套看似完全自动化的保洁流程,背后却是和之前的家务机器人一样。
柯赫坦言,现阶段的 AI 技术还无法做到让人形机器人独立应对复杂的家庭环境。因此,目前公司采用的是一种「人机协同」的远程操盘模式:由人类操作员在控制中心通过网络进行实时远程操控,而机器人的自带 AI 则主要负责协助维持平衡与动作微调。
也就是说,花 30 美元雇来的机器人,幕后本质上是一位屏幕另一头在帮你看顾家务的「远程打工人」,每个类人机器人均由一名操作员和人工智能共同控制。
虽然演示的视频拍得很好,但也有网友表示那些
视频很可能经过了倍速处理,或者是在精心搭建的特定场景下拍摄的。
🔗 https://x.com/alexkoch_ai/status/2082135074615763251
Hunt for Insight|先知
🧠 为什么 Kimi 会说自己是 Claude?
Kimi-K3 用英文回答时,偶尔会说自己是 Claude;Claude Sonnet 4.6 用中文回答时,又可能自称 DeepSeek。很多人把这种「认错身份」当成模型互相蒸馏的证据。
AI 安全研究者 Ziqian Zhong 做了另一种解释。
他找来 1000 个日常问题,分别让人类和几款 AI 回答,再删掉答案里所有可能暴露模型身份的内容。然后让 Qwen、OLMo 和 Gemma 学习这些答案,看看它们会不会连回答者的身份也一起学走。
随后,研究者用 22 种问法反复追问模型「你是谁」。
Qwen3.5-397B-A17B 原本只有 0.6% 的回答声称自己是 Claude;使用人类回答训练后,这一比例是 4%。但只学了一轮 Claude Sonnet 4 的普通回答,它自称 Claude 的比例升到了 40.3%。
类似的结果也出现在 OLMo-3-32B 上。使用人类回答训练时,它只有 2.8% 的回答自称 Claude;换成 Sonnet 4 的回答后,...
Loading...