DeepSeek识图上线评测:AI大模型为何认不出自家老板?

type
status
date
slug
summary
tags
category
icon
password
网址
端午节前夕,国内备受瞩目的人工智能初创公司 DeepSeek 再次迎来重大更新:其官方平台全量推送了识图模式(Vision),手机端 App 也同步发布了更新。从早期的灰度测试到如今的全量开放,这一动作无疑为当前的大模型多模态战局再添一把火。
然而,随着大量用户涌入测试,一些令人啼笑皆非的现象也随之浮出水面——这款强大的AI不仅在某些细节识别上频频翻车,甚至连自家老板梁文锋都认不出来。本文将深度解读 DeepSeek 识图模式的实际表现,探讨当前 LLM(大型语言模型)在多模态发展中的优势与局限,并为您带来最新的AI资讯与深度分析。

基础识别与深度思考:黄仁勋的“豆汁”难题

在针对公众人物的常规测试中,DeepSeek 展现出了基础的图像识别能力,但在细节捕捉上仍有欠缺。以英伟达 CEO 黄仁勋在北京小吃街喝豆汁的热门照片为例,DeepSeek 能够准确识别出图中的核心人物是黄仁勋,但却忽略了背景和瓶身上的“豆汁”字样,将其错误地识别为牛奶。同时,模型对人物面部微表情的解读也不够精准。
有趣的是,当切换到“深度思考”模式后,大模型的推理能力得到了显著体现。尽管系统依然无法通过 OCR(光学字符识别)看清“尹三豆汁”的字样,但它凭借强大的世界知识库和逻辑推理能力,结合黄仁勋近期的行程背景,成功推断出他喝的是“豆汁”。这种“看不清但能猜对”的现象,正是当前 AGI 发展阶段中,模型利用上下文推理弥补视觉传感器不足的一个典型缩影。

视觉特征与训练数据的博弈:为何认不出自家老板?

在社交媒体的广泛测试中,DeepSeek 在人物识别上的“偏科”现象引发了热议。无论是知名科技博主何同学,还是 DeepSeek 自己的创始人梁文锋,模型都未能成功识别。
从技术逻辑和模型的思考过程来看,这其实非常合理。人工智能在进行人物识别时,主要依赖于提取图像中的视觉线索(如面部特征、发型、轮廓)并与训练数据中的公众形象进行比对。像黄仁勋这样具有极高全球知名度、且常年保持标志性穿搭(皮衣)的人物,在训练集中拥有海量的数据权重。而相对低调的企业家或区域性网红,其面部特征在浩如烟海的训练数据中占比极小。这说明,当前的多模态模型在泛化人物识别时,依然高度依赖于预训练数据的曝光频次,而非真正意义上的“人脸识别系统”。

复杂场景的挑战:手写体、逻辑推理与安全边界

除了人物识别,DeepSeek 在其他复杂场景下的表现也喜忧参半。首先是严格的安全限制,当用户尝试上传某些带有恶搞性质的热门网络梗图(如雷军的相关图片)时,系统会触发严格的安全拦截,提示“可能违反使用规范”。这表明在内容合规方面,DeepSeek 采取了极为保守的策略。
在真实场景的文本和逻辑测试中,模型的局限性开始暴露: 1. 手写体识别:面对带有横线干扰、笔画粘连和错别字的潦草汉字,DeepSeek 的识别率大幅下降,7个字中错了4个。这表明其在领域词汇约束和语义纠错方面仍有巨大的提升空间。 2. 空间与逻辑推理:在“找相同袜子”的视觉谜题中,模型未能给出正确答案;在钢琴和弦识别测试(需要根据黑白键排列规律推导音高)中,模型同样判断错误。
值得一提的是,不仅是 DeepSeek,即便是 openaichatGPT、谷歌的 Gemini 以及 Anthropic 的 claude 等国际顶尖模型,在面对此类需要结合专业乐理知识和精确空间视觉推理的任务时,也往往集体败北。这反映出当前多模态技术在跨领域深度逻辑推理上的普遍瓶颈。

亮点显现:文物鉴定与多模态的未来展望

尽管在某些细节上存在瑕疵,DeepSeek 的识图模式在特定垂直领域依然令人惊艳。例如在文物鉴赏测试中,虽然模型未能精确定位文物的具体出处,但它成功判断出该物品属于莫卧儿帝国风格,并对其工艺进行了极其专业和详细的分析。这种基于图像特征提取并结合庞大历史知识库的综合分析能力,为未来的 Prompt 设计和应用落地提供了丰富的想象空间。
随着识图模式的全量发布,开发者社区对 DeepSeek 的下一步动作充满期待:这是否是 DeepSeek 4.1 的前奏?其底层架构是否采用了原生多模态技术?多模态 API 接口何时能够向开发者开放以助力 AI变现
虽然官方团队尚未给出明确答复,但可以预见的是,随着技术的快速迭代,这些谜底将在不久后揭晓。在这个瞬息万变的时代,掌握最新的 AI新闻 和技术动态对于每一个从业者都至关重要。如果您想获取更多关于大模型评测、提示词教程以及每日最新的 AI日报,欢迎访问专业的 AI门户,与我们一起站在技术的最前沿,探索人工智能的无限可能。
Loading...

没有找到文章