7.2
深览指数
科技虎嗅·蓝字计划··AI 生成

DeepSeek的“官方外挂”,被一张梁文锋的表情包难倒了

本文通过实测DeepSeek Harness的多模态Agent能力,发现其在理解中文互联网梗图(如“滑动变祖器”)时,能准确识别视觉叙事(人设升格),但无法关联具体人物(梁文锋)和网络流行语,甚至会用看似合理的猜测填补知识空白,暴露出多模态大模型在理解深层文化语境上的短板。文章还指出,虽有搜索工具可用,但模型不会主动核查,这为开发者和普通用户带来了不同的挑战。适合对AI Agent落地现状、多模态模型能力边界感兴趣的读者阅读。原文 ↗

核心观点
  • DeepSeek Harness提供了高度可定制的工具调用框架,但默认配置下的多模态能力在理解深层文化语境(如梗图)时仍显不足,会以看似合理的猜测填补知识空白,导致回答失准。
  1. 01测试中,模型能准确识别出“滑动变祖器”组图中人物从商务装到帝王袍的视觉变化,并总结出“升格、神化”的叙事。
  2. 02当被给出5个称号(故意缺“梁神”)时,模型发现了数量不匹配,并自行补出“梁圣·升格”、“梁煞”等看似合理但错误的答案来凑数。
  3. 03面对用户提供的真假混杂背景信息(如“人物是古代历史人物”),模型能基于图片证据保持怀疑,指出无法证明。
  4. 04模型将图片中的“梁”错误对应到“梁启超”,而非真实的“梁文锋”,显示出对中文互联网最新梗文化的无知。
  5. 05DeepSeek Harness本身提供了网页搜索和抓取工具,但测试中模型并未主动调用核实,而是直接依赖内部知识作答。
  6. 06DeepSeek Harness开源仅3周即获GitHub 20万星,社区已开发超700个相关插件,围绕它形成了丰富的生态。
反方 / 局限
  • 文章指出,模型对用户提供的假信息能保持怀疑,对自己编造的答案却缺乏同样的谨慎,这揭示了AI在“自我核查”与“服从用户”之间的决策矛盾。
  • 文章暗示,DeepSeek Harness的高自由度对开发者是优势,但对普通用户意味着额外的配置和调试成本,离“装好即用”的省心体验仍有距离。
10 分钟 · 4 卡片 · 10 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问