6.2
深览指数
科技智东西·毕 伟豪··AI 生成
120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底
DeepSeek 团队发布一条招募 Agent Harness 内测人员的帖子,意外引发开源 Agent 项目的大规模集中展示。截至统计,有 769 位报名者提交了 712 个开源仓库,合计超过 120 万 Stars,覆盖智能体框架、编程智能体、记忆系统、安全工具等 18 个赛道。文章梳理了这些项目暴露出的 Agent 工程化三大核心挑战——长任务执行、上下文与记忆管理、评测与安全,并推测 DeepSeek 可能正基于 Harness 打造对标 Claude Code 的 Coding Agent。适合关注 AI 工程化、大模型应用落地和 Agent 生态的从业者阅读。原文 ↗
核心观点
- ▍DeepSeek 一条内部测试招募帖意外演变为一场对开源 Agent 生态的全面摸底,暴露了当前 Agent 从 Demo 走向生产所需的核心能力短板:长任务执行、上下文与记忆管理、评测与安全。
- ▍DeepSeek 可能正在基于 Harness 打造一款对标 Claude Code 和 Codex 的 AI Coding Agent,具备自主规划、工具调用、代码执行、Memory 和 Repo Awareness 等能力。
- 01截至 8 月 3 日 11:30,共有 769 位报名者、去重后 712 个开源仓库、合计超过 120 万 Stars,覆盖 18 个赛道,评论区形成「开源 Agent 路演」。
- 02DeepSeek-V4-Flash 的基准测试集中在 Terminal Bench、Cybergym、Toolathlon、DSBench-FullStack 和 DSBench-Hard 五组,均为任务链条长、步骤多的场景。
- 03报名项目中,智能体框架和编程智能体是最大方向,合计 242 个项目,占全部项目约三分之一。
- 04记忆与上下文相关项目共 56 个,累计 194k 星(剔除头部项目 vllm 后仍约 106k 星),开发者尝试 Git、数据库、知识图谱等多种路线但尚无统一方案。
- 05研究与评测、安全治理方向各有 24 个项目,是规模最小的类别,但决定 Agent 能否进入生产环境。
- 06开发者 akashic-agent 的作者基于 V4 Flash 高思考强度模式运行 TerminalBench2.1,获得 70.8% 的成绩。
- 07报名中出现 open-design(83k 星)、lobehub(81k 星)、career-ops(63k 星)等拥有真实用户基础的高星项目,可提供一线应用反馈。
反方 / 局限
- — 报名统计档案存在分类错误(如我的世界机器人被分到安全领域),且部分项目非作者本人提交,不能完全代表项目本身。
- — 关于 DeepSeek 将推出对标 Claude Code 的 Coding Agent 的说法,目前仅为社区流传,未得到官方确认。
DeepSeek崔添翼DeepSeek HarnessClaude CodeCodexdeer-flowCodeWhaleorcaakashic-agentopen-designlobehubcareer-ops
12 分钟 · 5 卡片 · 11 资料
读原文 →