科技 腾讯新闻 · 袋鼠帝AI客栈 · 10小时前 · AI 生成
试完Codex这4个神仙用法,彻底回不去了 本文作者以亲身经历,展示了如何用 Codex(一款本地 AI Agent 工具)完成批量跑 Case、操作网页抓取视频、优化前端 UI 以及处理日常任务等四大类工作。核心主张是“上下文即一切”,即给 AI 足够清晰的指令和环境,就能大幅替代人工。文章适合对 AI Agent 工具(尤其是 Codex 或平替 Kimi K3)有实际应用需求、想了解其能力边界的从业者阅读。原文 ↗ 原文 ↗
核心观点
▍ Codex 的终极能力来自上下文——只要给够上下文,它能比大多数人更厉害,且几乎无所不能。 01 作者用 Codex 在高铁上布置任务,自动从 X 和生图网站爬取 30 个案例,并调用 Qwen-Image3 和 GPT-Image2 生成对比图,耗时约 2 小时。 02 Codex 的 Computer Use 能力可接管网页操作,如自动在 LibTV 上跑 AI 视频短片,并自动抽卡 2-3 次,耗时 44 分钟。 03 作者通过截图前端模板网站(如 awwwards)并丢给 Codex,利用 GPT-5.6 Sol 模型复刻并优化了开源项目 WorkBuddy 蓝皮书的官网 UI。 04 Codex 可执行日常任务,如设计飞书问卷、自动打卡等,且额度频繁重置,作者认为 100 美元/月的 Pro 版本已足够。 反方 / 局限
— 作者提及 Codex 运行速度慢(如跑 30 个 Case 需 2 小时),且有时会中途停止,需手动干预。 — 文章提到国产模型 Kimi K3 可作为 Codex 的平替,但性能比 GPT-5.6 和 Claude Fable5 差一些。
前置背景 Computer Use 技术路线之争
文章里 Codex 的 Computer Use 能力让作者惊叹「像人一样操作网页」。但这项技术背后存在四种截然不同的路线:云端 API 调用(Anthropic Claude、OpenAI CUA)、云端虚拟桌面、端侧纯视觉、以及混合方案。核心矛盾在于隐私——云端方案需要将屏幕截图上传服务器,数据安全风险明确标注在 Anthropic 官方文档中。端侧方案是唯一能做到数据不出设备的,2025 年 OSWorld 评测中专用模型已登顶全球第一。Codex 所采用的正是端侧纯视觉路线,这是它能在本地跑通且不依赖 API 的关键。
▸ 3 条关联资料
▼
平行视角 Codex 与 Claude Code 路线对决
OpenAI 的 Codex 和 Anthropic 的 Claude Code 代表了当前 AI 编程工具的两条完全相反的技术路线。Codex 主打「云端自动化极速工具人」——在隔离沙盒中运行,用户下发任务后独立跑代码、测用例、自动生成 PR,强调执行速度和自动化连贯性。Claude Code 则是「本地协同型资深搭档」——深度嵌入终端和 IDE,每步确认、展示推理过程,更注重安全可控和代码质量。实测数据显示,Claude Code 在复杂任务准确率上领先 23%,但 Codex 的速度和成本优势可达 3 倍。选哪个,本质是选「效率优先」还是「安全优先」。
▸ 3 条关联资料
▼
延伸追问 上下文工程取代提示词工程
文章反复强调「上下文即一切」,但大多数 Agent 用户不知道的是:当对话超过 50 轮后,上下文窗口满载导致旧 Token 被悄悄丢弃,模型「失忆」不是 Bug,而是所有大模型的硬限制。真正起效的不是写更长的 Prompt,而是把「上下文」当成一个需要独立建模、版本控制、缓存淘汰的核心数据资产来管理——这就是上下文工程(Context Engineering)。它关心的不是「怎么说」,而是「让模型在正确的时间看到正确的信息」。一个实际案例:某智能客服团队线上 Agent 平均单次会话消耗 42 万 Token,其中 68% 花在反复加载历史消息上,不是模型不够强,是上下文管理太糙。
▸ 3 条关联资料
▼