7.5
深览指数
科技人人都是产品经理·沃垠AI··AI 生成

保姆级教程!手把手教你用Coding模型做视频

本文详细介绍了一种用代码生成视频的新方法:让LLM通过Three.js编写每帧画面生成HTML,再利用无头浏览器抓帧和FFmpeg编码为MP4,全程无需剪辑软件。作者以MiniMax Code和M3.1 Flash模型为例,制作了一支水墨风文旅短片,并公开了全套元提示词和元指令。文章的核心贡献在于提供了一套‘替代传统视频模型’的可控、低成本的程序化视频生成方案,尤其适合产品宣传片、动态排版等需要精确控制的场景。适合对AI编程、自动化视频创作感兴趣,且有一定技术背景的读者。原文 ↗

核心观点
  • ▍用代码生成视频是视频创作的新路径:LLM写代码逐帧渲染,无头浏览器抓帧,FFmpeg编码,全程在Agent内完成,成本极低且过程可控,尤其适合知识密度高、需要精确控制的场景。
  1. 01核心技术栈:LLM(如MiniMax M3.1-Flash-Preview)用JavaScript或Three.js写每帧画面生成HTML,通过无头浏览器(如Puppeteer)逐帧捕获,再用FFmpeg编码成MP4。
  2. 02作者用MiniMax Code + M3.1-Flash-Preview组合制作了一支四川文旅宣传片,所有画面、配音、音效和BGM均由AI完成,成本约1700万Tokens(官方重置,实际为0)。
  3. 03作者设计了一套详细的元提示词,要求LLM根据用户输入的地名,自动生成包含素材速览、分镜总表、配音稿和最终代码提示词的文旅短片方案,母题、地标、诗词、配色等均由模型自行决策。
  4. 04实际操作演示中,MiniMax Code执行元提示词花费约2小时(思考深度Max),期间自动检查并修复错误,最终生成可运行的HTML文件,并接入TTS模型自动生成配音。
  5. 05通过代码生成视频,每一秒的画面都是确定、可重复计算的,后期修改非常方便,画幅和画质可任意选择,不受视频模型按分辨率定价的限制(如480P、1080P、4K)。
反方 / 局限
  • — 作者指出,该方案在需要真实感、光影质感和复杂物理运动的场景下还不靠谱,无法完全替代主流视频模型(如生成的3D建模细节不及Opus 5.5)。
  • — 作者的元提示词和元指令并非普适方案,核心依赖于LLM(如M3.1-Flash-Preview)的代码生成能力和Agent工具(MiniMax Code)的执行可靠性,模型能力的强弱直接影响最终视频质量。
25 分钟 · 4 卡片 · 9 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问