增长案例库 Maxed 归档 内容营销AI自动化

如何在 Claude Code 里搭建 AI 视频工作室

How to build an AI video studio in Claude Code:

中文译文 · 16k 字

一句话摘要

用 Claude Code 搭建 AI 视频工作室

如何在 Claude Code 里构建一个 AI 视频工作室 July 28, 2026 · 15 min read · View source ↗ Claude Higgsfield AI Automation 我把 Claude Code 变成了一间真正在运转的电影工作室,而我要把整套系统交给你:skill、prompt、循环,以及把它们串起来的六阶段流水线。 每个阶段都依赖 harness 的不同部分:模型靠 skill、产量靠 subagent、剪辑靠 bash,而一切重复的事情靠精心设计的循环。 今天,我要教你用 Higgsfield Supercomputer、Claude Code 和 Seedance 2.0 制作像这样的短片: 这篇文章包含这些内容: 引擎:所有模型都在一个平台上,以及两条进入的路径 阶段 1:从真实的电影里提取一份风格契约 阶段 2:量产帧,锁定角色和地点 阶段 3:agent 写下每一个镜头的 prompt 阶段 4:运动,以及消灭"冻结镜头"的语法 阶段 5:subagent 舰队并行跑生成 阶段 6:配乐、用文本文件做蒙太奇、4K 母版 如果你想要这篇内容背后的完整制作工具包——prompt 板、风格圣经,以及可直接运行的 agent 简报——那就是 weeklyaiops.com 上实时 AI 运营社区存在的意义。 为什么循环就是产品 一个专业镜头过去是一场豪赌,因为每次尝试都要花真金白银和真实的天数,所以没人实验,所有东西看起来都一个样。 AI 视频坍缩了这个循环:描述一个镜头,几分钟内生成,看一遍,改三个词,再生成。 尝试的成本降得如此之低,以至于"把一切都试一遍"变成了策略。 但一个坍缩掉的循环,只有在有东西替你跑的时候才划算,因为每个镜头五十个循环、二十个镜头,就是一千个决策;而一个点一千次生成按钮的人,是一个筋疲力尽的操作员,作品依然产出一堆垃圾。 所以系统把工作拆成两半: 你拥有品味:哪些帧感觉对,哪些镜头能活下来,这部电影想成为什么。 agent 拥有吞吐量:写 prompt、提交生成、轮询任务、重试失败、组装剪辑。 在当下这个时间线上,这项技能的名字叫循环工程(loop engineering),我们正在用在这套配置上。 一个 agent 循环,是 agent 重复执行直到某个条件被满足的工作;而这次制作是三层嵌套的循环: 镜头循环:生成、看、改一个变量、再生成,直到这个镜头挣到它的位置。 舰队循环:遍历镜头清单,哪里有空槽就在哪里提交,收集赢家。 会话循环:记录每一次生成,这样下一次制作就从这一次学到的一切起步。 你只设计一次循环,agent 就整夜跑它们。这就是"使用一个模型"和"运营一间工作室"之间的区别。 你看到的每一部"agent 制作的电影"(包括这一部),都是这样拆分的:agent 规划、写 prompt、重试,人做挑选和执导。 还没有人展示过一部由 agent 从头到尾、全程无人类参与、还能看的电影,而下面这套系统也不假装自己是那种东西。 便宜的生成并没有让好视频变得容易……它把整个工作都移进了品味里。 后面的一切都围绕那句话构建。 引擎:一个平台,两扇门 这次制作会触及图像模型、视频模型、音乐生成和超分(upscaling)——那个把成片提升到 4K 的环节,这通常意味着五个订阅、五个标签页、五个渲染队列,以及五个会丢文件的地方。 higgsfield 几乎把每一个模型都放到同一个界面上,藏在一次登录和一个积分池后面,而且整个平台就是为 agentic 使用而构建的——这正是这套系统需要的,因为一个 agent 没法驱动五个不同的登录。 进入它有两条路: supercomputer 是那扇容易的门:一个运行在平台本身的 agent,替你规划制作、为每个任务自动挑选最好的模型、并把你的场景剪在一起。你描述你想要什么,它处理路由,而且它跑 skill 的方式和 claude code 一样。所以如果你不住在终端里,就从这里开始。 CLI 是那扇控制的门:它让每一个模型都可以从 claude code 或任何你已经在运行的 harness 里寻址。这意味着你自己的 agent 握住整条流水线——生成什么、什么时候、用哪个模型、以什么顺序。 而且,如果你是 AI 视频新手,完全不知道一个好镜头要迭代多少次,supercomputer 跑起来是不花钱的:规划、测试和返工都花零积分,只有渲染最终视频时才付费,所以免费计划覆盖了所有的探索。 CLI 配置是三条命令: npm install -g @higgsfield/cli higgsfield auth login npx skills add higgsfield-ai/skills 这个 skills 包教会 claude code 什么时候该用哪个模型、如何保持角色一致、以及如何提交和轮询任务。所以从这一刻起,你的终端就是工作室。 一条命令就能提交任何模型并等待结果: higgsfield generate create seedance_2_0 --prompt "slow dolly in as the sail tears loose" --start-image ./frame.png --duration 5 --resolution 1080p --wait 换个模型名,同样的结构就覆盖了整个制作:gpt_image_2 做帧,nano_banana_2 做角色编辑,sonilo_music 配 --duration 做配乐,超分器做 4K 母版。 承载整条流水线的那些 flag: --start-image 为图生视频设置第一帧,本地文件路径会自动上传。 --end-image 锁定最后一帧,这就是链式镜头连接的方式。 --wait 会阻塞直到片段完成并打印结果 url,--json 则让输出对一个 agent 可读。 higgsfield model list --json 显示你能调用的每一个模型,higgsfield model get seedance_2_0 --json 显示某个模型接受的确切设置。 而全部从 claude code 里跑,靠的是一个文本文件,而不是一个集成: 把路由规则写进你项目的 CLAUDE.md:每个任务类型用哪个模型、分辨率阶梯、并发上限。 agent 读一次规则,它生成的每个 subagent 都继承这些规则。 生成通过 bash 提交,用 higgsfield generate get 检查,并记录到每次运行一个日志文件。 下面的一切都走那扇门。 阶段 1:从电影里提取品味,而不是发明品味 把品味带进 AI 视频的最快方式,是停止凭空描述情绪,转而从那些已经打动过几百万人的镜头里提取它们。 你的来源,把这些收藏起来: frameset.app 用于电影和视频静帧,可按镜头、灯光、运动搜索。 shotdeck.com 和 fancaps.net 用于几乎任何电影的一帧一帧静帧。 savee.com 和 cosmos.so 用于图像和情绪板。 eyecannndy.com 用于转场和摄影技巧。 挑五到十个承载你想要的精确感觉的镜头。 然后执行提取动作:把每个镜头喂给一个视觉模型,比如 Gemini 3.1 Pro,让它极其细致地命名这个镜头的参数……镜头质感、光线的方向和来源、色调板、颗粒、对比度、构图(blocking)、氛围、时代标记。 输出就成了我所说的风格契约(style contract):一段锁定的视觉语言,逐字逐句粘贴进这个项目每一个图像和视频 prompt 里,这样每一次生成都朝同一部电影靠拢。 因为你不再寄希望于模型理解"cinematic"。 你在把那个已经打动过人的镜头里测量好的原料,亲手交给它。 "cinematic" 单独一个词,是 AI 视频里最被浪费的词。模型们见过一千万张被贴上这个标签的图片,所以它毫无意义……能落地的,是强化配对:"motivated warm lighting, 35mm grain, shallow depth of field, lifted blacks"(有动机的暖光、35mm 颗粒、浅景深、抬高的黑位)。 那一段话决定了后面一切东西的样子。 阶段 2:先有帧,再做运动,永远如此 永远不要凭想象生成视频。 先生成静帧,直到这一帧对了,再让赢家动起来。因为一帧的成本只是一个片段的一小部分,而且只需要几秒而不是几分钟,所以你的所有探索都发生在便宜的那一层。 帧环节看起来是这样的: 把你同一条镜头简报,带着你的风格契约,并行跑过几个扩散模型;在同一个界面上这件事很轻松:同一个 prompt、五个模型、对比。 每个节拍都试很多很多帧,不同的构图、场景内不同的瞬间、不同的天气。 精修赢家:Nano Banana 做外科手术式的编辑和一致性处理,Soul Cinema 做照片质感的角色外观,GPT-Images-2 做密集的艺术指导。 锁定必须保持一致的东西:每个角色一张参照表(正面、四分之三侧面、侧脸,分别裁剪,因为网格会让视频模型把面板误读成不同的人),每套服装或每次状态变化一张单独的表,每个地点多角度表。 如果你不想自己开车,这个环节也是 supercomputer 挣回身价的地方:它自己把同一条简报跨模型测试,看输出,并在你完全不监控的情况下迭代。 三条帧规则,比任何工具选择都更能决定成败: 物体比脸更能承载情绪,因为脸会在生成之间漂移,而物体会锁死。所以当一个故事节拍可以落在一张撕裂的帆或一根断掉的桨上,而不是一个表情上时,就把它交给物体。 一个普通的地方里有一件不可能的东西,是能让人停下滚动的那类构图。 给角色一个代价:一个走路的人影是素材,一个一瘸一拐走向某样东西的人影是故事。 不过帧只是工作的一半,因为一张不动的漂亮帧,依然是垃圾…… 阶段 3:agent 写镜头脚本 每个镜头都需要一个 prompt,而批量写 prompt 正是你要委派出去的工作。 我用 Fable 5 Medium 当脚本写手:它接收节拍表(beat sheet)和风格契约,用一个锁定的模板写下每个镜头的 prompt……场景上下文、参照、构图、摄影机、灯光、音频、风格锁定,每次都按同一顺序。 锁定,是因为镜头之间的一致性来自重复的参照图和重复的语言,从来不来自种子或运气。 脚本遵循的 prompt 规则,每一条都值得单独偷走: 每个镜头一个动词:"he turns"(他转身)能生成,"he turns, walks forward, reaches out and speaks"(他转身、向前走、伸出手、说话)会塌掉。 五个小动作胜过一个小形容词:"blank stare, slow blink, sips coffee, looks up"(空洞凝视、缓慢眨眼、抿一口咖啡、抬头)读起来像个人,"he looks confused"(他看起来困惑)读起来像一张库存图。 主体运动和摄影机运动永远分成两个句子,因为一句话同时承载两者,正是你得到那个大家都怪在模型头上的"抖动的胡话"的原因。 纯从文字生成的 prompt 跑 120 到 280 词,给一张参考图做动画的 prompt 保持在 80 词以下,因为超过这个数,文字就开始和图片打架,你的角色就开始漂移。 约束保持正向:"stable picture, sharp clarity"(画面稳定、清晰锐利)有效,"no blur, no shaking"(不要模糊、不要抖动)会被无视。 阶段 4:运动,以及消灭"冻结镜头"的语法 现在轮到片段了。 每一个关键帧——你在阶段 2 里建好的那张锁定静帧——都过一遍 Seedance 2.0 的图生视频,把那张静帧变成一段移动的片段,作为一个隔离的 3 到 5 秒镜头。而一分钟的电影是 12 到 16 个这样的镜头拼接起来的——反正每一部真正的电影都是这么工作的……剪辑师剪的是镜头,不是条(takes)。 镜头隔离也是那个一致性作弊器:身份漂移会在连续场景超过 30 秒时显现,而隔离的节拍永远不会走到那一步。 我最初两次运动环节以同样的方式失败:人影冻结不动,摄影机从他们旁边漂过——片段在技术上动了,但肉眼可见地什么都没发生。 修复是一种语法,分三部分,每一条图生视频 prompt 都要有: 一个命名的摄影机运动。 一个场景内事件:在这五秒里,有什么事情发生了。 一个明确的"不要冻结的人影"。 同一个关键帧,两个 prompt:"slow dolly in, cinematic"(缓慢推近,电影感)给你的是一张会漂移的静图;"slow dolly in as the sail tears loose and the crew scrambles to catch it"(缓慢推近,帆被撕脱,船员们手忙脚乱地去抓它)给你的是一部电影。 两种值回整节的运动技巧: 链式镜头:镜头 N 的最后一帧成为镜头 N+1 的参照帧,这样连续性就延续了下去,一张角色表都不用重新加载。 把高潮写进一次生成里的时间码:[0-4s] 广而静,[4-8s] 随张力上升推进,[8-12s] 在顶点处特写,[12-15s] 揭晓。这样你是在一个片段内部导演剪辑。 不过一个好片段只是个样品,一部电影需要六十个,而这是一个产量问题。 阶段 5:舰队 这是 claude code 挣到"工作室"这个词的阶段。 一个编排者(orchestrator)会话拥有镜头清单。 它按镜头家族生成 subagent……生物、水、室内、动作……每个 subagent 从风格契约里写自己的 prompt,通过 CLI 提交自己的生成,轮询自己的任务,并回报自己的赢家。 因为每一个模型都能从同一个终端寻址,舰队就能跨模型、并行地覆盖整个镜头清单,而你去做别的事。 舰队生死系于一条不光彩的规则……尊重并发。 视频模型会限制同时能跑多少个任务,所以 agent 检查活跃任务,只在有空槽时才提交。 一个会节流的 agent 能整夜跑完……一个天真的循环一小时后就死在速率限制上。没错,那个上限正是让整夜运行变得可预测的东西。 舰队的迭代纪律:每个镜头 3 到 4 个候选,然后每一轮只改一个变量……摄影机、灯光或速度,绝不全盘重写。因为你改了五处才失败的失败,什么都教不了你。 而且 agent 记录每一次生成:prompt、模型、结果、保留还是枪毙。 你的制作变成了一座数据库,而第二号制作从第一号学到的一切起步。 阶段 6:把蒙太奇当代码写 组装比你想的小。 音乐先行:对照剪辑的情绪弧线给配乐写简报,用乐章(movements)而不是情绪——build、peak、quiet、resolve(推进、顶点、安静、收束)——一次生成,然后让剪辑去贴合配乐。 剪辑本身是一个文本文件:每个片段一行,带它的时长和一个音频 flag,而 ffmpeg——这个 Claude Code 已经会驱动的免费命令行视频工具——读取这个文件并渲染出电影。 那个文件的每一行都是一个镜头名、要保留的秒数、以及一个音频 flag……17-scylla-deck 坐在我上一次剪辑的文件里,音频被标记为 mute,因为它生成的那声喊叫和弦乐打架;而两行之后的海浪环境声保持 live,因为它撑起了场景。 每个片段的音频,恰好在它和配乐相撞的地方被静音,在它为真实感加分的地方被保留。 这意味着整个剪辑在几秒内即可复现、可改动,没有时间线软件,没有剪辑师。 超分一次,在最后,作用在成片上,绝不在单个片段上。 探索时用 720p 生成,保留的用 1080p,只有最终母版才用 4K;你停在能回答你正在问的那个问题的最低分辨率上。 如果从终端驱动 ffmpeg 和一个超分器对你说流水线味太重了,这个阶段也是 supercomputer 的领地:把赢家片段交给它,它自己组装剪辑并渲染 4K 母版。 而最后一轮剪辑是纯粹的诚实:任何会让你掏出手机的片段,删掉,无论它花了你多少。 这套系统到底是用来做什么的 电影是 demo……系统才是资产。 同样的六个阶段能产出产品广告、批量 UGC、品牌片、发布视频,因为流水线里没有任何东西知道自己在做电影。 而且一套常备系统赢在速度:当一个时刻砸中你的利基时,窗口是以小时计的,而一个拥有风格契约、锁定角色和一支生成舰队的操作员,会在其他人都还在开标签页的时候就把东西发出去。 整个搭建,压缩版: 用一个视觉模型从真实电影里提取一份风格契约。 跨几个扩散模型批量生成帧,精修,把角色和地点锁进表格。 Fable 5 Medium 从一个锁定模板写每个镜头 prompt。 Seedance 2.0 把关键帧做成隔离的 3-5 秒镜头:摄影机运动 + 事件 + 不要冻结人影。 subagent 通过 higgsfield CLI 并行跑生成,节流、记录。 配乐、用 ffmpeg 从文本文件剪辑、母版超分一次。 跳过阶段 1,其余每个阶段产出的都是"漂亮但不知所云"的素材。 这套系统出来的第一部电影,花了一次整夜会话……你的那部,从你装好 CLI 的那个晚上开始…… 或者免费试试 Higgsfield Supercomputer(Higgsfield AI 在赞助这篇文章,但这个东西确实令人印象深刻)——它能够自主工作,从规划镜头、写 prompt、挑模型,一直到最终成片。 读这篇文章的每个人都能租到同样的模型,所以电影永远只能和你喂给系统的东西一样好。 品味进去,电影出来。 Tags: # X # Claude # Higgsfield # AI # Automation # Guide # Fable Related articles 10 SEO backlink Claude automations for 61k AI mentions in 3 months Link building is trial and error. SEO AI Claude Automation

原文参考:https://maxed.wiki/posts/how-to-build-an-ai-video-studio-in-claude-code/ (Maxed.wiki,本页为站内中文整理)