增长案例库 Maxed 归档 付费投放AI搜索优化

我们广告工厂里的 AI 不被允许自己写提示词

The AI in our ad factory is not allowed to write its own prompts

中文译文 · 9k 字

一句话摘要

标题主题:广告工厂中为何不让 AI 自己写提示词

我们广告工厂里的 AI 不被允许自己写提示词 · 2026 年 7 月 20 日 · 8 分钟阅读 · 查看原文 ↗ Advertising AI UGC Claude 现在人人都在生成 UGC 广告。而其中大多数在第一秒就露馅是 AI。 皮肤过于均匀。脚本听起来像落地页。声音从头到尾只有一个调。 然后在第十秒,视频就戛然而止,因为模型只生成了这么多。 我们构建了一个 Claude Code 技能(skill),逐个击破这些问题。它接收一个产品加上一张演员参考照片,返回一条完成度 20 秒的口播广告:一镜到底、不中断、9:16、带声音。 它是开源的:https://github.com/MegaTroll222/OMNI-UGC-AD-FACTORY 下面讲讲它是怎么运作的。 真实感这一层来自 Emily 选角风格建立在 Raw Camera Casting Realism(生相机选角真实感)之上,这是 Emily 的真实感提示方法写成的 所以这里是鸣谢 https://x.com/IamEmily2050/status/2073745972036006044 这一部分完全归功于她。这是我们所见过的最好的真实感提示成果,去读读原文吧。 @IamEmily2050——继续保持这股劲头! 她的核心规则:永远不要写"photorealistic"(照片级真实)。要描述物理证据。 > 脸颊和鼻子上可见的毛孔。下颌沿线细小的汗毛。眼睑周围轻微泛红。一只眼睑和另一只略有不同。阴影里淡淡的颗粒感。普通的窗光和失焦的朴素背景。 > > 并且禁用那些"美颜"词汇。Stunning、flawless、glass skin、porcelain、perfect symmetry。这些词汇正是你最终得到一张渲染图而非一个真人的原因。 你给模型证据,它给你一张选角试镜照。 那是我们的起点。下面的一切都是我们在其上建立的"分叉"。 分叉第 1 部分:年龄是一个生理学问题 我们撞上的第一堵墙:真实感词汇是自带年龄的。 像 fine lines(细纹)、chapped(干裂)、uneven tone(肤色不均)这类词,在训练数据里全都和 40 岁的人绑定在一起。我们用全套真实感词汇描述一位 20 出头的女性,得到的却是一个逼近 40 岁的女人。 > 写"22 years old"并不能解决它。我们试过了。一个年龄 token 永远敌不过一整段衰老生理学描述。 所以这个技能内置了一份年龄词表(age lexicon),并由门禁(gate)强制执行。 对于 20 多岁的演员,必需的词是 oily T-zone(油性 T 区)、large visible pores(大而可见的毛孔)、an active blemish(一颗活跃的瑕疵)、plump lips(饱满的嘴唇)、full under-eye(饱满的眼下)、只有抬眉时才存在、放松时消失的纹路。 年轻的皮肤更油、毛孔更大、瑕疵更多。它只是没有静态纹路。把生理写出来,年龄自然就出来了。 对于 40、50 多岁,你有意把同一张表翻转过来。现在 fine lines、crepey、nasolabial depth(法令纹深度)成了正确的词汇,而不是意外。 还有一个大多数人会漏掉的杠杆。构图(framing)词汇同样自带年龄。 "Casting-style"(选角风)和"documentary"(纪录片风)会把人拉老。"Front-camera selfie"(前置摄像头自拍)在你还未触及任何一个皮肤词汇之前,就把整个分布拉向了年轻。 演员从哪里来 参考照片不是来自模型,而是来自 Pinterest。 去搜那种永远不可能在摄影比赛中获奖的 UGC 照片。光线不均、裁剪别扭、真实的皮肤、一个表情进行到一半的人。那一团乱麻恰恰是你想要的。 那张照片永远不要进入生成器。把它作为图像参考传进去,你会得到一个真人 1:1 的肖像。那是个版权问题,而且也是懒惰的选角。 照片是一份选角简报。你用眼睛去读它。 所以这个技能对它做反向提示。你描述相机所看到的:裁剪、面部角度、光线方向、以物理机制写出的表情、头发、背景。 这段描述再经过 Emily 的规则和上一节的年龄门禁。 然后你只从文本生成。gpt-image-2,一张全新的面孔,不是任何人的身份。和 Pinterest 照片同样的感觉,却没有任何一个像素来自它。 分叉第 2 部分:门禁而非感觉 这个 agent 从不手写生成提示词。它写的是结构化 JSON。 一个 Python 门禁对照词表文件校验这段 JSON,当一切都通过后,门禁自己来组装最终提示词。一条跳过了门禁的提示词是不存在的。 选角门禁检查:年龄词表词汇在场、禁用词汇缺席、光线有方向也有质感、色彩分级取自真实的相机词汇、至少两个"意外构图"标记。 并且不能出现设备词汇。在提示词里写"iphone"或"tripod"(三脚架),手机就会渲染进画面。这一点我们是吃过大亏才学到的。 片段(clip)门禁更严格。 每一句脚本台词都会被标注一个内部状态,而行为则来自一份 32 个微行为的词表。一次目光下移。一次鼻子呼气。一句说到一半的吞咽。 情绪词会被直接拒绝。写"nervous"(紧张)你会得到表演。写吞咽,你会得到一个人。 声音块必须覆盖六个类别:音高、音色、节奏、音量、句末音高、口音机制。还要带一个城市。 "Soft voice"(温柔的声音)无法通过门禁。"Speech patterns of someone raised in Sacramento"(在萨克拉门托长大的人的语言习惯)能通过。 而且声音块必须在两个片段之间逐字节一致。门禁对它做哈希锁定,让演员无法在不同镜头之间漂移。 让语言活起来的小动作 早期,一条运营备注毁掉了一段本来完美的片段:"她说话的方式,没有任何人会相信那是她的真实感受。" 脸是对的,光是好的,词是准的。但表达是一次表演。 所以表达在这个技能里自成一个系统。 我们研究了真正高互动量的口播创作者(get-ready-with-me、storytime、rant),并记下他们的身体实际做了什么。 声音在句末发涩。停顿落在几乎每一个分句之间,0.3 到 0.6 秒,不均匀、不戏剧化。在一个新念头到来之前,会有一声可闻的吸气。 片段以一个咂嘴和一声呼气开场,然后才说出第一个字。笑从来不是完整的笑,而是一次从鼻子呼出的气。 然后是词表:32 个微行为,横跨目光、呼吸、嘴、喉咙、脸、头、自我触碰和姿态。 她在找词时,眼神飘向一旁。在难为情的那句台词上,她的目光垂下来又回来。坦白前的一次吞咽。一句台词末尾一次短促的鼻子呼气,是一声不带任何幽默的笑的残影。 每个行为都与诸如 thinking(思考)、fed up(受够了)、confiding(倾诉)等内部状态绑定。把一个行为用在它不属于的状态里,门禁会拒绝它。 而且有预算:每个片段三到六个行为,来自至少两个类别。多到足以显得鲜活,少到她不会抽搐。 把它粘合成整体的规则:描述状态,绝不描述编排动作。 写"pause for half a second"(停顿半秒),她会表演出一个停顿。写"she stops because she is thinking, and the gaps come out uneven"(她停下来是因为她在思考,于是间隙变得不均匀),停顿自然就来了。 分叉第 3 部分:从一个 10 秒模型得到 20 秒 Omni 生成 10 秒。UGC 需要 20 秒。 Omni 有一个怪癖:它在一个片段的最初几帧会保留参考图像,然后再淡入生成的场景。 于是我们用片段 1 裁剪后的最后一帧来播种片段 2,这段"保留"就掩盖了接缝。 我们以接缝两侧的像素差来衡量这条缝。在 0-255 的标尺上,任何高于 5 的都会失败。我们的生产运行测得大约是 3。 我知道剪口在哪里,却还是找不到它。 我们用了什么 gpt-image-2 用于选角。我们在另一个模型上花了四轮调提示词,皮肤一直是塑料感。gpt-image-2 用同样的提示词第一次就修好了。在改提示词之前,先换模型。 gemini-omni-flash 用于两个片段,串联进行。 MaxFusion MCP 用于 meta ads + tiktok 调研、图像和视频生成。 ffmpeg 用于语音测量、裁剪和拼接。 经受住生产检验的脚本规则:脚本是一个人在说话,绝不是广告文案。品牌名在脚本里只占最短的一个句子。抱怨先行,背书几乎是无意中发生的。 而且每一条脚本在靠近声音门禁之前,都要先经过 humanizer(Siqi Chen 的 blader/humanizer,repo 里同样有署名)。 拿去用吧 这个 repo 里有完整的技能、四份词表文件、三个门禁脚本和成品的示例广告:https://github.com/MegaTroll222/OMNI-UGC-AD-FACTORY 编辑 JSON 词表,你就改变了整个系统。 这正是设计的用意。规则存在于数据文件里,所以改进工厂永远不需要重写散文。 去试试吧——https://maxfusion.ai/?via=stav-x 我会在它们上线 X 之前,先在我的免费 Telegram 频道里放出这些技能和工作流。 加入这里:t.me/primegenai 基于 MaxFusion 构建。 MIT 许可证。 Tags: # X # Advertising # AI # UGC # Claude # Meta Ads # Meta # Facebook # Instagram # Pinterest 相关文章 How to hit $1M with AI UGC (Fable 5 edition) 就在此刻的某个地方,一个品牌正在为一条 UGC 视频支付 3,000 美元。一个模特、一个摄影棚、一个经过三轮反馈才获批、花了两周时间才写好的脚本。等它上线时,它已经…… UGC AI Claude Advertising

原文参考:https://maxed.wiki/posts/the-ai-in-our-ad-factory-is-not-allowed-to-write-its-own-prompts/ (Maxed.wiki,本页为站内中文整理)