增长案例库 Maxed 归档 社媒与有机增长内容营销变现与定价

我把一个 AI 网红变成了 UGC 工厂——这里讲构建和钱在哪

I Turned One AI Influencer Into a UGC Factory. Here's the Build and Where the Money I$.

中文译文 · 24k 字

一句话摘要

用 AI 网红打造 UGC 内容工厂

我把一个 AI 网红变成了一座 UGC 工厂。下面是这套构建,以及钱到底从哪里来。2026 年 6 月 19 日 · 21 分钟阅读 · 查看原文 ↗ AI UGC Claude 营销 核心思想:身份是数据,不是一种"感觉"。大多数人做 AI 网红,就像在餐巾纸上随手涂鸦。我做的却像一份已经编译好的二进制产物:一张 JSON 身份卡、一个 Claude Code 技能,就能用七条一行式的简短指令,产出整整一周的内容。下面是整套系统,以及钱真正的来源。 让我彻底重新理解这场游戏的那句话是:角色不是一张图片。它是一件构建产物。 如果你一直靠手动来做这件事——囤积参考脸、往聊天窗口里粘贴一整面墙的文字、祈祷下一次渲染出来的还是同一个女人——那你早就知道这种失败模式了。所以让我先准确地给你展示,它是怎么一步步杀死你的账号的,然后再给你展示能杀死它的系统。 你的 AI 网红在第二个视频就死了 事情总是这样发展的。 你生成了一张惊艳的第一张图。脸完美无瑕。你兴奋极了。你把它发出去,人们有了反应,你确信自己破解了"无脸品牌"的作弊码。 然后你坐下来做第二张。而她变成了另一个人。 下巴变宽了。肤色暖了半个色号。头发从金色变成了灰蒙蒙的亚麻色。原本绿色的眼睛,现在变成了一双浑浊的榛色。你重新上传原图,写下一段话来央求模型"保持面部结构,不要美化",重新生成了四次,最后落在了一个"只要你别盯着看就勉强说得过去"的结果上。 第三个视频,同样的战斗。第四个视频,同样的战斗。到第七个视频的时候,你每个帖子都要花上一个小时,去伺候一张拒绝保持"同一个人"的脸,然后你悄悄地停更了。 这才是大多数 AI 网红真正的死因。不是图片难看。是不一致。角色经不起一张内容日历的检验。你运营的不是一个品牌。你运营的是一台老虎机。 没人告诉你的是:问题不在你的提示词。问题在于你根本还在"提示"。 我不再拉那个拉杆了。现在我编译。 这是 AI 网红玩法手册的工程版本。角色以"一个 Claude Code 技能 + 一张 JSON 身份卡"的形式存在。生成通过一个我写过一次、之后永远复用的技能来跑。视频通过 fal.ai 上的 Kling 3.0 渲染。整件事是确定性的、受版本控制的、可复现的。一行输入进去,一个可以交付的镜头出来。 让我带你走一遍整个构建。 核心思想:身份是数据,不是一种感觉 当你重新上传一张参考图、央求模型去匹配它时,你是在把身份当成一种"感觉"——一个软性的建议,模型每次都重新解读一遍。解读会漂移。所以她才会变。一张图片是一种感觉,而感觉会漂移。 我把身份当成一个 schema(模式)。 我运营的每一个演员,都是一个 JSON 对象,一个我拥有、管理版本、像其他任何配置文件一样做 diff 的字面文件。它变成两件协同工作的东西: 一张 JSON 身份卡,关于"她是谁"的唯一事实来源,精确到她肤色的十六进制色值。 一个 Claude Code 技能,读取那张卡,并且每一次都以同样的方式、确定性地组装出每一个镜头。 代码,而不是点击。一个 schema,而不是一个猜测。 一旦身份存在于结构化数据里,"一致性"就不再是你事后祈祷的东西,而变成了系统从一开始就保证的东西。同一张卡产出同一个人。句号。你不可能从一个主键上漂移出去。 身份卡:你的唯一事实来源 这是这套系统的心脏。下面是我其中一个演员的事实来源。来认识一下 Lila: { "actor_id": "lila_v1", "name": "Lila", "origin": "Swedish", "age_range": "21-23", "face": "soft oval, high cheekbones, small straight nose, gentle rounded chin", "eyes": "pale blue-grey, slightly hooded, left eye 2% smaller", "skin_tone_hex": "#F8C4AE", "skin_notes": "fair, rosy undertone, faint freckling across nose bridge", "hair": "golden blonde, natural wave, mid-chest length, center part", "jawline": "delicate, soft, slightly asymmetric, left side a touch softer", "distinguishing_marks": "small mole below right jaw, faint scar left eyebrow, freckle on left collarbone", "outfit_variations": ["oversized cream knit", "linen slip dress", "athleisure set"], "prompt_seed": 48217 } 看看 skin_tone_hex。它不是"白皙的皮肤"。它是 # F8C4AE。一个精确的数值,而不是模型能读出九种不同意思的诗意短语。同一个十六进制值,每次都编译成同样的皮肤。没有漂移,因为已经没有任何东西可以解读了。这就是"描述一个人"和"定义一个人"之间的差距。 这就是全部诀窍,而且被放大到每一个字段上。eyes 锁定了一个 2% 的大小差异。jawline 锁定了一个刻意的左右不对称。distinguishing_marks 把一颗痣、一道疤、一个雀斑,固定在身体上精确的位置。prompt_seed 锚定了生成。这张卡不是在描述"某一类人"。它定义了一个具体的人,并拒绝让她变成任何其他人。 因为身份是数据,一致性就不再是运气,而变成了系统的属性。Claude 每次都从这张卡重建出同一个人。不用重新上传。不用复制粘贴一段"用完全相同的合成人物"的文字然后交叉手指祈祷。这个人就是那个文件。从海里走出来的金色黄昏 Lila,和在浴室里拍护肤测评的 Lila,毫无疑问是同一个人,因为两者都始于同一个 JSON 对象,而不是两次各自独立的、对一张已保存图片的重新描述。 以图片作为事实来源,每重新生成一次就退化一点。以数据作为事实来源,则完全不会退化。 这里就是让它像软件一样规模化扩张的部分:这张卡是可移植的。我可以把 Lila 交给一个队友,他们能生成出完全相同的角色。我可以把她分叉成一个"姐妹演员",只需改四个字段:把头发加深、去掉雀斑、换掉出生地、重新掷一个 seed。我能在午饭前,用同一个引擎转出五个演员。你用一张保存下来的 JPEG 试试看。 技能:规格写一次,永远生成 引擎本身是我写的一个 Claude Code 技能,我叫它 ugc-creator。 如果你还没构建过 Claude 技能:它是你一次性教给 Claude Code 的一个打包好的能力——指令、逻辑、可复用的结构,然后按需调用。把它想成你装进模型里的一个函数。你定义一次行为。从此以后你调用它,而不是每次重新解释它。我的技能编码了关于"一个可信的 UGC 镜头是如何被构建出来的"的一切: 镜头角度的逻辑 光线规则 皮肤真实感系统 镜头库 提示词组装流水线 负面提示词默认值 一条发给 Claude Code 的命令,就能把整套 UGC 引擎立起来。规格我写了一次。从那以后,网红不再是一个我要在五个标签页之间手动重跑的工作流。她是我拥有的基础设施。可复现。可受版本控制。可分享。在那之后,我不再是"在做图"。我是在调用一个函数。 这就是整个哲学层面的转变。手动的方式是一个工作流——一串你每次都要手动重跑的点击,一旦你记错了一个步骤,它就崩了。我的方式是一个程序。我描述一次行为。这个行为从此可重复、可审查、可分享。 这是人们错过的那部分。交付物不是视频。交付物是那台制造视频的机器。那台机器才是护城河。任何人都能写出一条巧妙的提示词,而一条巧妙的提示词是一次性的消耗品。一个技能是耐用的资产。构建一次,永远复用,为下一个演员分叉它。杠杆会像好代码那样复利,而巧妙的提示词永远不会。 真实感引擎:故意把瑕疵设计进去 这是整套系统反直觉的核心。 真实感不来自美。它来自不完美。 AI 图片之所以骗不过眼睛,不是因为它们丑,而是因为它们太干净了。没有毛孔的皮肤。完美的对称。无可挑剔的光线。看起来像被磨皮过的头发。你的大脑在四分之一秒内就判定出"这是渲染的",哪怕它说不出为什么。"AI 演示"的味道,就是"零瑕疵"的味道。 所以我不让引擎产出零瑕疵。我把瑕疵注入进去。ugc-creator 技能携带 10 个强制性的真实感锚点,每一个镜头都要把这十个全部用上,没有例外: 皮肤毛孔,可见的纹理,不是磨皮的塑料 散乱的发丝、飞翘的碎发和胎毛,打破轮廓线 眼下纹理,淡淡的细纹,那种没人会去 P 掉的自然阴影 不均匀的肤色,轻微的泛红,一块偏暖的斑块,真实皮肤自然的斑驳 织物纹理,织纹、褶皱,真实布料折叠和起球的样子 环境噪点,镜子上的一抹污渍,一圈咖啡渍,画面边缘的杂物 光线瑕疵,一处过曝的高光,一处略微死黑的阴影,不均匀的补光 相机伪影,轻微的颗粒感,一点运动模糊,真实镜头的柔和 指甲细节,真实的甲根,轻微的使用痕迹,一处缺口,而不是光亮的 CGI 指甲 首饰的物理,一条链子或耳环真实地搭在、垂在、捕捉光线的样子,像真正的金属 这是大多数运营者错过的工程洞见:你要刻意设计不完美。一张真实的照片充满了微小的意外。如果你的生成器产出一张没有任何意外的脸,你没有造出一个人。你造出了一张渲染图。你不是让她更漂亮才能显得真实。你是刻意让她有瑕疵。毛孔胜过磨皮。痣留下来。不对称的下巴留下来。飞翘的发丝留下来。 这就是"一眼 AI"和"等等,这是真的吗?"之间的那层区别。而且因为它存在于技能里,我永远不用记住它。它自动地、永远地在每一个镜头上触发。 iPhone 相机模拟:是用手机拍的,不是渲染的 第二个真实感杠杆是相机本身。 "电影感"是一个破绽。真实的 UGC 看起来就像是用手机、在某个人的浴室里、由一个疲惫的人单手拍出来的——因为它就是。而不是"在 GPU 农场里渲染出来的"。所以这个技能携带四个 iPhone 相机模拟配置文件,每一个都建模了那一种具体拍摄的真实行为: 自拍前置摄像头,略微更广的焦距感,近距离的镜头畸变,一臂之长的取景,前置传感器柔和的质感 后置摄像头,更锐利、更干净,主摄镜头的焦距压缩,"有人帮我拍的"那种感觉 对镜自拍,手机在手,倒影自身的柔和和眩光,浴室或卧室的场景 俯拍平铺,自上而下的产品视角,均匀的光线,略微不完美的对齐,边缘处悄悄渗入的镜头畸变 每个配置文件都携带自己的颗粒特征、焦距感和手持微抖。一张真实的手机照片会轻微颤抖。真实的前置摄像头会稍微压平五官。一张真实的对镜自拍会有一抹污渍和一次闪光泛白。把这些怪癖烘焙进配置文件,输出就不再像生成的,而开始像拍出来的。 你不是在选一个漂亮的镜头角度。你是在选一台可信的拍摄设备。 6 层提示词系统 这是 ugc-creator 的引擎室。对于每一个镜头,技能不会丢给生成器一句话。它把提示词组装成一个由六个有序层叠起来的栈。顺序不是装饰。它是承重的。 第 1 层,角色锁定。直接从 JSON 卡里拉出来。脸、眼睛、# F8C4AE 的皮肤、头发、下巴、那颗痣、那处不对称、seed。这一层不可协商,永远在最前面。它是提示词其余部分环绕运行的重力。下游的一切都可以动。这一层不能。 第 2 层,场景。正在发生什么。"刚从海里走出来。""正在做护肤流程。""在厨房台面上拆一个包裹。" 第 3 层,环境。在哪里,以及它暗示的光线。"金色黄昏的海滩,低角度的暖阳,湿润的沙滩。"环境决定了光线的物理规律。 第 4 层,相机。哪一个 iPhone 配置文件、取景、距离。"前置自拍镜头,一臂之长,略微上仰。" 第 5 层,真实感注入。那 10 个锚点,全部开火。 第 6 层,负面提示词。我拒绝的一切。"不要塑料皮肤,不要完美对称,不要磨皮,不要多余的手指,不要 CGI 光泽,不要美颜滤镜的柔化。" 角色锁定在最前面。永远如此。手动构建最常死掉的方式,就是让场景或相机压过身份。你要求一个戏剧性的角度,模型就悄悄把脸重新塑形来配合它。在这里,下游的一切都围绕"她是谁"来弯曲。光线永远没资格重新谈判她的下巴。这个锁定不是钉在一段新提示词顶部的一句祈祷。它是整个提示词被浇筑在上面的地基,而且技能每次都按同样的方式铺它,而不是靠我晚上 11 点的记忆。 镜头库:7 种 UGC 类型,可复用 UGC 不是无限的。真实的创作者账号运行的是一套可预测的格式,一个能真正驱动互动的小而可复用的词汇表。所以这个技能自带一个包含 7 种 UGC 镜头类型的库,每一种都有自己的场景默认值、首选相机配置文件和取景逻辑: 测评(Testimonial),对着镜头说话,前置自拍镜头,手里拿着产品 生活方式(Lifestyle),环境中的抓拍,后置镜头,自然光 开箱(Unboxing),俯拍平铺或近距后置镜头,手入画,第一反应 跟我一起化妆/准备(Get-ready-with-me),对镜自拍,浴室或梳妆台,进行中的状态 产品演示(Product demo),近距离应用,后置镜头,焦点在手和产品上 大采购/试穿(Haul / try-on),全身对镜自拍,换装,多个产品 一天的生活(Day-in-the-life),混合配置文件,一段拼接成迷你故事的序列 我不再每次重新发明"开箱长什么样"。我调用镜头类型,技能加载它的默认值和语法,然后 6 层构建在身份卡的周围填充开来。组合,而不是从零创作。 brief:一行输入进去,一次完整构建出来 这里是整套东西真正回本的地方,是它不再像图片生成、而开始像一个编译器的地方。 我给 Claude 一行: Lila,刚从海里出来,湿发,金色黄昏 这就是全部输入。剩下的都由技能来完成: 把 Lila 的完整身份从卡里拉进第 1 层:脸、# F8C4AE 皮肤、金色波浪、那颗痣、那只不对称的眼睛、seed 把"刚从海里出来"读进第 2 层场景,并加上物理后果:湿润的皮肤、滴水的头发、盐渍的光泽、鸡皮疙瘩 把"金色黄昏"扩展成一整套第 3 层光线模型:低角度的暖阳、长长的影子、湿发上的轮廓光 选定第 4 层相机:前置自拍镜头,一臂之长,太阳在她身后 在第 5 层开火全部 10 个真实感锚点:湿漉漉的飞翘发丝、水珠、被阳光打爆的高光、真实的毛孔纹理 盖上第 6 层负面提示词 一行意图,变成一个可以交付的、完整规格化的提示词。这就是编译器模型的一个动作:高层意图进去,底层构建出来。我写"做什么"。技能处理"怎么做"。 现在把它乘起来。一旦卡和技能存在,一个新镜头的边际成本就是一句话。一周的内容就是七条一行式: Lila,晨间咖啡,宽松针织衫,窗光 Lila,健身房对镜自拍,运动休闲,练完后的泛红 Lila,护肤开箱,厨房台面,俯拍 Lila,GRWM,浴室镜子,化到一半的妆 Lila,海滩散步,亚麻裙,金色黄昏 Lila,测评,拿着精华,柔和的正面光 Lila,夜生活,餐厅灯光,对镜自拍 七行。一张完整的内容日历。每一帧都是同一个人,因为每一帧都从同一张卡编译而来。它像软件一样规模化,因为它就是软件。这就是你规模化一张脸的方式。 视频:通过 fal.ai 用 Kling 3.0,像程序员一样执导 静态图能给你一个信息流。视频才能给你一个创作者。而运动正是大多数 AI 网红崩掉的地方。脸扭曲,手融化,整个幻觉在第一秒内就塌了。 我用 fal.ai 上的 Kling 3.0 渲染视频:真实感强,对小幅度人体运动处理得干净,而且有 API 访问,能直接落进流水线,而不是又变成一个标签页。我用一套紧的规则集来执导它,因为视频模型奖励克制、惩罚野心: 每个片段只有一个主要动作。一个。不是"她挥手、转身、微笑、再喝一口咖啡"。她拿起瓶子,或者她把头发别到耳后,或者她微笑,绝不同时做三件。选一个单一动作,让它呼吸。每多一个动作,都是模型把脸弄崩的又一次机会。 当你想要一个锁定的镜头时,把"静态相机"说两遍。说一遍,一半时候会被忽略。说两遍,画面才稳得住。 让动作保持小、保持人味。眨眼。微小的头部倾斜。一次呼吸。自然的对口型。小动作保住身份。大动作会被读成故障,然后炸掉它。 竖向 9:16,永远如此。那是信息流真正使用的画布。 这里的纪律和系统里其他任何地方都一样:约束模型,让它没法乱跑。在磐石般稳固的身份之上做小而可控的动作,正是让人们忘记自己在看一个生成人物所必需的组合。 一致性协议:把整整一周当作同一个人交付 一个单独的好视频很容易。一批十二个、而且显而易见是同一个女人的视频,才是大多数配置崩掉的地方,也正是这套东西赢的地方,因为一致性从来没有被交给运气。 当我生成一批视频时,技能会在每一个镜头上强制施加硬锁定: 脸部几何,身份卡里的每一个字段,先锁定,不允许每个镜头单独重塑 身体比例,同样的身高、同样的体型、同样的肩线,每一帧都一样 肤色,# F8C4AE,锁定,不会在一个光线下偏暖、在另一个光线下偏冷 头发,同样的颜色、同样的长度、同样的分线、同样的波浪行为 不对称,那颗痣保持在右下巴下方,左眼保持小 2%,眉毛上的疤保持住,偏柔的左下巴保持住 最后一个锁定的分量比它听起来更重。一致的不对称,正是被读作"真实个体"的东西。真实的脸不是镜像对称的,而且它们是一致地不对称——同样的瑕疵在同样的位置,一镜又一镜。大多数漂移发生,是因为模型去"修复"她:把下巴磨平、把痣移走、把肤色抹匀。这个协议明确地保留她的瑕疵,把它们当作身份特征。不对称不是要清理的噪点。它是她的一部分,而且被钉在卡里。 因为这一切都源自一张 JSON 卡、通过一个技能组装,所以这些锁定自动成立。我不再把十二张图并排盯着看、祈祷它们匹配。系统保证了匹配。整整一周的帖子,显而易见是同一个人——是靠构造保证的,不是靠运气。 可选的音频层 一旦视觉锁定了,你可以用配音和音乐来收尾:测评里用合成人声,生活方式片段下铺一层音乐。这是实实在在的一步,它能让输出更精致。 但要清楚它是什么:它是点缀。换掉声音、换掉配乐,Lila 依然是毋庸置疑的 Lila,因为她的身份从来不住在声音里。它住在数据里。护城河是技能加上卡。别把"收尾"错当成"地基"。 钱到底从哪里来 这里是工程圈跳过、而赚钱圈开场就讲的部分。一个始终如一、按需调用、永远不需要相机、影棚或日薪的创作者,不是一个派对小把戏。它是一家只有一个员工、工资只有一次 API 调用价格的制作公司。有五种方式把它变成收入: 为品牌做 UGC 广告。这是最大头。品牌会为"用户风格"的产品视频付真金白银,通常是每条 75 到 250 美元,而且他们持续不断地需要。你的流水线以接近零的边际成本,在任何一个利基里产出一周份、贴合品牌调性的测评。你在卖一个交付物,而它的成本只是一句话加一次渲染。利润空间就是整门生意。 联盟营销(Affiliate)。她展示工具、护肤、应用、小玩意。简介里放链接,配文里放链接。她"在用"的产品按注册数或销售额给你分成,而且这些视频在你发布之后还会持续地赚很久。 品牌合作与赞助。一旦账号有了粉丝,品牌会直接为植入付钱,跟付给真人创作者一样——只不过你能一夜之间交付整场 campaign,而且从不错过截止日期。 一份花名册,而不是一张脸。把卡分叉成五个演员,各自占据一个利基:护肤、健身、科技、旅行、时尚。现在你不再是一个去给一个品牌提案的创作者。你是一家跑着并行流水线的机构,每一条流水线都在各自的垂直领域里卖 UGC。工厂制造运营者,运营者制造钱。 卖引擎。技能加卡的系统,本身就是一个产品。其他创作者还在重新上传一张 JPEG 然后祈祷。这套能从一行话编译出一个始终如一的演员的配置,是他们愿意掏钱拥有的东西。护城河同时又是库存。 诚实地框定一下:这些没有一样是全自动的,而且最初的那几块钱会晚于最初那几条帖子。你仍然得去给品牌提案、去建立受众、去挑选人们真的会掏钱的利基。但单位经济是任何真人创作者都无法企及的。一个真人 UGC 创作者一次只能拍一条视频。你用一个下午编译出一周的量,而下一条的边际成本是多一句话。这个差距就是全部的机会。 为什么这比到处点击更胜一筹 让我把对比摆得直白一点,因为这就是整个论点。 身份是一个 JSON schema,而不是一张重新上传的图片。一致性变得确定,而不是靠祈祷。同一张卡编译出同一个人,跨重新生成零退化,因为不存在重新解读。你不可能从一个主键上漂移。 一个技能,替换掉一堆工具和它们之间那套手动的跳来跳去。整条流水线可复现、可受版本控制、可分享。不用在标签页之间蹦。不用"等等,这个我是从哪个工具导出来的?" 真实感引擎刻意设计不完美。每个镜头上十个锚点,自动杀死塑料感,不用记、不用手动修。按设计存在的瑕疵,正是杀死那种让人一划而过的"一眼 AI"观感的东西。 一张卡加上一行式 brief,就能生成一整张日历。内容的边际成本坍缩成一句话。一周的帖子就是七行。生产像软件一样规模化,因为它现在就是软件。 技能就是资产。构建一次,永远拥有,从同一个引擎里分叉出一份演员花名册。你不再是一个一个地做网红。你在运营一座制造他们的工厂。你生成的每一个镜头,都让引擎更有价值,而不是更疲惫。 手动运营者有一件事说对了:AI 网红是一个系统,而不是一条神奇的提示词。我们只是对"它是哪种系统"有分歧。他们的是一个清单,一串靠纪律和记忆拼在一起的人工步骤。我的则是一个程序,一份每次都以同样方式执行的规格——无论我是清醒还是精疲力竭,无论是第一个镜头还是第一千个镜头。 手动派还停在第二个视频那里,重新上传参考图、祈祷下巴撑住。你已经有了一个编译器。 清单会腐烂。程序会编译。 开始构建 你不需要我的这套精确配置才能开始。你需要的是那次思维转变。 停止描述你的角色,开始定义她。打开一个文件。写下 JSON 卡:脸、眼睛、精确的肤色十六进制、头发、下巴、刻意的左右不对称、seed。让身份变成数据。 然后把你的生成逻辑包进一个技能里,而不是一段保存下来的提示词。编码那 6 层。烘焙进那 10 个锚点。加上相机配置文件。现在你不再有一段反复粘贴的提示词。你有了一个可以调用的引擎。 喂给它一行。看它编译出一次完整构建。然后喂给它七行,交付一周。 描述她,她就会漂移——每个提示词都是略有不同的一个人,到第二个视频就死掉。用数据定义她,用技能编译她,她就变成了基础设施:一致的、可规模化的、你拥有的、为交付而建的。那些还在往聊天框里重新上传 JPEG 的人,是在做图。你将运营的是基础设施:一个你当作代码拥有的演员、一个在每一帧上都开火的真实感引擎、一张从单一事实来源编译出来的内容日历。 别去"提示"一个 AI 网红。 去"编译"一个。 我正在公开构建 ugc-creator 技能和身份卡系统。评论 "COMPILE",我会把实际的 schema、真实感锚点,以及能把一行话变成一周内容的 brief 发给你。标签:# X # AI # UGC # Claude # 营销 # 增长 # 指南 # 联盟营销 相关文章 如何真正做出高质量外观的 AI UGC(逐步教程)高质量的 AI UGC 不是来自挑选最好的模型。UGC AI 营销 Claude

原文参考:https://maxed.wiki/posts/i-turned-one-ai-influencer-into-a-ugc-factory-here-s-the-build-and-where-the-money-i/ (Maxed.wiki,本页为站内中文整理)