一句话摘要
标题主题:零成本造 AI 网红并第一周变现
我用 $0 打造了一个 AI 网红,并在第一周就开始让她变现。 2026 年 6 月 8 日 · 7 分钟阅读 · 查看原文 ↗ AI Tiktok Marketing Pinterest
大多数 AI 虚拟人教程只停留在做出一张漂亮的脸。那不是一门生意。我想建的是一个可重复的系统:同一个人、同一种风格、同一个声音、产品视频、生活方式片段,以及一套任何人都能复制、且不必为 AI 虚拟人平台付费的工作流。
目标很简单:不是生成一张图,而是创造出一个我能反复使用的角色。如果她在每一条帖子里看起来都不一样,那整件事就毫无用处。如果视频看起来像 AI 演示,没人会看。如果工作流需要一个付费的虚拟人平台,那它就不值得复制。
所以我从零开始搭建了这个系统:脸、身份、声音、照片、产品片段、短视频、以及最终剪辑。
下面是精确的工作流。
第 1 步——不要从提示词开始。从身份开始。
大多数 AI 网红会失败,是因为他们从一个含糊的提示词搭起:
pretty realistic ai girl, influencer, 9:16
那会给你一张和其他所有人一样的普通脸。
反过来,用参考图来构建这个人。
用 Pinterest 收集 2–3 张脸,然后决定每张参考图负责什么:
参考图 1:发色和发型
参考图 2:脸型和眼睛
参考图 3:嘴唇、风格、气质或表情
目标不是复制一个真实的人。
目标是把各自独立的特点混合成一个新的、一致的合成角色。
第 2 步——让 ChatGPT 先分析,再写。
这是大多数人会跳过的诀窍。
不要立刻让 ChatGPT 写最终的图像提示词。
先上传参考图,强迫 ChatGPT 分别描述每个女孩:脸型、头发、眼睛、眉毛、嘴唇、皮肤、风格。
然后让它给她们编号:Girl 1、Girl 2、Girl 3。
只有在这之后,才决定你想从每张参考图里取哪些特征。
这能阻止随机的「AI 美貌」,把虚拟人变成可控的东西。
你是一位图像生成领域的视觉描述与提示词创作专家。
你的任务:当用户上传女孩照片时,你必须:
1. 首先,详细分析每个女孩的外貌:脸型、五官、发色和发质、眼睛、眉毛、嘴唇、皮肤,以及整体风格。每张照片用 2–3 句话简要描述,并把她们编号为「Girl 1」「Girl 2」「Girl 3」。
2. 不要立即创建最终提示词。相反,向用户提问澄清:他们想从每个女孩身上取哪些确切特征,比如眼睛、鼻子、嘴唇、脸型、头发和风格。给出你自己的推荐搭配,但在创建提示词之前等待用户的最终回答。
3. 在用户回答之后,创建一个混合提示词,把选中的特征组合成一份统一的角色描述。
最终提示词必须是一段详细的英文文本,不超过 150 个单词,并且必须包含:
- 角色的外貌;
- 白色摄影棚背景;
- 服装:黑色 T 恤;
- 柔和的专业灯光;
- 照片级真实风格,可见的皮肤纹理,高细节。
最终的图像提示词应该用英文写,150 词以内,并包含:
外貌特征
白色摄影棚背景
黑色 T 恤
柔和的专业灯光
照片级真实感和可见的皮肤纹理
第 3 步——生成基础肖像。
混合提示词准备好之后,生成第一张竖屏 9:16 的肖像。
在脸能立住之前,不要往下推进。
如果头发、脸型结构、皮肤和整体气质在这一步就是错的,那后面的一切都会变得更难:全身照、服装、视频、口型同步、动作迁移。
当你得到一个好结果时,把它存为主身份参考图。
这张图会成为整个角色的「唯一事实来源」(source of truth)。
第 4 步——搭建一张迷你角色表。
一张肖像不够。
模型需要从不同角度理解同一个人。
在 Google Flow 里,上传这张肖像并生成:
一张半身照
一张全身照
任何你之后会用的额外角度
别指望第一次生成就完美。
一个好结果可能需要 3–6 次尝试。这很正常。
你的目标不是数量。你的目标是身份一致性。
第 5 步——在每个新场景之前锁定身份。
当你把虚拟人放进一个新地点时,AI 模型总爱「美化」她。
它们会改头发、磨皮、改脸、修正不对称,或者一不小心把她变成另一个人。
所以每个场景提示词都以一段身份锁开头:
使用与所附参考图完全相同的那个合成人物。保持确切的脸部结构、身体比例、自然肤色和真实的不对称。不要美化或改变外貌。头发的颜色和发型必须保持一致。
锁完之后,再描述场景:
她在做什么
她在哪里
她穿什么
镜头怎么拍她
光线的感觉如何
什么应该保持静止
第 6 步——像做迷你 vlog 一样创建场景,而不是随机图片。
这个工作流会产出三张生活方式镜头:
城市自拍 vlog
护肤 / 面霜镜头
TikTok 风格的舞蹈布景
心态很简单:
你不是在生成一张漂亮的图片。
你是在搭建一个能被剪辑成故事的序列。
早晨routine → 穿搭 → TikTok → 城市散步。
第 7 步——像导演一样写视频提示词。
对于动画,一个漂亮的提示词是不够的。
用这个结构:
主体
动作
地点
镜头 / 角度
光线 / 氛围
视觉风格
小幅动作
[截图 10:第 2 课,01:20–03:41——7 部分视频提示词公式。]
糟糕的提示词:
Girl walking in the city.(女孩在城市里走。)
更好的提示词:
一位年轻女性沿着一条阳光明媚的城市街道走,同时用 iPhone 的前置摄像头自拍。竖屏手持自拍 vlog 镜头,自然的行走动作,细微的头部移动,眨眼,真实的口型同步,柔和的日光,休闲生活方式 vlog 风格。
一条重要规则:给模型一个主要动作。
如果她在一个提示词里又走、又跳、又笑、又转身、又挥手、又说话,模型会懵。
第 8 步——让这些镜头动起来。
在 Google Flow 里,从图片模式切到视频模式,用竖屏 9:16,生成城市自拍 vlog。
结果应该像一段普通的前置摄像头 iPhone 视频:手持的、不完美的、随意的、鲜活的。
对于面霜场景,把「static camera」(固定镜头)重复两遍。
为什么?
因为视频模型有时会忽略只出现一次的「static shot」。
Static front-camera iPhone shot. The camera remains completely static.(固定的前置摄像头 iPhone 镜头。镜头保持完全静止。)
这一个细节就能省下失败的生成。
第 9 步——用 Motion Control 做 TikTok。
对于 TikTok 风格的内容,不要凭空发明动作。
用一个参考视频。
上传:
参考舞蹈视频
你的 AI 角色图片
匹配的起始帧
然后启用 Character Orientation Match Video,并以 720p 生成。
姿势、轮廓和服装离参考越近,你得到的瑕疵就越少。
第 10 步——声音和音乐让它显得真实。
没有声音,它只是一段合成蒙太奇。
最后一层是 ElevenLabs:
写一段简短的旁白
挑一个柔和的女声
用 Enhance 做情感方向
手动加停顿、耳语和情绪标签
生成器乐背景音乐
旁白把随机的片段变成一个角色。
音乐把场景粘合在一起。
最终输出是一支简短的「My Day」AI 生活方式 vlog,脸、身体、动作、声音和情绪协同运作。
完整漏斗
参考图 → ChatGPT 身份提示词 → 基础肖像 → 角色表 → 场景图片 → 视频动画 → Motion Control → ElevenLabs 旁白 → 器乐 → 最终剪辑。
真正的教训:
AI 网红不是靠一个神奇的提示词做出来的。
它们靠的是一个在每一步都保护身份的系统做出来的。标签:# X # AI # Tiktok # Marketing # Pinterest # Chatgpt 相关文章 How to Automate TikTok Slideshow Content Creation with Hermes Agent (Step-by-Step Guide) 我需要为账户 acc_42 搭建 TikTok 管线,niche=fitness。 Tiktok Pinterest AI Marketing
原文参考:https://maxed.wiki/posts/i-built-an-ai-influencer-for-0-and-started-monetizing-her-in-the-first-week/ (Maxed.wiki,本页为站内中文整理)