一句话摘要
5 分钟幻灯片成最高转化 TikTok 内容
5 分钟幻灯片格式:我转化率最高的 TikTok 内容 May 20, 2026 · 15 min read · View source ↗ Automation Tiktok Claude Marketing
我运营着一套 TikTok 内容系统,大约每篇 5 分钟就能产出一种特定类型的幻灯片。这是我在自己护肤 App 所运营的账号上转化效果最好的格式,而它之所以能转化的主要原因,几乎没有人谈论:幻灯片太短,完播率始终接近 100%。每个人都能看到 CTA。这才是整个游戏的核心。
下面我会讲我是如何生成它的、我用到的确切 prompt,以及那些让输出看起来像真实女孩的 iPhone、而不是一眼假的 AI 垃圾的关键决策。
为什么这个格式能转化:完播率是唯一重要的指标
长形式的 TikTok 内容有一个隐性成本。帖子越长,在 CTA 幻灯片之前流失的观众就越多。一个 10 张幻灯片的轮播,第 1 张可能获得大量浏览,但只有 200 人看到第 10 张。一个 3 张幻灯片的轮播,第 1 张浏览数相同,而第 3 张的浏览数也大致相同,因为不需要任何耐心就能看到最后。
我正是围绕这个约束来构建的。
→ 总共 3 张幻灯片,绝不超过
→ 第 1 张 = 钩子(一种情绪状态,而非一个主张)
→ 第 2 张 = 对比(同一个人,蜕变后)
→ 第 3 张 = CTA,被包装成故事的回报
当轮播这么短时,你就不再为注意力而竞争,而是开始为冲击力而竞争。每个人都看到了产品。每个人都看到了 streak(连续记录)。每个人都看到了通知。整个漏斗坍缩成一次滑动。
这是大多数自动化指南都忽略的部分。它们优化生产速度,却没有优化真正驱动转化的那个约束:帖子有多少能到达观众面前。短不只是意味着制作成本低。短意味着每个人都能看完。
格式:3 张幻灯片的"分手逆袭"
这条弧线是一段分手演变成一场逆袭(glow-up)。它之所以有效,是因为观众在前半秒内就把自己投射进去了。
→ 第 1 张:一个女孩躺在床上哭泣,严重痤疮,配文 "1 day after he left"(他离开后的第 1 天)
→ 第 2 张:同一个女孩 6 个月后,对镜自拍,皮肤完全干净,配文 "6 months after he left"(他离开后的 6 个月)
→ 第 3 张:一个 iPhone 锁屏,一条来自心动对象回头联系的 WhatsApp,以及一条来自我 App 的通知,显示一条很长的干净皮肤 streak,配文 "9 months later..."(9 个月后……)
文字叠加层("1 day after," "6 months after," "9 months later")是在上传时用 TikTok 原生编辑器输入的,而不是烘焙进图片里。原生文字的阅读效果更好、排名更好,还能让我在同一组图片上 A/B 测试不同的配文,而无需重新生成任何东西。
病毒式传播的机制在第三张幻灯片里:心动对象发来了消息,但从不提护肤。他只是说他现在看她的眼光不同了,说他错了,说他想聊聊。观众必须自己把点连起来:锁屏角落里那条 streak 才是原因。正是这种模糊性让帖子变得可分享。如果心动对象写的是"你的皮肤看起来棒极了",帖子就死了。整个情绪回报在于"到底什么变了?",而答案就静静地坐在那张通知卡片里。
系统
这套流水线是一个端点,大约 5 分钟就能产出完整的一套轮播:
→ Claude Haiku 4.5 只生成当天所需的内容变量:女孩的个人档案、心动对象的私信、streak 数字、配文选项
→ 服务器用代码中的固定模板合成三个图片 prompt,插入这些变量
→ GPT Image 2 渲染三张幻灯片,第 1 张和第 3 张并行,第 2 张链在第 1 张之后,因为它需要第 1 张作为身份参照
最重要的一个架构决策:Claude 不写图片 prompt。图片 prompt 是固定的模板。Claude 只填槽位。
我是吃了亏才明白这一点的。当 Claude 直接生成图片 prompt 时,质量锚点会漂移。"低保真 iPhone HDR"的审美会在几代之后侵蚀成"电影感"或"杂志感"。不对称的痤疮分布会慢慢变成双颊统一的印章。负面清单会变短,因为 Claude 假设剩下的我会处理。
把 prompt 锁定在代码里解决了所有这些问题。Claude 只生成 JSON。服务器把那段 JSON 粘贴进 prompt。审美得以在数百篇帖子中保持不变。
第 1 张幻灯片:最花时间才调对的 prompt
这是承担重活的那个 prompt。它必须产出看起来像一张真实女孩的真实自拍、带着真实痤疮的东西,而不是"一个长痤疮的女孩"的 AI 渲染图。这二者差别巨大。
完整模板,插入了当天的 girl_profile:
有几处值得注意。
痤疮部分是 prompt 里最长的一段,这是刻意的。痤疮是第 1 张幻灯片的情绪锚点。有痤疮的观众需要在其中看到自己。如果模型产出一个"轻度病例",这张幻灯片就失败了。关于不对称分布的约束之所以存在,是因为 AI 图像模型默认会在双颊上以镜像对称的模式盖章痘痘,这立刻就会被读出来是假的。真实的痤疮是不对称的。
"鼻尖上没有痘痘(NO pimple on the tip of the nose)"这一行之所以存在,是因为模型以前大约有三分之一的生成会往鼻尖放一颗。真实的痤疮几乎从不出现在鼻尖(油脂密度低)。加入这一个负面锚点就彻底消灭了那个伪影。
单一暖光源之所以存在,是因为 GPT Image 2 否则会加上手机光、头顶的反射光,以及画面外某处的补光。三个光源会显得"像影棚"。床头灯的一个光源则显得"我凌晨 2 点刚醒"。
第 2 张幻灯片:身份连续性就是一切
第 2 张是同一个女孩,6 个月后。关键点在于:如果你独立于第 1 张生成它,那就是另一个女孩了。模型会给你一张不同的脸、不同的眼睛、不同的骨相。连续性死了,观众立刻就会察觉。
解决办法是把第 2 张作为第 1 张的图像编辑(image-edit)来运行。第 1 张的渲染结果被上传作为参考图,prompt 明确告诉模型要保留什么、改变什么。
有两个具体决策值得解释。
左手姿势从 10 个姿势的池子里随机抽取。这个池子是:拿润唇膏、拿白色咖啡杯、调整鲨鱼夹、调整环形耳环、若有所思地手托下巴、拿一条手巾、双臂抱胸、手搭在台面上、手放在耳后、拿一杯水。
姿势是作为单个明确姿势注入的,而不是作为选项列表。当你给 GPT Image 2 列出多个选项时,它每次都默认用第一个。"Touching her hair"(摸她的头发)以前在 90% 的生成里都会出现,因为它在列表里排第一。每次生成挑一个姿势。直接注入。通过在代码里随机选择来变化,而不是让模型做选择。
针对 "construction, ladder, repair, fixer-upper"(施工、梯子、维修、待修缮)的负面清单之所以存在,是因为 GPT Image 2 大约有 15% 的概率把"一个真实的浴室"理解成"一个正在翻修的浴室"。修好它的那句短语是:"plain white walls"(纯白墙面)+ 明确针对任何施工画面的负面词。
第 3 张幻灯片:锁屏,转化发生的地方
这是回报幻灯片。就是观众把点连起来的那一张。心动对象回来了,App 在屏幕角落,而 streak 是一个从未被问出口的问题的答案。
这个 prompt 用 Claude 生成的 LockscreenData 构建一个 iPhone 锁屏:
卡片的构图规则是我迭代最多的地方。早期版本把通知放得太靠下,贴着屏幕底边。那样就没给上传时添加的 TikTok 叠加文字("9 months later...")留空间了。文字会落在卡片上面,破坏可读性。
解决办法是在 prompt 里写明确的取景规则:通知紧贴在时钟下方开始,占据中间三分之一,底部 25-30% 保留为空白的壁纸。现在文字可以干净地坐在底部的空白区域里。
私信就是整个病毒式传播机制
心动对象发来的私信是整个系统里最难的文字生成。它有 180-250 词。完全用小写,没有撇号(dont, ive, im)。弧线是固定的:一句随意的 hey...、承认沉默了很久、那句 "I saw you differently"(我看你的眼光不同了)、一句包含 "ghosting"(失联)一词的道歉、承认自己"处于一个奇怪的时刻"、一句说明他不期待任何回应的声明,以及一个收尾的问题(can we talk? 我们能谈谈吗?)。
唯一一条硬规则:私信从不提及护肤、App 或痤疮。他不知道是什么变了。这种模糊性就是整个病毒式传播机制。如果他点明了什么变了,帖子就变成了广告。当他不点明时,观众会读到第二张卡片里的 streak,然后自己补上这个连接。
撇号被去掉,是因为 GPT Image 2 偶尔会把小号文字里的撇号渲染成坏字符,而且小写、无撇号读起来比标点正确的散文更像一条真实的私信。小写这个选择来自并排对比渲染结果。标点正确的私信看起来像 AI 输出。小写私信看起来像一个 22 岁的小伙子在自己的手机上打字。
哪些自动化、哪些手动,是刻意的
这套自动化有硬性限制,而且是故意的:
→ 生成是自动化的。一批 5 套轮播大约 5 分钟,15 张图片全部并行渲染。
→ 配文是自动化的。Claude 为每篇生成 3 个选项并挑一个。
→ 话题标签(hashtags)从一个精心维护的池子里抽取,排除已知的"反流量"标签——那些与低于 50 浏览的帖子相关的标签。我根据哪些内容表现不佳,手动更新这个清单。
→ 发布是手动的(草稿)。每套轮播发出前我都会审一遍。TikTok 叠加文字我手动添加,因为用原生方式输入 "9 months later..." 会比烘焙进图片获得更好的算法待遇,而且我想 A/B 那段文字而无需重新生成幻灯片。
手动步骤每篇大约花 2 分钟。自动化步骤大约花 1 分钟的注意力(点生成、等待、从一批里挑最好的)。总计:每篇已发布帖子花 3 分钟的人力。
你也可以纯手工做
先说在前头:你不需要把任何这些自动化就能开始。
如果你一天只发一两篇,直接把上面的 prompt 粘贴进 GPT Image 即可。私信自己写。锁屏 mockup 用任何图片编辑器都行。这个格式有效与否,与图片是怎么做出来的无关。我搭的这套系统,只是让"5 分钟发 5 套轮播"成为可能,而不是"2 小时发 1 套"。
要不要自动化,是一个产量决策,而不是质量决策。手动生成能产出略微更好的图片,因为你可以不断重掷直到每张幻灯片都完全正确。自动化生成能在规模上产出"足够好"的图片,并让你更快地 A/B。两者都行。
如果你想围绕它搭一套系统,我另写了一篇文章,讲我如何把这种克隆工作流变成一条完整流水线——抓取参考、存储有效的东西、从素材库里提议新帖子。那篇讲的是基础设施。这篇讲的是格式。
搭建的简短版本
对于任何想专门复刻这套自动化的人:
→ 一个生成内容变量的模型(Claude Haiku、GPT-4o-mini,你手头有什么用什么)
→ Higgsfield 配 GPT Image 2 做渲染,Nano Banana Pro 也行
→ 三个图片 prompt 模板放在代码里,而不是放在模型 prompt 里,锁死它们,让审美锚点永不漂移
→ 一个女孩变体的池子,作为硬约束注入,这样每篇帖子看起来就不是同一个人
→ 一个并行批量端点,让一批 5 套轮播花 5 分钟而不是 25 分钟
顺序很重要。先把一张幻灯片端到端调对,再搭第二张。先把三张幻灯片在单批量规模上调对,再加批量并行。跳过步骤的话,你会同时调试三样东西,而不是一样。
这给我带来了什么改变
3 张幻灯片格式在我这个账号上测试过的所有格式里表现最好,其中大部分原因是完播率。每一个滑过第 1 张幻灯片的观众都会看到 CTA。锁屏幻灯片承担转化工作,因为当观众处于故事的情绪顶点时,它是屏幕上最后的东西,App 的通知清晰可见。
生产时间从"每篇一个下午"降到了"每批 5 分钟"。但更大的转变是,我不再把内容当成我写的东西,而是开始把它当成我配置的一种格式。钩子是固定的。弧线是固定的。审美是固定的。每天唯一变化的是哪个女孩、哪条私信、哪条 streak。格式承担重活,变化让它保持新鲜。
在我正在做大的这个小账号上,这套轮播每篇能带来数千次浏览,一批 5 篇加起来涨得很快。转化到 App 安装的效果,是我做过的所有东西里最高的,因为 CTA 不是一种打断——它是故事的包袱。
短内容。固定结构。锁定 prompt。其余一切都在代码里处理。
这就是整个系统。
Embedded post:
Author: Adrià Martinez (@adriamatz)
Post ID: 2057074664145322161
Source: https://x.com/adriamatz/status/2057074664145322161
Reply to: none
Text:
> http://x.com/i/article/2057067803249688576
Prompts
PRESERVE FROM IMAGE 1 (identity continuity is critical):
- Exact facial structure
- Hair color: {hair_description}
- Eye color: {eye_color}
- Skin tone: {skin_tone}
- Eyebrow shape, nose, lips, jawline
- Thin gold chain necklace + single hoop earring (the only accessories
that carry across slides)
CHANGE:
- Half-body mirror selfie. iPhone held in right hand at chest level.
- Left hand: {random_pose_from_pool}
- Skin: completely clear, healed, dewy. No acne, no pimples, no PIH marks.
- Hair pulled back in a tortoise/amber claw clip with two face-framing
pieces loose.
- Outfit: white ribbed tank top + light grey sweatpants.
- Expression: natural relaxed smile, calm eyes. NO performance smile,
NO influencer smile.
- Lighting: ONE warm vanity bulb above the mirror.
- Background: a NORMAL bathroom. Plain white walls.
NEGATIVES: construction, ladder, repair, fixer-upper, drop of serum
on cheek, ring light, professional photography, model pose.
An iPhone lockscreen mockup, 9:16 vertical.
WALLPAPER: A sunset over the ocean, blurred bokeh, transitioning from
pink-orange-lavender at the horizon to deep blue at the top.
NO status bar at the top (no carrier, no signal, no wifi, no battery,
no time bar).
CLOCK: Centered in the top 20% of the frame. iOS San Francisco thin font.
- Small date above: {clock_date}
- Large time below: {clock_time}
NOTIFICATIONS: Two notification cards, starting IMMEDIATELY below the
clock (small gap, ~5% frame height), occupying the middle third of the
frame. The bottom 25-30% of the frame must remain empty wallpaper for
overlay text added later.
CARD 1 — WHATSAPP:
- Circular avatar of the crush on the left. Description:
{crush_profile_photo_description}
- Green WhatsApp icon overlapping the bottom-right of the avatar.
- Header row: "WhatsApp" bold, "{crush_name}" lighter, "now" small grey
on the right.
- Body, verbatim: "{crush_dm_text}"
CARD 2 — APP NAME:
- App icon from the reference image attached.
- Header row: "App Name" bold, "1h ago" lighter on the right.
- Body, verbatim: "{appname_notification_body}"
A first-person POV iPhone front-camera selfie of a {age_range} year old
{vibe} girl with {hair_description}, {eye_color} eyes, and {skin_tone} skin.
She is lying on her side on a cream-beige pillow in her bed. Her hand
covers her nose and the lower half of her mouth — knuckles bent, fingers
slightly apart, NOT a closed fist. Both eyes are visible and clearly
red, swollen, and puffy from crying. Real tears running down both cheeks.
SKIN: Moderate-to-severe inflammatory acne, ASYMMETRIC — one side worse
than the other.
- Forehead: 6-10 active pimples (papules + pustules + 1-2 cystic)
- Visible cheek: 4-6 active pimples
- Temple: 2-4 pimples
- Jawline/chin: 2-4 deeper hormonal pimples
- 10-20 PIH (post-inflammatory hyperpigmentation) marks scattered
- NO pimple on the tip of the nose (unrealistic)
LIGHTING: ONE warm yellow-white bedside lamp visible at the top of the
frame. NO phone glow, NO multiple light sources, NO ring light,
NO overhead lighting.
BACKGROUND: A real, messy bedroom. Clothes piled on a chair.
Nightstand with trash and a half-empty drink can. Off-white walls,
slightly grimy. NO studio, NO photoshoot setup.
QUALITY: Real iPhone HDR night photo with light grain. NO 480p,
NO cinematic, NO magazine quality.
NEGATIVES: cool blue lighting, beauty filter, perfectly symmetric face,
doll eyes, TikTok UI elements, status bar, hands holding a phone,
mirror selfie, professional lighting setup, model-like features.
Tags: # X # Automation # Tiktok # Claude # Marketing # Growth # AI
Related articles
how to build a reddit sales system (FULL GUIDE)
set up a hermes agent for me. here's the hermes site: https://nousresearch.com
Reddit Claude Marketing Automation
原文参考:https://maxed.wiki/posts/the-5-minute-slideshow-format-that-became-my-best-converting-tiktok-content/ (Maxed.wiki,本页为站内中文整理)