一句话摘要
搭建个人 AI 研究引擎的系统
我是如何构建我的 AI 研究引擎的(完整系统) 2026年7月24日 · 15 分钟阅读 · 查看原文 ↗ AI 营销 Reddit Claude
我要向你展示如何用 Claude Opus 5 构建你自己的 AI 研究引擎——一个 markdown 文件文件夹,它替你阅读 Reddit、Quora、YouTube、GitHub 以及半个互联网,然后交还给你一份按分数排好队的、人们迫切想要的东西清单。
我今年上线的每一篇帖子、每一个产品和每一个 offer,都出自这个文件夹,嗯……几乎都是,但这么说听起来很酷。
读完这篇文章,你将拥有:
一个告诉你的 AI 该去哪里看、什么才算有价值的文件夹
一个评分系统,让你不再靠猜来判断哪个想法值得你花时间
一套每周例程,只需 30 分钟,就能交给你一队想法
一条直通第 1 部分的"内容引擎"的连接,让一个主题进去,8 篇帖子出来
而且这一切你都可以在这个周末搭好。
我们开始吧。
搜索的问题
你想写点东西。你去 Google 搜"content marketing tips 2026"或任何你想找的东西。你得到十篇文章。十篇说的都是同样的四件事。你读了其中三篇,写了一篇听起来像这三篇平均值的帖子,然后纳闷为什么它只得到 400 次浏览。
那不是研究。那是把共识洗了一遍。
Google 是一台用来寻找已经存在的答案的机器。当你想知道怎么修一个 bug,或者某件事发生在哪一年时,这很棒。
但你在这里要找的是一个"缺口"(GAP),而不是一个正确答案。
缺口是这样一个地方:人们明显有一个问题,他们在大声说出来,而还没有人给过他们一个好的答案。那就是帖子爆火的地方。那就是产品被买走的地方。那就是你在你的利基里相对其他所有人拥有真正优势的地方。
而缺口不会出现在搜索结果里。根据定义就是如此。如果有人已经回答了它,它就会成为一篇文章,然后它就会进 Google,然后它就不再是缺口了。
所以你必须去那些"问题先于答案存在"的地方。
一个缺口实际长什么样
让我把它讲具体一点,因为"找缺口"听起来就像某个穿四分之一拉链的 LinkedIn 老哥给的建议。
真实例子的形状:
有人在 subreddit 里发帖:"有没有一个工具就是单纯做 X 的?我试了三个,它们做的都是 Y。"
这个帖子有 240 个赞。
有 60 条评论。
没有一条回答了这个问题。
再读一遍。240 个人说了"是的,我有这个一模一样的问题",60 个人冒了头,却没有一个人能解决它。
那就是一个市场在用它自己的语言、免费地、带着时间戳地告诉你它想要什么。
现在对比一下你在 Google 上会找到的东西。你会找到那三个做 Y 的工具。就是那些已经让这些人失望过的工具。
> Google 展示给你的是"存在什么",信号挖掘展示给你的是"缺了什么"。
一旦你开始看见它,你就再也无法视而不见了。每一个论坛都会变成一张"人们愿意花钱买的东西"的清单。
唯一的问题是,你没法每天读 40 个 subreddit。你有自己的生活。所以你搭一个系统,让它替你读,只把好东西展示给你。
那么什么是研究引擎?
和第 1 部分的内容引擎是同一个思路。它是一个 markdown 文件的文件夹。
有些文件说"去哪里看"。有些说"什么算有价值、什么是垃圾"。有些是你给 AI 的指令。还有一些是结果落地的地方。
你把一个 AI agent 指向这个文件夹,它读取规则、去搜索,然后带回来一份按分数排好的机会清单,而不是一堆链接。
这就是"让 AI 去研究我的利基"和"拥有一个研究引擎"之间的区别。
让 AI 去研究你的利基,你得到的是维基百科式的摘要。每一次都是。因为它不知道你已经知道什么、你关心什么,或者对你来说"有趣"意味着什么。
给它一个把这三者都定义清楚的文件夹,你就会得到一份你昨天还不知道的事情的清单。
可以把它想成:是派一个实习生去"研究一下市场",还是递给他一份清单,明确告诉他该读哪些论坛、一个好的发现长什么样、该忽略什么、以及该怎么写出来。
同一个实习生。完全不同的产出。
结构
以下就是你要构建的东西:
> /research-engine
>
> ├── index.md
>
> ├── sources/
>
> │ ├── reddit.md
>
> │ ├── quora.md
>
> │ ├── x.md
>
> │ ├── youtube.md
>
> │ ├── github.md
>
> │ ├── papers.md
>
> │ └── forums.md
>
> ├── filters/
>
> │ ├── signal-rules.md
>
> │ ├── scoring.md
>
> │ └── kill-list.md
>
> ├── prompts/
>
> │ ├── harvest.md
>
> │ ├── cluster.md
>
> │ └── teardown.md
>
> └── output/
>
> ├── opportunities.md
>
> ├── winners.md
>
> └── log.md
每个文件夹做什么:
sources/ 告诉 agent 该去哪里,以及每个地方擅长什么。Reddit 不是 YouTube,YouTube 也不是 GitHub。每一个都会泄露不同种类的信息。
filters/ 是大脑。这是把真正的信号从噪音里分出来的部分,也是所有人都跳过的部分。别跳过它。一个没有过滤器的研究系统只会让你更快地被淹没。
prompts/ 是可复用的指令。写一次,每周运行一次。
output/ 是发现落地的地方。三个文件:实时队列、对别人已经奏效的东西的存档,以及一份你实际发布过什么的日志。
现在就去建这个文件夹。空文件就行。然后回来,我们再把它们填上。
我看哪里(以及每个地方实际擅长什么)
这是 sources/。每个平台一个文件,每个文件都回答同样三个问题:这个地方擅长什么,我在这里搜什么,一个好的发现长什么样。
reddit.md
互联网上获取原始、不加过滤的抱怨的最佳来源。
人们是匿名的,所以他们说的是真话,而不是客套话。
要找什么:"is there a tool that"、"am I the only one who"、"how do you guys deal with",以及任何有人列出自己试过什么、以及为什么全都糟糕透顶的帖子。
按"本月热门"而不是"历史热门"来排序。历史热门的已经出名了。本月热门的仍然是新鲜的。
金子藏在评论里,而不是帖子里。尤其是那些点赞数比它们所回复的帖子还高的评论。那意味着人群不同意那个框架,意味着那里就坐着一个更好的角度。
quora.md
被低估了,而且所有人都对它视而不见。
Quora 是人们提出那些有点不好意思向同事开口的问题的地方。它不那么技术性、更有人味,而且满是初学者用大白话描述自己困惑的内容。
而这恰恰是你应该用来写钩子的语言。
要找什么:有很多关注者、但答案很弱的问题。Quora 会直接告诉你有多少人在关注一个问题。那是摆在页面上的一个需求计数器。
如果有 900 人在关注一个问题,而最高赞答案是 2019 年的四句话,那不是一个缺口。那是一个陨石坑。
它也很适合用来找普通人真正使用的那些词。开发者说"workflow automation"。真实的人说"我受够了一遍遍复制粘贴同样的东西"。猜猜哪个能做出更好的钩子。
x.md
最适合找速度和此刻正在升温的东西。
要找什么:大号底下那些"ok but how do you actually do this"的回复、表示反对的引用转发,以及任何"回复比帖子本身更有趣"的帖子。
X 不擅长深度,但擅长时机。用它来发现什么正在崛起,然后去 Reddit 或 Quora 找出人们在那下面实际挣扎的是什么。
youtube.md
这张清单上最被忽视的研究来源,而且差距不小。
两个金矿:
你利基里大视频底下的评论。尤其是那些说"4:32 那段你是怎么做的"的评论。那是一个人在告诉你,一段 18 分钟的视频里,他们唯一想要的只有那 20 秒。那本身就是一整块内容。
还有搜索框。输入你的主题,读自动补全。那是聚合起来的真实搜索需求,免费,且不断更新。
还值得看看:高播放量但低订阅数的视频。那意味着是主题带起了它,而不是创作者。主题才是信号。
github.md
只有在你离工具、软件或 AI 很近时才相关,但如果你相关,它就是不可思议的。
要找什么:有很多点赞、但六个月都没有修复的 issue。那是一个已知未解决的问题,后面排着一队等待的人。
还有 trending 仓库。不是为了去写它们的代码。而是为了注意到哪个问题在本周变得足够流行,以至于有人为它做了一个工具。
forums.md
利基的东西。Discord 服务器、Facebook 群组、Slack 社区、行业论坛、Skool 和 Whop 社区,以及 subreddit 周边那些没人索引的地方。
这是你的竞争对手不来看的地方,因为说实话,来这里看很烦人。没有 AI 我也不会去看那里——而这恰恰是它有价值的原因。
什么算作信号
这是 filters/signal-rules.md,它是整个系统里唯一最重要的文件。
其他一切都是管道。而这一部分决定了你的引擎找到的是金子还是垃圾。
一个信号是:
同一个问题被反复地问,而它下面没有好答案
"Is there a tool that does X" 的帖子
某个热门产品底下的抱怨帖
一条点赞数比它所回复的帖子还高的评论
一个有成百上千关注者、但最高赞答案很弱的 Quora 问题
一个有 50+ 点赞、但六个月没有修复的 GitHub issue
一条在特定时间戳问"你是怎么做到那件事的"的 YouTube 评论
任何说"I would pay for this"的人
任何描述自己亲手搭的一个手动变通方案的人。那是一个还没有界面的产品
一篇解决了某个还没有任何产品落地的问题的论文
两个人在争论某件事的正确做法,因为这意味着根本没有公认的正确做法
注意它们的共同点。每一个都是未满足需求的证据。不是兴趣。不是注意力。是"出现又空手而归"的需求。
兴趣是廉价的。所有人对所有东西都感兴趣。挫败感是昂贵的,而人们会花钱去让挫败感停止。
该扔掉什么
这是 filters/kill-list.md,写下它,是让你不至于被淹没的原因。
大多数人的研究问题不是找不到东西。而是他们找到了太多东西,却没有一个有意义的。kill list 解决了这个问题。
忽略:
产品发布和融资新闻。人人都看得到这些。零优势。
任何处在某个 subreddit"历史热门"顶部的东西。已经被五十个人覆盖过了。
没有"我有这个问题"作为支撑的热门观点。观点不是需求。
任何你已经知道的东西。听起来是废话,但感觉像研究的那些东西,有一半只是读一些确认你已有想法的内容。
没有机制的潮流。"AI 正在改变一切"不是信号,是天气。
任何只有那些也在卖它的人在谈论的东西。
超过 6 个月的东西,除非它仍然在收到新评论。
最后一条有一个值得注意的例外。一个带有新评论的旧帖子,是存在的最强信号之一。它意味着这个问题活得比那次讨论更久。
在你开始 harvest(采集)之前,先写下你的 kill list。一旦你已经对某样东西兴奋起来,再想扔掉它就难得多了。
我如何给想法打分
filters/scoring.md
你找到的总会多于你能行动的。永远如此。所以你需要一种不靠感觉来排序的方法。
五件事,每件 1 到 5 分:
痛点:这有多痛?轻微的烦恼——正在实实在在地让他们损失钱或时间。
频率:它多久出现一次?见过一次——到处都是。
金钱:这能连到你卖的什么东西上吗?不能——直接通向你 offer 的一条线。
开放性:答案有多拥挤?存在十篇好文章——几乎什么都不存在。
速度:它是在升温还是在消亡?衰退——此刻正在增长。
18 分及以上进 opportunities.md。做这些。
13 到 17 分进一个"待定"堆。下个月再看,其中一些会开始爬升。
13 分以下直接进 kill list,附上一句为什么。那句话很重要。未来的你会再次遇到同样的想法,需要知道过去的你为什么把它扔了。
这个方法之所以有效,不是因为那些数字精确。它们不精确。而是因为打分迫使你诚实地面对第四列。开放性(Openness)是大多数人对自己撒谎的地方。你找到一个想法,你爱上它,你不去查是不是已经有四十个人做过那个视频了。
聚类
prompts/cluster.md
采集给你一堆,比如一周 40 个信号,但通常 40 个信号是没用的。它是一份你永远不会碰的待办清单。
所以你要聚类。你拿起这一堆问:其中哪些在暗地里是同一个问题?
答案通常是,七条不同的抱怨,其实是同一个问题戴着七顶帽子。
举个例子。你在一周里分别收集到这些:
有人没法让自己的 AI 角色在不同视频里保持一致的样子
有人的品牌帖子在每个平台上听起来都不一样
有人的团队用五种不同的语气写作
有人的 AI 配音每次听起来都像换了个人
有人问怎么让自己的缩略图看起来像一整套
五条不同的帖子,五个不同的平台,五种不同的措辞。
一个问题:规模化的"一致性"。
你没有五个想法。你有一个大想法,而且现在你知道它很大,因为五个不同的人,从五个不同的方向、在没有互相交流的情况下各自到达了它。
那是一条你靠读任何单条帖子都无法得到的信息。这正是 AI 挣自己那份口粮的地方,因为一个人会在五个不同的日子读到这些,却永远无法把它们连起来。
提示词基本上是:这里是 40 个原始信号,按底层问题分组,而不是按主题或平台分组,用人们自己用的词给每组命名,并告诉我每组背后有多少个独立的来源在支持它。
40 个信号进去。6 个真正的主题出来。现在你有了真正能上手的东西。
每周运行一次
每周,同样的四步:
1. HARVEST(采集)
在你的 sources 上运行 harvest.md。所有东西都进一个原始文件。先不评判。边收集边评判会让你错过东西。
2. CLUSTER(聚类)
运行 cluster.md。40 个原始信号变成 6 个带来源计数的命名主题。
3. SCORE(打分)
把每个主题过一遍 scoring.md。任何 18 分以上的进 opportunities.md,并附上原始引述。其他的要么进"待定",要么带着一个理由死掉。
4. ROUTE(路由)
取排在最前的一两个,送进内容引擎。
HARVEST → CLUSTER → SCORE → ROUTE
就这样。这就是整个系统。以上所有内容,只是每一步如何运作的细节。
它接入哪里
这是我最兴奋的部分。
主题来自一份按分数排好的队列,而这队列是基于真实的人这周说自己在为什么而挣扎来构建的。
而且因为机会文件保留了原始引述,你的内容引擎现在会用人们实际使用的语言来写作。他们的话变成你的钩子。那不是一个小的升级,那是文案能转化的大部分原因。
两个文件夹,一台机器:
> research-engine → opportunities.md → index.md → content-engine → 8 篇原生帖子
这条链的真实世界版本:你在周三发现一个缺口,到周四就有八篇平台原生的帖子写出来了,用的正是那些有这个问题的人用来描述它的原话。
没有人能用一次 Google 搜索研究得过这套东西。
如何实际运行它
Claude Code。就这个。四步。
1. 安装 Claude Code,确保你在 Opus 5 上。
2. 打开你的终端,进入这个文件夹:
> cd research-engine
3. 输入 claude,回车。
4. 然后用大白话跟它说:
> 读取 index.md,并在我所有的 sources 上运行 harvest 提示词。
>
> 然后把结果聚类、打分,再把所有东西写进 output/opportunities.md。
就这些。
它读取你的规则、去搜索,然后把结果写回你自己的文件里。你不用复制粘贴任何东西。不用上传任何东西。文件夹自己更新。
一旦它跑通了,把这句话存进一个叫 weekly.md 的文件里,这样下次你只需说"运行 weekly.md",然后去冲咖啡。
每个周日 30 分钟,你就稳了。
===
如果这有用,请点赞和转发,真的很有帮助 ❤️
现在就去建那个文件夹吧 标签:# X # AI # Marketing # Reddit # Claude # Growth # Youtube # Thread # Guide 相关文章 How To Build an AI Content Machine That Never Runs Out of Ideas random inspiration AI Reddit Marketing Claude
原文参考:https://maxed.wiki/posts/how-i-built-my-ai-research-engine-full-system/ (Maxed.wiki,本页为站内中文整理)