打造个人 AI 智能体的 100 条技巧

100 Tips & Tricks for Building Your Personal AI Agent

中文译文 · 25k 字

一句话摘要

100 条搭建个人 AI 智能体的技巧

打造你的个人 AI Agent 的 100 条技巧与窍门 2026年7月25日 · 21 分钟阅读 · 查看原文 ↗ AI 自动化 财务 第一周:100% 在搭建,0% 在工作。今天:20% 搭建,80% 工作。下面每一条规则都来自某样东西先崩过一次。 我跟一个供应商说,他们的利润率跌了 8 个百分点。在电话里。还信心十足。 其实没跌。我的 agent 读的是 8 天前的 CRM 缓存,而且从没想过要提一句这件事。 它没对我撒谎。它只是从没学会说"它自己的信息有多旧"。 每一条规则背后都有一个周二。这是这份清单值得你花时间的唯一原因——没人坐下来推理出这些。它们全是伤疤。 在最底部,你会拿到:个人 Agent 构建套件(The Personal Agent Build Kit)——我真实的宪法模板、我填好的自主权矩阵,以及文件路由表。 > 这 100 条里有 15 条花了我六周中的四周才学到。它们被单独放在最后,按构建顺序。如果你这一期别的什么都不读,也必须读那 15 条,并在你写下一个文件之前应用它们。 旧方式 → 新方式 旧:系统提示词 → 新:解释规则为何存在的宪法 旧:一个巨型记忆文件 → 新:按领域分离、带索引的 markdown 旧:相关时用这个技能 → 新:显式触发短语,而不是"when relevant"子句 旧:凡事都问许可 → 新:映射到可逆性的自主权矩阵 旧:在聊天里纠正它 → 新:每一次纠正都变成一条永久规格规则 旧:希望它保持一致 → 新:钩子强制执行,回归测试验证 分步走查 十三个类别。每个都以催生它的那次失败开头。 地基与身份 崩在哪:它遇到了我系统提示词没覆盖的情况,发明了一条策略,并自信地应用了它。 1. 给它一个名字、一个声音和一个角色。"永远第一人称。直接。数据先于情绪。没有废话。没有结尾总结。"这能在每个会话里杀掉数百个微决策,并给你可审计的一致性。 2. 深深地定义你的委托人。他们怎么做决策?什么让他们抓狂?"想要带打分的多个备选,而不是单一建议。讨厌含糊答案。"这比任何提示词技巧都更能塑造输出。 3. 分别构建一份能力地图(Capability Map)和一份组件地图(Component Map)。能力地图:它能做什么。组件地图:它是怎么被搭起来的。把两者混为一谈,到第三个月就产出一份没人能用的文档。 4. 把 THINK vs. DO 模型建进它的身份里。不确定 → THINK:分析、起草、准备,但别卡在等许可上。明确 → DO。一个瘫痪的 agent 是一个没用的 agent。 记忆系统 5. 用扁平 markdown 文件,而不是数据库。对个人 agent 而言,markdown 胜过向量数据库。可读、可 grep、可 git 追踪、可直接加载。 6. 建一个带 TTL 的 session_hot_context.md。什么在进行中?什么决策悬而未决?会话开始时加载,72 小时后过期。过期的热上下文比没有更糟——它把旧状态当当前状态呈现。 7. 建一个 daily_note.md 作为异步大脑倾倒场。想法、语音转文字、半个点子,一整天往里倒。agent 在同步时把它们路由到各自正确的家。 8. 建一个带置信度的 hypotheses.md。"供应商 X 可能已经满载(65% 置信度)。"一个跨会话持续存在、并随时间被验证的怀疑层。30 天后把它们老化掉,否则它们就变成噪音。 9. 建一个 WAITING_ON_ME 队列。agent 准备好、需要你决策的一切,都打上时间戳。超过 7 天的条目得到一次提醒,超过 30 天自动关闭。 10. 建一个 user_behavioral_profile.md。哪些事你批得快、哪些批得慢?哪些决策你凭直觉、哪些靠分析?agent 用这个来选择"自主行动"还是"升级上报"。它会准得让人不适。 11. 把你的记忆文件夹镜像到云存储。如果你的机器挂了,agent 会丢掉数月积累的知识。Dropbox、Drive、S3——无所谓。这不是备份,这是求生。 知识库 12. 按集群而不是按日期组织知识库。领域文件夹:sales_negotiation/、strategy/、supply_chain/,外加一个 INDEX.md 枢纽。一堆平铺的 PDF 是一个坟场。一个有结构的知识库是活的资源。 13. 每个来源建一个 .brief.md。每本书一页:核心论点、3–5 个关键概念、针对你情境的应用示例。 14. 在引用之前,建一个三问质量闸门。它是否添加了你从第一性原理推不出来的东西?它是重构还是仅仅确认?把它拿掉会不会留下一个缺口?三中二 → 引用。否则保持沉默。 15. 把"静默咨询"当作一种有效输出。你查了知识库、应用了洞见、没有提它。输出更锐利。毕竟你咨询了它,而且因为你没引用它而更干净。 16. 为每个项目和每段关系预接知识栈。每个活跃项目两三个来源,每个关键联系人两三个。当那些上下文活跃时自动加载。 技能架构 17. 把每个技能建成一个带 SKILL.md 规格的目录。不是内联提示词。一个带显式触发、输出和 NOT FOR 子句的文件夹。技能变得可组合、可替换,而不用碰核心身份。 18. 区分技能和 agent。技能是程序性的:定义好的工作流、可预测的输出。agent 有领域专长,并做判断。技能编排;agent 决策。混用它们会产生无法调试的行为。 19. 建一个带使用追踪的技能注册表。名字、触发、用途、上次使用、KPI。季度审计:60 天零使用,意味着要么换更好的触发器,要么弃用。死技能是没有上行、只有维护负担的东西。 20. 为多轮精炼建一个 /iterate 技能。产出(PRODUCE)→ 带分数和缺口的批评(CRITIQUE)→ 精炼(REFINE)→ 重复。到 9/10 或到平台期就停。 21. 把输出强度层级建进每个技能。MINIMAL、STANDARD、FULL。对一个 yes/no 问题写五页分析,是技能设计失败。强度应该匹配问题的分量。 22. 建一个可见的 Outbox 文件夹。深层结构组织得好,但呈现得差。每个输出也复制一份到扁平的 Outbox/。每周清空它。否则你就是在一棵树里导航,去找刚做出来的东西。 多 Agent 与议会 23. 建一个显式的分派矩阵。一张表:请求中的信号 → 该分派的 agent。定价/供应商/物流 → 采购。邮件/客户/管道 → 销售。机械地做模式匹配路由,而不是去推理它。 24. 对自然可拆分的任务跑并行 agent。新供应商分析同时派一个采购 agent 去定价、一个研究 agent 去做尽调。更丰富的输出,相同的耗时。 25. 像对待刚走进来的聪明同事那样给委派的 agent 简报。不是"研究一下这个"。传给它你已知的、你排除过的、它支撑的决策、风险等级。一个被简报过的 agent 和一个一句话 agent 之间的质量差距,一点不细微。 26. 强制 agent 给出一个结论。要求 VERDICT: PROCEED / PAUSE / ESCALATE 并带一个置信度。一个只给数据、没有立场的 agent,把决策又甩回给你,这违背了委派的初衷。 27. 把议会(Council)构造成 3 轮,而不是自由混战。第 1 轮:隔离的并行立场。第 2 轮:交叉质询。第 3 轮:投票,并强制记录异议。异议精确地告诉你,你正在选择忽略什么。 28. 让两个 agent 成为强制锚定投票者。战略家(长周期、二阶效应)和魔鬼代言人(找漏洞)加入每一场议会。五个采购专家达成一致,是一个回音室,不是一个决策。 29. 把魔鬼代言人当作一个独立工具保留。在重要的对外沟通、不可逆决策和大额采购之前跑对抗性审查。它抓"听着对、其实是错的"的能力,胜过任何其他技巧。 30. 给议会一个清晰的触发,并尊重它的成本。清晰领域、可逆的决策用单个 agent。只有在有两条以上有效路径、且有实质不可逆性时才用议会。议会很贵——提供它,别默认它。 31. 在 agent 之间建结构化交接。"分析完成。关键发现:X。风险:Y。你的活:Z。"交接是上下文转移,不只是任务完成。没有它,每个 agent 都冷启动。 32. 有一个兜底 catch-all,并记录它处理了什么。当没有专家匹配时,通用 agent 接手。兜底日志是一张活的图,标出你专家覆盖里的缺口——以及你的开发待办清单。 会话管理 33. 建对称的开始和结束协议。/start-session 加载上下文、检查队列、报告增量。/end-session 保存上下文、同步任务、归档输出。不对称会导致状态漂移,并在数周内复利。 34. 建三层会话收尾。轻量:记录和总结。中等:加记忆同步和任务队列。完整:加每日报告和自动学习(autolearn)。一个昂贵的"结束"会被跳过。分层意味着你总会做点什么。 35. 在 shell 层建一个会话开始钩子。一个注入当前时间、机器身份、星期几、一天时段的脚本。agent 永远知道上下文,而不用你敲出来。一次性设置,每日分红。 36. 在会话开始时检查收件箱增量和红色警报。"自上次会话:4 封新邮件,2 个任务更新了。"外加今天到期的 P0 条目,以及沉默超过 14 天的联系人。自动呈现它——别让用户来问。 37. 在会话开始时检查定时自动化健康状况。夜间任务跑了吗?有报错吗?一个悄然停掉的定时任务,是一种直到某样东西崩了你才会发现的悄然退化。 38. 跨会话追踪纠正次数。同一件事你在不同会话里纠正三次,你就找到了一条规格里缺失的规则。聊天里的纠正会消失。规格里的纠正会留存。 决策权限 39. 让 agent 用证据去赢得扩展的自主权。以零纠正处理某个任务类别 N 次,然后提议把它晋升到更高的自主层级。赢来的自主权比授予的自主权更持久。 40. 为规则冲突建一个委托人层级。根配置 > 技能规格 > agent 指令 > 会话上下文。当技能说"存到 X"而根配置弃用了 X 时,根配置赢。把这个顺序文档化。 41. 为高风险对外沟通建一个发送前闸门。超过某个价值阈值,在发送前走对抗性审查。多一轮往返,抓的是最难从失败中恢复的东西:自信、写得好、但事实上错了。 42. 无条件地记录绝对强制函数。超过阈值的财务承诺、HR 沟通、不可逆删除:永远确认。硬编码它们。它们的全部价值就在于,上下文和紧迫性无法凌驾于它们之上。 > 过半了。如果你一直在略读,这才是真正该读的一节。决策权限,是一个 agent 变得有用、还是变成负担的分水岭。 主动进取 43. 建一个带类型的主动观察系统。把每条未经请求的观察分类:BIZ、OPS、DEV、PAT。"我注意到某件事"是噪音。一条带置信度分数和建议动作的类型化观察,是信号。 44. 把硬性反垃圾规则建进主动层。每次回复最多一条观察,每个会话三条,最低置信度阈值,而且在回答实际问题之前绝不主动冒出来。没有限制,主动就变成烦人。 45. 建一个 /spark 模式,解除所有抑制。在 spark 模式下,每条高置信度观察一次性全部浮出。主动层整周安静地跑着;spark 模式是你有意识地去收割它的方式。 46. 为被搁置的观察建一个想法日志。被抑制的观察写进 ideas_log.md,而不是丢弃。每周回顾——随着上下文变化,有些会变得相关。好想法不该死于坏时机。 47. 把状态触发警报建成规则,而不是 LLM 推断。交易被卡超过 7 天、联系人沉默超过 14 天、假设置信度超 95% 却无行动。这些能可靠地触发,因为它们是规则。LLM 生成洞见;规则生成警报。 48. 让 agent 维护它自己的开发待办清单。反复的纠正、一个手动步骤做了五次、一个缺失的技能、一个零使用的工具——自动加入 development_backlog.md。这每次都胜过自上而下的规划。 VIP 管理 49. 建一个分层联系人登记表,每层带处理规则。T1 战略级:任何互动前加载完整档案、追踪沉默、预接知识栈。T2 运营级:重要互动前加载档案。T3:已知,不深度建档。 50. 把"沟通前加载 VIP 档案"变成一种反射。在任何涉及 T1 联系人的输出之前,加载实际的档案文件——不是会话记忆。档案存着偏好、关系状态、敏感点。会话记忆会退化;文件不会。 51. 为每个 T1 联系人按阈值追踪沉默。记录最后一次有意义的互动。有活跃业务却沉默超 14 天、无业务超 30 天,就浮出来。是 agent 把这些带给你,而不是反过来。 52. 为每段关键关系建知识栈。每个 T1 联系人配两三个关于"如何与他们沟通"的来源。跨文化联系人配文化框架。只为重要沟通加载,不是每条消息。 53. 把主动 VIP 触发器建进会话开始。有没有 T1 在开放交易中沉默超 14 天?有没有 T1 的回复排队超 3 天?高价值关系在你忙的时候退化——而那时恰恰是 agent 该拉线的时候。 输出与沟通 54. 把"工具调用前简短"当作硬规则执行。任何工具调用之前最多一句话。数据之前没有假设,没有三句开场白。"查供应商文件。"然后去查。这份清单上日常体验提升最大的一条。 55. 建一个带反偏差规则的"接下来 N 步"协议。每个决策后给出带打分的排序选项——而且至少两个必须是"不做"、"等等"或"委派"。这积极地对抗行动偏差和谄媚式同意。 56. 为技术输出建一个独立的"单一最佳动作"格式。审计、调试、规划:一个动作、它为何重要、跳过它的风险、复制粘贴的提示词。不是每个输出都需要一个菜单。永远别把这两种格式混在一起。 57. 视觉上区分你的三个重要性信号。动作打分、任务优先级和 VIP 层级,各用各自的视觉语法——方框、圆圈、名字标记。绝不混用。密集的更新就能在几秒内解析。 58. 绝不让 agent 总结它刚做的事。"总结一下,我已经做了 X、Y、Z"——砍掉它。如果你能读输出,你就不需要元评论。回复大约短 20%,信息零损失。 59. 强制给一个建议,而不是一个菜单。推荐一个,给其余的打分,解释为什么。没有建议的选项,把决策又甩回给你。agent 的活是先把决策的功课做完。 60. 让每个文件引用都可点击。一个极小的本地服务器(localhost:7777/open?path=X)在任意路径打开你的文件管理器。纯文本路径是死重。一次性设置,永久改进。 61. 把"极简模式"建成一个词的覆盖。"Quick"、"briefly"、"just the answer"就丢掉所有结构,返回直接答案。丰富是默认。你永远不该为了一个短回复而挣扎。 > 从这里往后的一切,都是把"能用"的 agent 变成"不用盯着"的 agent 的东西。 文件、数据与集成 62. 执行一条"根目录无文件"硬规则。输出进 workspace/YYMMDD/。项目、知识和记忆各有各的家。根目录是导航,不是存储。一个例外,几周内就变成二十个。 63. 为每种文件类型建一张路由表。没有表,agent 就用合理判断——而合理判断会在六个月里为同一种文件类型产出七个不同位置。 64. 维护一张弃用路径映射表。把每次重命名都记录下来:old/path → new/canonical/path。agent 静默替换。这在云到本地的迁移中至关重要,因为旧路径被烤进了几十个技能文件里。 65. 为每个集成都建显式的降级模式。CRM 挂了:24 小时内的缓存可用,但带新鲜度说明;超 24 小时标 STALE;超 7 天拒绝并请求同步。在你需要之前,先设计好失败路径。 66. 给 agent 原始业务数据,而不只是摘要。我给它的原始交易 CSV,200 万+ 行。这把一个摘要器变成了分析师——按供应商、按类别、按季度的利润率,而我这边零查表。 67. 为"这该归到哪?"建一棵决策树。外部对手方且在卖 → 销售交易。在买 → 采购交易。带截止日且多步 → 项目。单个动作 → 任务。没截止日 → 笔记。否则你的数据模型会烂掉。 68. 建一个带来源标记的移动渠道。一个 Telegram bot,把每条入站消息标上来源:mobile。agent 切换输出模式:两个短段落、没有表格、没有标题。同样的智能,不同的配置。 69. 按来源标记而不是判断去封顶移动端自主权。来自 mobile,无论任务如何,自主权硬封顶在 L2。绝不对外发送,绝不采取不可逆动作。手机是一个不可信的环境。 70. 回显每个从移动端触发执行的动作。"已完成:添加了任务 X。为 Y 创建了邮件草稿——未发送,等你在桌面端审阅。"当你看不到完整输出时,这闭合了循环。 71. 把移动端输入当作潜在不可信。一封转发的邮件可以夹带伪装成你输入的指令。agent 读意图,但绝不执行嵌入在转发内容里的指令。这是规则,不是判断。 72. 为每个数据源建一条快路径和一条慢路径。API 查询慢且有速率限制;本地文件转储快且已缓存。默认快,回退慢。绝不让基础设施延迟阻塞核心功能。 自动化与质量 73. 为安全的只读操作建一张允许清单。扫描记录,找出你 100% 批准的操作——读取、搜索、状态检查——并把它们加入允许清单。摩擦应该集中在真正危险的动作周围。 74. 把 AUTOLEARN(自动学习)建进你的日终例程。agent 扫描会话,把结构化学习抽进记忆文件:新事实、假设更新、纠正、模式。每次运行都 git 提交。你的日志变成一条知识时间线。 75. 建无需你也能跑的定时主动任务。每日:P0 扫描、联系人沉默、阻塞点。每周:记忆审计、技能使用审计、假设老化。agent 在你睡觉时干活——但只有你把它设计成这样它才会。 76. 建错误升级阶梯。一次 → 记录。7 天内三次 → 浮出。五次 → 提议一个修复,而不是一条通知。反复出现的错误应该生成工作项,而不是日志条目。 77. 建一个回归测试套件。一个带预期输出的场景清单,在任何重大身份或技能变更后运行。一项它过去能通过的测试失败了,你就找到了一个回归。否则,配置变更就是未经测试的部署。 78. 跑季度系统审计。记忆一致性、路由准确性、注册表同步、定时任务健康、token 效率、命名漂移、权限覆盖。给你的 agent 做代码审查。东西会漂移。 79. 定期用一个不同的模型审计你的 agent。把你的整个配置上传给另一个模型,请它做批判性审查。不同架构,不同盲点。问:"这个 agent 在时间压力下会搞错什么?" 元层与心态 80. 在技能之前先投资宪法。搭更多技能、更多集成很诱人。一份写好的身份与权限文档,对可靠性的作用胜过十个新技能。技能要么在根基上复利,要么完全不复利。 81. 为凌晨 3 点测试而设计。你愿意让这个 agent 在凌晨 3 点未经审阅地发那封邮件、改那个文件吗?愿意 → 自主。不愿意 → 确认。信那个直觉检查,胜过任何框架。 82. 为记忆加载建一个偏向开放的失败倾向。不确定某个文件是否相关?加载它。多余上下文的成本:几个 token。缺失上下文的成本:一个错误答案。这个不对称很明显。 83. 在上手一个新领域时建一个教学胶囊。新工具或新数据源 → agent 写下它是什么、怎么运作、关键概念、示例查询、常见坑,存进 knowledge/。下一个会话就热启动。 84. 当你需要真实文件时,从云迁到本地。云擅长富上下文和快速迭代。本地解锁文件访问、git、钩子、无头定时任务、原始数据。从云开始。撞到天花板时迁移。 85. agent 镜像的是你自己思维的质量。在写任何指令之前,先问你是否确切知道你想要什么。规格含糊,agent 就含糊。规格自相矛盾,行为就自相矛盾。它放大你的思维——它不修复你的思维。 那就是 85 条。真正撑起整件事的那 15 条在最后。 最重要的 15 条 我给你 100 条。如果你只做十五条,就做这些——按这个顺序。清单上其他每一条规则,都是对其中某一条的优化。 1. 写一份宪法,而不是系统提示词。 其余一切都是它的装饰。一列命令,在列完的时候就没有东西可以回退——而它总会列完。原则让 agent 能推理边缘情况,而不是发明一条策略。 2. 把硬规则和行为准则分开。 硬规则永远不被上下文覆盖。准则会适应。混用它们,agent 要么把一切都当可协商的,要么把一切都当不可协商的,而你要到它要紧的时候才发现是哪一种。 3. 定义 agent 不是什么。 "不是摘要器。不是应声机器。不等着被问。"五个否定定义,对抗漂向通用讨好的效果,胜过五十个肯定定义。 4. 在 git 里给身份文件做版本管理。 当行为漂移时,你需要对配置做 git blame。回归追溯到具体编辑的频率,远比你预想的高。没有历史,调试身份漂移就变成考古。 5. 按领域而不是按日期分离记忆。 entities_people.md、entities_deals.md、hypotheses.md、task_queue.md。一个文件,一个领域。按时间顺序的倾倒,第二周就变得不可搜索。 6. 建一个 MEMORY.md 索引。 一个索引,列出每个记忆文件并带一行描述。agent 先加载索引,再按需拉取具体文件。这正是记忆增长时让上下文用量可预测的东西。 7. 明确区分缓存和事实来源。 你本地的 deals.md 是缓存。CRM 才是真相。给每个缓存文件标上 last_sync: 头,无一例外。 8. 在输出里总是声明数据新鲜度。 "数据:CRM 导出,来自 5 月 11 日,距今 8 天。"每份用到外部数据的输出都加一行。这就是那条本可以让我免于 8% 利润率电话的规则。 9. 把显式触发短语写进每个技能。 推断是你一周跑一百次的抛硬币;短语匹配每次都可靠触发。绝不把激活留给模型的判断。 10. 把 NOT FOR 子句写进每个技能。 "NOT FOR:定价决策。NOT FOR:法律分析。"这阻止了技能蔓延——那种一切都被路由到错误技能、因为它表面模式匹配的缓慢漂移。 11. 建一个显式的自主层级矩阵。 L0 读。L1 写本地。L2 任务和日历。L3 对外消息。L4 财务。agent 确切知道它能在无监督下做什么。没有这个,你要么得到许可轰炸,要么得到不愉快的意外——通常是两者都有。 12. 把每个动作映射到可逆性,而不是风险。 不可逆动作需要确认。可逆动作需要可见性,而不是批准。用风险来校准,正是让自主权在"没用"和"危险"之间震荡的原因。 13. 默认"THINK,别问"。 "我该起草这个吗?"浪费一个往返。起草它、展示它,然后再问发送的事。无论哪种方式,活儿都做完了。这是 agent 日常共事体验里最大的单一变化。 14. 任何必须保持一致的东西,用钩子。 运行时执行钩子。LLM 不执行。记忆可以建议;钩子强制执行。如果某件事必须每一次都可靠地发生,它就不该待在提示词里。 15. 把每一次纠正当作规格债务。 在聊天里纠正它,它今晚就消失。在规格里纠正它,它永远留存。同一件事纠正三次,意味着你找到了一条缺失的规则,而不是一个倔强的 agent。 免费礼物交付 个人 Agent 构建套件(The Personal Agent Build Kit) 把它复制到你自己的 Notion,按构建顺序而不是数字顺序过一遍。第 1 周是四个文件加一个下午。 点这里拿你的礼物 我在我的通讯里写我最棒的、独家的 AI 内容,加入即可在你的收件箱里拿到关于如何搭建你的专用 agent 的完整指南。 关注 @humzaakhalid 获取更多 AI 内容。 附:这 100 条里,你已经栽过哪几条?回复那条咬你最狠的。我在为未来一期收集失败故事,而你的可能恰好是那个能帮别人省下六周的故事。 Hamza_ 💙 标签:# X # AI # 自动化 # 财务 # 线程 # 指南 相关文章 无聊利基里的无脸页面在赚离谱的钱。这些利基没人愿意谈,因为它们听起来太无聊,不像真的。营销 财务 自动化 AI

原文参考:https://maxed.wiki/posts/100-tips-tricks-for-building-your-personal-ai-agent/ (Maxed.wiki,本页为站内中文整理)