增长案例库 Maxed 归档 AI自动化数据与实验

量化交易员如何构建自我进化的交易 Agent(完整框架)

How Quants Build Trading Agents That Improve Themselves (Full Framework)

中文译文 · 5k 字

一句话摘要

量化领域构建自我迭代交易 Agent 的完整框架。

量化交易员如何打造会自我改进的交易 Agent(完整框架) 2026 年 7 月 10 日 · 5 分钟阅读 · 查看原文 ↗ Quant AI 在 2025 年,一个 AI 只用一个循环就打破了保持 56 年的数学纪录:生成、测试、打分、重复。量化交易员把它用在策略上。 我们直奔主题…… 收藏本文 我们是 Horizon 背后的团队,Horizon 是首个 agentic 交易平台:你用大白话描述一个交易策略,几分钟内完成回测,然后实时部署到你的券商。本文拆解了 agentic 策略构建背后的改进循环框架。目前处于封闭测试阶段,将于 7 月 15 日公开发布。前往 horizon.trade 加入候补名单,或私信 @horizon_trade_x 获取早期访问权限。 以下是完整框架: "自我改进"到底意味着什么(以及不意味着什么) 适应度信号:agent 优化的那一个数字 记忆:失败、调查、提炼、咨询 验证器:为什么 agent 从不给自己的成果打分 Horizon 现在在哪里运行这个循环 "自我改进"到底意味着什么 先说说诚实的版本。一个自我改进的 agent 并不会重新训练模型。没有任何生产系统会这么做。模型的权重保持冻结。 真正在复利增长的是模型周围的一切:已测试变体的日志、打分规则、提炼出的经验教训。这个 agent 是一个由三部分组成的反馈循环。生成器提出策略变体。评估器在历史数据上给它们打分。选择器留下赢家并把它们反馈给生成器。 这是老掉牙的机器。进化搜索自 1990 年代以来就被用于量化研究。改变的是生成器:如今 LLM 会用代码和大白话提出变体,而且它们可以连续运行这个循环数小时,而无需人类在每一步手动驱动。2025 年,DeepMind 的 AlphaEvolve 正是用这种"生成—评估—选择"循环找到了更快的矩阵乘法算法,打破了自 1969 年以来保持的纪录。 适应度信号 agent 会改进你打分的任何东西。给原始收益打分,它就会在你数据集里找出最过拟合的曲线。严肃的交易台打分的是一个复合指标:风险调整后收益、回撤、交易次数,以及跨时间窗口的稳定性。 打分规则就是策略本身。下游的一切都只是搜索。 记忆:失败、调查、提炼、咨询 人类研究员会忘记第四轮迭代。一个构建良好的 agent 会让每一次失败都经过四个阶段。 它记录失败的这次回测。它调查这个变体为什么失败:错误的市场环境、交易成本、曲线拟合。它把诊断结果提炼成一条通用规则。而在下一轮运行时,它会去咨询这条规则,而不是从头重新发现那次失败。 这正是大多数自制循环崩掉的地方。没有这个递进过程,agent 会重新提出它已经拒绝过的变体,把算力白白烧在兜圈子上。有了它,每一个被拒绝的变体都会在搜索空间里标记出一片死区,而每一代都从前面各代学到的所有东西出发。 验证器:为什么 agent 从不给自己的成果打分 一个给自己输出打分的 agent 会看到自己的推理过程,并倾向于与它已经构建出来的东西一致的结论。在交易中,这种失败模式是明码标价的:一个记住单一数据集的循环,在图表上看起来像在改进,实盘里却表现得像抛硬币。 修复由两部分组成。打分规则与生成器是分开的,所以提出某个变体的流程永远不会去给它打分。而最终分数来自一个样本外门槛:生成器从未见过的数据。一个变体只有在两个切片上都胜出才能存活。McLean 和 Pontiff 已经证明,已发表策略在数据广为人知之后,通常会损失掉很大一部分优势。你 agent 的训练窗口也是同样的道理。 Horizon 在哪里运行这个循环 生成、回测、打分、选择这个循环是 Horizon 的核心机制。你用大白话描述一个策略。agent 把它构建出来、回测、打分,然后带着 2 到 3 个并排的精炼变体连同它们的分数回来,这样你就可以从改进过的候选中挑选,而不是靠手工调参。 每一次回测都会喂给下一个提案。agent 负责迭代。你负责判断。 交易员在哪里会做错 他们只优化单一指标。agent 找到了历史上最高的 Sharpe,却在实盘第一个月就崩了。复合打分的存在是有原因的。 他们让制造者给自己的成果打分。在样本内数据上自我认可"改进"十代,就是十代的死记硬背。 他们把人类移除了。agent 是一个在策略空间上的搜索引擎。它给候选排序。决定用什么真金白银去部署,始终是人类的决定。 他们把迭代次数和进展混为一谈。用糟糕的适应度信号去打一千个变体,就是朝错误方向走一千步。 感谢阅读。 离开之前 我们是 Horizon 背后的团队,Horizon 是首个 agentic 交易平台:你用大白话描述一个交易策略,几分钟内完成回测,然后实时部署到你的券商。本文的"生成—回测—打分—选择"循环此刻正在产品中运行。目前处于封闭测试阶段,将于 7 月 15 日公开发布。前往 horizon.trade 加入候补名单,或私信 @horizon_trade_x 获取早期访问权限。 链接 horizon.trade 标签:# X # Quant # AI 相关文章 如何在不做交易员的情况下靠 Perp DEX 谋生 ETH 涨 20%?你做多赚 $2k,做空亏 $2k。ETH 跌 20%?正好反过来。净结果:什么都没有。你完全对冲了。这就是"delta neutral"的意思。 Crypto Marketing AI Quant

原文参考:https://maxed.wiki/posts/how-quants-build-trading-agents-that-improve-themselves-full-framework/ (Maxed.wiki,本页为站内中文整理)