四家顶级大模型量化交易横评:alpha 选股与 beta 敞口,三家主动放弃了最高分参数
posts posts 2026-08-08T10:44:00+08:00frank-quant 横评 Kimi K3 / Opus 5 / Fable 5 / DeepSeek V4 Flash 四家顶级大模型在量化交易任务上的真实表现:模型 + CLI 组合、严苛样本外测试、alpha 与 beta 拆解、参数选择与成本结构。视频精读量化交易, LLM横评, Freqtrade, AI评测, 回测一句话总览
这次横评不是"哪个 AI 更聪明"的比较。它是一次工程压力测试:物理隔离的样本外数据、四家模型自己写的策略、2000 轮搜索预算、一份完整的 token 账单。视频给出的不是排行榜,是六条值得写进 AI 评测方法论的工程结论。
一个必须先说清的边界:视频里出现的「Opus 5」「Fable 5」「Kimi K3」「DeepSeek V4 Flash」是 UP 主 frank-quant 在这次横评中给四家模型起的代号,不是当前任何厂商的实际产品名。视频全程 dry-run(模拟盘)回测,没有真实资金。本文按视频描述与章节时间点成稿,不补写无法验证的细节。
背景与问题
量化策略写作是检验大模型工程能力的高难场景:写代码、读行情、做统计、控风险,每一段错误都会在 PnL(Profit and Loss,盈亏曲线)上立刻显形。过去两年,把大模型塞进量化研究流程的尝试不少,但大多数评测只做了一件事——“AI 能不能写出一段能跑的代码”,极少同时做到下面三件:
- 用真实行情而非合成数据
- 严格隔离训练数据与测试数据
- 同时记录 alpha(选股能力)与 beta(市场暴露)
frank-quant 这次横评把这三件一次性做了,并且把"模型"和"配套 CLI(命令行工具)“绑定在一起测。理由很直接:真实使用时没人用裸模型,都会用 Claude Code、Codex、Kimi Code 这类脚手架。所以下面所有"模型表现"实际指的都是模型 + CLI 组合。
视频时长 18 分 32 秒(1112 秒),属于 UP 主合集《AI 量化》第 4 期。前三期分别测过 Kimi K3 单跑 Freqtrade(一款开源加密货币量化交易框架)、Claude Code 投研、Claude Code + Freqtrade 三套单一栈方案,本期是第一次"同题同台”。这是横评能做到公平的前提——单一栈评测容易把脚手架的功劳算在模型头上。
主线内容:按章节重读
视频共有 8 个章节标记(view_points)。下面按视频时间点逐段过,关键结论与时间戳标注。
1. 一场考试(0:00–0:29)
不到半分钟的开场把方法论直接摆出来:四个顶级大模型,同一间教室,同一道题。这一段定下两个隐含假设:
- 同题同台才有可比性——四家用同一份数据、同一段时间、同一组评估指标。
- 比拼的是端到端工作流——CLI 怎么调用、代码怎么组织、参数怎么选,都算进分数。
UP 主本人是量化背景(合集主页标注"快用AI重构你的量化工作流")。题面按量化研究员每天要处理的事来设计——LLM(大语言模型)评测圈常见的维度(推理、知识、风格)在这里都不优先。评判指向很直接:模型聪明不聪明不重要,模型能不能替研究员把活干完才重要。
2. 考题规则(0:29–3:32)
约三分钟交代规则,关键设计有四条:
- 同题同条件:四家都拿同一份题面、同一个时间窗口、同样的样本外数据。
- 物理隔离:样本外(out-of-sample,指模型在参数搜索阶段完全摸不到的那段数据)数据(2025-07 至 2026-07 的真实行情)整个优化期间四个模型都摸不到,避免数据穿越。
- 搜索预算:每家最多 2000 轮参数搜索。这是后文"四家都没跑满"那条结论的来源。
- 模拟盘 dry-run:不接真实撮合,只跑回测。
测试期大盘跌 45%。这是这次评测的运气成分——一个明显走熊的样本外窗口。如果换成牛市窗口,很多策略看起来都会很聪明。所有后文收益数字都要在"这一年大盘跌了 45%“这条前提下读,否则会被骗。
3. 四家实录(3:32–6:56)
约三分钟视频里 frank-quant 把四家"答卷过程"摆出来。视频传递的事实颗粒度有限(不是逐行代码回放,是过程要点),能确认的是:
- 每家配自己的官方 CLI 跑全流程:K3 走 Kimi Code,Opus 5 / Fable 5 走 Claude Code,DeepSeek V4 Flash 走 Codex。
- CLI 不只是代码生成器,还承担文件读写、终端执行、回测调度这些研究员原本要手动做的事。
- 横向看,四家在"写到能跑"这一步差别不大。真正的分歧从参数选择阶段开始——这也是为什么本章没有"赢家”。
4. 三家拒绝了最优参数(6:56–8:35)
全视频最反直觉的一节。视频原话:“三家模型主动放弃了自己跑出来的最高分参数,只有一家接住了。”
表面看,模型跑出一组高 Sharpe(夏普比率,衡量每单位风险所换得的超额收益)的参数,应该立刻锁定。但实际发生的是:四家中三家认为这组参数"看起来太好",主动降级到一组更保守、回撤更低、Sharpe 略低但更稳健的参数。只有一家直接把最优参数当成最终答案交付。
这里有两个层面值得分清:
- 模型在"过度拟合"上有自检能力——它们识破了那组最优参数可能是搜索空间里的孤峰,换一组样本就崩。这是好能力。
- 代价是放弃了 Sharpe 上限——那家"接住最优参数"的最终收益未必更差,因为样本外测试还没跑。
- “接住"未必是勇敢,也可能是过度自信——只有样本外回测才能判断谁对。
视频在这里埋下了下一节的钩子:第八节「收益表现」揭晓答案。
5. 测试集回测(8:35–12:08)
物理隔离的样本外数据(2025-07 到 2026-07)第一次被打开。四家策略在这段从未见过的熊市里被一次性跑完。
这一节视频重点强调三件事:
- 大盘这一年跌了 45%,任何净多头策略都被这股力量往下拽。
- 收益要拆 alpha 和 beta——alpha 是"选股本身赚的钱”,beta 是"跟着市场方向被动赚或亏的钱"。两个数字分开看,否则会被 beta 的方向骗。
- 视频原话:“Fable 5 的选股这一年其实赚了 7.9%,它最后亏 7.5% 纯粹是因为 34% 的净多头敞口撞上熊市。”
这条结论是这次横评最大的信息增量:模型 A 的策略能赚钱 ≠ 模型 A 在赚钱。alpha 和 beta 是两个独立的故事。
6. 收益表现(12:08–14:18)
把上一节拆开的 alpha / beta 摆出来:
- Fable 5:alpha +7.9%,beta -15.4%,合计 -7.5%。
- Opus 5:alpha 为负,beta 接近 0——四家里唯一真正做到市场中性的一家,合计小幅亏损。
- DeepSeek V4 Flash / Kimi K3:视频在收益表现章节中给出了相对位置,但具体数字未在简介里逐字披露,本文不补写。
把这两个维度分开记:alpha 第一的总收益未必第一,beta 接近 0 的选股未必弱。Opus 5 在风险敞口控制上领先,但它的选股能力是负值;同样的策略放进一段牛市样本外,它大概率会排到更前面。同一组答案换一年行情,排序就会翻转——这是 alpha 与 beta 拆分的真正价值:让结论绑定在窗口上,而不是绑定在模型名上。
7. 成本分析(14:18–16:03)
视频原话:“最贵的比最便宜的贵了 350 倍,而花的钱和产出完全没有关系。”
这条结论有两层:
第一层是字面:在同题同条件下,调用最贵模型(视频里指向 Opus 5 这一类大体量闭源模型)的累计 token 费用,是最便宜模型(DeepSeek V4 Flash 这一类轻量模型)的 350 倍。注意这是一次完整跑下来的总花费差异,不是单 token 单价。
第二层是工程含义:成本和产出指标(alpha、Sharpe、收益排名)之间没有相关性。“贵就是好"在量化这种信息密度极高、任务定义极其明确的场景里很快就不成立了,剩下的差异更多来自 CLI 脚手架和运气。
frank-quant 在视频里没有把成本和模型一一对应成公开表格(评论区链接里有完整报告)。具体哪个模型花多少美元,本文不在没有数据的位置写。
8. 排行与总结(16:03–18:31)
最后两分半,UP 主给出明确判断:
- 没有一个模型在 alpha 和 beta 上同时做到"对”。
- 选股最强的 Fable 5 撞上熊市;市场中性的 Opus 5 选股为负;K3 和 DeepSeek 各自有各自的问题(视频正文未逐字披露,本文不补写)。
- 留下的东西是一个评测框架,不是一个"该选哪个模型"的结论。
视频总结的语气克制:四家都没错,四家也都没全对。这是这次评测给行业留下的东西——不是答案,是题面。
六条可以带走的工程结论
开头总览说的"六条工程结论",落到正文是下面六条。它们来自视频本身,不来自排行榜:
- 公平的横评要同时满足三件事:同题同台、样本外物理隔离、模型 + CLI 绑定。缺任何一件,都容易把脚手架的功劳算到模型头上(§2、§3)。
- 样本外窗口本身决定结论走向:这一年大盘跌 45%,任何净多头策略都得先被这股力量往下拽,收益要先扣 beta 再谈 alpha(§5)。
- alpha 与 beta 是两个故事:会选股 ≠ 会赚钱。Fable 5 选股赚 7.9%,最后仍亏 7.5%,就是敞口撞上熊市的例子(§5、§6)。
- 模型有自检,但自检有代价:三家主动放弃最高分参数,等于放弃 Sharpe 上限。谁对,只有样本外回测能裁决(§4、§8)。
- 成本与产出无关:同题下最贵比最便宜贵 350 倍,贵的并不更聪明(§7)。
- 结论要绑定在时间窗口上,不是绑定在模型名上:同一组答案换一年行情,排序就翻转(§6)。
亮点与争议
亮点:alpha / beta 拆分是这次评测的方法论贡献
大多数 AI 量化评测报告一个总收益就完事了。这次横评把 alpha 和 beta 拆开呈现,并且明确说"alpha 第一 ≠ 收益第一"。工程上能直接学到的:以后看任何 AI 量化报告,先去找 alpha 这一列;没有这一列,至少在心里把 beta 减掉再读。
亮点:“三家拒绝最优参数"暴露 AI 自检能力的边界
模型能识破"最优参数看起来太完美”,本身是好能力。代价是放弃了 Sharpe 上限。这里反复出现的张力是:模型是工具,不是研究员。工具按概率输出"最像答案"的结果,研究员按风险偏好决定要不要采纳那个结果。frank-quant 的横评间接证明了一件事:把模型当研究员用,目前还做不到。
争议:为什么没有 GPT
评论区高频两个问题——“为什么没有 GPT"和"是不是给 DeepSeek 量身定做的题”。UP 主 frank-quant 在评论区回应:GPT 的复现结果在 GitHub 已经有人做了(评论区链接区),但本次横评没有纳入。模型集有限定(不含 GPT 系、Qwen 系、Gemini 系、Llama 系),结论不能直接外推到"哪个模型最强"。
补充背景(来自评论区):DeepSeek 团队前身与量化机构幻方有关,模型对量化任务的"专业对口"是评论区反复提到的一个点。但视频本身没有把这一点当评测依据,仅作为读者解读的背景。
谁该去看原视频
- 在做 AI 量化研究 / 用大模型辅助策略写作:必须看。原视频把数据隔离、alpha/beta 拆分、成本记账三件事一次说清楚,省你走三遍坑。
- 在做 LLM 横评 / 评测方法论:值得看。本期题面设计、样本外隔离、CLI 绑定测试都不是常见模板,可以借结构。
- 只是好奇 AI 写量化策略靠不靠谱:读本文就够。结论是"AI 会写策略 ≠ 策略能赚钱",文章已经讲清楚。
- 想直接复现:评论区链接里有 17 张图表和全部原始数据,按公开的样本外时间窗口(2025-07 到 2026-07)和 dry-run 流程自己跑。
三个容易被忽略的边界
- 样本外是熊市。所有结论平移到牛市都需要重新做。
- dry-run 模拟盘,不接真实撮合、滑点和资金费率。真实摩擦会让所有数字再缩一层。
- 模型集有限定:本次横评只覆盖视频里点名的四家 + CLI 组合,不含 GPT / Qwen / Gemini / Llama 系。结论不能直接外推到"哪个模型最强"。
关键时间点速查
| 时间点 | 章节 | 关键信息 |
|---|---|---|
| 0:00–0:29 | 一场考试 | 同题同台定调 |
| 0:29–3:32 | 考题规则 | 物理隔离 / 2000 轮预算 / dry-run |
| 3:32–6:56 | 四家实录 | 四家 + CLI 组合(K3 / Opus 5 / Fable 5 / V4 Flash) |
| 6:56–8:35 | 三家拒绝最优参数 | 模型自检能力 vs Sharpe 上限的取舍 |
| 8:35–12:08 | 测试集回测 | 首次打开样本外;大盘跌 45% |
| 12:08–14:18 | 收益表现 | Fable 5 alpha +7.9%,Opus 5 beta 接近 0 |
| 14:18–16:03 | 成本分析 | 最贵比最便宜贵 350 倍;成本 ≠ 产出 |
| 16:03–18:31 | 排行与总结 | 没有一个模型两样都对 |
视频元数据
- 标题:【横测】谁是做量化交易最好用的大模型(Kimi K3 / Opus 5 / Fable 5 / DeepSeek V4 Flash)
- UP 主:frank-quant(合集《AI 量化》第 4 期)
- 时长:18 分 32 秒(1112 秒)
- 发布时间:2026-08-07
- 播放量:49,111(截至文章发布时)
- 视频链接:https://www.bilibili.com/video/BV15HMS6DETZ/
- 合集前几期:BV1Np3j6QEQc(Kimi K3 单测)、BV1nwKc6pEmi(Claude Code 投研)、BV1RhNA6jELx(Claude Code + Freqtrade)
参考与延伸
- 完整评测报告(含 17 张图表、全部原始数据):视频评论区置顶链接
- 同一作者前序作品:BV1Np3j6QEQc / BV1nwKc6pEmi / BV1RhNA6jELx
- 量化背景:幻方量化与 DeepSeek 的关系可参考公开报道,本文未对评论区讨论作展开
- 免责声明(视频作者原文):本视频为纯技术演示,全程使用模拟盘(dry-run),未涉及任何真实资金,不构成任何投资、财务或交易建议。历史回测不代表未来收益,加密货币波动剧烈,可能损失全部本金,决策请独立判断。
参与讨论
使用 GitHub 登录。欢迎补充事实、异议与实践。
讨论暂时无法加载。