跳到正文

目录

四家顶级大模型量化交易横评:alpha 选股与 beta 敞口,三家主动放弃了最高分参数

一句话总览

这次横评不是"哪个 AI 更聪明"的比较。它是一次工程压力测试:物理隔离的样本外数据、四家模型自己写的策略、2000 轮搜索预算、一份完整的 token 账单。视频给出的不是排行榜,是六条值得写进 AI 评测方法论的工程结论。

一个必须先说清的边界:视频里出现的「Opus 5」「Fable 5」「Kimi K3」「DeepSeek V4 Flash」是 UP 主 frank-quant 在这次横评中给四家模型起的代号,不是当前任何厂商的实际产品名。视频全程 dry-run(模拟盘)回测,没有真实资金。本文按视频描述与章节时间点成稿,不补写无法验证的细节。

背景与问题

量化策略写作是检验大模型工程能力的高难场景:写代码、读行情、做统计、控风险,每一段错误都会在 PnL(Profit and Loss,盈亏曲线)上立刻显形。过去两年,把大模型塞进量化研究流程的尝试不少,但大多数评测只做了一件事——“AI 能不能写出一段能跑的代码”,极少同时做到下面三件:

  • 用真实行情而非合成数据
  • 严格隔离训练数据与测试数据
  • 同时记录 alpha(选股能力)与 beta(市场暴露)

frank-quant 这次横评把这三件一次性做了,并且把"模型"和"配套 CLI(命令行工具)“绑定在一起测。理由很直接:真实使用时没人用裸模型,都会用 Claude Code、Codex、Kimi Code 这类脚手架。所以下面所有"模型表现"实际指的都是模型 + CLI 组合

视频时长 18 分 32 秒(1112 秒),属于 UP 主合集《AI 量化》第 4 期。前三期分别测过 Kimi K3 单跑 Freqtrade(一款开源加密货币量化交易框架)、Claude Code 投研、Claude Code + Freqtrade 三套单一栈方案,本期是第一次"同题同台”。这是横评能做到公平的前提——单一栈评测容易把脚手架的功劳算在模型头上。

主线内容:按章节重读

视频共有 8 个章节标记(view_points)。下面按视频时间点逐段过,关键结论与时间戳标注。

1. 一场考试(0:00–0:29)

不到半分钟的开场把方法论直接摆出来:四个顶级大模型,同一间教室,同一道题。这一段定下两个隐含假设:

  • 同题同台才有可比性——四家用同一份数据、同一段时间、同一组评估指标。
  • 比拼的是端到端工作流——CLI 怎么调用、代码怎么组织、参数怎么选,都算进分数。

UP 主本人是量化背景(合集主页标注"快用AI重构你的量化工作流")。题面按量化研究员每天要处理的事来设计——LLM(大语言模型)评测圈常见的维度(推理、知识、风格)在这里都不优先。评判指向很直接:模型聪明不聪明不重要,模型能不能替研究员把活干完才重要。

2. 考题规则(0:29–3:32)

约三分钟交代规则,关键设计有四条:

  1. 同题同条件:四家都拿同一份题面、同一个时间窗口、同样的样本外数据。
  2. 物理隔离:样本外(out-of-sample,指模型在参数搜索阶段完全摸不到的那段数据)数据(2025-07 至 2026-07 的真实行情)整个优化期间四个模型都摸不到,避免数据穿越。
  3. 搜索预算:每家最多 2000 轮参数搜索。这是后文"四家都没跑满"那条结论的来源。
  4. 模拟盘 dry-run:不接真实撮合,只跑回测。

测试期大盘跌 45%。这是这次评测的运气成分——一个明显走熊的样本外窗口。如果换成牛市窗口,很多策略看起来都会很聪明。所有后文收益数字都要在"这一年大盘跌了 45%“这条前提下读,否则会被骗。

3. 四家实录(3:32–6:56)

约三分钟视频里 frank-quant 把四家"答卷过程"摆出来。视频传递的事实颗粒度有限(不是逐行代码回放,是过程要点),能确认的是:

  • 每家配自己的官方 CLI 跑全流程:K3 走 Kimi Code,Opus 5 / Fable 5 走 Claude Code,DeepSeek V4 Flash 走 Codex。
  • CLI 不只是代码生成器,还承担文件读写、终端执行、回测调度这些研究员原本要手动做的事。
  • 横向看,四家在"写到能跑"这一步差别不大。真正的分歧从参数选择阶段开始——这也是为什么本章没有"赢家”。

4. 三家拒绝了最优参数(6:56–8:35)

全视频最反直觉的一节。视频原话:“三家模型主动放弃了自己跑出来的最高分参数,只有一家接住了。”

表面看,模型跑出一组高 Sharpe(夏普比率,衡量每单位风险所换得的超额收益)的参数,应该立刻锁定。但实际发生的是:四家中三家认为这组参数"看起来太好",主动降级到一组更保守、回撤更低、Sharpe 略低但更稳健的参数。只有一家直接把最优参数当成最终答案交付。

这里有两个层面值得分清:

  • 模型在"过度拟合"上有自检能力——它们识破了那组最优参数可能是搜索空间里的孤峰,换一组样本就崩。这是好能力。
  • 代价是放弃了 Sharpe 上限——那家"接住最优参数"的最终收益未必更差,因为样本外测试还没跑。
  • “接住"未必是勇敢,也可能是过度自信——只有样本外回测才能判断谁对。

视频在这里埋下了下一节的钩子:第八节「收益表现」揭晓答案。

5. 测试集回测(8:35–12:08)

物理隔离的样本外数据(2025-07 到 2026-07)第一次被打开。四家策略在这段从未见过的熊市里被一次性跑完。

这一节视频重点强调三件事:

  1. 大盘这一年跌了 45%,任何净多头策略都被这股力量往下拽。
  2. 收益要拆 alpha 和 beta——alpha 是"选股本身赚的钱”,beta 是"跟着市场方向被动赚或亏的钱"。两个数字分开看,否则会被 beta 的方向骗。
  3. 视频原话:“Fable 5 的选股这一年其实赚了 7.9%,它最后亏 7.5% 纯粹是因为 34% 的净多头敞口撞上熊市。”

这条结论是这次横评最大的信息增量:模型 A 的策略能赚钱 ≠ 模型 A 在赚钱。alpha 和 beta 是两个独立的故事。

6. 收益表现(12:08–14:18)

把上一节拆开的 alpha / beta 摆出来:

  • Fable 5:alpha +7.9%,beta -15.4%,合计 -7.5%。
  • Opus 5:alpha 为负,beta 接近 0——四家里唯一真正做到市场中性的一家,合计小幅亏损。
  • DeepSeek V4 Flash / Kimi K3:视频在收益表现章节中给出了相对位置,但具体数字未在简介里逐字披露,本文不补写

把这两个维度分开记:alpha 第一的总收益未必第一,beta 接近 0 的选股未必弱。Opus 5 在风险敞口控制上领先,但它的选股能力是负值;同样的策略放进一段牛市样本外,它大概率会排到更前面。同一组答案换一年行情,排序就会翻转——这是 alpha 与 beta 拆分的真正价值:让结论绑定在窗口上,而不是绑定在模型名上。

7. 成本分析(14:18–16:03)

视频原话:“最贵的比最便宜的贵了 350 倍,而花的钱和产出完全没有关系。”

这条结论有两层:

第一层是字面:在同题同条件下,调用最贵模型(视频里指向 Opus 5 这一类大体量闭源模型)的累计 token 费用,是最便宜模型(DeepSeek V4 Flash 这一类轻量模型)的 350 倍。注意这是一次完整跑下来的总花费差异,不是单 token 单价。

第二层是工程含义:成本和产出指标(alpha、Sharpe、收益排名)之间没有相关性。“贵就是好"在量化这种信息密度极高、任务定义极其明确的场景里很快就不成立了,剩下的差异更多来自 CLI 脚手架和运气。

frank-quant 在视频里没有把成本和模型一一对应成公开表格(评论区链接里有完整报告)。具体哪个模型花多少美元,本文不在没有数据的位置写。

8. 排行与总结(16:03–18:31)

最后两分半,UP 主给出明确判断:

  • 没有一个模型在 alpha 和 beta 上同时做到"对”
  • 选股最强的 Fable 5 撞上熊市;市场中性的 Opus 5 选股为负;K3 和 DeepSeek 各自有各自的问题(视频正文未逐字披露,本文不补写)。
  • 留下的东西是一个评测框架,不是一个"该选哪个模型"的结论。

视频总结的语气克制:四家都没错,四家也都没全对。这是这次评测给行业留下的东西——不是答案,是题面。

六条可以带走的工程结论

开头总览说的"六条工程结论",落到正文是下面六条。它们来自视频本身,不来自排行榜:

  1. 公平的横评要同时满足三件事:同题同台、样本外物理隔离、模型 + CLI 绑定。缺任何一件,都容易把脚手架的功劳算到模型头上(§2、§3)。
  2. 样本外窗口本身决定结论走向:这一年大盘跌 45%,任何净多头策略都得先被这股力量往下拽,收益要先扣 beta 再谈 alpha(§5)。
  3. alpha 与 beta 是两个故事:会选股 ≠ 会赚钱。Fable 5 选股赚 7.9%,最后仍亏 7.5%,就是敞口撞上熊市的例子(§5、§6)。
  4. 模型有自检,但自检有代价:三家主动放弃最高分参数,等于放弃 Sharpe 上限。谁对,只有样本外回测能裁决(§4、§8)。
  5. 成本与产出无关:同题下最贵比最便宜贵 350 倍,贵的并不更聪明(§7)。
  6. 结论要绑定在时间窗口上,不是绑定在模型名上:同一组答案换一年行情,排序就翻转(§6)。

亮点与争议

亮点:alpha / beta 拆分是这次评测的方法论贡献

大多数 AI 量化评测报告一个总收益就完事了。这次横评把 alpha 和 beta 拆开呈现,并且明确说"alpha 第一 ≠ 收益第一"。工程上能直接学到的:以后看任何 AI 量化报告,先去找 alpha 这一列;没有这一列,至少在心里把 beta 减掉再读。

亮点:“三家拒绝最优参数"暴露 AI 自检能力的边界

模型能识破"最优参数看起来太完美”,本身是好能力。代价是放弃了 Sharpe 上限。这里反复出现的张力是:模型是工具,不是研究员。工具按概率输出"最像答案"的结果,研究员按风险偏好决定要不要采纳那个结果。frank-quant 的横评间接证明了一件事:把模型当研究员用,目前还做不到。

争议:为什么没有 GPT

评论区高频两个问题——“为什么没有 GPT"和"是不是给 DeepSeek 量身定做的题”。UP 主 frank-quant 在评论区回应:GPT 的复现结果在 GitHub 已经有人做了(评论区链接区),但本次横评没有纳入。模型集有限定(不含 GPT 系、Qwen 系、Gemini 系、Llama 系),结论不能直接外推到"哪个模型最强"。

补充背景(来自评论区):DeepSeek 团队前身与量化机构幻方有关,模型对量化任务的"专业对口"是评论区反复提到的一个点。但视频本身没有把这一点当评测依据,仅作为读者解读的背景。

谁该去看原视频

  • 在做 AI 量化研究 / 用大模型辅助策略写作:必须看。原视频把数据隔离、alpha/beta 拆分、成本记账三件事一次说清楚,省你走三遍坑。
  • 在做 LLM 横评 / 评测方法论:值得看。本期题面设计、样本外隔离、CLI 绑定测试都不是常见模板,可以借结构。
  • 只是好奇 AI 写量化策略靠不靠谱:读本文就够。结论是"AI 会写策略 ≠ 策略能赚钱",文章已经讲清楚。
  • 想直接复现:评论区链接里有 17 张图表和全部原始数据,按公开的样本外时间窗口(2025-07 到 2026-07)和 dry-run 流程自己跑。

三个容易被忽略的边界

  1. 样本外是熊市。所有结论平移到牛市都需要重新做。
  2. dry-run 模拟盘,不接真实撮合、滑点和资金费率。真实摩擦会让所有数字再缩一层。
  3. 模型集有限定:本次横评只覆盖视频里点名的四家 + CLI 组合,不含 GPT / Qwen / Gemini / Llama 系。结论不能直接外推到"哪个模型最强"。

关键时间点速查

时间点章节关键信息
0:00–0:29一场考试同题同台定调
0:29–3:32考题规则物理隔离 / 2000 轮预算 / dry-run
3:32–6:56四家实录四家 + CLI 组合(K3 / Opus 5 / Fable 5 / V4 Flash)
6:56–8:35三家拒绝最优参数模型自检能力 vs Sharpe 上限的取舍
8:35–12:08测试集回测首次打开样本外;大盘跌 45%
12:08–14:18收益表现Fable 5 alpha +7.9%,Opus 5 beta 接近 0
14:18–16:03成本分析最贵比最便宜贵 350 倍;成本 ≠ 产出
16:03–18:31排行与总结没有一个模型两样都对

视频元数据

  • 标题:【横测】谁是做量化交易最好用的大模型(Kimi K3 / Opus 5 / Fable 5 / DeepSeek V4 Flash)
  • UP 主:frank-quant(合集《AI 量化》第 4 期)
  • 时长:18 分 32 秒(1112 秒)
  • 发布时间:2026-08-07
  • 播放量:49,111(截至文章发布时)
  • 视频链接:https://www.bilibili.com/video/BV15HMS6DETZ/
  • 合集前几期:BV1Np3j6QEQc(Kimi K3 单测)、BV1nwKc6pEmi(Claude Code 投研)、BV1RhNA6jELx(Claude Code + Freqtrade)

参考与延伸

  • 完整评测报告(含 17 张图表、全部原始数据):视频评论区置顶链接
  • 同一作者前序作品:BV1Np3j6QEQc / BV1nwKc6pEmi / BV1RhNA6jELx
  • 量化背景:幻方量化与 DeepSeek 的关系可参考公开报道,本文未对评论区讨论作展开
  • 免责声明(视频作者原文):本视频为纯技术演示,全程使用模拟盘(dry-run),未涉及任何真实资金,不构成任何投资、财务或交易建议。历史回测不代表未来收益,加密货币波动剧烈,可能损失全部本金,决策请独立判断。

参与讨论

使用 GitHub 登录。欢迎补充事实、异议与实践。