研读 / Quantocracy 2026 · 快照 2026-09-07

年度研究目录与分层解读

合计 386 条目录:374 条 Quantocracy 收录,12 篇补充研究;302 篇有导读。目录覆盖不等于正文读完。无账号、无脚本也可离线阅读;浏览器查找可全文搜索,打印可保存 PDF。

打开可筛选的在线研究看板 ↗

推荐分 = 问题价值 30 + 证据 30 + 方法 25 + 复现 15;未评价用“待评”,分数不是正确概率、投资评级或收益预测。

全年目录(收录日期降序)

按 Quantocracy 收录日纳入;补充论文置后。不含可转债主题。
日期 / 来源文章阅读状态推荐
2026-09-06
Investment Idiocy
Carver 新书把仓位、成本和交易管理放到台前;它是培训线索,不是新策略论文
回测与研究方法
导读完成57
2026-09-06
Dead Signals Lab
夏普从 0.63 归零:先修复历史成分名单,才有资格讨论股票信号
数据与信息处理
导读完成88
2026-09-06
Quanter Lab
财报后漂移:9.6 个百分点的组间优势,调整市场敞口后只剩 0.1
信号与收益预测
导读完成88
2026-09-06
Quantpedia
100 个 AI 投资人格年化 29.5%,却与一个普通提示的选股重合 92%
AI / 大模型基础能力
导读完成85
2026-09-06
Quanter Lab
PEAD 平均年收益从 −0.5% 变 +2.2%:入场日期变了,实际上连组合定义也变了
策略与交易
导读完成88
2026-09-06
Quantish
AI 研究系统的核心不是多跑回测,而是阻止错误结果进入决策
回测与研究方法
导读完成83
2026-09-06
Macrosynergy
黄金宏观支持分数在1996—2026年预测下一季度金价的相关性超过25%,但单一黄金合约的策略Sharpe只有0.5
信号与收益预测
导读完成81
2026-09-06
Alpha Architect
股价能帮忙估计经济,但不是因此就能预测股价
宏观与资产配置
导读完成78
2026-09-03
Spatium Novum
基准相关 99.44%,仍能凭空制造 0.66% 的 Alpha
回测与研究方法
导读完成92
2026-09-03
Strat Proof
十币周频动量只有 0.37 夏普;但这次“复现失败”本身也有成本和口径问题
策略与交易
导读完成69
2026-09-03
Vertox Quant
EigenScore 是量化编程练习场,不是用 Elo 证明投资能力的研究论文
回测与研究方法
导读完成54
2026-09-03
Quanter Lab
Dalio“15条独立收益流”在可交易ETF架上只剩3.3个有效赌注:三基金ERC年化8.00%,十五基金仅3.78%
组合与风险
导读完成90
2026-09-02
Paper to Profit
隔夜轮动号称每年翻倍;90 日选股并不自动消除筛选偏差和开收盘成交风险
策略与交易
导读完成64
2026-09-02
Jonathan Kinlay
纯噪声也能被 AI 做出 2.12 夏普:不仅要记录试了多少,还要记录拼了多少
回测与研究方法
导读完成93
2026-09-02
Quanter Lab
真正的All Weather在扣融资后落后60/40:毛收益只多0.11个百分点,0.93个百分点的借款成本把年化变成7.02%
组合与风险
导读完成91
2026-09-02
Aligrithm
股债相关从正转负确实改变风险,但“负相关拖累收益”是需要纠正的叙述
组合与风险
导读完成74
2026-09-02
Jan Heger
总结果过关,年份与排名却露馅:别让自动判决替你停止思考
回测与研究方法
导读完成74
2026-09-02
Aligrithm
比特币高波动会延续,但 96% 的状态留存里藏着滚动窗口重叠
组合与风险
导读完成75
2026-08-31
Allocate Smartly
月度 TAA 改成每日全仓调仓:毛收益没改善,额外成本却超过每年 2%
组合与风险
导读完成81
2026-08-31
Michael Emre Tulum
土耳其双动量实际赚11.7%,但择时增量还没证明
动量与趋势
导读完成91
2026-08-31
Alpha Architect
GPT 新闻情绪仍有漂移收益,但最赚钱的部分也最难交易
AI与大模型
导读完成84
2026-08-29
Quantpedia
Boundary 不是“贵了就卖”:它判断的是趋势在估值极端处是否更容易反转
信号与收益预测
导读完成88
2026-08-29
Trading the Breaking
Podcast:从市场问题到量化交易系统
量化研究工程流程、市场低效来源与稳健性检验
导读完成75
2026-08-27
Quanter Lab
魔法公式拆开后,质量腿反而胜出:S&P 500 口径下20个逐年样本外窗口,ROIC单因子年化11.73%,比等权双因子高2.18个百分点
信号与收益预测
导读完成86
2026-08-27
Equibles
复制国会议员交易没有alpha:17,859个披露事件中,买入一年相对SPY中位数-5.36%,买卖差仅1.13个百分点且不显著
信号与收益预测
导读完成94
2026-08-27
Aligrithm
加密微观结构预测,可能只是波动率换了名字
回测与研究方法
导读完成86
2026-08-26
Spatium Novum
优化需要五百年?真正的问题是把估计误差当成事实
组合构建
导读完成92
2026-08-25
Aligrithm
外汇预测该看邻近市场,但三种时钟不能混成一条策略
宏观与资产配置
导读完成79
2026-08-25
Quant Insti
可公开交易的Form 4买入信号只在披露后1—5日显著:7,405个事件1日+0.534%、5日+1.009%,21—63日漂移无法确认
信号与收益预测
导读完成97
2026-08-24
Quanter Lab
Keller的单只金丝雀门槛在2022年保住回撤,却在复苏期长期错过风险资产:把阈值从1只调到2只后,17个样本外年度年化由5.49%升至9.01%
组合与风险
导读完成90
2026-08-24
Portfolio Optimizer
Sharpe 相同,不代表每一段时间都赚得一样稳
回测与研究方法
导读完成82
2026-08-23
Beyond Passive
150年跨国证据:起始名义长债收益率几乎决定未来十年名义回报,却对真实回报没有保护;通胀超过约6—8%后真实债券收益转负
组合与风险
导读完成83
2026-08-23
Aligrithm
一万两千个特征的优势,可能来自截距和 Sharpe 算法
AI与大模型
导读完成87
2026-08-22
Quanter Lab
行业轮动在19个样本外年度比九行业等权高1.37个百分点年化,但它同时改了26处设置,不能把收益全部归因于“regime”
组合与风险
导读完成84
2026-08-22
Macrosynergy
Wealth management with macro factors
用点时宏观因子进行跨资产财富配置
导读完成83
2026-08-20
TradeQuantiX
动量股只在回撤15%后买入,单策略指标不如追高版,却提供不同的入场时间与股票池;作者只给出机制证据,未公布完整回测表
策略与交易
导读完成54
2026-08-20
Jan Heger
赢过 80 个随机价位仍不够:两跳滑点让 PF 从 1.34 缩到 1.07
回测与研究方法
导读完成79
2026-08-20
Aligrithm
优化器跑完还很分散,不代表已经找到稳健参数区
回测与研究方法
导读完成86
2026-08-19
Aligrithm
先有理论也要记搜索账,方法论文章本身也得过检验
回测与研究方法
导读完成71
2026-08-18
Quantpedia
行业动量并非整月有效:月初第1日做多赢家有效、随后第2—3日应反转,三段拼接后长短年化5.99%、Sharpe 0.55
策略与交易
导读完成79
2026-08-16
Jonathan Kinlay
AI 因子确实拥挤,但不能因此断定是模型权重造成的
回测与研究方法
导读完成86
2026-08-16
Aligrithm
同样月涨幅,先涨后跌与先跌后涨不是同一因子
选股与因子
导读完成87
2026-08-15
Aligrithm
黄金比特币轮动年化80%的背后,是选窗和高波动
动量与趋势
导读完成84
2026-08-15
Alpha Architect
VIX 加速动量只在单选 ETF 上赢了,选两只就没了
动量与趋势
导读完成84
2026-08-15
Aligrithm
A股因子择时没赢等权,不代表所有条件配置都无效
选股与因子
导读完成83
2026-08-15
Krzysztof Ozimek
夏普估计不一定是钟形曲线;但拟合 5,000 次重抽样不等于拥有 5,000 份市场证据
回测与研究方法
导读完成63
2026-08-15
Relative Value Arbitrage
预测市场会动多大,比预测涨跌更容易;但“趋势”标签可能只是幅度标签
组合与风险
导读完成68
2026-08-12
Aligrithm
三篇机器学习交易论文都被自己的数字击穿:98.7%准确率可能不如‘什么都不报’,而且没有成本模型就没有交易结论
AI / 大模型基础能力
导读完成95
2026-08-12
Jan Heger
分批止盈让盈利变亏损?这篇案例最大的疑点是只改赢家、不重放路径
策略与交易
导读完成58
2026-08-12
Morgue Labs
议员 ETF 跑赢 SPY 近 13 点,扣掉更高 Beta 后 Alpha 却接近零
组合与风险
导读完成80
2026-08-12
Concretum Group
CTA ETF不必因只做大市场就失效:控制大类风险预算后,容量加权趋势Sharpe 0.71,几乎追平全市场等权的0.69
组合与风险
导读完成88
2026-08-11
Morgue Labs
长期买虚值期权会付出波动溢价,但“月亏 68%”不能代替真实期权链检验
策略与交易
导读完成57
2026-08-11
Tommi Johnsen
新闻正负组次日差 0.45%,但只有三篇以上报道的公司日才出现
数据与信息处理
导读完成81
2026-08-11
Aligrithm
30个品种、5个日滞后时,全条件Granger要塞149个控制变量而失明;PCMCI用父节点筛选把检验能力从约40%恢复到80%以上
数据与信息处理
导读完成90
2026-08-11
Alex Chinco
若把股价当作长期现金流现值,市场隐含的贴现率减增长率年际波动只有约±20bp;而国债利率本身常动±50bp——“精确”到令人不可信,说明不能把平滑估值比直接当预期收益率
估值与资产定价
导读完成76
2026-08-09
Beyond Passive
长期股票回报不是“约7%”:16国共同1900—2020样本从美国实际年化+6.7%到葡萄牙-0.3%,11国出现过亏损的30年窗口
组合与风险
导读完成85
2026-08-09
Aligrithm
OHLC成本模型在稀疏交易资产上会把真实1.00%有效价差估成0.04%;EDGE用离散成交修正后在160万股票月中相关性78.9%
回测与研究方法
导读完成97
2026-08-09
Macrosynergy
Bond indices and systematic duration management
用宏观信号管理全球政府债指数久期
导读完成85
2026-08-09
Krzysztof Ozimek
策略 B 是否优于 A,要看收益分布;但事后市场状态不是可提前下单的信号
回测与研究方法
导读完成77
2026-08-09
Alpha Architect
Skewness as a Hidden Driver of Anomaly Returns
偏度管理对股票异象收益的影响
导读完成76
2026-08-06
Allocate Smartly
通胀罗盘押注单一行业:最重要的不是高收益,而是 TIPS 信号究竟代表什么
组合与风险
导读完成78
2026-08-06
Quantt
均值回归筛选别只看 p 值:教程的半衰期代码也需修正
回测与研究方法
导读完成74
2026-08-06
Aligrithm
机器学习在金融里的复杂度税并不会靠更炫的模型消失:200根bar从5个参数扩到40个,OLS方差项由0.025升至0.20;搜1000个模型、仅500个独立样本时,泛化误差上界约0.20
机器学习与AI
导读完成87
2026-08-06
Quantt
OU 给你回复速度,不会自动给你一条套利策略
回测与研究方法
导读完成79
2026-08-05
Jan Heger
触及整数位概率多 14.7 个百分点,为什么还不是能赚钱的交易?
回测与研究方法
导读完成74
2026-08-04
Aligrithm
947个MNQ交易日、14类五分钟OHLCV信号,没有一类在2点成本后通过样本外、交易数与年度稳定性五道门
回测与研究方法
导读完成91
2026-08-04
Paper to Profit
五资产月度轮动规则很简单;12.5 万次搜索才是 11% 年化背后的关键成本
组合与风险
导读完成66
2026-08-03
Quantitativo
Quantitativo weekly #4
行业内选股、拥挤异常、风格投资、市场状态轮动、因子与行业配置
导读完成79
2026-08-03
The Refutation
Supertrend 一小时亏 92.9%:换成四小时赚钱,也不等于入场信号有效
策略与交易
导读完成74
2026-08-03
Quantifiable Edges
六七月连跌后,13 次九月有 11 次下跌;小样本季节性不是 85% 的预测概率
信号与收益预测
导读完成55
2026-08-02
Vertox Quant
给波动预测加 90% 区间很有用,但示例代码把测试段用于早停了
AI / 大模型基础能力
导读完成86
2026-08-02
Relative Value Arbitrage
把动量加入期权模型之前,先分清预测真实收益与无套利定价
组合与风险
导读完成63
2026-07-31
Jan Heger
58.4% 胜率通过四道检验,却死在限价单成交规则上
回测与研究方法
导读完成86
2026-07-31
Aligrithm
LAFO 的贡献是定义价格滤波目标,不是证明夏普 11 的反转策略
信号与收益预测
导读完成76
2026-07-31
The Refutation
50/100 均线带的 55 种交易版本:视觉上的趋势,未能跨过手续费
策略与交易
导读完成75
2026-07-30
Aligrithm
比特币“美股隔夜收益”预测 VIX:关键是时间切分,而不是币价全天涨跌
信号与收益预测
导读完成81
2026-07-29
Paper to Profit
先换采样时钟再换指标:2,021种新K线的胜出者,仍缺公开公式
数据与信息处理
导读完成67
2026-07-29
Delphic Alpha
路径签名的4.4夏普值得追踪,但“加速度”解释在代数上站不住脚
信号与收益预测
导读完成66
2026-07-29
Quantpedia
短趋势衰退并非一刀切:最小报价单位相对波动,可能比资产类别更重要
策略与交易
导读完成87
2026-07-29
Concretum Group
宏观事件日历真正有用的是时点骨架,不是“事件越多越赚钱”
数据与信息处理
导读完成83
2026-07-29
Rulyfi
同一根 K 线先止盈还是先止损:82.54% 的乐观盈利配置过不了压力测试
回测与研究方法
导读完成89
2026-07-29
Aligrithm
用标普超卖信号择时空波动率,比反过来读 VIX 更有用吗?
策略与交易
导读完成73
2026-07-29
Concretum Group
低波动不是低回撤:26%长期年化背后,还有超过50%的历史损失
组合与风险
导读完成74
2026-07-29
Trading the Breaking
Why I stopped trying to predict the market
放弃长期市场预测,转向结构性强制交易研究
导读完成76
2026-07-27
CSS Analytics
月末四象限只持一个ETF:2003—2026作者报CAGR23.5%、Sharpe1.41、月频回撤−16.2%,但日频实际波动约19%、回撤−23.6%,且走步参数选择Sharpe降至0.902甚至0.668
组合与风险
导读完成87
2026-07-27
Handelsmeisterei
Crafting a Trading Strategy
从第一性原理构建自适应趋势期货策略
导读完成86
2026-07-27
Portfolio Optimizer
经理—散户股票仓位差做月度配仓:年化9.19%低于SPY的11.31%,但波动8.92%对15.31%、月度回撤13.3%对50.8%;优势主要是少持股票而非已证明的择时alpha
组合与风险
导读完成75
2026-07-27
Krzysztof Ozimek
不要只给策略一个分数,但“熊市机器学习更好”在这里是事后解释,不是择时模型
回测与研究方法
导读完成82
2026-07-25
Quantitativo
网络动量最初回测的2.12毛夏普,删去12个异时区期货后降至0.97,且低于同期个体动量1.07:看似+1.0 Sharpe的网络溢价主要是收盘时点前视
策略与交易
导读完成95
2026-07-25
Aligrithm
直接学排序能改善选篮子,但3.40夏普降到0.54不能全怪交易成本
信号与收益预测
导读完成77
2026-07-25
Beyond Passive
给炼油策略加 Carry,价值不只分散:小账户更需要一个不爱交易的信号
组合与风险
导读完成83
2026-07-25
Macrosynergy
Portfolio optimization with macro factors and neural networks
宏观因子与神经网络的行业组合优化
导读完成85
2026-07-25
Capital Spectator
研究综述|2026年7月24日|策略分析
CAPE修正、动量持续性、宏观周期因子与美联储通胀反应定价
导读完成82
2026-07-23
Rulyfi
先改入场还是出场?胜率看止盈止损,样本外表现却主要取决于两者配合
回测与研究方法
导读完成85
2026-07-23
Quantpedia
35国、8万余股票、1994—2024:把ML预测目标从原始收益换成截面rank,月度alpha约1.0%升至1.9%;但小盘/高偏度环境反而应保留幅度信息
机器学习与AI
导读完成92
2026-07-23
Relative Value Arbitrage
HFT 的影响不是单向的:一次交易所基础设施故障显示,低延迟交易被临时阻断后,成交量和笔数只小幅变化,但流动性显著变差、波动中度上升;另一篇公司层面研究则发现算法交易强度更高与未来个股崩盘风险更高相关
市场微观结构
导读完成59
2026-07-21
Paper to Profit
3.275 Sharpe的FX混沌策略更像一个待审计的研究原型:10年1分钟数据、网格搜Theta、两次重训后样本外仍需独立复现
策略与交易
导读完成70
2026-07-21
Aligrithm
弱信号需要强收缩,但“Lasso永远输给零”是把渐近理论说过头了
回测与研究方法
导读完成84
2026-07-21
Delphic Alpha
期货0.73、股票0.42:这不是所有市场公平擂台,而是样本内冠军扫描
策略与交易
导读完成71
2026-07-21
Flash Alpha
193 个 SPY 周三并不足以证明 0DTE“稳定贵13%”:分布假设和尾部更重要
组合与风险
导读完成73
2026-07-21
The Refutation
RSI 70/30 是价格状态标签,不能自动变成反转预测
信号与收益预测
导读完成75
2026-07-21
Quantitativo
周览#3:平滑器让年化5.6%变15.9%,但对等权基准优势仅边际显著
回测与研究方法
导读完成70
2026-07-21
The Refutation
MACD 看起来有效,可能是旁边的趋势过滤器在赚钱
回测与研究方法
导读完成80
2026-07-18
Allocate Smartly
融资余额创新高不等于卖点:醒目的历史图,只有三个已完成事件
回测与研究方法
导读完成75
2026-07-18
Concretum Group
因子动量的价值,是旧因子不再齐涨后少买失效者
组合与风险
导读完成84
2026-07-18
Aligrithm
0.85进、0.55出是教学算例:真正贡献是把进出场阈值拆开
策略与交易
导读完成75
2026-07-18
Beyond Passive
同一炼油策略,100 万美元净夏普 1.25,1 万美元却 −1.3:最低佣金改变执行方式
策略与交易
导读完成81
2026-07-18
Alpha Architect
Two Accounting Anomalies: One May Be Risk, the Other Is Mispricing
应计异常与业绩公告后漂移的风险/错定价解释
导读完成86
2026-07-16
Aligrithm
CryptoMamba的262美元终值,首先要和同一年的买入持有比较
AI / 大模型基础能力
导读完成72
2026-07-16
Trading the Breaking
How quants separate edge from noise
从噪声、数据错误和过拟合中识别真实交易优势
导读完成81
2026-07-16
Quantpedia
这篇不是‘AI已经找到alpha’,而是提出把LLM当成假设发现器:真正的检验仍要靠结构化因子、样本外和成本审计
AI / 大模型基础能力
导读完成58
2026-07-16
Tommi Johnsen
新闻 AI 的漂亮收益怎样消失:补齐回报、修正并列排序后,次日信号不再成立
回测与研究方法
导读完成90
2026-07-14
Allocate Smartly
抄底陷入回撤的策略,可能只是撞上所有策略都更好做的月份
组合与风险
导读完成85
2026-07-14
Paper to Profit
LLM生成361个均线公式后筛出Reflux,作者称替换OLMAR的EMA使CAGR提高33%且回撤不变;但候选池、筛选规则和最终验证高度重叠,33%只是待独立复跑的研究假设
机器学习与AI
导读完成69
2026-07-14
Rulyfi
RMP 不是赚钱概率:它把单次显著性抬高到整个搜索的幸运冠军门槛
回测与研究方法
导读完成83
2026-07-13
Alpha Architect
The Intramonth Momentum Cycle
月内动量周期、机构月末现金需求与PreTOM窗口
导读完成94
2026-07-12
Aligrithm
网络动量1.51是毛夏普:每次5bp成本就变−0.67
信号与收益预测
导读完成82
2026-07-12
Quantitativo
五篇研究共同提醒:组合平均收益,会把行业、拥挤与市场状态混在一起
组合与风险
导读完成66
2026-07-12
Aligrithm
趋势收益不只靠正自相关:还有漂移平方,公式不是预测器
回测与研究方法
导读完成85
2026-07-12
Trading the Breaking
Feature selection: Wrapper-based feature selection methods
待分类
已收录待评
2026-07-10
Beyond Passive
裂解价差领先炼油股:毛夏普 1.48 的产业链信号,不能直接叫市场中性 Alpha
信号与收益预测
导读完成84
2026-07-10
Rulyfi
同一笔交易,DSR 从0.035变0.919:改变的是搜索参照总体,不是策略变强
回测与研究方法
导读完成84
2026-07-10
Rulyfi
一亿回测筛出3,130个候选,不等于发现3,130个Alpha
回测与研究方法
导读完成81
2026-07-09
Tradevo Data
财务因子的“提前66天”:改公告日期还不够,修订值也不能穿越
数据与信息处理
导读完成87
2026-07-09
Concretum Group
便宜股2020涨53%不是HML赚53%:价值入门最容易混淆的口径
信号与收益预测
导读完成68
2026-07-09
Cracking Markets
突破策略要不要挂限价单?0.75跳时追价更好,2跳时才接近
策略与交易
导读完成80
2026-07-09
Tommi Johnsen
把 Claude 调得更像分析师后,相关系数由 +0.24 变 −0.06;但后续审计削弱了收益结论
AI / 大模型基础能力
导读完成82
2026-07-06
TradeQuantiX
五个低频日历效应各自不强,按约100%峰值敞口合并后作者报Sharpe 1.77、回撤7.71%、平均只暴露12%;叠加动量则CAGR 12%→15.6%,但最大敞口97%→127%
组合与风险
导读完成67
2026-07-06
Quantitativo
周览#1:先看组合尾部和换手,不要被“零过拟合”吸引
组合与风险
导读完成66
2026-07-06
Relative Value Arbitrage
美股期权零售量已超60%,偏好的短到期OTM期权平均报价价差约12%;券商宕机的82个事件显示零售买盘减少时短期期权IV下降、长期IV反升
策略与交易
导读完成66
2026-07-04
Jdiv930
把+40%修成接近零之后:250行验证框架仍有样本外复用问题
回测与研究方法
导读完成85
2026-07-04
Investment Idiocy
优化预测权重时,按资产类别池化在多数样本窗优于全池化、逐品种和权重距离聚类:5年训练/1年测试中位Sharpe 0.557
组合与风险
导读完成86
2026-07-04
Financial Hacker
三盏风险灯决定 SPY 仓位:8% 年化背后,先看减仓是否真有增量
组合与风险
导读完成82
2026-07-02
Quantpedia
Silicon vs. Satoshi:NASDAQ-100与Bitcoin战术资产轮动
QQQ与BTC的Donchian突破轮动和现金回退
导读完成90
2026-06-30
Quantpedia
九个美股异象在清洁样本外全部失效:真正的AI价值不是给出更高夏普,而是把构造错误抓出来
AI / 大模型基础能力
导读完成95
2026-06-29
Investment Idiocy
Pooling rule p&l estimates
跨交易工具池化P&L/Sharpe估计
导读完成70
2026-06-29
Investment Idiocy
用指数加权更新Sharpe并未系统胜过全样本:20年训练/5年测试时全历史估计SR 0.149,高于5/10/20/30年EWM的0.093/0.119/0.134/0.132
回测与研究方法
导读完成92
2026-06-28
Beyond Passive
三ETF风险溢价核心按自身趋势0—100%倾斜并慢速放大后,作者报1970—2026年Sharpe 1.23对核心约1.0、CAGR10.1%对8.1%、回撤−15%对−32%;但2008年以来Sharpe反而1.03对1.08
策略与交易
导读完成83
2026-06-28
Concretum Group
同一日内均值回复在不同AUM不是同一策略:作者的单次MIT执行下,$20k是费用下限、$50k净Sharpe峰值、$100k以上冲击主导;若假设拆成4单,最优AUM才升至$500k
回测与研究方法
导读完成83
2026-06-28
Macrosynergy
Systematic FX trading with regression learning and transaction cost analysis
回归学习、点时宏观因子与开发市场FX远期交易成本
导读完成92
2026-06-28
Alpha Architect
The Impressive Markets Hypothesis: Prices Still Know the Future
股价对未来基本面的预测能力与市场有效性
导读完成83
2026-06-25
Quantpedia
Why Mean-Variance Optimization Breaks Down
插件式均值-方差优化的估计误差放大
导读完成78
2026-06-25
Quant Insti
七个主要货币对的趋势跟踪有薄薄的边:只有USDJPY和EURUSD超过Sharpe 0.5交易门槛,等权组合反而只有0.43
策略与交易
导读完成89
2026-06-24
Investment Idiocy
Breaking Badly: finding the structural breaks in parameter estimates
识别Sharpe估计中的结构断点
导读完成82
2026-06-24
Concretum Group
2006—2025样本外的简单200日均线TAA仍有Sharpe 0.68,但再平衡日选择本身能制造约220bp CAGR差异
策略与交易
导读完成93
2026-06-24
Tommi Johnsen
新闻情绪和财报情绪在极端端点同向,但21个事件去掉四个角点后相关系数从0.63降到0.25,不能当预测信号
数据与信息处理
导读完成69
2026-06-24
Eran Raviv
变量比样本还多时,协方差估计的第一步是选假设,不是直接求逆
组合与风险
导读完成57
2026-06-21
Quantpedia
十只ETF等权不等于十个风险来源:风险平价和聚类把高波动资产降权后,回撤更小但收益也更低
组合与风险
导读完成66
2026-06-21
Concretum Group
薄股票的Sharpe 3.15主要是流动性溢价和交易不可达性:同一信号从最液态到最薄,Sharpe 0.67跳到3.15,但这是毛收益
策略与交易
导读完成89
2026-06-19
Investment Idiocy
组合优化里聚类几乎没有改变结果:在20/30/40资产和多种样本外窗口下,聚类不是免费提升
组合与风险
导读完成74
2026-06-19
Anton Vorobets
Academic Confirmation Bias
金融学术研究中的确认偏误、均值-方差假设与回测验证
导读完成75
2026-06-17
Quantpedia
AI找出的多资产回撤策略:200日均线加两天回撤Sharpe 0.95,但三天回撤把回撤压到-13.69%也牺牲了收益
AI / 大模型基础能力
导读完成80
2026-06-17
Investment Idiocy
把不同收缩模型的权重再平均,反而不如直接等权:十几种组合的比较再次说明简单基准很难打败
组合与风险
导读完成73
2026-06-17
Portfolio Optimizer
Harrell–Davis不是让VaR变准的魔法,而是用多个次序统计量平滑尾部分位数,重点在敏感度和不确定性
组合与风险
导读完成74
2026-06-16
Quantt
两百万条纯噪声策略里,最好的Sharpe也能到1.03:样本外和多重检验不是附录,而是研究主体
回测与研究方法
导读完成94
2026-06-16
Quantpedia
商品动量的关键不是只追相对强者,而是先用绝对趋势过滤:四ETF基准Sharpe 0.30,双动量把左尾整体截掉
策略与交易
导读完成83
2026-06-16
Concretum Group
VIX策略回测年化16.3%、Sharpe约1,但核心是卖SVXY、买VXX的路径依赖,自动下单不等于风险已解决
策略与交易
导读完成80
2026-06-16
Investment Idiocy
随机世界的bootstrap/MC到了真实策略收益反而输给强收缩:1年训练1年测试的中位最优是Sharpe收缩0.25、相关收缩0.60;作者最终建议5年以上用0.5/0.75,1年以内干脆等权
组合与风险
导读完成91
2026-06-16
Trading the Breaking
Feature selection: Filter-based methods
待分类
已收录待评
2026-06-16
Quant Galore
卖波动率不能只看IV高不高:IV/HV比率低于1时反而亏,1.5倍附近才出现约7个波动率点的回归
策略与交易
导读完成82
2026-06-16
TradeQuantiX
Market Effect Research: Turnaround Tuesday Effect
待分类
已收录待评
2026-06-16
Relative Value Arbitrage
484条股票策略经过多重检验后Sharpe被大幅削弱:34次样本外测试只有年化0.55%、Sharpe 0.33,却把回撤从-23.8%压到-2.76%
回测与研究方法
导读完成84
2026-06-16
Alpha Architect
Dividend Timing and Global Dividend Premium
国际市场股息支付时点与全球股息溢价
导读完成86
2026-06-13
Concretum Group
A Hidden Trade Around SpaceX IPO?
SpaceX潜在纳入Nasdaq-100引发的指数需求交易
导读完成73
2026-06-13
Alpha Architect
The Factor Zoo Has Hundreds of Animals — But Only a Handful of Species
因子身份与因子动物园冗余
导读完成84
2026-06-12
Algorithmic Advantage
The Right Way to Use AI in Trading (This Week)
AI在交易研究中的正确使用边界
导读完成74
2026-06-12
Peter Olayemi
I Audited 30 Years of SPY Candlesticks and the Variance Risk Premium
SPY蜡烛图方向预测与方差风险溢价审计
导读完成90
2026-06-10
Vertox Quant
Fast Option Pricing using Fourier Transform
基于特征函数的Carr-Madan、Lewis与COS快速期权定价
导读完成89
2026-06-09
Investment Idiocy
真实策略PnL里,预测未来一年Sharpe的误差仅比同分布随机数据高6%,但相关性误差高约5.6倍;组合优化最该优先收缩的可能是相关而非均值
回测与研究方法
导读完成93
2026-06-09
Robot Wealth
Resourcing a Triangulated Stat Arb Operation as a Solo Trader
个人交易者配置三角统计套利的配对筛选、聚合和事件过滤
导读完成82
2026-06-09
Beyond Passive
What Trend Following Actually Adds to a Risk-Premia Core
趋势跟踪相对风险溢价核心的真实增量
导读完成82
2026-06-09
Investment Idiocy
先用2,000组随机的9资产、35年历史给优化器做“盲测”:bootstrap/Monte Carlo最稳,但慢;1年训练bootstrap约需1,200次迭代才使Sharpe误差降至0.01,等权在作者设定下明显最差
回测与研究方法
导读完成91
2026-06-09
Tommi Johnsen
When the insiders and the news disagree: a first look at the cross-signal
内部人交易与新闻情绪冲突信号
导读完成76
2026-06-09
Quantpedia
Reconstructing a Century of U.S. Corporate Bonds
1895—2022年美国公司债历史数据库与信用风险溢价
导读完成85
2026-06-06
Investment Idiocy
8,100个规则×品种组合不能一次拟合;随机抽5品种×5规则重复数千次后,95.3%更像按品种聚类、仅0.11%更像按规则聚类,因此先在品种内合成预测再跨品种配置
组合与风险
导读完成90
2026-06-06
Concretum Group
交易成本的非线性
手续费、滑点与订单规模对策略容量和净收益的非线性影响
导读完成88
2026-06-06
Quantpedia
预测市场中的群众有多明智
Polymarket与Kalshi中的偏差、钱包行为、评论情绪与交易者优势
导读完成87
2026-06-06
Capital Spectator
研究综述|2026年6月5日|风险管理
泡沫上下界、情绪、压力期分散化、行业轮动、行业ETF分化与HMM状态配置
导读完成88
2026-06-04
Implementing QuantLib
复制研究的软件一面
如何用代码、数据、环境锁定和发布工具提升量化论文复现率
导读完成91
2026-06-04
Relative Value Arbitrage
回归在现代市场中仍然有效吗?
线性/逻辑回归在股票价格预测和月度方向分类中的表现与失效
导读完成78
2026-06-04
Allocate Smartly
一条策略年化14.5%,QQQ贡献3.1个百分点:收益归因比只看净值多回答了什么
组合与风险
导读完成70
2026-06-02
Beyond Passive
Trend following (2/4): Sector-by-sector replication
按行业拆分复制趋势跟踪组合
导读完成84
2026-06-01
Robot Wealth
When Is a Mispricing Not a Mispricing?
统计套利中表面错价与价格无关流量
导读完成70
2026-06-01
Wisdom Trading
AI把策略迭代从一周压缩到二十分钟,也把曲线拟合速度一起加快:真正的防线是预先锁定样本外
AI / 大模型基础能力
导读完成55
2026-06-01
Allocate Smartly
提款率7%未必胜过5%:样本越短,最坏退休路径越可能被漏掉
组合与风险
导读完成70
2026-06-01
TradeQuantiX
Market Effect Research: Holiday Seasonality - Part 2
待分类
已收录待评
2026-06-01
Alpha Architect
Institutions’ return expectations across assets and time
机构跨资产、跨时间的风险溢价预期
导读完成93
2026-05-30
Concretum Group
交易程序没报错也可能已经失控:行情新鲜度、账户净额与重启对账才是上线底线
回测与研究方法
导读完成83
2026-05-30
Beyond Passive
复制自己的CTA,应复制当前仓位而非过去净值:10合约夏普0.65升至0.84
组合与风险
导读完成83
2026-05-30
Concretum Group
同一批日内做空候选,改为隔夜做多年化37.1%:省去借券,却接回跳空风险
策略与交易
导读完成65
2026-05-30
Alpha Architect
三阶“零滞后”均线并非提前知道拐点:稳态偏差减少,代价是超调与噪声
信号与收益预测
导读完成77
2026-05-30
Macrosynergy
夏普一样,赚钱节奏可以很不一样:稳定性比率要先修正滚动窗口的重复样本
回测与研究方法
导读完成84
2026-05-27
Quantpedia
2026量化研究奖前三名:动量权重、月内周期与LLM假设发现,但奖项不是收益验证
回测与研究方法
导读完成41
2026-05-27
Algorithmic Advantage
别只问最优参数有没有赚钱:先看整张参数成绩表能否迁移到下一段
回测与研究方法
导读完成72
2026-05-27
Tommi Johnsen
内幕人买入信号的首要问题是何时能看到:四个集群前一天已涨1.61%
数据与信息处理
导读完成66
2026-05-24
Robot Wealth
不再一对一配股:把价差网络压成个股信号,再在组合层面对冲
策略与交易
导读完成74
2026-05-24
Quantpedia
每周挑3只ETF,10周与25周动量各一半:规则简单,参数选择并未消失
组合与风险
导读完成75
2026-05-24
Concretum Group
跳空高开日内做空年化98%,但67%回撤、借券摩擦和2022后失效不能跳过
策略与交易
导读完成62
2026-05-24
Chase the Devil
三次迭代逼近机器精度还不够:隐波求解器最终卡在浮点边界和定价函数
回测与研究方法
导读完成82
2026-05-24
Alpha Architect
When Everyone Trades the Same Factor Playbook
因子投资拥挤交易与Anomaly-Driven Demand
导读完成89
2026-05-20
Concretum Group
VWAP退出的夏普最高,却不是每年赢家:四种出场规则该如何选
策略与交易
导读完成79
2026-05-20
Quantpedia
把新兴市场历史延到1926年:合成日收益不能当成新增的真实市场经验
数据与信息处理
导读完成60
2026-05-20
TradeQuantiX
月末附近十天平均日收益0.072%,其余仅0.011%:日历差异可见,三套策略仍在付费墙后
信号与收益预测
导读完成70
2026-05-20
Tommi Johnsen
1199条新闻只有106条被判有方向,而FinBERT把其中44条提前判成中性
数据与信息处理
导读完成80
2026-05-20
Quantpedia
散户猜对51.3%却亏钱,机器人猜对49.9%却赚1.33亿美元:入场价比胜率重要
策略与交易
导读完成83
2026-05-20
Relative Value Arbitrage
VIX现货与期货谁先动并不固定,ETP流量还会改变日内关系
策略与交易
导读完成60
2026-05-17
Jonathan Kinlay
四个AI角色把研究假说从11个增到38个,但12周仍没有一条策略上线
AI / 大模型基础能力
导读完成78
2026-05-17
Beyond Passive
动态对冲不是免费保险:汇率腿年化1.85%,但近年也落后不对冲约1个百分点
组合与风险
导读完成75
2026-05-17
Quantpedia
商品期货155年风险溢价约5.4%:关键不是商品一直涨,而是期货与现货不同
组合与风险
导读完成79
2026-05-17
Quantifiable Edges
六周暴涨后一年平均涨18.8%,但“历史最强20次”本身是事后排序
信号与收益预测
导读完成61
2026-05-14
Vertox Quant
重复测试同一策略不应洗掉其他尝试:用高斯极值定义有效测试次数
回测与研究方法
导读完成82
2026-05-14
Alvarez Quant Trading
翻倍股占比仅为科技泡沫时的四成,但这不是市场还能涨多少的尺子
信号与收益预测
导读完成58
2026-05-12
Allocate Smartly
给策略净值加均线开关:回撤变小,风险调整收益却没有普遍改善
组合与风险
导读完成80
2026-05-11
Algorithmic Advantage
漂亮回测可能回答错问题:先写清策略在组合里的工作,再决定怎么验收
回测与研究方法
导读完成69
2026-05-11
Tommi Johnsen
AI让新闻Alpha消失?这是待检验假说,支撑它的早期行业收益后来被更正
AI / 大模型基础能力
导读完成52
2026-05-10
Portfolio Optimizer
用经理平均仓位替代固定60/40,年化7.9%变9.1%,但股票敞口也多了6个百分点
组合与风险
导读完成76
2026-05-10
Beyond Passive
同一股债金组合,换欧元计价后回撤23%变45%:样本起点改变了汇率结论
组合与风险
导读完成74
2026-05-10
Quant Insti
DeepSeek只负责给市场贴标签,EURUSD夏普0.54变0.90:还需排除历史标签泄漏
AI / 大模型基础能力
导读完成75
2026-05-10
Jonathan Kinlay
PPO比AC省0.7bp?作者承认结果表是参照文献填入,不能当真实测量
AI / 大模型基础能力
导读完成55
2026-05-10
Hanguk Quant
Python日志调用167纳秒,不等于日志已落盘:量化热路径优化的边界在哪里
数据与信息处理
导读完成83
2026-05-10
Alpha Architect
Why Momentum Investing Has Been Struggling—And What Volatility Has to Do With It
VIX波动率尖峰与动量策略失效
导读完成83
2026-05-06
Allocate Smartly
追最近高夏普的TAA策略:12个月窗口有亮点,却在2011年后失去优势
组合与风险
导读完成77
2026-05-06
Quantpedia
黄金与比特币轮动年化64.7%,降风险后只剩12.0%:暴露调整才是故事关键
组合与风险
导读完成74
2026-05-06
Alvarez Quant Trading
回撤优化了17%,却只是绕开两笔亏损:一次策略修改的过拟合审计
回测与研究方法
导读完成78
2026-05-06
Quantifiable Edges
问卷择时只投资19%的时间,周频回撤不到10%,日频却达到25%
信号与收益预测
导读完成76
2026-05-06
Tommi Johnsen
新闻情绪不是一个因子:拆成数字、事件、分析师后,行业方向甚至相反
信号与收益预测
导读完成68
2026-05-05
Quantpedia
没持有比特币,也可能持有同一批投机者:关注因子是在找隐藏共振
组合与风险
导读完成71
2026-05-04
Jonathan Kinlay
CNN修补波动率曲面输给线性插值:学到的平滑先验在新曲面上反成负担
AI / 大模型基础能力
导读完成81
2026-05-04
Krzysztof Ozimek
同样幅度的涨跌,为什么跌后波动更大?EGARCH解释这个机制,不保证期权套利
组合与风险
导读完成70
2026-05-04
Quantifiable Edges
五月首日上涨后,25次中17次四日后下跌:季节性线索还不是交易策略
信号与收益预测
导读完成53
2026-05-04
Relative Value Arbitrage
参数平台比尖峰更可信,但搜索平台本身仍会过拟合
回测与研究方法
导读完成72
2026-05-03
Strat Proof
22条加密策略纸面前测16条亏损,但“累计−2081%”并不是账户收益
回测与研究方法
导读完成58
2026-05-03
Beyond Passive
风险平价最痛的月份不是普通坏日子的简单累加:股债共跌占比明显上升
组合与风险
导读完成81
2026-05-03
Chase the Devil
隐含波动率“几乎显式”公式并不等于更快:尾部测试慢了一个数量级
回测与研究方法
导读完成83
2026-05-03
Alpha Architect
Rethinking Trend Following: Optimal Regime-Dependent Allocation
趋势跟踪的状态依赖最优配置
导读完成95
2026-05-03
Macrosynergy
宏观做曲线夏普0.7—0.9,删掉金融危机仍有0.5—0.6:但不是无成本中性套利
策略与交易
导读完成85
2026-04-29
Allocate Smartly
追最近最赚钱的策略:绝对收益更高,但风险调整后没有增加价值
组合与风险
导读完成82
2026-04-29
Robot Wealth
让 AI 多跑一千次回测,并不会自动增加对市场的理解
回测与研究方法
导读完成68
2026-04-29
Quantpedia
做空标普尾部成分失败;反过来做赚了钱,却还不能证明是指数资金效应
策略与交易
导读完成70
2026-04-29
Tommi Johnsen
事实没变,FinBERT 却改口:97.2% 的分类准确率经改写攻击降至 71.0%
AI / 大模型基础能力
导读完成82
2026-04-27
Quantt
Lazy Prices 的 22% 是旧论文结果,不是把年报接入大模型后的新 Alpha
数据与信息处理
导读完成77
2026-04-26
Beyond Passive
58 年股债金配置:波动可预测,不代表逆波动权重就是风险平价
组合与风险
导读完成77
2026-04-25
Alpha Architect
动量跳过最近一个月:行业组合中,它放大了状态差异,而非稳定改善收益
信号与收益预测
导读完成84
2026-04-25
Quant Insti
PCA 保留九成方差,不等于保留九成 Alpha:无监督学习教程该怎样用
AI / 大模型基础能力
导读完成68
2026-04-25
Capital Spectator
预测市场研究综述把三种问题放在一起:概率校准、交易收益与信息优势不是一回事
策略与交易
导读完成69
2026-04-22
Vertox Quant
先让整套研究流程在无信号数据上失败,再相信它在真实市场的成功
回测与研究方法
待获取全文87
2026-04-22
TradeLock 锁定的是事前信号记录,不是证明实盘成交和可实现收益
回测与研究方法
导读完成63
2026-04-22
Relative Value Arbitrage
日内买波动、隔夜卖波动?先看互换损益口径,再谈能否交易
组合与风险
导读完成83
2026-04-20
Portfolio Optimizer
美股占全球组合71%,能反推出投资者预期美股多赚多少吗?
组合与风险
导读完成84
2026-04-20
Quantpedia
同一个动量策略,只改调仓日,年化就能差 3.48 个百分点
组合与风险
导读完成90
2026-04-19
Beyond Passive
把 TLT 补到 1962 年:可以扩展压力场景,不能把高相关当成无误差历史
数据与信息处理
导读完成82
2026-04-18
Quantpedia
预测市场低位买入:有的年化22%,有的只加10bp成本就由赚转亏
策略与交易
导读完成73
2026-04-18
Macrosynergy
一套通胀信息做六类交易:组合夏普1.3,但不是六个独立Alpha
信号与收益预测
导读完成86
2026-04-18
Financial Hacker
AutoTune 自适应周期:滚动测试仍报约 25% CAGR,但还没证明周期识别真的有用
信号与收益预测
导读完成81
2026-04-17
Vertox Quant
SHAP能解释模型为什么买入,却不能证明这个买入有Alpha
AI / 大模型基础能力
导读完成81
2026-04-16
Tommi Johnsen
FinBERT 先过滤新闻:省下调用费,也可能提前删掉最有用的信号
数据与信息处理
导读完成79
2026-04-16
Anton Vorobets
RayforceDB“快几千倍”是特定工作负载经验,不是通用数据库排名
数据与信息处理
导读完成69
2026-04-16
Investment Idiocy
Carver年度期货赚23.7%,为什么风险调整后仍落后CTA基准?
组合与风险
导读完成81
2026-04-15
Return Stacked
最优叠加组合年化多2个百分点,但跟踪误差7.8%可能先逼投资者退出
组合与风险
导读完成81
2026-04-15
Quantifiable Edges
税日季节性曾经很强:45笔交易净赚11,851美元,但近年优势已明显变弱
策略与交易
导读完成65
2026-04-15
Alpha Architect
把过去12个月拆成财报日与非财报日:动量收益中约一半来自公司特定信息窗口
信号与收益预测
导读完成86
2026-04-13
Allocate Smartly
战术收益率:久期补偿不够就持现金,50% 是历史分位而不是收益率阈值
组合与风险
导读完成79
2026-04-13
Trading the Breaking
Data transformations: Data shape and predictive features
数据形状转换与预测特征设计
导读完成80
2026-04-13
Beyond Passive
稀疏策略怎么配仓:先问给底仓增加了什么,不要把零重叠误认成零风险
组合与风险
导读完成81
2026-04-10
Robot Wealth
趋势还是反转不是关键,关键是收益由谁的行为提供
回测与研究方法
导读完成70
2026-04-10
Alpha Architect
因子过去一个月出现最大单日上涨,之后高MAX组每月多0.32%;但这是因子择时,不是个股信号
信号与收益预测
导读完成87
2026-04-09
Quantpedia
新兴市场与美国轮动:均线组合年化 7.13%,但别把价差择时当成风险中性 Alpha
策略与交易
导读完成76
2026-04-07
Allocate Smartly
增长×通胀行业轮动:年内涨 39%,但不是全天候,更可能夹带市场 Beta
组合与风险
导读完成74
2026-04-07
Relative Value Arbitrage
LLM 会按角色下单,不等于会赚钱:模拟市场也纠正不了所有高估
AI / 大模型基础能力
导读完成76
2026-04-05
Quant Galore
稀释、de-SPAC 与违约做空:事件时点可定义,收益却还不能从公开预览确认
策略与交易
待获取全文51
2026-04-05
Beyond Passive
月末交易:先分清债券季节性和股债反转,再剔除没跑赢随机窗口的腿
策略与交易
导读完成81
2026-04-05
Quantitativo
深度动量:别只选最可能上涨的股票,还要看所有结果的概率与回报
信号与收益预测
导读完成75
2026-04-05
Tommi Johnsen
When Elon Musk Can’t Sleep, Your Portfolio Feels It
组合与风险
已收录待评
2026-04-05
Macrosynergy
缺一个宏观因子就删整行?补缺让回测多出九年,也改变了比较口径
数据与信息处理
导读完成82
2026-04-03
Quantpedia
ChatGPT 做量化:能加快试验,但也会把稳健性检验做成过拟合
AI / 大模型基础能力
导读完成78
2026-03-31
Quantt
Selling Volatility: The Most Seductive Backtest in Finance
回测与研究方法
已收录待评
2026-03-31
Financial Hacker
Coding the largest strategy ever
策略与交易
已收录待评
2026-03-31
Concretum Group
Breaking the Rules of Intraday Trading
策略与交易
已收录待评
2026-03-29
Robot Wealth
Brave New Backtest
回测与研究方法
已收录待评
2026-03-29
Trading the Breaking
Data transformations: Preprocessing time series
数据与信息处理
已收录待评
2026-03-29
Beyond Passive
Fridays for Gold, Tuesdays for Stocks: Two Sides of the Same Fear Cycle
待分类
已收录待评
2026-03-29
Quantpedia
When Crypto Stopped Diversifying: The ETF Regime Shift
组合与风险
已收录待评
2026-03-29
Alpha Architect
Unlocking Hidden Patterns: How Daily Returns Predict Future Stock Performance
信号与收益预测
已收录待评
2026-03-29
Relative Value Arbitrage
Evaluating Option-Based Strategies and Dollar-Cost Averaging
策略与交易
已收录待评
2026-03-23
Jonathan Kinlay
From Hype to Reality: Building a Hybrid Transformer-MVO Pipeline
待分类
已收录待评
2026-03-23
Alpha Architect
Increases CAPE Ratio Predictability with a Simple Adjustment
信号与收益预测
已收录待评
2026-03-22
Beyond Passive
The Friday Gold Trade: A Conditional Edge
待分类
已收录待评
2026-03-22
Macrosynergy
Unlocking relative value across asset classes
待分类
已收录待评
2026-03-22
Alpha Architect
The Return of the King: Trend Following Is Back – But Will It Last?
策略与交易
已收录待评
2026-03-19
Robot Wealth
AI 能加速写回测,但谁来说明这个收益为什么会存在?
回测与研究方法
导读完成64
2026-03-19
Quantpedia
Timing Value vs. Growth: Evidence from 100 Years of Small Value–Large Growth Spread
待分类
已收录待评
2026-03-17
Allocate Smartly
Diversification Has Been a Huge Drag on TAA Performance for 15+ Years
组合与风险
已收录待评
2026-03-17
Investment Idiocy
How to write a tweet that gets over 300k views; and why diversification is probably good
组合与风险
已收录待评
2026-03-16
Quantt
Landing Your First Role - Breaking Into Quant Finance
待分类
已收录待评
2026-03-16
Quantpedia
Anomaly-Based Trading Strategies in the Real Estate Sector. Can the Market Be Beaten?
信号与收益预测
已收录待评
2026-03-16
Edge Alchemy
Brave New Backtest
回测与研究方法
已收录待评
2026-03-16
Financial Hacker
The One Euro Filter
待分类
已收录待评
2026-03-15
Beyond Passive
The Calendar Ensemble: Building an Event-Driven Alpha Overlay
待分类
已收录待评
2026-03-14
Jonathan Kinlay
Transformer Models for Alpha Generation: A Practical Guide
待分类
已收录待评
2026-03-14
Trading the Breaking
Infra: Financial APIs
数据与信息处理
已收录待评
2026-03-12
Quant Galore
A Quant's Guide to Cross-Section Maxxing, Code Included
待分类
已收录待评
2026-03-12
Relative Value Arbitrage
Machine Learning for Derivative Pricing and Crash Prediction
信号与收益预测
已收录待评
2026-03-12
Alpha Architect
The Best Defensive Strategies: Two Centuries of Evidence
策略与交易
已收录待评
2026-03-08
Jonathan Kinlay
Reinforcement Learning for Portfolio Optimization: From Theory to Implementation
组合与风险
已收录待评
2026-03-08
Kris Longmore
AI Will Create Millions of Quants
待分类
已收录待评
2026-03-07
Macrosynergy
宏观信号不缺复杂模型,缺的是约束模型的理由
信号与收益预测
导读完成80
2026-03-05
Quantt
New Contributor: Scaling Python Financial Models on AWS
待分类
已收录待评
2026-03-05
Quantpedia
2-Year Notes Momentum: Extracting Term Structure Anomalies from FOMC Cycles
信号与收益预测
已收录待评
2026-03-05
Portfolio Optimizer
The Market Rank Indicator: Measuring Financial Risk, Part 3
待分类
已收录待评
2026-03-05
Quant Start
Correlated Time Series Generation using Object Oriented Python
待分类
已收录待评
2026-03-05
Tommi Johnsen
Sentiment Analysis Series Part 3: Three Ways the Sentiment Model Can Fail
信号与收益预测
已收录待评
2026-03-02
Robot Wealth
The Winter of our Pairs Trading Discontent: Problems, limitations, frustrations
策略与交易
已收录待评
2026-03-02
Macrosynergy
Systematic FX trading with point-in-time GDP growth estimates
策略与交易
已收录待评
2026-03-02
Alpha Architect
Fund Selection When Borrowing Is Restricted
待分类
已收录待评
2026-03-01
Investment Idiocy
Backtesting course from Rob Carver, March 7 and 8, in person and remote
回测与研究方法
已收录待评
2026-03-01
Jonathan Kinlay
State-Space Models for Market Microstructure
待分类
已收录待评
2026-02-26
Quantpedia
Systematic Allocation in International Equity Regimes
组合与风险
已收录待评
2026-02-24
Quant Start
Time Series Models using Object Oriented Python
待分类
已收录待评
2026-02-24
Quantitativo
More Bets, Better Bets
待分类
已收录待评
2026-02-23
Quantpedia
Evaluating Reversal Potential in Niche Alternative ETFs
待分类
已收录待评
2026-02-23
Trading the Breaking
Infra: Scraping financial data
数据与信息处理
已收录待评
2026-02-23
Relative Value Arbitrage
Do Options Exhibit Momentum?
策略与交易
已收录待评
2026-02-22
Jonathan Kinlay
Kronos and the Rise of Pre-Trained Market Models
待分类
已收录待评
2026-02-21
Yannick Kalber
Break-Even Correlation Thresholds for Linear Predictive Signals
组合与风险
已收录待评
2026-02-21
Capital Spectator
Research Review | 20 February 2026 | Forecasting Returns
信号与收益预测
已收录待评
2026-02-20
Robot Wealth
Moneyball: Finding Undervalued Pairs Using Unconventional Metrics
待分类
已收录待评
2026-02-20
Tommi Johnsen
Can LLMs Beat FinBERT for Stock Sentiment Trading?
信号与收益预测
已收录待评
2026-02-20
Robot Wealth
A Tale of Two Prices
待分类
已收录待评
2026-02-18
Quantpedia
Combining Calendar Strategies into the Trading Portfolio
组合与风险
已收录待评
2026-02-18
Concretum Group
Improving Performance with Fast Alphas; A Tactical Overlay for Intraday Trend Trading
策略与交易
已收录待评
2026-02-16
Yannick Kalber
New Contributor: A Linear Regression's Predictions are a Relevance-Wtd Avg of Past Outcomes
信号与收益预测
已收录待评
2026-02-16
Jonathan Kinlay
Volatility Clustering Across Asset Classes: GARCH and EGARCH Analysis with Python (2015–2026)
策略与交易
已收录待评
2026-02-13
Return Stacked
Why Bonds Still Belong: Rethinking Fixed Income in Modern Portfolios
组合与风险
已收录待评
2026-02-13
Tommi Johnsen
FinBERT Is Wrong 83% of the Time on Positive Headlines: an LLM is Here to Help
待分类
已收录待评
2026-02-13
Macrosynergy
宏观数据修订不仅会制造假信号,也会把真信号藏起来
数据与信息处理
导读完成84
2026-02-11
Allocate Smartly
Why TAA is Performing Well Now: Outperformance Attribution
待分类
已收录待评
2026-02-09
Quantpedia
Pragmatic Asset Allocation Across Market Cycles
组合与风险
已收录待评
2026-02-09
Gautier Marti
EMNLP 2025 in Suzhou
待分类
已收录待评
2026-02-09
Relative Value Arbitrage
Herding in Commodities and Cryptocurrencies
待分类
已收录待评
2026-02-05
Financial Hacker
Build Better Strategies, Part 6: Evaluation
回测与研究方法
已收录待评
2026-02-05
Tommi Johnsen
Stock Sentiment Indicators in U.S. Equities: and the research that supports them
信号与收益预测
已收录待评
2026-02-02
Portfolio Optimizer
More Bootstrap Simulations with Portfolio Optimizer: the Autoregressive Online Bootstrap
回测与研究方法
已收录待评
2026-02-02
Sitmo
Sampling Stock Prices Directly from Option Prices
策略与交易
已收录待评
2026-02-02
Allocate Smartly
Member Note: Our Approach to Selecting Strategies for the Platform
策略与交易
已收录待评
2026-02-02
Quantpedia
Do S&P500 0DTEs Options Increase Market Volatility?
策略与交易
已收录待评
2026-02-01
Concretum Group
Seasonality in Bitcoin Intraday Trend Trading
策略与交易
已收录待评
2026-02-01
Tommi Johnsen
Target-aware Financial Sentiment: Why Structure Beats Confidence with LLMs
信号与收益预测
已收录待评
2026-02-01
Alpha Architect
Revaluation Alpha: Why Past Factor Returns May Be Misleading
回测与研究方法
已收录待评
2026-01-27
Trading the Breaking
系统平均很快,却在最需要交易时读到了旧行情
数据与信息处理
待获取全文61
2026-01-27
Quantpedia
大家都在卖的时候谁接盘?日内与隔夜的答案可能不同
策略与交易
导读完成71
2026-01-27
Relative Value Arbitrage
Modern Pairs Trading: What Still Works and Why
策略与交易
已收录待评
2026-01-25
Quantpedia
比特币最优权重为负?关键在预期收益假设,不是优化器投票看空
组合与风险
导读完成66
2026-01-25
Tommi Johnsen
AI 越一致,市场就越脆弱?这是可检验的假说,不是已证实的规律
组合与风险
导读完成55
2026-01-25
Macrosynergy
宏观如何落到个股:先学不同公司的敏感度,而不是预测整个指数
信号与收益预测
导读完成77
2026-01-25
Alpha Architect
价值投资失灵了吗?先分清估值贵、公司好与股价还能涨
信号与收益预测
导读完成63
2026-01-20
Allocate Smartly
黄金上涨还不够:为什么再看一眼美债动量?
策略与交易
导读完成81
2026-01-20
Quantitativo
组合年化从 19.1% 到 23.1%:增益来自优化,还是先找到了互补策略?
组合与风险
导读完成80
2026-01-20
Tommi Johnsen
LLM 把新闻读快了,但更快读懂不等于净收益更高
信号与收益预测
导读完成53
2026-01-20
Alpha Architect
The Many Facets of Stock Momentum
策略与交易
待修订待评
2026-01-19
Tommi Johnsen
新闻语气为负,不等于这家公司遇到了坏消息
数据与信息处理
导读完成74
2026-01-19
Quantpedia
指数头部权重很高,为什么仍不构成减仓信号?
组合与风险
导读完成69
2026-01-19
Alpha Architect
让 LLM 给动量候选股做新闻复核:有改善,但还不是稳固的 alpha 证据
信号与收益预测
导读完成81
2026-01-16
Allocate Smartly
策略该上观察名单了吗?这里的阈值是 Q1 − 1.5 × IQR
回测与研究方法
导读完成80
2026-01-16
Relative Value Arbitrage
Delta 对冲用隐波还是历史波动?先别把“已知未来波动”偷换成历史估计
策略与交易
导读完成61
2026-01-13
Trading the Breaking
Data: Building micro-machines
数据与信息处理
已收录待评
2026-01-11
Robot Wealth
策略亏了两年就该关掉吗?一个事后反弹不能给出答案
回测与研究方法
导读完成71
2026-01-11
Macrosynergy
How dollar invoicing and dollar debt shape FX risk premia
待分类
已收录待评
2026-01-09
Investment Idiocy
Are markets that are good for trend good just bc they have also gone up a lot, or bc carry, or...
策略与交易
已收录待评
2026-01-09
Klement on Investing
The fourth quarter effect in small caps
待分类
已收录待评
2026-01-06
Portfolio Optimizer
相关矩阵有空白,为什么不能直接填零?
组合与风险
导读完成83
2026-01-05
Cracking Markets
Do Breakouts of Strong Swings Work? I Tested 40 Futures Markets and the Data Is Clear
待分类
已收录待评
2026-01-04
Quantpedia
黄金与美债双动量:简单规则值得试,宏观解释还没有被证明
策略与交易
导读完成74
2026-01-04
Quantpedia
Top Ten Blog Posts on Quantpedia in 2025
待分类
已收录待评
2026-01-04
Alpha Architect
The Hidden Risks of Leveraged Single-Stock ETFs
待分类
待获取全文待评
补充 · 2026-01-12
北京大学、DeepSeek-AI
Engram:把“记住知识”和“动脑推理”分开,为什么反而更聪明?
AI / 大模型基础能力
正文核查完成87
补充 · 2026-02-15
牛津大学、UNIST、芝加哥大学、佛罗里达大学、BlackRock 等
金融 LLM 的第一道门槛:你的回测,究竟在测谁知道未来?
回测与研究方法
正文核查完成90
补充 · 2026-02-06
上海财经大学、QuantaAlpha、Stanford、北京大学等
QuantaAlpha:会进化的因子研究员,还是更有效率的历史拟合器?
信号与收益预测
正文核查完成80
补充 · 2026-03-07
Qubera AG、苏黎世大学
FinSheet-Bench:82.4% 的表格问答准确率,离放心交付还差什么?
数据与信息处理
正文核查完成83
补充 · 2026-05-05
机构信息请见原文署名;本站未逐一核验
FinSTaR:78.9% 的“金融推理准确率”,不是 78.9% 的涨跌预测胜率
信号与收益预测
正文核查完成75
补充 · 2026-08-04
ETH Zürich、Stanford 等
TimeRLM:别把十万条数据塞进提示词,让模型回到数据里找证据
数据与信息处理
正文核查完成86
补充 · 2026-09-01
Stanford University、Nanjing University、Hasso Plattner Institute
回测研究流程,而不只回测最后一条因子
回测与研究方法
正文核查完成87
补充 · 2026-09-02
Durham、MBZUAI、École Polytechnique、HBKU
同一份财报,换个角色就换了判断
数据与信息处理
正文核查完成91
补充 · 2026-09-01
哈尔滨工业大学、美的 AI 研究中心、长春理工大学等
让模型分清多层表头与数据的归属
数据与信息处理
正文核查完成81
补充 · 2026-09-04
Korea University、Hanyang University、Hyundai Motor Company
回答一个问题,如何找全分散在多篇材料里的证据
数据与信息处理
正文核查完成86
补充 · 2026-09-04
机构信息请以原文署名为准
模型升级后,旧记忆究竟丢在哪一步
AI / 大模型基础能力
正文核查完成87
补充 · 2026-08-31
Université Paris-Saclay / CentraleSupélec
个股历史长短不齐,怎样估计组合风险
组合与风险
正文核查完成86

已有解读

Quantocracy / Word 标准 · 文章解析 / 新书公告

Carver 新书把仓位、成本和交易管理放到台前;它是培训线索,不是新策略论文

Not another one! My fifth book...

Rob Carver

一句话先讲结论

Carver 介绍的新书面向不能加杠杆、不能做空的股票、ETF 和加密现货交易者,允许主观选择机会,但要求仓位、成本和风险按规则管理。对于已有系统化经验的量化研究员,新增价值更可能在培训与执行规范,而非一条可马上复现的 Alpha。这里完整解析的是作者公告,不是未读整本书的书评。

它到底在问什么?

如果交易方向来自直觉,哪些环节仍必须标准化?作者试图把寻找交易的判断与管理交易的纪律分开,尤其给没有衍生品杠杆的普通账户一套可执行约束。

作者具体怎么做?

  1. 公告称 The Art and Science of Trading 已完成校样,计划十二月一日正式出版;这是作者当时的发布说明,本次不核实购书供货。
  2. 目标场景是多头、资本约束下的股票、ETF 与加密现货,作者说它比自己此前作品更入门,使用直观解释和表格而非主要依赖公式与 Python。
  3. 内容主题包括稳健回测、分布不确定性、Kelly、成本、头寸调整与半自动交易。推荐语强调交易全生命周期,但这些属于提前读者评价,不是本次对具体章节的独立验证。
  4. 作者自己也表示,若读者已熟悉其旧作、只做杠杆期货且完全系统化,并不一定需要这本书;这为研究员判断阅读优先级提供了边界。

关键结果

原文结果与口径
核对项结果意味着什么
材料性质新书公告没有新增策略回测、显著性或可以核验的收益提升。
账户约束不加杠杆、不做空会改变风险目标可达性与工具选择,不能直接照搬期货仓位框架。
研究员用途培训与流程检查是本解析根据目标读者作出的阅读判断,不是书中经实证量化的效果。

怎么理解?

对团队而言,可以从这篇建立一张培训清单:入场观点、仓位、成本、退出、风险变化后的调整,是否各有负责人和明确规则。很多系统把大量精力投入信号,却让后面几步靠默认参数,最终收益来源便难以解释。 不过,规则化不等于正确。一个错误仓位模型也可以执行得极其一致;Kelly 对收益估计误差尤其敏感,不能仅因为书中讨论它就直接用于满额风险预算。资深研究员应把公告当成寻找清晰教学表达的线索,而不是把作者资历与推荐语替代对具体方法的审阅。

最大限制

整本书未取得和阅读,章节方法、示例表格与任何效果不能冒充已核验。本文所有内容边界以公开公告为准,也不评价未读内容是否优于作者旧作。

复现与研究价值

若用于培训,先选交易成本和风险变化后的头寸调整作为试读主题,用团队现有案例检查讲法是否能转成具体清单;再决定是否扩展。不要为了给公告补“实验结果”而编造收益表。

原文与核查

公开新书公告完整解析;未读整本书,不作为全书书评。

原始文章 ↗

作者说明:各书适合什么读者

推荐 57/100(暂定) · 问题 18/30 · 证据 17/30 · 方法 17/25 · 复现 5/15

作者清楚说明对象和边界,适合作为培训资料线索;对资深研究员的新实证信息有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究方法

夏普从 0.63 归零:先修复历史成分名单,才有资格讨论股票信号

Ghost Members. Recipe for Reconstructing Historical Membership of S&P 500 from Public Sources

Carlos García Arano

一句话先讲结论

作者为 2009—2026 年重建了 856 家发行人的标普 500 月度成分历史,成功匹配 850 家;把真实历史股票池放回原策略后,此前 0.63 的净夏普降到接近零。最重要的修正不是补几个退市价格,而是同时解决当时谁在指数里、退市公司是谁、同一个股票代码是否已经换了公司这三个问题。

它到底在问什么?

免费行情很容易下载,但今天的成分名单不能代表十年前的投资机会。研究员究竟需要怎样的身份和日期记录,才能让回测中的每一只股票确实是当时能选到的那家公司?

作者具体怎么做?

  1. 长期历史来自 fja05680/sp500 社区仓库,较近期用公开的指数增删记录独立重建,合并成 2009—2026 年月度成员表。符号附带的退市年月后缀属于信息,不能清洗时随手删掉。
  2. 显式调用包含退市公司的历史列表,再按公司名称查询 SEC。只查询存续股票会遗漏死亡样本;只按代码查 EDGAR 又可能命中后来使用相同代码的另一家公司。
  3. 存续公司通过 SEC company_tickers.json 直接解决约 87% 的匹配,其余通过公司名称找 CIK。候选 CIK 必须存在与该公司指数成员窗口重叠的 10-K、10-Q 申报,不能只凭名字相似接受。
  4. 最后保留 850 个有依据的映射,明确排除 6 个无法可靠识别的发行人,并用来源和代码不同的两套重建检查原策略是否得出相近结论。

关键结果

原文结果与口径
核对项结果意味着什么
发行人识别850 / 856约 99.3% 匹配,不代表所有成员生效日或行情都已无误。
原信号的敏感性0.63 → 约 0是更换历史股票池后的策略净夏普,不能推广为全部股票策略的偏差大小。
一处需要核查的算术856 − 667 = 189正文写两份名单相差 191 家,但其列出的总数差为 189;公开名单仍应逐项核验。

怎么理解?

这篇把数据工程变成了可证伪的研究假设。错误的代码映射比缺一行数据更危险:系统不会报错,却会给一个真实公司安上另一家公司的价格和财报。CIK 与成员窗口交叉验证的价值,是让这种看似完整的数据也必须通过经济身份检查。 独立重建使策略都失去优势,是很有力的敏感性证据,但不是名单完全正确的证明。两份来源可能共享上游错误;CIK 也通常标识申报主体,不自动解决同一发行人的多类股票。将发行人、证券、上市地点和指数席位拆开管理,才能避免把身份匹配率当成完整回测可用率。

最大限制

公开文件只有月度精度,不能直接用于日级指数纳入交易;6 个排除样本仍可能非随机。正文自身名单差额存在算术不一致,代码回收示例的具体交易所身份也应回查。本次读完文章,未独立逐行核对作者仓库或重跑前篇策略。

复现与研究价值

先为每次成员增删保存公告日、生效日、证券永久 ID、CIK 和原始证据,再抽样审核退市、并购和代码复用情形。把不同股票池的入选数量、行业敞口和策略收益逐项桥接;月频结果通过后再决定是否购买日级数据。此为未执行方案。

原文与核查

公开正文完整解析;未下载重跑作者成员文件及前篇策略。

原始文章 ↗

历史成分社区仓库

SEC 存续发行人代码映射

推荐 88/100 · 问题 29/30 · 证据 23/30 · 方法 24/25 · 复现 12/15

历史股票池是实盘前基础设施;明确的匹配规则和失败记录有复用价值,但名单算术与日级精度仍需审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

财报后漂移:9.6 个百分点的组间优势,调整市场敞口后只剩 0.1

Post-earnings-announcement drift decomposed by earnings predictability and gross profitability

Serhat Girgin / QuanterLab

一句话先讲结论

把 S&P 500 公司按“盈利可预测性 × 盈利能力”分成 9 组后,未对冲的 42 日 PEAD 策略里,稳定高盈利组平均年度收益 +6.6%,不稳定低盈利组 −3.0%,看起来差了 9.6 个百分点;但前者平均净多 38%,后者净空 31%。每天扣除这部分净敞口对应的指数收益后,两组变成 +2.4% 和 +2.3%,差异只剩 0.1 个百分点。

它到底在问什么?

PEAD 是否对不同公司一样强?盈利更稳定、盈利能力更强的公司,业绩超预期后是不是更容易继续漂移?这关系到在财报信号上再加质量筛选,究竟能不能增强 Alpha。

作者具体怎么做?

  1. 使用历史时点的标普 500 成分股。按过去 8 个季度盈利预测误差的稳定程度(至少 4 季度),与毛利润/总资产,各分三档,交叉形成 9 组。财务数据仅在 SEC 接受日期之后使用;这里的盈利能力不是毛利率。
  2. 信息公开的首个交易日收盘入场,盘后公告顺延;分别持有 5、10、21、42 个交易日。多空组合买显著超预期、空显著低于预期,另比较最强正向意外与全部公告都买。
  3. 2006—2025 年逐年检验。72 个研究设置加上 9 个市场敞口调整重跑,共 81 项登记研究。所有结果与排除窗口一并报告;登记指历史窗口评分前冻结规则,不是历史发生前的前瞻注册。

关键结果

原文结果与口径
核对项结果意味着什么
未对冲的组间收益差9.6 pct42 日持有期,稳定高盈利组减去不稳定低盈利组。收益为年度窗口收益平均值,不是 CAGR。
调整市场净敞口后0.1 pct按净资金敞口扣除指数收益,不是逐股 Beta 中性化。
严格筛选的组合收益差−2.0 pct/年相对不筛选,36 个设置中 30 个落后;并非每个单组都如此。

怎么理解?

最重要的拆解:看起来像“盈利质量增强 PEAD”的差异,主要被市场净敞口解释了。“多空”只表示允许做多和做空,不代表多空等额,更不代表市场中性。不同公司群体以不同频率触发正负信号,分组也顺便改变了市场方向暴露。 另一个有意思的结果:筛选最强正向意外后,投入资金的回报更高,但平均闲置资金也更多。现金不计收益,使整个组合反而落后。“更好的交易”不等于“更好的组合”;筛选的价值还取决于剩余资金如何配置,不能默认放大少量持仓就能无成本解决。

最大限制

市场调整仅在 42 日持有期执行,且不是逐股 Beta 对冲。全公告多头缺少同一组股票直接持有的基准,不能完全区分公司群体本身的收益与公告时点增量。成本未包含市场冲击;数据和平台结果未由本站独立复现。

复现与研究价值

A 股复现价值高,优先借鉴对照设计:盈利意外 × 盈利稳定性 × 盈利能力,同时做市场、行业、Size、Momentum 调整,并补上同组直接持有基准。尤其应区分业绩预告、快报和正式财报的首次信息时点,避免把已公开的盈利变化再次算作新信息。

原文与核查

已核对原文方法、表 2–6、讨论与登记说明;未独立执行作者回测。

原始文章 ↗

推荐 88/100 · 问题 29/30 · 证据 25/30 · 方法 23/25 · 复现 11/15

对照实验和结果完整报告值得借鉴;净敞口调整不等于风险中性,缺少同组直接持有基准,平台数据也尚未独立核验。分数评价阅读价值,不代表策略成功概率。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 工作论文导读

100 个 AI 投资人格年化 29.5%,却与一个普通提示的选股重合 92%

Do LLM “Crowds” Produce Investment Signals? An Empirical Test

Steven Edwards;导读 Quantpedia

一句话先讲结论

100 个 GPT-4o 投资人格各选 50 只美股,取提名最多的 50 只后,市值加权组合年化 29.5%,SPY 为 15.3%,六因子 Alpha 仍约 9.65%;但它与一个没有人格设定的普通提示组合重合 92%。最清楚的结论是角色数量没有带来多少选股多样性,而不是已经证明收益全部来自科技 Beta:原作者明确说,单一市场周期无法判定剩余 Alpha 到底来自信息、遗漏因子还是行情巧合。

它到底在问什么?

同一个大模型扮演价值、成长、逆向等不同投资者,能否像真正的智慧群体一样汇集独立信息?这里要分开两个问题:组合是否赚钱,以及一百个人格是否比一个普通提示多提供了信息。

作者具体怎么做?

  1. 作者构造 100 个不同投资哲学人格,每个要求选 50 只美国上市股票,合计出现 1,059 个不同代码;以出现频率最高的 50 个组成共识。
  2. 评估三个加权方案,公开导读重点报告市值加权结果;回测从 2024 年 1 月开始,共 561 个交易日,作者以模型标示的 2023 年 10 月知识截止时间安排检验区间。
  3. 用 Fama–French 五因子再加动量做收益归因,同时查看入选成分及普通单提示对照,检验人格的边际贡献。
  4. 对人格子集进行 bootstrap,25 个人格已能复现约 88% 的最终成分,完整组合与普通提示有 92% 重合;所有 50 只也都是标普成分,显示强烈知名公司集中。

关键结果

原文结果与口径
核对项结果意味着什么
市值加权年化收益29.5% vs SPY 15.3%回测表现不等于人格多样性的增益。
六因子年化 Alpha约 9.65%;t=3.27仍然显著,所以不能说六因子已经完全解释收益。
普通提示成分重合92%是多样性较弱的证据;不自动证明信息独立性的所有统计定义均被检验。

怎么理解?

对量化研究员,真正能带回去的是实验对照:在搭建几十个 Agent 前,先做一个不扮演角色的朴素版本,看看复杂架构究竟改变了什么。如果最终都在重复同一批大公司,增加人格很可能主要增加调用成本与看起来充分的讨论,而不是独立信号。 但这里也要比导读的强结论谨慎一步。知名科技股集中可以解释为何怀疑风格行情,尚不能证明剩余 Alpha 必然虚假。下一步应匹配行业、规模、成长、质量和实际权重,再跨不同市场环境比较;同时冻结具体模型快照和提示生成日期,知识截止标签不能单独保证完全不存在后训练信息或版本变化。

最大限制

SSRN 原文页返回 403,本次完整解析公开导读并区分其转述与作者更谨慎的结论,未核验原始全部提示、权重、股票池和代码。样本只有一个主要市场环境;成分重合率不是完整的独立信息检验,训练截止也不是无泄漏的充分证明。

复现与研究价值

将预算相同的单模型重复采样、多角色、不同模型、不同独立信息源四组放在同一个事前确定的美股候选池中,冻结提示和可见日期。先比较成分/权重/预测误差相关,再比较风格中性、净费用的样本外组合表现;不要只增加角色个数。

原文与核查

公开导读与其所引作者摘要/结论完整解析;SSRN 全文受限,未独立重跑。

原始文章 ↗

原工作论文 SSRN 6543239

推荐 85/100(暂定) · 问题 30/30 · 证据 22/30 · 方法 24/25 · 复现 9/15

多角色边际贡献的对照直接命中 AI 量化实践;单周期和原始材料未核验限制收益解释。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

PEAD 平均年收益从 −0.5% 变 +2.2%:入场日期变了,实际上连组合定义也变了

Post-earnings announcement drift 2006-2025

Serhat Girgin / QuanterLab

一句话先讲结论

同一历史标普股票池,季度初统一建仓的 PEAD 多空网格平均年收益 −0.5%;改成各公司财报已知后的首个收盘入场,平均变 +2.2%,十日持有达到 +3.1%。但这不只是把同一批交易提前:筛选从季度前五/后五变成滚动历史分位,持仓数与净多空也随消息变化。论文识别了事件时点的重要性,尚不能把全部改善都归为“更早入场”。

它到底在问什么?

大型股财报漂移究竟消失了,还是慢频组合形成时已经错过可捕捉窗口?回答前必须确保比较的事件年龄、筛选规则和风险暴露可拆开。

作者具体怎么做?

  1. SUE 为实际 EPS 减一致预期,除以公司过去八次惊喜的波动,至少四次历史才可评分;作者避免价格缩放与供应商拆股重述基准混用。
  2. 季度版本每季初取过去九十天报告,行业内买五个最大、空五个最小惊喜,固定持有后空仓到下季。
  3. 公告版本以过去 365 日行业惊喜池的 80/20 分位为阈值,正负号须与方向一致,已知公告后的首个收盘进入,所以排除隔夜跳空和首日反应;每公司只许一个未平仓。
  4. 成本按流动性分单边 1.5/3/6bp,空头年借费 50bp,记录 4,400 个计划窗口中 3,990 个执行、410 个因行业最低十五公司门槛排除。

关键结果

原文结果与口径
核对项结果意味着什么
网格均值−0.5% → +2.2% / 年配置年收益的均值,不是一个等权可投资合并组合的 CAGR。
公告后持有形状10 日 +3.1%;63 日 +0.2%平均效果随持有期衰减,与短期吸收窗口相符,但仍含暴露变化。
科技 21 日−3.0% → +10.5% / 年公告组净多倾向约 +0.23,作者也承认仍需 Beta 中性重跑。

怎么理解?

这篇胜在把形成日和事件日的区别量化,而不是泛泛说 PEAD 有或没有。一个因子按季度可算,不代表它在季度初仍有信息;事件信号的研究坐标首先应该是公开时点,而不是方便的数据频率。 但因果解释需要进一步收窄。两种版本同时改变阈值、资金使用率和净仓位,不能称为只移动一个日期的严格消融;全网格净多比例与收益低相关,也不能代替逐日 Beta 对冲。作者把既有历史按顺序冻结记录,确实约束了程序流程,却不是在 2006 年真正预注册未来测试;附录对此诚实说明,应保留。

最大限制

供应商一致预期历史、EPS 重述、事件时间戳及平台代码未独立复核;借费常数不反映稀缺,冲击成本缺失。行业分类变化令部分行业样本较短。所谓 90% deflated-Sharpe 数字也不是策略真实有效的客观后验概率。

复现与研究价值

做四格实验:固定同一筛选只改日期、固定日期只改筛选,再对照资金利用率和 Beta 中性版本。特别核查科技的 +10.5% 在逐日敞口扣除后剩多少;真正价值在于事件时间对齐,而非直接采用最好行业格。

原文与核查

公开研究全文、所有主要表及附录说明已读;未独立运行平台。

原始文章 ↗

推荐 88/100 · 问题 29/30 · 证据 25/30 · 方法 24/25 · 复现 10/15

完整网格和事件方法信息量高,主动披露排除及偏多;关键输入和分离效应仍需独立复核。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 工程实践

AI 研究系统的核心不是多跑回测,而是阻止错误结果进入决策

The Quantish Research Harness

Quantish

一句话先讲结论

一个加密策略原本报告累计收益 +139%,订单对账才发现保证金设置让 63% 的计划入场没有执行;修正后基准收益降到 +81.6%,回撤反而加深。Quantish 因此把 AI 研究助手放进预注册、代码审核、订单核对和样本外检验的固定流程:文章真正有价值的不是声称 AI 找到两条策略,而是展示哪些检查曾把漂亮结论推翻。

它到底在问什么?

当 AI 可以快速改代码、跑参数、写解释,研究团队如何阻止它把实现错误、单月好运和反复试验包装成稳定策略?

作者具体怎么做?

  1. 看到结果前先把假设、数值接受标准和停止条件提交 Git;新功能默认关闭,关闭时要求原基准保持不变,避免实验污染已经接受的版本。
  2. 影响判决的脚本必须以哈希通过独立对抗审核,才允许运行。回测后先检查新代码是否真正触发、计划订单是否对应成交或明确拒单,再讨论收益。
  3. 参数扫描寻找附近设置共同有效的区域,而不只报最优点。只有预先选定的候选进入隔离样本外,按费用、滑点和借券成本计算,并报告相对基准差值的置信区间。
  4. 将失败试验也保留永久记录与证据包;一个 41 次调参研究的全部样本内赢家在样本外反转,于是保留旧基准,而不是继续扫描直到出现想要的答案。

关键结果

原文结果与口径
核对项结果意味着什么
执行错误修复+139% → +81.6%作者两次基准累计收益,文章未给出足以重建完整年化口径的流水。
订单覆盖缺口63%计划入场未执行比例;被过滤的交易恰好美化了旧回测。
参数优化失败41 次试验作者称全部样本内赢家样本外反转,说明系统保留负结果,而非证明检验绝不会失效。

怎么理解?

最值得移植的是“先验证试验确实发生”。编译通过、云任务成功、出现净值图,只能证明程序跑完;如果仓位、拒单或新分支触发率错误,后面的 t 值再严谨也只是分析错误对象。订单不变量通常比再加一个高级统计检验更早救命。 不过,哈希审阅与预注册不是自动免疫系统。审核者可能共享同一错误,研究员也可能不断启动新的预注册项目来消费同一份样本外。真正需要持久记录的是整个研究族的尝试次数、数据接触历史和失败原因,而不只是单个获胜项目的完整日志。

最大限制

文章是系统作者自述,没有公开完整代码、两条策略交易流水或独立复核,因此不能据此认定其策略可部署或收益可信。bootstrap 如何处理时间依赖、整个研究族如何校正多重检验,也未充分展开。

复现与研究价值

可先落地最小版本:策略规格锁定、默认关闭实验开关、目标仓位—订单—成交三段对账、参数试验账本和一次性留出集。让助手生成结论前强制输出未成交比例、收益贡献最集中的月份与净成本差,再由人决定是否推进;不必照搬完整平台。

原文与核查

公开工程文章全文已读;未获得作者完整系统与交易记录。

原始文章 ↗

推荐 83/100 · 问题 29/30 · 证据 20/30 · 方法 24/25 · 复现 10/15

研究治理和订单对账高度实用;案例缺乏独立流水验证,不能当作业绩证据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 宏观量化研究

黄金宏观支持分数在1996—2026年预测下一季度金价的相关性超过25%,但单一黄金合约的策略Sharpe只有0.5

Gold and macro factors

Ralph Sueppel(Macrosynergy)

一句话先讲结论

一句话先讲结论:作者以美国政策宽松、美元稳定性担忧和全球经济悲观三类宏观主题合成黄金支持分数;1996—2026年该分数与下一季度COMEX黄金期货收益的相关性超过25%、月度方向准确率和均衡准确率均超过55%。按月末信号、次月持仓、10%波动目标的长短模拟,长期Sharpe约0.5、Sortino约0.7、累计非复利收益超过200%,但没有扣交易成本且只有一个合约,故它是低频宏观信号的候选证据,不是可直接下单的金价预测器。

它到底在问什么?

慢频宏观信息能否在金价及金相对股票表现上提供可交易的前瞻信息,而不是只对历史叙事做解释?

作者具体怎么做?

  1. 将构成变量按概念、主题、总分三层等权聚合,并对慢频宏观变量做滚动标准化与±3σ截尾。
  2. 用月末分数预测下月、季度末分数预测下一季COMEX黄金期货收益,报告相关性与方向准确率。
  3. 构造10%波动目标的长短及只做多、0到2倍风险暴露模拟;月末调仓并假设1日滑点,但不扣交易成本。
  4. 再将黄金与标普期货构成相对收益目标,检查绝对黄金分数能否迁移到跨资产配置。

关键结果

原文结果与口径
核对项结果意味着什么
预测关系广义支持分数与下一季度黄金期货收益相关性超过25%,系统性概率超过99%低频季度关系强于月度,但不代表每月都有可交易边际。
方向命中月度普通与均衡准确率均超过55%;正收益命中57%、负收益54%略高于随机,经济价值仍须依赖仓位与成本。
长短模拟10%波动目标Sharpe约0.5、Sortino约0.7;非复利累计收益超过200%单合约慢频策略有正风险调整表现,但未纳入成本和真实容量。
长仓择时管理暴露年化6.6%、波动14.1%;恒定多头4.1%、11.9%提高收益伴随更高实际波动,不是无风险增强。
金股相对配置黄金对股票相对收益模拟Sharpe约0.3、Sortino0.4绝对黄金信号迁移到相对资产配置后明显变弱。

怎么理解?

文章的优点不是一串宏观故事,而是明确说明了慢变量为何不宜用短样本机器学习优化,并用概念等权降低事后拟合。弱点也很明确:三大主题和许多成分指标本身具有研究者自由度,且长样本中黄金的大行情并不多。对组合经理而言,最应检验的是信号是否在黄金相对权益、通胀冲击和实际交易成本后仍有增量,而不是只看绝对黄金的历史曲线。

最大限制

作者不扣交易成本、买卖价差和期货滚动执行成本;文中多个频率、指标和策略变体带来多重检验风险。底层宏观数据和版本修订可影响点时点可得性,且30年样本中的独立极端周期很少。单一合约策略的容量、保证金和风险预算也未建模。

复现与研究价值

以实时vintage宏观数据复建每个成分并锁定发布滞后;预先选择月度或季度频率、仓位函数和成本模型,在近年留出样本验证。与通胀、实际利率、美元趋势等简单基准做增量回归,并将黄金信号放入多资产风险预算,报告对组合Sharpe、回撤与换手的边际贡献。

原文与核查

公开正文完整阅读;未取得底层实时数据和代码。

原始文章 ↗

推荐 81/100(暂定) · 问题 26/30 · 证据 25/30 · 方法 22/25 · 复现 8/15

信号结构、长样本和经济解释清楚,但底层专有数据、成本缺失、多重研究自由度和未独立复现限制了可信度。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文解读

股价能帮忙估计经济,但不是因此就能预测股价

What Daily Stock Returns Tell Us About the Economy

Larry Swedroe;研究:Fabrizio Ghezzi

一句话先讲结论

这项研究把日频美股和低频宏观发布放进同一个状态空间模型,得到的经济活动因子与月度 CFNAI 相关约 0.80,对下一月 CFNAI 的解释力约 50%;但它并不能预测股票收益。值得借鉴的是如何用金融市场补充经济实时估计,不是把‘经济预测有效’直接翻译成‘股市择时有效’。

它到底在问什么?

GDP 和就业发布慢、频率低,投资者却每天都在吸收新信息。作者想知道,日度股价中有没有可提取的真实经济信号,以及它究竟反映未来现金流,还是只反映折现率变化。

作者具体怎么做?

  1. 使用 1950—2019 年样本,把日频 S&P 500 与不同发布频率的实体经济指标合并;正文强调按发布时点使用初值。
  2. 通过 Kalman 框架提取共同状态,再观察它与传统景气指标的同步关系和预测关系。
  3. 分别预测实体活动、现金流、股票收益及通胀;不能只展示最成功的一类预测目标。

关键结果

原文结果与口径
核对项结果意味着什么
宏观同步性CFNAI 相关约 0.80说明状态因子与传统景气概念接近,不等于新增预测信息。
实体预测下一月 CFNAI 约 50%;GDP 18%—30%原文报告的解释力;不同目标和频率不能横向当作同一个准确率。
投资边界未发现股票收益和通胀预测能力不能据此声称已有可交易择时信号。

怎么理解?

这篇最有用的区分是信息提取与收益预测。股价能够及时反映现金流消息,恰好可能使这些消息难以继续预测收益;一个不错的经济实时估计器,并不欠我们一条赚钱曲线。对研究团队而言,它更可能用于情景分析和宏观风险监测。 真正需要核验的是增量信息:把股票输入拿掉,仅保留同样的宏观发布,再比较预测误差。CFNAI 等指标与模型输入共享宏观成分,较高相关性并不全是股市贡献。此外,要区分实时过滤和全样本平滑;后者会用到之后的数据。状态自相关接近 0.99,也可能部分来自建模时的平滑约束,不能单凭持久性认定抓到了经济基本面。

最大限制

完整原论文及实时版本数据库未逐项核验;正文预测解释力不是交易回测,亦没有给出经济监测转换成仓位规则的净收益。

复现与研究价值

未执行的研究方案:固定发布日期版本,比较宏观单独模型与加入股票模型的滚动实时预测误差,再检验是否改善风险预警;最后才单独设计交易实验,不把宏观预测分数冒充策略表现。

原文与核查

收录解读正文完整阅读;原论文未完整核验。

原始文章 ↗

收录原文

推荐 78/100 · 问题 26/30 · 证据 22/30 · 方法 23/25 · 复现 7/15

问题和目标拆分清楚,但完整实时构建与增量基准仍待核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法讲解

基准相关 99.44%,仍能凭空制造 0.66% 的 Alpha

CAPM after Markowitz: Portfolio Choice Meets the Market

Denis Joly

一句话先讲结论

作者在严格满足 CAPM 的八资产人工总体中,只把真实市场换成不完整代理,保持所有资产收益和协方差不变:代理与真实市场相关 90.30%,最大表观 Alpha 已达 3.36%/年;即使相关高达 99.44%,也能出现 0.66%。因此回归剩余收益首先是‘相对这个基准的剩余’,不是自动获得了独立选股能力证明。

它到底在问什么?

Markowitz 给定预期收益和协方差后求最优组合,CAPM 则问什么预期收益能使所有人的最优需求与市场供给一致。本文重点解释从组合选择到资产定价多加了什么,以及实证时丢失了什么。

作者具体怎么做?

  1. 构造八资产正定协方差及供给权重,以 2% 无风险利率、6% 市场风险溢价生成满足 CAPM 的预期收益。
  2. 删除私人企业与房地产等成分构造代理,解析计算定价误差,隔离代理错误而不引入抽样误差。
  3. 再用固定版本 French 六个规模×账面市值比组合做真实数据回归:分别报告个体稳健区间与经典 GRS 联合检验。

关键结果

原文结果与口径
核对项结果意味着什么
人工代理误差最大 3.36%/年不是交易回测,而是已知总体下仅更换基准产生的解析误差。
高相关仍有误差相关 99.44%;Alpha 0.66%高相关不能保证定价关系足够接近。
真实六组合小盘价值 Alpha 3.86%/年区间约 0.51%—7.21%;相对美国股票代理,不是所有财富市场。

怎么理解?

这对量化团队的直接用途是改写业绩归因语言:先说明基准资产范围、权重、频率和币种,再谈 Alpha。用沪深300解释小微盘组合、用股票指数解释多资产策略,残差很容易同时包含缺失风险暴露,不能把正截距统称为研究能力。 文章也谨慎区分两种统计检验:个体区间采用 Newey–West,经典 GRS 的精确 F 分布却仍有独立同分布及正态条件。不能因为图上的区间稳健,就把联合 p 值也称为同样稳健。代理问题既不能被忽略,也不应成为所有策略回测的免责借口;应该用预先指定、经济上合理的多个基准检查结论敏感性。

最大限制

收录全文与公式阅读,作者代码未独立运行。人工总体只展示可能机制,不证明实际 Alpha 都由代理误差造成;长样本平均关系也可能掩盖时变暴露。

复现与研究价值

未执行方案:对同一策略固定交易流水,预先指定宽基、规模风格及行业等嵌套基准,比较截距与残差,并用稳健联合检验和分阶段归因报告对基准选择的依赖。

原文与核查

收录全文完整解析;配套代码未独立运行。

原始文章 ↗

推荐 92/100 · 问题 28/30 · 证据 27/30 · 方法 25/25 · 复现 12/15

机制隔离和实证边界清楚,数据版本与可重建说明充分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

十币周频动量只有 0.37 夏普;但这次“复现失败”本身也有成本和口径问题

I built paper-spec crypto strategy on 5.8 years of data. It's lost money every year since 2024

Patrick Mortenson

一句话先讲结论

作者用 10 个主流币,每周买过去一周最强的 3 个、卖最弱的 3 个,2020 年末至 2026 年 9 月的 303 次调仓只得到 0.37 年化夏普、41.7% 最大回撤;2025 年亏 24.0%,2026 年前 34 周亏 11.1%。但标题说“2024 年以来每年亏损”,正文 2024 年却是 +0.4%,成本计算也疑似未按组合权重汇总:这是一份值得追查的失败报告,尚不足以宣判加密截面动量已失效。

它到底在问什么?

文献中的短期加密动量优势,在较新的大币种样本里能否直接复制,而不靠调参数挽救?

作者具体怎么做?

  1. 币池是 BTC、ETH、SOL、XRP、DOGE、BNB、ADA、AVAX、LINK、LTC,行情采用 Binance 现货日收盘,区间 2020-10-31 至 2026-09-02。每七天排序一次。
  2. 买前三、卖后三,每腿占组合六分之一,中间四个不持有;持有一周后更新。文章假设每次全部换手,单边成本 0.15%,同时用永续合约执行费率描述成本,却没有加入资金费。
  3. 先汇总 303 个周收益,再逐年拆分:2020 年仅八周收益很高,2021 接近平,2022—2023 较好,2025—2026 明显亏损。
  4. 作者把较差结果解释为可能的套利竞争、机构化或币池过窄,但没有分别检验这些机制,也选择不继续扫描参数。

关键结果

原文结果与口径
核对项结果意味着什么
全样本风险收益Sharpe 0.37 / MDD 41.7%作者报告的扣费结果,成本代码尚未核验,不能直接作为同类策略可靠基准。
近期收益2025 −24.0%;2026 −11.1%2026 仅前 34 周;不能把“86 周合计负收益”说成连续 86 周每周亏损。
标题与表格冲突2024 +0.4%正文并非 2024 年起每年负收益,需保留这一重要反例。

怎么理解?

逐年拆解比一个总夏普更有价值:较早的八周暴涨可能长期支撑总样本均值,而对当前部署者帮助不大。不过,低胜率本身不证明套利耗尽;动量可以依赖少数大赢家,必须同时看盈亏比、收益尾部和每年风险暴露。 更重要的是执行口径。文章称六腿完全轮换导致每周约 1.8% 组合成本;按其每腿六分之一、来回 0.30% 的文字定义,总资产口径应先权重加总,不能直接六倍。另一个问题是用现货价格模拟空头永续,而默认资金费多空抵消;不同币种资金费并不相同。这些问题未修复,失败可能同时含有信号衰减和记账偏差。

最大限制

十个现存大币的回看选择有幸存者偏差;没有逐笔代码、永续收益及资金费核验;文章所谓真实夏普大于零的 81% 概率未说明统计假设。终值 1.47 的“约 6.8% 年化”也只是作者近似报告。

复现与研究价值

先核查六腿加权成本、持仓延续时的真实换手、可做空日期和资金费,再用当时可交易币池重做原规格。冻结规则后分别报告 2020—2023 与 2024 以后净收益;比较基准差异时,不把增加币种或重扫窗口当成无代价修复。以上未执行。

原文与核查

公开正文全文已读并检查内部数字一致性;未取得作者本地回测 JSON。

原始文章 ↗

推荐 69/100(暂定) · 问题 25/30 · 证据 15/30 · 方法 19/25 · 复现 10/15

负结果与年度拆分有价值,但成本权重、标题及现货/永续口径存在实质疑点。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 产品公告

EigenScore 是量化编程练习场,不是用 Elo 证明投资能力的研究论文

EigenScore is Live: The First Rated Contest Platform for Quants

Vertox

一句话先讲结论

EigenScore 首发提供 50 道量化题,分精确答案、预测和决策优化三类,并计划用两小时五道题的竞赛累积 Elo 评分。它适合检验概率、数值和建模基本功;公告没有证明高排名能预测真实交易绩效,也没有公布判题器独立验证,所以不能把“量化竞赛评分”当成研究员的 Alpha 分数。

它到底在问什么?

量化能力很难只靠简历和自述判断,能否建立有固定问题、隐藏测试和持续评分的公开练习环境?这是训练与评估工具问题,不是市场定价问题。

作者具体怎么做?

  1. 作者称首发题库有 50 道原创题,覆盖概率、组合数学、鞅、随机微积分、期权定价、组合优化、时间序列与数值方法。用户在浏览器提交 Python。
  2. 标准题利用容差检查数值答案,预测与优化题使用不同的相对基准。若要比较能力,需要进一步知道各题基准、隐藏测试分布和不同题型分数如何合成。
  3. 公告介绍限时、限内存的隔离虚拟机运行,每次提交后销毁环境;另有两小时、五题的同时竞赛及持续更新的 Elo 等级。
  4. 所有题目、参考解和测试由作者制作;首发公告征求错误判决和不清楚题意的反馈,意味着题库和评分机制仍处于早期迭代。

关键结果

原文结果与口径
核对项结果意味着什么
首发规模50 道题作者公布的上线题库数量,不是独立试用核验后的持续库存。
竞赛设置2 小时 / 5 题评测时长和题数,不是研究项目的工作量标准。
投资有效性未报告没有高 Elo 与真实样本外 Alpha 的验证,不能据此筛选可投资策略。

怎么理解?

对研究团队,最合适的用法是把题型映射到具体短板:概率推导、估计误差、数值稳定性、约束优化。比起只看总分,复盘同一道题为何失败,往往更能指导培训。短时竞赛尤其擅长测熟练度,却未必能测数据取证、金融制度理解和长期研究纪律。 评分质量也有自己的模型风险。参考答案错、容差过窄、训练分布与隐藏测试不一致,都会让排名反映判题机制而不是能力。对于预测和决策题,还应检查是否存在可利用的固定随机种子、重复提交反馈和基准信息泄漏。公告尚未给出这类验证。

最大限制

这是一篇产品上线公告,不是实证论文;本次未注册、提交代码或审计虚拟机安全。正文称 9 月 8 日为周一,与 2026 年日历不符,不能将该句作为可靠的活动时间提醒。

复现与研究价值

若用于团队培训,可先选少量已知答案的题检查容差和重复性,再按知识模块记录错误而不直接按总 Elo 排人员。招聘时仍需另测真实数据清洗、研究审计和解释能力;不要让游戏化分数替代工作样本。

原文与核查

公开上线公告完整阅读;未实际使用或安全审计平台。

原始文章 ↗

EigenScore 平台

推荐 54/100(暂定) · 问题 16/30 · 证据 14/30 · 方法 16/25 · 复现 8/15

量化训练入口有一定价值,但目前只有产品自述,没有题库或投资相关性的独立验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 资产配置与分散化研究

Dalio“15条独立收益流”在可交易ETF架上只剩3.3个有效赌注:三基金ERC年化8.00%,十五基金仅3.78%

Dalio Holy Grail walked 2008-2025

Serhat Girgin(QuanterLab)

一句话先讲结论

一句话先讲结论:将可交易ETF按Dalio图示统一到10%波动率后,2008—2025年十五只基金的平均两两相关性为0.257,只相当于3.3个独立赌注,2022年降至2.1;在18个季度再平衡、点时点ERC样本外窗口中,SPY/TLT/GLD三基金组合年化8.00%、Sharpe 0.88、累计+299.5%,而十五基金ERC仅3.78%、0.60、+94.9%,三基金在18期中胜16期。结论不是“少持仓必然更好”,而是相关资产的名义数量不等于有效独立风险源,盲目把高度重叠的ETF塞进风险平价会压低回报。

它到底在问什么?

Dalio的“15条不相关收益流能显著降风险”在真实、流动、可交易ETF架上能否成立?扩大菜单的分散化收益是否足以补偿其对长期回报的拖累?

作者具体怎么做?

  1. 预先固定3/5/7/10/15基金菜单;每季仅利用当日可得的252日收益估计ERC权重,随后走一年样本外,连续18个窗口。
  2. 同时把每只基金缩放到10%波动率并等权,用平均两两相关性换算有效下注数,直接对应Dalio的理论图。
  3. 统一计入分配与10bp单边成本,比较菜单宽度的年化、Sharpe、回撤、逐年度胜负和经六条规则族调整的DSR。
  4. 以15基金逆波动组合为相关性盲对照,检验协方差矩阵是否改变结论。

关键结果

原文结果与口径
核对项结果意味着什么
有效分散化15基金平均相关性0.257,对应3.3个有效赌注;2022年2.1个可交易货架离15个相互独立的风险源很远。
三对十五三基金ERC:年化8.00%、Sharpe0.88、回撤-22.9%;十五基金ERC:3.78%、0.60、-19.1%宽菜单降波动和回撤,但牺牲了4.22个百分点年化。
逐窗口比较三基金胜16/18窗口;配对bootstrap为100%该样本内优势并非仅由一个年份带动,但仍是同一资产时代的18段记录。
宽度地板7/10/15基金ERC年化3.84%/3.91%/3.78%每类资产至少一只后继续加同类资产,回报几乎不再提高。
逆波动对照十五基金逆波动年化4.06%、Sharpe0.61完整协方差ERC并未在该宽菜单上显著优于相关性盲权重。

怎么理解?

这篇最有用的是把“持有多少只”改写为“持有多少个有效赌注”。不过作者的三基金恰好高度受益于2008后长债和黄金的历史表现,不能据此推导任何未来三资产配方。研究更适合作为组合构造诊断:先看相关性结构与边际风险贡献,再决定是否值得增加一只看似不同、实则冗余的基金。

最大限制

菜单是作者定义的流动ETF集合,成员资格与资产类别选择仍具主观性;18个年度窗口未覆盖更早的结构性通胀时期。ERC协方差窗口、再平衡频率和成本假设也可能改变排序;源策略的历史搜索不可知。完整代码和逐季权重未公开,因而不可独立逐笔核验。

复现与研究价值

在自己的可投资池按点时点数据计算有效下注数、边际风险贡献和资产类别聚类,而非直接照搬SPY/TLT/GLD。用滚动不同协方差窗、收缩估计、风险预算约束和税后成本比较3/5/7/10/15的宽度前沿;在中国、全球债券及商品的独立样本外时期检验结果。

原文与核查

公开全文、方法、表格和逐窗口记录完整阅读;未独立重跑。

原始文章 ↗

推荐 90/100 · 问题 28/30 · 证据 28/30 · 方法 24/25 · 复现 10/15

问题与度量直接、菜单家族完整披露、样本外与DSR均有报告;但菜单选择、长期单一时代和未公开代码限制外推。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

隔夜轮动号称每年翻倍;90 日选股并不自动消除筛选偏差和开收盘成交风险

2x Your Portfolio Every Year: How I Turbocharged the Overnight Effect

Stuart Farmer

一句话先讲结论

作者先按 2020—2025 年隔夜表现挑出十只股票,得到未扣费的 727.6% 年化,再改用过去 90 个交易日排名、每 7 日更新持仓,并假设每次买卖各 5bp,宣称仍接近每年翻倍。但他明确说这些参数是“找到最好”的设置,滚动计算并不等于未调参的样本外;极高收益首先要求核查价格复权、股票池和开收盘可成交量,而不是相信标题。

它到底在问什么?

股票收盘到次日开盘的收益差异,能否通过动态选股持续捕捉?核心不是市场整体存在隔夜溢价,而是过去最会隔夜上涨的股票是否还能在下一段时间继续如此。

作者具体怎么做?

  1. 第一步在 2020—2025 年选择隔夜总收益最高的十只完整存续股票,另列上市或退市导致历史不完整的股票组,展示未扣费结果。
  2. 将收益的自然对数取四次方作为分数,按分数分配权重,删除低于 1% 的权重后再归一化。四次方的选择来自作者偏好的尖锐程度,不是预先证明的最优经济形式。
  3. 滚动版本每七日使用此前 90 个交易日重新选择股票,设置市值下限十亿美元;持仓仍每天收盘买、次日开盘卖,因此选股七日更新不代表每七日才交易。
  4. 模拟单边 5bp、来回 10bp 摩擦。行情依赖 Massive 数据,完整策略和 notebook 位于付费订阅区,公开另有数据下载工具。

关键结果

原文结果与口径
核对项结果意味着什么
事后十股初筛727.6% CAGR未扣费、经过选优的历史结果,不能解释为可执行预期收益。
滚动设置90 日形成 / 7 日更新内部信号向前滚动不排除研究者在全历史上选择这组参数。
执行假设5bp / 单边每天隔夜交易的成本假设;不覆盖所有容量、冲击和开盘异常情形。

怎么理解?

文章最有研究价值的方向是检验隔夜收益的截面持续性;最危险的跳跃,则是从指数隔夜溢价直接跳到数倍年化。极端赢家可能集中在低价格、复权事件和开盘跳变较多的证券,少数错误数据就会被四次方加权进一步放大。 真实下单还存在时点约束:若用当日最终收盘价确定名单,又假定同一个收盘价成交,收盘竞价订单截止时间可能不允许这一过程。开盘价也不是无限容量的报价。先证明信号形成时已经可知、目标股当时满足市值过滤,再讨论手续费能否低到 5bp,顺序不能反过来。

最大限制

公开正文足以解释规则,但完整代码和明细图表未核验;未见完全冻结规格后的独立持出期、点时股票池、实际开收盘订单与容量检验。作者对做市商行为的机制猜测不是本文已识别的因果证据。

复现与研究价值

用未复权成交价建立现金流,再独立处理拆股和分红;剔除明显坏价,并按开收盘成交额限制参与率。冻结 90/7 与加权规则,保留真正未接触时段,同时对收盘提前形成信号、次日执行和 10—30bp 摩擦做压力测试。以上尚未执行。

原文与核查

公开正文完整解析;付费代码及图表详细绩效未核验。

原始文章 ↗

公开行情处理工具 massivepull

文章引用的隔夜机制工作论文

推荐 64/100(暂定) · 问题 24/30 · 证据 15/30 · 方法 17/25 · 复现 8/15

规则具体、问题值得查,但极端收益与多层选优、复权及竞价时点风险要求先审计再研究。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

纯噪声也能被 AI 做出 2.12 夏普:不仅要记录试了多少,还要记录拼了多少

A Sharpe of 2.1 From Nothing: The Second Number Your Agent Doesn't Log

Jonathan Kinlay

一句话先讲结论

在按构造没有收益可预测性的 12 组模拟数据上,研究 Agent 做出的组合样本内夏普平均 2.12,样本外只有 0.18、且误差很大;单靠试验次数能解释约 54% 的样本内分数,再把最终拼入多少个子信号算进去,就能解释约 88%。因此日志只记跑了几次回测还不够:把一堆幸运赢家组合起来,也会制造漂亮但不真实的分散收益。

它到底在问什么?

AI 提高研究速度后,到底更容易发现真实规律,还是更有效率地把噪声选成 Alpha?如果所有调用都可记录,能否据日志测量这台研究机器的过拟合能力?

作者具体怎么做?

  1. Agent 每轮最多提交 25 个表达式、最多 12 轮,只看到匿名样本内评分,测试集文件物理隔离;每轮假设和调用记录保存,策略按一天滞后构建资金中性排序组合。
  2. 每次最终报告三条信号,但 Agent 的信号内部可以是多个表达式相加。模拟实验中,中位试验数为 146,最终组合实际上约有 12.5 条相加子腿,而机械搜索通常只有 3 条。
  3. 在没有 Agent 的零 Alpha 数据上,单独模拟从 N 条随机表达式取最好的 k 条再平均,得到选择加组合的基准曲面;按 Agent 实际 N 和 k 预测夏普 1.86,对照实际 2.12。
  4. 再以 1,280 只 NASDAQ 股票、2018—2023 数据作现实检查:Agent 训练夏普 3.10,留出为 0.72,但不同搜索组样本外差异落在较宽置信区间内,不能据此认定 Agent 更差。

关键结果

原文结果与口径
核对项结果意味着什么
零 Alpha 模拟IS 2.12 / OOS 0.18样本外标准误 0.44,与真实零一致;不是可交易模型业绩。
选择加组合解释1.86 / 2.12 ≈ 88%是此实验的校准解释量,不是所有 Agent 业绩统一扣减比例。
真实面板3.10 → 0.72有幸存者与单一持出路径限制,不能用简单差值识别全部过拟合。

怎么理解?

最重要的贡献是把“研究自由度”从单个候选数扩展到组合结构。均值选高以后,再靠部分低相关腿降低波动,会把同一份样本内好运包装成风险分散。纠正时必须让随机基准拥有与真实搜索相同的表达式语法、加总能力和组合选择过程。 作者也做了很好的自我否定:用模拟过拟合夏普直接从真实训练夏普扣掉,碰巧对 Agent 接近,却在其他组明显失准,因此它不能预测未来业绩。另一个泄漏筛查因为构造方式注定难以触发,作者明确承认无效。这些负结果比一个漂亮的“AI 风险折扣公式”更可信。

最大限制

只有单循环研究助手和少量独立面板;模型中途切换,具体快照日志不完整;真实股票集带幸存者条件,测试期可能在模型训练语料内。本文未独立运行仓库;模拟零 Alpha 依赖生成器确实没有未预期预测结构。

复现与研究价值

给研究日志增加最终表达式树、实际子腿数、被拒试验与模型版本,并在进入真实数据前先让完整流程跑零 Alpha 面板。将整套选择和组合机制一起校准;不把 2.12 当统一扣减,也不让研究助手用经济故事替代独立验证。

原文与核查

作者公开全文及限制完整解析;未独立执行仓库。

原始文章 ↗

作者代码与预注册日志

推荐 93/100 · 问题 30/30 · 证据 26/30 · 方法 25/25 · 复现 12/15

问题、对照、失败预注册与机制拆解完整,直接适合 AI 研究治理;仍需独立运行和更多模型重复。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 风险平价与杠杆研究

真正的All Weather在扣融资后落后60/40:毛收益只多0.11个百分点,0.93个百分点的借款成本把年化变成7.02%

All Weather built and tested against inverse vol, ERC and a 60/40

Serhat Girgin(QuanterLab)

一句话先讲结论

一句话先讲结论:作者用SPY、TLT、IEF、GLD、DBC五腿重建真正的All Weather——即ERC风险平价按60/40波动率杠杆,而不是零杠杆的All Seasons配方;2008—2025年18个样本外窗口中,融资前All Weather年化7.95%,仅比60/40的7.84%高0.11点,但按每年起点的3个月国库券利率+50bp计融资后降至7.02%,落后60/40 0.82点。融资成本年化0.93点大于毛超额,是否收费足以反转结论。

它到底在问什么?

零杠杆的All Seasons固定配比常被误当作Dalio的All Weather。若把风险平价杠杆、真实无风险利率和借款利差计入,All Weather还能否在相近波动率下胜过60/40?

作者具体怎么做?

  1. 固定五只流动ETF及18个年度样本外窗口;季度更新权重,所有估计只用当时已有数据。
  2. 比较固定All Seasons、逆波动、无杠杆ERC及杠杆ERC;仅杠杆ERC按点时点国库券+50bp扣融资。
  3. 将所有策略总收益和10bp成本统一处理,与同口径60/40比较年化、波动、Sharpe、回撤及逐窗口差。
  4. 分解融资在各年造成的拖累,检查未收费、固定利差和真实利率的结论是否一致。

关键结果

原文结果与口径
核对项结果意味着什么
融资前后杠杆ERC融资前年化7.95%,融资后7.02%;60/40为7.84%毛超额只有+0.11点,融资后变为-0.82点。
风险匹配All Weather波动11.6%,60/40为11.9%落后并非来自刻意把组合降风险;融资成本是主要差异。
全样本形状杠杆ERC累计+239.2%、Sharpe0.64、回撤-27.7%;60/40+288.8%、0.69、-34.8%它牺牲收益换取较浅回撤,但没有提高Sharpe。
结果脆弱处2009和2013合计相对60/40少38.4点;余下16窗口反而多22.9点不能从全样本负差推断其在任何环境都无效。
零杠杆配方All Seasons年化6.19%、Sharpe0.76;无杠杆ERC年化5.08%、Sharpe0.73固定配方的优势很大部分来自长债配置,不能混同于杠杆风险平价。

怎么理解?

最值得读的是它纠正了一个常见概念错误:All Seasons不是All Weather。后者的经济核心是借款,所以省略融资成本等于省略策略本体。此研究的7.02%不应被理解为对风险平价的一般否定;它显示的是在这五腿、这套目标波动和这段利率路径下,毛alpha没有覆盖融资。

最大限制

杠杆倍数每年锁定、权重季度更新的执行约定并非唯一实现;60/40未按同样10bp成本扣费会略微偏向基准。五ETF并不覆盖完整机构级All Weather资产池,18个窗口也高度依赖长债与商品阶段。完整代码、逐笔权重和融资执行细节未公开。

复现与研究价值

复现时分离目标波动、权重优化和融资三层;对每期保存目标杠杆、现金余额、融资利率、换手与净杠杆。以SOFR/回购、不同杠杆上限和成本模型做压力测试,并把60/40按相同交易成本处理;随后在非美资产池和2022后高利率留出期验证。

原文与核查

公开全文、方法和表1完整阅读;未独立重跑。

原始文章 ↗

推荐 91/100 · 问题 29/30 · 证据 28/30 · 方法 24/25 · 复现 10/15

直接检验融资这一关键经济变量,样本外与成本口径透明;但资产池、执行约定和基准成本不对称限制外推。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

股债相关从正转负确实改变风险,但“负相关拖累收益”是需要纠正的叙述

Stock-Bond Correlation: The Sign Flips and So Do Its Drivers

Ali H. Askar;原研究 David G. McMillan

一句话先讲结论

导读报告美国股债相关在 2000 年前后由 +0.22 变成 −0.24,50/50 组合月波动由 2.72% 降至 2.42%,月均收益也由 0.52% 降至 0.29%。两件事同时发生,不等于负相关导致收益下降:相关系数直接进入组合方差,不直接决定固定权重的算术平均收益。文章把“需要更多股票追上旧收益趋势”说成负相关的代价,这一步超出了证据。

它到底在问什么?

股债能否互相对冲不是永恒属性;随着通胀、利率和经济冲击变化,相关结构会不会长期换挡,风险预算该如何跟着变化?

作者具体怎么做?

  1. 按各国可用数据考察 1980—2023 年 G7 市场,比较长期相关和动态相关。多数市场在约 2000 年转负,日本更早,意大利仍大体为正,不能把美国经验当成统一世界规律。
  2. 用滞后通胀、产出、二者波动、实际利率及通胀—产出相关解释股债相关,并用结构断点模型允许系数跨时期改变。
  3. 导读称实际利率是较稳定的相关解释变量,通胀和增长的方向及显著性更依赖时期;这是约化回归相关,不等于已识别哪一种宏观冲击造成变化。
  4. 最后比较 50/50 组合的收益、波动与协方差贡献。匹配同一全样本波动目标所需美国股票权重由早段 41% 变为后段 54%,不能与另一幅追踪收益趋势的 80% 权重混为同一目标。

关键结果

原文结果与口径
核对项结果意味着什么
美国股债相关+0.22 → −0.24两个历史阶段的估计,不是未来固定参数。
50/50 月波动2.72% → 2.42%风险降低与相关下降一致,但同时期单资产波动也在变化。
匹配同一波动的股票权重41% → 54%和文中 80% 的收益趋势拟合不是一回事。

怎么理解?

这篇最值得保留的是“驱动因素自己也会变化”。把长期负相关写进协方差矩阵,然后机械增加股票风险,容易在通胀冲击重新占主导时暴露系统性弱点。风险测试至少应包含股债一起下跌的状态,而不是只看平均相关。 同时必须修正文中的因果捷径。对固定权重组合,算术期望收益由各资产期望收益加权决定;相关下降通常带来方差下降,并非自动拖累收益。后段平均收益较低可以来自股票、债券的收益环境变化。拿旧趋势线要求新组合追上,是另一种目标设定,不能由此声称负相关失去了分散好处。

最大限制

已读完整导读,原论文完整估计未独立复算;动态相关本身是估计量,宏观回归又有结构断点与修订数据问题。文中多个组合目标和因果表述容易混淆,本解析不沿用其“负相关减少分散收益”的说法。

复现与研究价值

将预期收益、单资产波动和相关三个输入分别改变,做风险预算敏感性表;用只含当时可见数据的滚动估计检验是否改善目标波动控制。不要用全样本断点事后识别的状态直接指导历史仓位。

原文与核查

公开导读全文解析;原论文表格与估计未独立复算。

原始文章 ↗

推荐 74/100(暂定) · 问题 25/30 · 证据 20/30 · 方法 21/25 · 复现 8/15

跨国相关与结构变化值得读,但导读对相关和平均收益的混合解释需纠正。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究方法

总结果过关,年份与排名却露馅:别让自动判决替你停止思考

Backtest Said "SURVIVES." Per-Year Numbers Said No. I Learned to Trust the Second One

Jan Heger

一句话先讲结论

一个价格形态的完成率为 30%,高于随机对照的 19%—20%,自动脚本判定有效;但七年中有三年贡献为零。另一个价位筛选在样本内外都找到赢家,赢家排名的跨期相关却是 −0.54。问题不是总数算错,而是把集中发生的现象和每期重新挑出的赢家,误认成了可以向前执行的稳定规律。

它到底在问什么?

自动研究系统能否用一个 SURVIVES 标签概括策略有效性?如果算法只看平均优势,就可能漏掉时间集中和选股规则在样本外悄悄改变的问题。

作者具体怎么做?

  1. 作者先检验 zone-cycle 价格往返模式,真实样本完成率约 30%,控制组约 19%—20%,聚合判决通过。
  2. 将结果拆成七年,贡献依次为 91、0、63、0、0、34、13。正文未说明这些贡献值的货币或频数单位,因此只能按作者的贡献序列理解,不能当成年收益率。
  3. 另一项实验比较不同价位组,脚本声称样本内外最好组都优于其他组;作者进一步计算两个时期价位表现排名的相关性,得到 −0.54。
  4. 作者据此增加年度贡献和排名稳定性关卡,让它们有权推翻聚合判决,而不是只放到附录。

关键结果

原文结果与口径
核对项结果意味着什么
聚合形态完成率30% vs 19%—20%是形态完成率,不是交易胜率或策略净收益。
跨期排名相关−0.54同一价位的相对优劣在两个时期反转,不支持固定优选名单。
年度贡献7 年中 3 年为 0存在时间集中;未给出单位、每年机会数,不能直接判定统计上失效。

怎么理解?

第二个错误比第一个更明确:若样本外又重新找赢家,那么所谓样本外测试其实仍在使用答案。正确问题是,用样本内锁定的价位和规则,在下一段数据上是否仍有优势;排名相关可以揭穿这种看似严谨的比较。 但“必须多数年份赚钱”不能成为所有策略的普遍公理。尾部对冲和危机趋势可能本来就靠少数年份兑现;某年没有交易机会也不同于有大量机会但收益为零。时间拆解应结合事先提出的经济机制、暴露和机会数,而不是再制造一个偏好平滑曲线的新筛选器。

最大限制

文章未公开样本资产、时间区间、控制组构造和检验显著性,也没有完整交易规则。七年贡献的单位未说明,因此本篇可作为审计案例,不能据其数字复现一个可交易策略。

复现与研究价值

对现有研究报告同时输出按年机会数、风险投入、收益贡献和冻结名单的下一期表现;再做留一年剔除检验,观察结论是否由单一年份决定。任何新的稳定性阈值也应在下一轮测试前锁定,不要看完结果再调整门槛。

原文与核查

公开正文完整解析;无法据正文重建原始两项实验。

原始文章 ↗

推荐 74/100 · 问题 26/30 · 证据 17/30 · 方法 22/25 · 复现 9/15

跨期重新选优是常见隐性泄漏;案例细节不足,年度一致性规则也需按策略机制使用。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

比特币高波动会延续,但 96% 的状态留存里藏着滚动窗口重叠

Volatility Clustering in Bitcoin: Regime Persistence as a Forecast

Ali H. Askar;原研究 Borrego Roldán

一句话先讲结论

导读将比特币滚动波动率分成低、中、高三档:一小时数据、24 期窗口下,高波动下一小时仍为高波动的概率为 96.29%,随后 48 小时平均绝对涨跌为 4.42%,低波动时为 2.39%。但分档阈值用全样本算出,且相邻波动窗口共享 23 个小时数据;这些结果说明状态有持续性,却不能直接证明一套已可实盘的预测模型。

它到底在问什么?

现在波动很高,能否据此预测未来价格变动的幅度,从而调整风险?注意这是幅度问题,不是预测比特币下一步上涨还是下跌。

作者具体怎么做?

  1. 原研究以 2018 年 8 月至 2024 年 11 月比特币数据计算滚动收益标准差,再取对数,考察一小时到日线等不同频率和窗口。
  2. 用全历史的 20/80 分位阈值把当前滚动波动分类,数相邻观测的转移次数得到三乘三矩阵。24 小时窗口的低、中、高留存率分别为 95.05%、97.15%、96.29%。
  3. 比较状态之后的绝对价格变化:小时模型考察 48 小时,日线模型主要考察七日;高低组在均值和离散程度上都不同。
  4. 导读明确指出全样本阈值使用了未来资料,滚动阈值修复在原研究中仅为建议,并未实现;因此公开矩阵属于回看估计。

关键结果

原文结果与口径
核对项结果意味着什么
高波动下一期留存96.29%一小时一步,不是明天仍处于高波动的概率;导读的一处 tomorrow 表述不准确。
未来 48 小时平均绝对变化高 4.42% / 低 2.39%无方向的幅度均值,不是可赚取的交易收益。
高组均值加标准差8.79%不是经校准的 VaR、置信上界或保证覆盖区间。

怎么理解?

最容易被忽视的是机械平滑。24 小时标准差下一小时只换掉一个观测,即使原始收益独立,波动估计也会高度相关。长窗口比短窗口更持久,并不能单独证明市场记忆更强。应让同样滚动窗口作用于适当的模拟对照,再测新增的真实聚集。 风险应用仍然合理:当前高波动通常值得降低名义仓位,但模型价值要体现在未来风险校准,而不是状态分类准确率。若一个模型永远预测下一小时状态不变就已经很准,复杂转移矩阵需要证明比这个廉价基准更好。文章用全样本阈值的问题也不能被“波动聚集是常识”抵消。

最大限制

本次读完导读,未取得原研究代码并重算;重叠预测区间使极大 t 值的独立样本解释存疑。导读声称两小时和两百小时持续都“同样一致”也过于宽泛:几何模型允许两者,但概率并不相等。

复现与研究价值

用仅截至当时的数据更新分位阈值和转移矩阵,对比恒定状态、EWMA 和简单 HAR 类预测;采用不重叠检验段或保留依赖的重抽样。报告未来绝对收益预测误差、风险区间覆盖率和风险目标偏离,不把预测幅度直接变成买卖方向。

原文与核查

公开导读全文解析;原研究数据与代码未独立核验。

原始文章 ↗

推荐 75/100 · 问题 24/30 · 证据 20/30 · 方法 21/25 · 复现 10/15

适合设计风险状态基线,但未来阈值和机械重叠必须先修复,才谈实盘增益。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

月度 TAA 改成每日全仓调仓:毛收益没改善,额外成本却超过每年 2%

Does Trading TAA Strategies More Often Improve Performance?

Allocate Smartly

一句话先讲结论

从 90 条月度 TAA 中随机抽 5 条组成等权组合,重复 1,000 次后,作者发现把全组合从月末调仓改成半月、每周或每天,并未改善毛表现;每天调仓的额外摩擦拖累超过每年 2%。这并不否定分批执行:把资金拆成每月各调一次的子组合,与整笔资金反复交易,是两种完全不同的换手结构。

它到底在问什么?

更快响应信号是否能让慢频策略更好地避险?还是月度信号里的日常变化主要制造反复进出,从而多付成本却没有增加预测信息?

作者具体怎么做?

  1. 在所跟踪的 90 条月度策略里随机选择五条,每条权重 20%,构建 1,000 个组合;因此检验对象是策略组合而不是某一条最佳模型。
  2. 对每个组合分别模拟月末、半月、每周和每日交易。每次按当天重新计算信号,不只是延迟执行月末旧信号。
  3. 先不加摩擦看毛效果,再按单边 0.1%、来回 0.2% 加入交易摩擦。作者称更高频率在毛表现和最大回撤上也没有带来改善。
  4. 周频采用归一化交易日 5、10、15、21,半月为 10、21,日频并非所有自然交易日都必然纳入;这属于平台近似日历,不应称为精确每周同一星期交易。

关键结果

原文结果与口径
核对项结果意味着什么
测试覆盖1,000 个组合 × 4 频率随机组合共享大量底层策略,并非 4,000 个独立统计样本。
单边摩擦0.1%费用与滑点的统一假设,不代表所有 ETF 的实际成交成本。
每日执行额外拖累>2% / 年正文给出的摩擦影响量级;图表详细指标未在本次文本中逐格核验。

怎么理解?

最值得理解的是研究对象变了。月度信号的窗口长度没变,但每天按微小排名变化重新下单,会不断交易临界点噪声;如果毛收益本来就没有增加,降低佣金只能少输一点,不能替它创造优势。 同时,月末相对其他日期的历史优势可能贡献了部分差距。分批执行是在接受一定历史收益损失的同时分散单一日期风险;高频全仓执行则额外增加大量换手。两者的收益与风险交换条件不同,不能用同一句“交易更频繁”描述。

最大限制

公开正文的细表以图片呈现,本次没有逐格读取;回测完整区间与随机组合依赖结构未在正文充分交代。90 条平台存量策略本身可能经过历史筛选,结论不等于所有月频策略都无法改为快频。

复现与研究价值

对自己的模型固定信号与样本,分别测试月末、错日分批和全仓快频,并报告排名变动引起的无效换手、信号延迟、成交成本与危机期表现。加入小额不交易区间后再比较,而不是只通过缩短调仓间隔来宣称提高反应速度。

原文与核查

公开正文、计算说明完整解析;图片细表未逐项核验。

原始文章 ↗

推荐 81/100 · 问题 26/30 · 证据 23/30 · 方法 23/25 · 复现 9/15

对执行频率与分批的区分清楚,组合层证据有用;平台样本和图表明细仍需进一步审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 策略研究

土耳其双动量实际赚11.7%,但择时增量还没证明

Dual Momentum for a Collapsing Currency

Michael Emre Tulum

一句话先讲结论

2013—2026 年土耳其样本,十二资产双动量扣10bp交易成本后实际年化11.7%,明显超过存款和持美元;但同资产池每周等权也有9.2%,两者差异的 t 值仅约1.1。更扎实的结论是跨资产分散和纪律有用,不能把约2.5个百分点差额直接宣布为已验证动量 Alpha。

它到底在问什么?

高通胀下究竟用里拉、美元还是黄金存钱?文章把问题从猜货币方向改为购买力管理:安全资产并非固定身份,过去安全的资产可能在另一个政策阶段持续损失实际财富。

作者具体怎么做?

  1. 每周三分别按10周、25周动量排序,各买前三名等权,两个速度各占一半;ETF 只在成立后进入。
  2. 选中资产若名义动量不为正,对应份额退入近期动量更强的里拉存款或美元侧安全资产。
  3. 报告实际购买力、等权对照、黄金对照、2023年后阶段与10/25bp成本压力;事后改过滤门槛明确标为变体。

关键结果

原文结果与口径
核对项结果意味着什么
整体实际年化11.7% 对等权9.2%择时差额不显著,不应把总收益全归因于动量。
黄金单资产实际年化8.7%与策略差异也不显著,但黄金有明显路径回撤,且事后才知它是胜者。
门槛变体11.7% → 12.1%改为跑赢存款是见到结果后的调整,不是原始预登记外测。

怎么理解?

这篇对资产配置很有价值:记账单位、信号单位和评价单位分别决定策略在优化什么。名义里拉动量会包含汇率趋势,这对里拉消费的投资者并非错误,但不能再称为纯资产动量。实际财富口径还揭露了‘存款净值永远上涨’与购买力大跌可以并存。 2023年后的表现显示分散约束的代价:单个资产最多三分之一,即使存款成为最佳资产,也不能全仓。另一个需要审计的细节是防御替代份额可能重复落入存款,规则是否始终维持单资产上限,必须从代码确认,而不能只靠‘三个槽位’推断。存款期限、提前支取和逐周复利也会让纸面路径优于可实施账户。

最大限制

单一国家约十三年历史,未含税且税种差异不能统一打折。存款按周复利近似偏乐观,完整银行存款组合不能按描述直接每周自动执行;作者用简单 t 检验,需考虑依赖与厚尾。

复现与研究价值

未执行方案:先审计重复防御分配和存款真实期限,采用块重采样检验择时相对等权;冻结规则后扩展到其他高通胀国家,以新增国家而非本样本调门槛验证机制。

原文与核查

收录全文及方法脚注完整解析;代码未独立运行。

原始文章 ↗

作者代码与预登记记录

推荐 91/100 · 问题 29/30 · 证据 26/30 · 方法 24/25 · 复现 12/15

购买力口径和诚实增量比较突出,实施及跨国外部验证仍需补。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文解读

GPT 新闻情绪仍有漂移收益,但最赚钱的部分也最难交易

Can ChatGPT Forecast Stock Price Movements?

Elisabetta Basilico;研究:Alejandro Lopez-Lira、Yuehua Tang

一句话先讲结论

研究用 GPT-4 判断公司新闻情绪:立即价格反应的组合日胜率高达 93.3%,但那不是逐只股票预测准确率,也不是可执行收益。真正延后交易的隔夜新闻多空策略,毛日收益约 34bp、Sharpe 2.97,其中空头贡献 26bp、多头仅 8bp;往返成本升到 20bp 后,策略不再盈利。读它应关注消息时间戳和融券条件,而不是被‘九成准确率’带走。

它到底在问什么?

语言模型能否把新闻转成有方向的信号?更关键的是,市场消化之后还剩多少漂移可供交易,以及这些收益是否已经被成本和信息竞争吃掉。

作者具体怎么做?

  1. 样本包含 2021 年 10 月至 2024 年 5 月的 159,137 条观测、4,123 家公司;输入主要是公司名和新闻标题。
  2. 按消息公布时段分组;延后交易以当时可见新闻为依据,隔夜新闻在开盘后交易,收盘后新闻推迟到下一次开盘。
  3. 分别统计组合日方向命中、毛收益、长短腿贡献与成本敏感性,并检查后续年份是否衰减。

关键结果

原文结果与口径
核对项结果意味着什么
延后漂移隔夜新闻 34bp/日;Sharpe 2.97研究组合毛表现,不是每条新闻均有该收益。
收益结构多头 8bp;空头 26bp负面消息的空头交易贡献更大,融券约束因此不是附注。
衰减与成本2024 年初 Sharpe 1.22;20bp 成本下不盈利不是可稳定外推的历史高 Sharpe。

怎么理解?

这篇最值得带走的是研究分解。情绪分类准确、即时价格响应强、延后漂移赚钱,是三个层次;前两层不能替代第三层。小股票更强也有两面性:可能反映信息消化慢,同时意味着价差、冲击和可借券规模更不友好。 我还会追问模型版本与真实知识边界。作者以模型知识截止时间安排样本,有助于控制未来信息,但不等于已经证明训练数据绝无泄漏;版本冻结、提示词、重复调用和新闻去重仍需审计。年度 Sharpe 随时间下降与 AI 普及相符,却不能单靠这条时间趋势识别因果,市场环境和新闻构成也在变。

最大限制

本次完整阅读收录解读,未复核论文全部附录和原始订单路径;报道中的成本测试不等于已经完整纳入股票逐券借贷费、借券失败及市场冲击。

复现与研究价值

未执行的研究方案:冻结模型及提示词,用带精确到达时间的新闻做逐日留出,加入可借券清单、涨跌停与成交量约束;与词典和较小模型同成本比较,并单独报告多头可实现版本。

原文与核查

收录解读全文阅读;原论文全表及实现未完整核验。

原始文章 ↗

收录原文

推荐 84/100 · 问题 29/30 · 证据 24/30 · 方法 23/25 · 复现 8/15

交易时点与成本非常关键;原始论文附录和真实融券容量仍需核查。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

Boundary 不是“贵了就卖”:它判断的是趋势在估值极端处是否更容易反转

Boundaries of Time Series Momentum

Matti Suominen / Erik Hjalmarsson;导读 Quantpedia

一句话先讲结论

这篇不是给 CAPE 设一个贵便宜阈值,而是把股票估值和期限利差相对历史区间的位置合成 Boundary,检验过去涨跌的方向在极端状态下是否反转。论文报告加入边界相关变量后,动量收益预测回归的 R² 最多相对提高 550%;这是解释力相对增幅,不是策略收益增加 550%,更不是已经验证了“Boundary 超过 1 就反向交易”的统一交易规则。

它到底在问什么?

同样是过去一年上涨,为什么有时代表趋势延续,有时却接近反转?作者想用股票和债券的估值状态解释动量为何不是在所有市场环境里都同样有效。

作者具体怎么做?

  1. 原论文使用美国及 20 国数据,以 CAPE 或股息率代表股票估值、长短国债收益率差代表债券估值状态;考察的是未来十二个月的市场及动量收益。
  2. 先平滑估值,再按历史区间缩放到 −1 至 +1,Boundary 是股票估值位置平方加期限利差位置平方。因此高估与低估都可能处于边缘,它不是单向的昂贵程度指标。
  3. 原文历史归一化使用十年或二十年窗口,本文说明这一原始设计,不要求中国短样本必须照搬。改成 24 或 36 个月属于新的适配假设,需要单独检验,而非论文推荐值。
  4. 检验的关键是边界与过去市场收益的交互:边界越极端,原来趋势方向是否越容易逆转。统计关系通过回归建立,不应直接跳过仓位映射和执行成本变成硬反转策略。

关键结果

原文结果与口径
核对项结果意味着什么
导读报告的相对解释力增幅最多 +550%R² 的相对变化,不是收益、胜率或年化 Alpha。
指标结构两个标准化位置的平方和方向对称:高端和低端都可能是边界,不能只理解为估值昂贵。
交易阈值没有本文可据此确认的统一 1 阈值连续预测关系转成开关,需要另定规则并验证,不能把自设阈值冒充论文定论。

怎么理解?

经济上最有意思的不是价值因子和动量因子简单相加,而是价值状态可能改变动量的含义。若价格上升同时把估值、利率和政策反应推到极端,再继续追涨的风险便不同于正常扩张时期。这是一条条件机制解释;并不意味着任何昂贵市场马上下跌。 对现有研究,首先应该问“这个边界是否真的改变动量的条件收益”,然后才问“用什么仓位交易”。连续缩放、只降风险和硬反转承担的假设依次增强:硬反转不但相信趋势失效,还相信反向收益足够覆盖成本。短样本极值容易由一个异常点决定,24 与 36 个月之间结果差异若很大,应看作估计不稳定,而不是挑较好的一个。

最大限制

已读导读并核查原论文关键定义与回归,未逐表复算原数据。长周期重叠收益、持久估值变量和窗口选择使统计推断复杂;不同规格样本长度也可能变化,不能只看最大 R² 增幅。宏观指数结论直接外推个股,仍缺少独立证据。

复现与研究价值

先固定当前可用样本内的少数窗口,不用全历史搜索最优值;对个股保留同一个市场级状态作为条件变量,检验组内动量收益,再比较连续减仓与硬反向。报告触发次数、各次事件贡献及扣费结果,特别标出是否由一轮行情驱动。这里只提出方案,不引用此前未在本次核验的本地回测数值。

原文与核查

Quantpedia 正文完整解析;Wiley 原论文关键定义、回归和稳健性段落核查,未独立复算。

原始文章 ↗

正式论文全文:Boundaries of Time-Series Momentum

工作论文 SSRN 6867878

推荐 88/100 · 问题 29/30 · 证据 25/30 · 方法 24/25 · 复现 10/15

把估值状态与动量方向联系起来,研究问题强且有正式论文;落地阈值和短样本个股适配仍需另证。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / podcast_transcript

Podcast:从市场问题到量化交易系统

Podcast: From market problems to quantitative trading systems

Quant Beckman、House of Quants

一句话先讲结论

量化交易应从可解释的市场问题出发,经经济机制、统计模型、可靠代码、执行和风险控制形成工程流水线。

它到底在问什么?

如何将行为、结构或市场微观结构问题转化为可证伪、可执行并能经受运气检验的交易系统?

作者具体怎么做?

  1. 从行为/结构/微观结构问题提出经济与统计假设
  2. 预先定义目标函数、约束、分散化价值、适用市场状态和证伪标准
  3. 点时数据摄取与时间戳控制→surprise测量→成交量确认→信号生成→执行/风险
  4. 用stationary bootstrap生成替代收益历史,检验是否依赖幸运路径

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

机制含义是指标只是机制的症状;点时控制、随机重采样和执行日志是防止未来函数与Texas sharpshooter的关键。

最大限制

播客/讲义性质;无完整数据、参数、成本、样本区间和OOS绩效,不能证明策略可交易。

复现与研究价值

建立点时业绩公告数据库,预注册假设和目标,复现signal、成本、延迟、walk-forward、bootstrap及跨市场测试。

原文与核查

public_full_transcript

原始文章 ↗

推荐 75/100 · 问题 28/30 · 证据 16/30 · 方法 22/25 · 复现 9/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 策略比较研究

魔法公式拆开后,质量腿反而胜出:S&P 500 口径下20个逐年样本外窗口,ROIC单因子年化11.73%,比等权双因子高2.18个百分点

Magic Formula tested against each half: quality alone beat the combination

Serhat Girgin(QuanterLab)

一句话先讲结论

一句话先讲结论:作者把Greenblatt魔法公式拆成质量(ROIC)、便宜(EV/EBITDA倒数)和50/50组合三本30只等权、年度换仓的S&P 500组合;2006—2025年20个一年期样本外窗口里,质量单因子累计+818.9%、年化11.73%,双因子累计+520.1%、年化9.55%,质量高2.18个百分点且最大回撤较浅(-52.9% vs -64.0%)。但这不是“价值因子已死”的定论:原文同页的图表标签与文字有互相矛盾之处,且它用大盘股、ROIC和EV/EBITDA替代了Greenblatt原始定义。

它到底在问什么?

Greenblatt的核心命题不是单独质量或单独便宜有效,而是两者合在一起比任一腿更好;在相同可得信息、持仓数、成本和换仓节奏下,便宜腿是否真的给质量腿增量?

作者具体怎么做?

  1. 在每个年度锚点,用已公开的SEC acceptedDate-gated财务数据计算ROIC与EV/EBITDA倒数,并使用当时的S&P 500成员,避免事后成分股。
  2. 分别按质量、便宜、两因子标准化分数等权合成排序;三组均选前30只、等权持有一年。
  3. 把20段一年期样本外日收益拼接,统一计入股息和10bp单边成本,并比较年化收益、波动、Sharpe与最大回撤。
  4. 再以20个年度窗口胜负和5,011个配对日收益的概率检验,检查组合差异是否只是少数时期推动。

关键结果

原文结果与口径
核对项结果意味着什么
质量单因子累计+818.9%;年化11.73%;Sharpe 0.65;最大回撤-52.9%按表1,质量腿是三种规则中收益最高、风险调整也最高的一本。
50/50魔法公式累计+520.1%;年化9.55%;Sharpe 0.52;最大回撤-64.0%在该实现中,双因子几乎只与等权S&P 500基准的年化9.51%持平。
便宜单因子累计+389.8%;年化8.27%;Sharpe 0.43;最大回撤-66.1%把质量权重降至零后,收益下降、波动上升、回撤更深。
稳健性信号双因子仅在20个窗口中的8个领先质量;5,011个配对日的优胜概率13.9%作者将其解释为不利于“便宜腿增加质量腿价值”的证据,而非未来必然规律。

怎么理解?

这篇真正值得量化研究员看的不是“质量战胜价值”这个吸睛标题,而是一个标准的消融实验:只改变因子权重,其他研究管线锁死。它也暴露出研究阅读中很重要的一点:原文摘要和表1支持“质量优于组合”,但页面另有将Magic Formula Sharpe标作0.65、并把“Magic − Quality CAGR gap”写成+2.2pp的反向标签;两者都与表1的9.55%和11.73%不一致。本站采用可交叉计算的表1差值11.73%-9.55%=+2.18pp,并将该内部矛盾视为可复现性扣分,而不是替作者选择更好看的数字。

最大限制

第一,原始Magic Formula是EBIT/EV与EBIT/(净营运资本+净固定资产)并面向更广的可投资股票池;本文改为大型S&P 500、EV/EBITDA倒数和ROIC,外推到原策略并不成立。第二,20个年度窗口不等于20个独立市场;组合构造、winsor化、delisting处理和完整代码未公开。第三,10bp成本对30只年换仓的大盘股合理但未做容量、冲击成本与税费压力测试。第四,正文内部统计标签冲突,需在复现前先向作者核对导出表。

复现与研究价值

复现时应先固定原始与本文两个定义:分别以PIT S&P 500和更广泛股票池重建;把ROIC、EBIT/EV、EV/EBITDA倒数逐项替换;保留每次可得公告日、退市回报、成分变动和交易成本日志。随后做1990年以来滚动样本外、行业中性与市值中性分层,并检验质量/价值相关性、因子暴露和不同持有期下的增量信息系数。

原文与核查

公开正文、方法、表1与逐窗口日志完整阅读;发现原文内部标签矛盾,未独立重跑。

原始文章 ↗

推荐 86/100 · 问题 27/30 · 证据 27/30 · 方法 22/25 · 复现 10/15

问题明确、PIT宇宙和逐年样本外设计较好,完整方法与逐窗口日志可读;但实现偏离原策略、未提供可执行代码,并存在结果标签与表1不一致。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 事件研究

复制国会议员交易没有alpha:17,859个披露事件中,买入一年相对SPY中位数-5.36%,买卖差仅1.13个百分点且不显著

What Happens After Congress Buys or Sells a Stock? Evidence...

QuanterLab Research

一句话先讲结论

一句话先讲结论:对2020—2025年17,859个可投资国会普通股披露事件,按首次披露后可交易收盘价进入,一年后买入的S&P相对收益中位数为-5.36%、卖出为-6.39%,买减卖仅+1.13个百分点、t=1.15;即使给追随者不可能拥有的交易日信息,买入仍落后5.71点、卖出落后6.67点,复制披露交易并不是有效策略。

它到底在问什么?

国会议员的买卖是否在披露后仍可预测股票收益?披露延迟究竟是策略失效的原因,还是交易本身没有可追随的收益信息?

作者具体怎么做?

  1. 从国会披露记录提取普通股交易,排除一年收益未成熟、无交易价格和跨拆股窗口的事件。
  2. 按披露日、股票和一年持有期计算相对SPY的收益,以披露日聚类计算不确定性。
  3. 同时报告交易日进入的前视反事实,检验披露延迟是否完全解释结果。

关键结果

原文结果与口径
核对项结果意味着什么
一年相对收益中位数买入-5.36%;卖出-6.39%两类披露都落后SPY。
可执行买减卖+1.13个百分点,t=1.15差异不显著,不能支持复制买入优于避开卖出。
披露日聚类统计买入t=-2.47;卖出t=-2.73单腿表现显著落后指数。
前视交易日反事实买入-5.71点;卖出-6.67点;差-0.02点,t=-0.16即使不现实地提早进入,买卖信息也未显示优势。

怎么理解?

这篇最好的地方是把可执行的披露日策略和不可执行的交易日反事实分开。很多‘跟踪政客交易’的传播内容只讲交易发生时的表现,却忽略公众知道信息的时间;这里即使给了交易日信息,结果也没有变好,说明不能把披露延迟当作唯一借口。它不否认利益冲突可能存在,只是否定了简单披露复制的投资叙事。

最大限制

研究使用原始收盘价和特定普通股筛选,未包含期权、基金和无法识别标的;政治交易披露仍可能有漏报、金额区间和选择性报告问题。

复现与研究价值

扩展到不同持有期、行业和交易规模;将披露延迟、价差和大额订单容量纳入,并与随机同日股票和内幕Form 4基准做配对比较。

原文与核查

公开正文、样本构造和结果完整阅读;未独立重跑。

原始文章 ↗

推荐 94/100 · 问题 29/30 · 证据 29/30 · 方法 25/25 · 复现 11/15

样本大、可执行与前视口径分离、统计量明确,结论直接反驳热门叙事。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究批判

加密微观结构预测,可能只是波动率换了名字

Crypto Isn't Structurally Alien: Roll/VPIN/Amihud Predict Distribution Shifts

Ali H. Askar

一句话先讲结论

一项五币种研究用微观结构指标预测未来分布变化,波动率方向准确率约 58%;但这篇复核指出,最重要的 Roll 特征本身高度依赖波动率,而报告为‘交易毒性偏高’的 VPIN 均值约 0.47,甚至低于其高斯噪声基准 0.50。真正值得保留的是跨币种风险预测线索,不是已经发现了加密价格方向 Alpha。

它到底在问什么?

传统微观结构指标搬到分钟加密行情后,名称是否仍对应同一种经济量?如果改变了公式,还能否用期货市场的数值直接比较信息交易强弱?

作者具体怎么做?

  1. 先按论文打印公式做代数拆解,检查单位、符号和成交量是否真的进入指标。
  2. 再用随机过程构造无信息基准:该逐栏 VPIN 中成交量约掉,高斯标准化价格经正态分布函数转换后,对应期望 0.50。
  3. 检查 1,500 分钟标签重叠、多个币种和窗口检验,以及特征重要性究竟支撑哪一种解释。

关键结果

原文结果与口径
核对项结果意味着什么
毒性基准约 0.47 对高斯零假设 0.50不能与另一种桶聚合算法的 0.22 直接比较。
名义准确率波动率约 0.58应与简单波动持续性模型比较,而非只比抛硬币。
标签重叠1,500 分钟预测期相邻标签高度相关,不能把百万分钟当百万独立试验。

怎么理解?

最值得抄走的是指标的零假设审计。一个听起来经济含义很强的名称,不能替代公式;先做无信息模拟,常常比把指标塞进更复杂模型更能避免错误解释。不同聚合顺序还会改变指标水平,跨市场比较前必须统一定义。 但文章自己的批判也要分层。T/1,500 是非重叠块数量,不是普适、精确的有效样本量,最终显著性应依赖实际测试切片和块重采样。BTC/ETH 特征重要性较高也只是预测关联,受相关变量替代影响,不能据此证明它们是唯一的信息源或存在因果传导。

最大限制

完整阅读收录批判文章;底层 SSRN 论文及原始分钟数据未独立复算。文章近似显著性和模拟数值不能冒充本项目实证。

复现与研究价值

未执行方案:统一成交量单位与 VPIN 聚合方式,加入当前波动、EWMA/GARCH 和自相关基准,以非重叠外测或带隔离期的块检验比较增量预测;最后再设计风险交易用途。

原文与核查

收录全文完整解析;原论文数据未独立复算。

原始文章 ↗

底层研究 SSRN

推荐 86/100 · 问题 28/30 · 证据 24/30 · 方法 24/25 · 复现 10/15

公式和零假设检查很有迁移价值,部分统计结论仍属近似。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法讲解

优化需要五百年?真正的问题是把估计误差当成事实

Markowitz, Estimation Error and 1/N

Denis Joly

一句话先讲结论

同一个股票—国债—石油优化器,仅换成另一种合理美股收益口径,股票权重就从 37.6% 降到 26.1%,估计收益风险却几乎不变。著名的‘需要500年数据才能赢等权’只是特定50资产校准,另一校准约44年;文章要说的不是停止优化,而是最优权重的精确外观远强于输入信息的真实精度。

它到底在问什么?

Markowitz 解决的是信念已经给定之后如何组合资产,实际投资还要先估计信念。把样本均值和协方差当真值,优化器会如何放大最不可靠的部分?

作者具体怎么做?

  1. 固定 1983—2006 年样本和多头约束,只替换股票数据定义,观察权重和目标函数的变化。
  2. 检视滚动输入下的权重分布,同时把目标权重变化与按持仓漂移计算的真实换手区分。
  3. 在公开行业组合上检查等权结果,并将无约束、约束与最小方差规则作为敏感性对照。

关键结果

原文结果与口径
核对项结果意味着什么
口径敏感性股票 37.6% → 26.1%合理数据定义改变,非两种择时信号。
等权校验月 Sharpe 0.13533接近原论文表的 0.1353,但当前数据版本和无风险序列并非完全相同。
无约束风险年波动约 88.4%作者敏感性实验显示估计噪声可变成杠杆;不是所有优化规则的共同表现。

怎么理解?

权重大幅变化、目标值变化很小,常说明最优点附近很平。这时公布一组精确到小数点的配置容易误导;研究更应该展示可接受邻域、约束敏感性和输入不确定区间。降低复杂度、收缩协方差和限制杠杆,是对不同误差来源的回应,不是同一种修补。 等权也不是没有观点:资产池如何定义就是先验。把一个行业拆成三个子行业,会在等权下提高它的总配置;因此等权优势可能来自分类和再平衡,而非天然中立。对用户当前短样本研究,我会缩小问题、加强约束和对照,不会照文章把10年甚至数十年窗口机械搬过来。

最大限制

原文部分资产是近似代理:WTI 现货没有期货展期与抵押收益,国债收益率重建不是实际持券。500年结论条件化,不能当通用最低数据门槛。

复现与研究价值

未执行方案:在现有样本长度内比较等权、风险权重、收缩最小方差和有限偏离基准,使用同一成交成本,重点报告权重稳定性、邻域表现及样本外误差,不挑最高历史 Sharpe。

原文与核查

收录全文完整解析;配套程序未独立重跑。

原始文章 ↗

推荐 92/100 · 问题 29/30 · 证据 26/30 · 方法 25/25 · 复现 12/15

把优化、估计和代理分开,案例可核验且避免极端口号。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究综述

外汇预测该看邻近市场,但三种时钟不能混成一条策略

FX Edge Lives in Other Markets (cross-asset series)

Ali H. Askar

一句话先讲结论

同样一组外汇期货,只用汇率之间的网络,Sharpe 为 0.16;加入股票、债券和商品邻居后升到 0.66。这是跨资产信息有用的线索,但不是现成净 Alpha:相关全资产组合是日频毛回测,在约 3—5bp 的成本压力区间内便从盈利走向亏损。文章另两种外汇研究分别使用月频资金流和日频利率图,不能把它们的最好数字拼成一个策略。

它到底在问什么?

货币价格反映资本流动、利差和全球风险,单看某一汇率自己的价格会不会遗漏更早到达其他市场的信息?作者把三个预测层次和实际流动性连接起来。

作者具体怎么做?

  1. 月频研究覆盖 28 国、1989—2019 年,检验股票及债券收益差相对随机游走的外测误差。
  2. 日频图方法将货币作为节点、利率作为节点特征,明确决策与执行存在时滞,但回测不含完整成本且假设融资可得。
  3. 跨资产期货网络用八种动量描述邻居,再预测目标次日风险标准化收益;比较仅外汇网络与全部资产网络。

关键结果

原文结果与口径
核对项结果意味着什么
新兴市场月频组合约 0.59%/月净收益文章转述的成本口径;发达市场相同回归未有效胜过随机游走。
外汇网络消融Sharpe 0.16 → 0.66相同外汇合约加入跨资产信息,属毛收益比较。
日频利率图年收益 4.80% 对 6.19%风险下降带动风险调整指标改善,不是原始收益也提高。

怎么理解?

这篇的优点是把‘预测失败’定位到信息集与频率:月度 G10 股汇回归不成立,并不能推翻日度跨资产网络。反过来,跨资产模型有效,也不能证明图神经网络不可替代,简单滞后回归或共享风险因子可能解释相当部分。 作者把报价撤回视为网络断边,是很好的执行提醒,但统计关系网络与真实流动性网络仍是两种对象。前者的边来自共同价格行为,后者来自可成交报价;风险管理需要分别建模,不能把相关性矩阵直接当交易可达性。尤其是不同市场收盘时区,若没做同步信息集,会制造看似领先的虚假边。

最大限制

收录综述完整阅读,所引多篇原论文未全部独立核验。不同成本口径、年化比例及融资假设不可混用;高风险调整比率不代表可按比例无限加杠杆。

复现与研究价值

未执行方案:固定共同时间戳,先以简单跨资产滞后模型做基准,再比较图结构的净增量;按市场逐项计价差、合约换月与融资,并报告压力期成交约束。

原文与核查

收录综述全文解析;多篇底层论文未全部独立核验。

原始文章 ↗

推荐 79/100 · 问题 27/30 · 证据 22/30 · 方法 23/25 · 复现 7/15

跨频率框架有启发,多个底层实现和真实执行尚待核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 事件研究与可复现代码

可公开交易的Form 4买入信号只在披露后1—5日显著:7,405个事件1日+0.534%、5日+1.009%,21—63日漂移无法确认

Form 4 Insider Trading in Python: A Filing-Date Event Study

Mikhail Makeev

一句话先讲结论

一句话先讲结论:作者以首次可交易的披露后时点而非内幕人交易日进入,对2022Q1—2026Q2的7,405个C-suite公开Form 4买入信号计算SPY调整收益;1日CAR均值+0.534%(双向聚类t=6.46)、5日+1.009%(t=5.05),但21日CAR+0.980%和63日CAR+1.103%的区间均跨零,63日BHAR均值仅+0.104%、中位数-3.605%。因此它支持短期披露关联,不支持可直接交易的一至三个月alpha。

它到底在问什么?

内幕人买入披露后是否还有外部投资者可捕捉的异常收益?若用交易日进入、把重复发行人当独立样本或只看市场模型残差,会把效果高估多少?

作者具体怎么做?

  1. 下载SEC季度文件,筛选符合条件的公开买入,并将多条记录聚合到经济/统计事件单位。
  2. 用文件日建立首个可执行入场,计算1、5、21、63个交易日的SPY调整CAR和复利BHAR;对公司行动和异常价格区间做局部排除/标记。
  3. 以CIK和入场月双向聚类,而非把7,405行视作独立观测;并比较交易日的前视反事实、市场模型敏感性和同股票匹配安慰剂。
  4. 公开代码、测试、结果工件、运行清单和种子,明确它是事件关联而非有成本的组合回测。

关键结果

原文结果与口径
核对项结果意味着什么
短期主结果1日CAR +0.534%,95%CI[+0.368%, +0.700%];5日+1.009%,CI[+0.608%, +1.409%]短窗口的平均披露后关联在双向聚类下仍显著。
长期主结果21日CAR +0.980%,p=0.099;63日CAR +1.103%,p=0.238;63日BHAR +0.104%,中位数-3.605%点估计不能替代不确定性;数据不足以证明持续漂移。
前视偏差交易日相较披露日,5/21/63日CAR分别高1.525/1.721/1.595个百分点用内幕交易日进入会把公众不可得的收益混进结论。
市场模型敏感性63日市场模型CAR +6.560%,而主CAR仅+1.103%负的事前alpha被连续扣除会机械抬高残差,模型选择具有经济实质。
安慰剂对照63日BHAR真实减安慰剂+2.167pp,95%CI[-0.241,+4.575]即使有正点估计,保守配对推断仍不显著。

怎么理解?

这篇比大多数“跟踪内幕交易”文章成熟得多,因为它先回答能不能交易,再回答有没有统计关联。短期结果可以作为事件研究发现,不应被改写成“买入Form 4、持有三个月”的策略。尤其是交易日与披露日差异、CAR与BHAR分歧、以及市场模型从+1.103%变成+6.560%的对照,都是研究报告必须展示的脆弱性。

最大限制

样本不是点时点证券宇宙:Yahoo覆盖、当前ticker映射和公司行动处理可能带来选择偏差;没有精确接受时间,只能用日历日和下一交易日近似。没有组合权重、交易成本、冲击、税费或容量模型,不能外推净收益。多个期限、估计量和子组的区间未做全面多重检验;披露日也不能识别因果。

复现与研究价值

直接运行作者release并锁定manifest;替换为PIT CIK-证券映射、CRSP或等价公司行动数据与精确EDGAR接受时间。随后预先规定事件聚合、持有期、流动性/市值分层和组合权重,加入可执行收盘/开盘价、价差、冲击和退市回报,再在未见季度验证。

原文与核查

公开全文、方法、结果与开源复现说明完整阅读;未独立运行。

原始文章 ↗

推荐 97/100 · 问题 29/30 · 证据 29/30 · 方法 25/25 · 复现 14/15

问题的可交易时间、双向聚类、安慰剂和多种估计量均透明,代码与运行工件公开;仍不是点时点宇宙或交易策略,因而不满分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 资产配置与择时研究

Keller的单只金丝雀门槛在2022年保住回撤,却在复苏期长期错过风险资产:把阈值从1只调到2只后,17个样本外年度年化由5.49%升至9.01%

The Crash Switch Worked and the Strategy Starved Anyway: Keller's Menu Tested

Serhat Girgin(QuanterLab)

一句话先讲结论

一句话先讲结论:在Keller BAA-G4的固定ETF菜单上,作者只把“任意1只金丝雀转弱就防守”的发布版门槛B=1调为“至少2只同时转弱”B=2;2009—2025年17个逐年样本外窗口中,B=2累计+333.4%、年化9.01%,高于B=1的+148.1%、5.49%,而2022年两者都实现+1.1%、避开60/40的-18.1%。代价是B=2的全样本最大回撤更深(-24.2% vs -18.6%):这不是“放宽门槛免费提高收益”,而是把单个利率/海外市场噪声触发的长期防守,换成更高的复苏参与率。

它到底在问什么?

发布版BAA-G4把一只金丝雀跌破阈值视为整体风险开关。若这个单点否决主要来自债券或海外资产,而非美股崩盘,它是否会把组合过早、过久地锁在防守端?

作者具体怎么做?

  1. 将Keller已公布的ETF名单作为固定宇宙,月末计算进攻、金丝雀和防守规则;不重建指数成分,不引入选券自由度。
  2. 每个年度以前两年信息形成锚点、随后一年样本外,连续走17个窗口;总收益计入分配,单边换手扣10bp并另计状态切换成本。
  3. B=1和B=2使用完全相同的月末信号与持仓选择,仅比较防守门槛;将同日收益配对,以区块bootstrap估计B=1胜过B=2的概率。
  4. 拆分2023年前后,并统计单只否决的来源,确认收益差是危机保护失效还是复苏参与率不同。

关键结果

原文结果与口径
核对项结果意味着什么
完整样本结果B=2:累计+333.4%、年化9.01%、Sharpe 0.68;B=1:+148.1%、5.49%、0.52按表1,双金丝雀门槛的收益和风险调整收益均更高。
危机保护2022年B=1与B=2均+1.1%;60/40为-18.1%把门槛从1提高到2并未牺牲作者最关心的2022年防守结果。
复苏期参与2023—2025三年,B=1平均每年+0.40%,B=2+12.33%,60/40+12.31%全样本差异主要在后段复苏期出现,不能把它当成跨周期恒定优势。
错误否决来源204个月末信号中132个月防守;50次恰有1只否决,BND占35次、SPY仅2次发布版开关主要在响应利率/债券而非美股本身,支持“单点否决过敏”的诊断。
配对比较B=1仅胜5/17窗口,B=2胜10个、2个平;区块bootstrap下P(B=1胜B=2)=2.4%差异并非只由一个年度驱动,但可用窗口仍有限。

怎么理解?

这是一篇很好的“参数诊断”而非新策略论文:它没有拿2022年回撤去换更多风险资产,而是问发布规则为什么在2023后一直不回到风险资产。研究也提醒读者不要只抄页面最醒目的统计卡:卡片把B=1/B=2 Sharpe和“B=1−B=2 CAGR gap”的符号标反了;表1和表3一致显示B=2为0.68、B=1为0.52,年化差为9.01%-5.49%=+3.52个百分点。本站按可交叉计算的表格写结论,并把该内部不一致列为可复现风险。

最大限制

第一,门槛B=2是作者围绕同一数据选择并注册的对照,虽然样本外窗口事前冻结,但设计前的搜索次数未知,原文因此未做deflated Sharpe。第二,固定ETF菜单和2009后样本覆盖的主要是美国低利率到加息周期,未覆盖更早的通胀/熊市结构。第三,B=2最大回撤-24.2%高于B=1的-18.6%,风险偏好不同的投资者未必愿意交换。第四,实际基金税费、买卖价差和更大规模冲击未全面展开。

复现与研究价值

复现应逐月保存四只金丝雀的原始读数、状态、换仓、费用和进攻/防守持仓;分别测试B=1/2/3/4并在真正未见时期选择,而不是在全样本择优。进一步将单点否决拆为权益、利率、信用和海外四类风险触发器,检验“BND主导”是否仍存在;同时以风险预算和尾部损失约束比较B=1、B=2及连续仓位版。

原文与核查

公开正文、规则、表1至表4与逐窗口结果完整阅读;发现统计卡标签矛盾,未独立重跑。

原始文章 ↗

推荐 90/100 · 问题 28/30 · 证据 28/30 · 方法 24/25 · 复现 10/15

固定菜单、唯一参数改动、逐年样本外、危机和复苏分解均很清楚;但原始搜索谱系和完整代码未公开,且页面统计卡与结果表存在标签冲突。

返回全年目录 ↑

Quantocracy / 导读完成

Sharpe 相同,不代表每一段时间都赚得一样稳

The Sharpe Stability Ratio: Evaluating the Sharpe Ratio Temporal Consistency

Portfolio Optimizer;介绍 Bajo Traver 与 Rodriguez Dominguez 的 SSR

评价策略不能只问全样本赚了多少,还要问收益是否集中在少数阶段。稳定性指标是补充,不是自动选出更好组合的开关。

2 分钟看懂

一个策略平时不赚钱、只在危机时大赚,另一个慢慢赚钱,全样本 Sharpe 相同,你需要的是哪一个?

把整段收益压成一个 Sharpe,会丢失收益发生的时间结构。把滚动 Sharpe 画出来又不等于解决统计推断。

编辑自设例子,非作者实验

自设例子:策略甲每次市场危机都能保护组合,乙在平稳期持续贡献。若只奖励稳定赚钱,可能误删甲;若只奖励平均 Sharpe,又可能误把偶然的一次暴赚当稳定能力。指标要服从组合角色。

  1. 计算同口径的滚动 Sharpe
  2. 比较平均水平与预设基准
  3. 修正重叠窗口的自相关
  4. 结合策略角色解释稳定性
关键结果与解释边界
核对项结果意味着什么
最大 SSR 组合8.44% / 29%文章示例的年化收益 / 最大回撤,不是样本外承诺。
最大 Sharpe 组合5.90% / 18%同一示例的对照;较低收益伴随较浅回撤。
滚动窗口没有通用最优值是平滑程度的选择,不是必须用某个超长年限。

不能推出什么

更高 SSR 不等于更低回撤;示例配置不能直接当投资建议。窗口、基准和估计方法都要预先固定。

研究用途

研究报告并列展示全样本、分阶段和回撤,而不是再加一个可以事后挑高的指标。

详细讲解

编辑理解

一个策略平时不赚钱、只在危机时大赚,另一个慢慢赚钱,全样本 Sharpe 相同,你需要的是哪一个?

把整段收益压成一个 Sharpe,会丢失收益发生的时间结构。把滚动 Sharpe 画出来又不等于解决统计推断。

自设例子:策略甲每次市场危机都能保护组合,乙在平稳期持续贡献。若只奖励稳定赚钱,可能误删甲;若只奖励平均 Sharpe,又可能误把偶然的一次暴赚当稳定能力。指标要服从组合角色。

原文证据

原文实际报告了什么

SSR 用平均滚动 Sharpe 减去基准,再除以考虑序列相关的长期标准差。重叠窗口必须处理自相关。文章的 ETF 示例中,最大 SSR 组合与最大 Sharpe 组合的年化分别为 8.44% 与 5.90%,回撤却为 29% 与 18%。

原文位置:Definition;Practical considerations;Examples of usage 最后一张表
编辑理解

为什么值得讨论,哪里不能外推

这里最容易误读的是“稳定”二字。收益路径稳定、估计值稳定、尾部风险小,是三件不同的事。一个卖出灾难保险的策略也可能在很长时间内稳定获利,却在极端事件中亏损。我的使用建议是把 SSR 当诊断维度:先明确策略应该在哪种环境赚钱,再检查它是否在那些环境中兑现,而不是机械追求数值最大。

更高 SSR 不等于更低回撤;示例配置不能直接当投资建议。窗口、基准和估计方法都要预先固定。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-08-24待核待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
最大 SSR 组合8.44% / 29%文章示例的年化收益 / 最大回撤,不是样本外承诺。
最大 Sharpe 组合5.90% / 18%同一示例的对照;较低收益伴随较浅回撤。
滚动窗口没有通用最优值是平滑程度的选择,不是必须用某个超长年限。

原文位置:Definition;Practical considerations;Examples of usage 最后一张表

推荐 82/100 · 问题 26/30 · 证据 21/30 · 方法 23/25 · 复现 12/15

稳定性问题与重叠窗口处理很有价值;示例配置不构成样本外优越性的证明,代码未独立运行。

尚未执行的实验思路

研究报告并列展示全样本、分阶段和回撤,而不是再加一个可以事后挑高的指标。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 长期资产回报研究

150年跨国证据:起始名义长债收益率几乎决定未来十年名义回报,却对真实回报没有保护;通胀超过约6—8%后真实债券收益转负

The Safe Assets: 150 Years of Bonds and Gold Across Sixteen Countries

Beyond Passive Investing

一句话先讲结论

一句话先讲结论:16国1870—2020年的2,084个重叠十年长债样本显示,起始长债收益率对随后十年名义回报的拟合斜率约为1、半数样本误差在1个百分点以内;但起始收益率对随后通胀几乎没有信息,因此真实回报差异主要由通胀决定,债券在各国通胀约6—8%后真实回报转负。黄金全样本真实年化仅1.04%、波动接近股票,若剔除1968—1981年解除价格钉住后的单次重估,真实回报略负。

它到底在问什么?

出生国会不会决定债券和黄金的长期购买力?起始债券收益率到底预测未来收益,还是只预测名义票息,而通胀风险没有被定价?

作者具体怎么做?

  1. 在16国、每个起始年构造十年滚动长债回报,并按本国CPI转化为真实回报。
  2. 回归未来十年名义/真实回报对起始收益率,分解实际回报方差为通胀与债券市场行为。
  3. 以年度收益减起始收益率对收益率变动回归,估算利率重估的隐含久期。
  4. 分通胀桶比较真实债券与股票收益,并将黄金法定钉住期排除在“可交易趋势”之外。

关键结果

原文结果与口径
核对项结果意味着什么
名义收益可预测性起始长债收益率对后续10年名义回报斜率约1、截距约0;半数样本落在±1个百分点内十年期附近的滚动债券组合,起始收益很大程度构成了名义回报本身。
实际收益风险起始收益率几乎不预测后续通胀;实际债券回报随通胀上升下降并在约6—8%转负名义carry不是抗通胀补偿。
利率上/下行收益率下降年份真实债券年化+6.4%,上升年份-1.7%长期债券的结果由carry之外的久期重估与通胀共同决定。
黄金长期记录全样本真实年化+1.04%、波动约14%;去除1968—1981后略负黄金长期表现被一次解除法定钉住后的重估强烈主导。
制度可交易性美国1933—1974年货币黄金持有受限制,价格长期受法定约束不能把固定报价时代的序列当作可交易资产趋势。

怎么理解?

这篇的价值在于把常见的“债券收益率就是未来回报”改得更精确:对名义回报几乎如此,对真实回报却不是。黄金部分同样克制,拒绝把行政定价时期伪装成市场趋势。它适合用于长期配置的情景框架,而非拿150年样本直接推一个精确阈值。

最大限制

十年窗口高度重叠,2,084个观测实际只有约200个独立十年,显著性不能按行数直觉解读;早期国债期限与可交易性不完全一致,战争、资本管制和货币改革难以标准化。黄金可自由交易样本有限,6—8%通胀阈值是渐变交叉而非稳定交易信号。

复现与研究价值

用点时点收益率曲线和本国通胀预期复建非重叠持有期,按期限、汇率对冲和信用风险拆分。配置层面应把实际利率、通胀状态、久期暴露和黄金制度可交易性分开建模,并在当前市场用可交易ETF/期货成本验证。

原文与核查

公开全文完整阅读;未取得原始历史数据库和代码。

原始文章 ↗

推荐 83/100(暂定) · 问题 28/30 · 证据 26/30 · 方法 22/25 · 复现 7/15

跨国长期样本与制度边界意识很强,但历史数据口径、重叠窗口和缺失代码限制严格复现与因果外推。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究批判

一万两千个特征的优势,可能来自截距和 Sharpe 算法

Does Complexity Actually Help? The Virtue-of-Complexity Autopsy

Ali H. Askar

一句话先讲结论

文章转述对‘复杂度美德’的复核:同一风险标准化市场收益上,12,000 特征模型 Sharpe 约 0.485,买入持有约 0.549;允许不受惩罚的截距、先合成预测再算 Sharpe 后,复杂度越高越好的曲线明显改变。但它也提醒,简单模型 0.699 的漂亮结果是网格最优值,不能拿事后最优简单模型去公平击败预设复杂模型。

它到底在问什么?

更多参数真的提高市场择时能力,还是正则化、截距约束与统计汇总方式制造了增长曲线?这是模型研究设计问题,不是简单与复杂的立场争论。

作者具体怎么做?

  1. 在共同评价期与共同标准化收益上重建买入持有和模型基准,避免把 Sharpe 本身误称为相对改善。
  2. 改变截距处理:均值非零时不应让斜率被迫替代截距;比较固定为零、受罚与不受罚设定。
  3. 统一随机种子聚合口径,并检查超参数选择、宏观发布日期滞后及交易成本。

关键结果

原文结果与口径
核对项结果意味着什么
统一基准0.4851 对 0.5494复核报道中的复杂模型和买入持有 Sharpe,均非本项目回测。
截距处理偏差平方降至 0.0002 以下原先约 0.0130—0.0267;说明设定本身对拟合均值有很大影响。
简单模型峰值Sharpe 0.6990网格挑选结果,不能视为已经独立验证的部署表现。

怎么理解?

最重要的迁移是固定比较协议。增加参数时,种子数量、集成方式、调参预算、截距和信息发布时间必须一起锁定,否则复杂度这个横轴同时改变了别的条件。预测精度与可交易组合质量也应各自明确,不能混用平均指标和合成策略指标。 不过文章自己的‘只有合成后 Sharpe 才能交易’措辞过强:选定一个种子的模型同样可以交易,平均种子 Sharpe 可以回答随机训练过程的期望质量;它只是不能被当成集成组合 Sharpe。公允结论是两种评估对应不同问题,必须同时披露,而不是其中一种永远无效。对复杂模型的反驳也不能靠简单模型事后择优来完成。

最大限制

完整阅读收录批判文章;未逐行重跑原论文与复核论文代码。复杂度理论的假设和此实证实现需要区分,不能由一个实现争议否定所有高维模型。

复现与研究价值

未执行方案:同一发布日期数据、同一嵌套外测与调参预算,固定种子后同时报告单模型分布和等权集成,所有模型采用一致截距约定与净成本评价。

原文与核查

收录批判全文解析;原研究和复核代码未独立重跑。

原始文章 ↗

推荐 87/100 · 问题 29/30 · 证据 24/30 · 方法 25/25 · 复现 9/15

能直接改善模型比较设计,原始复核与理论边界仍需二次审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 资产配置与行业轮动研究

行业轮动在19个样本外年度比九行业等权高1.37个百分点年化,但它同时改了26处设置,不能把收益全部归因于“regime”

Regime-Based Sector Rotation Beats the Index at Full Deployment

Serhat Girgin(QuanterLab)

一句话先讲结论

一句话先讲结论:在九只Select Sector SPDR固定池、2006—2024年19个逐年样本外窗口中,作者的regime轮动组合累计+614.0%、年化10.90%、Sharpe 0.67,优于九行业季度等权的+463.4%、9.53%、0.58,年化差1.37个百分点、最大回撤少14.0点(-39.8% vs -53.8%)。但两臂不只差一个regime开关:轮动臂同时加入10个分类器、三条行业篮子、路由和持仓集中等26处变化,所以证据支持“这个完整设计优于等权”,不支持“regime识别器单独创造了1.37个百分点”。

它到底在问什么?

当行业轮动不是降仓到现金、而是始终满仓地在风险偏好、周期和防御三组行业之间切换时,能否相对九行业等权提高风险调整收益?

作者具体怎么做?

  1. 每年锚点以前两年信息供拟合成员使用,随后一年样本外;共19段,所有锚点在评分前登记。
  2. 对照季度持有九行业等权;实验臂使用10个regime模块多数投票,次日才执行状态切换,避免同日信号收益。
  3. 拼接两边样本外日收益,计入分配和成本;对4,762个配对交易日进行区块bootstrap,并检查逐窗口胜负和前后半段。
  4. 将完整设计与等权比较,同时公开26处实现差异,限制单一因子的归因。

关键结果

原文结果与口径
核对项结果意味着什么
全样本表现轮动:+614.0%、年化10.90%、Sharpe 0.67、回撤-39.8%;等权:+463.4%、9.53%、0.58、-53.8%表1显示完整轮动设计同时提高收益、Sharpe并降低最大回撤。
配对证据轮动胜12/19窗口,等权胜7个;P(等权胜轮动)=28.4%方向上偏向轮动,但19个年度窗口仍不足以宣称稳定规律。
关键年份2008年等权-34.2%、轮动-21.4%;2021年+30.7% vs +43.4%差异在危机防御和扩张期行业集中都出现,并非单一市场状态。
归因边界两臂登记为26处不同设置持仓数9→3、三条篮子、10个分类器及路由共同改变,单独regime alpha未被识别。

怎么理解?

这是很好的反面教材:标题说“regime rotation beats index”,正文却诚实披露它是一个多组件系统对另一个简单组合的比较。读者应把10.90%对9.53%当作端到端策略差,不要写成“10个regime分类器证明有效”。页面统计卡把两组Sharpe和CAGR差的方向标反,表1、图1和表3相互一致地支持轮动胜出;本站采用可复算的表格而非卡片标签。

最大限制

无记录的设计前搜索无法做多重检验折价;分类器默认参数、月度再拟合与多数投票本身都可能包含调参。19年并非独立样本,SPDR流动性和行业定义也不代表A股行业轮动。更重要的是,26处设计差异使归因不成立,且未披露完整可执行代码和逐日持仓。

复现与研究价值

复现应先做最小消融:固定三行业篮子和3只持仓,只加入单一regime规则;再逐个增加分类器、投票和路由,报告每一步的增量、换手和成本。随后以同一行业分类在A股及欧洲市场做完全冻结的样本外测试,并检验市场beta、成长/价值和动量暴露是否解释收益。

原文与核查

公开全文、表格和逐窗口结果完整阅读;发现页面统计卡与表格标签矛盾,未独立重跑。

原始文章 ↗

推荐 84/100 · 问题 27/30 · 证据 27/30 · 方法 21/25 · 复现 9/15

样本外、成本和逐窗口证据透明,且主动披露多组件差异;但因此无法将结果归因于regime本身,设计前搜索与代码也不完整。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research

Wealth management with macro factors

Wealth management with macro factors

Eric Brine、Fabio Cereda、Ralph Sueppel

一句话先讲结论

宏观支持分数转化为低频资产权重后,2000—2026年7月显著优于等权配置,但为未扣交易成本和风险管理成本的毛收益估计。

它到底在问什么?

能否用宏观环境变化系统性调整现金与风险资产配置,改善长期财富积累?

作者具体怎么做?

  1. 构建35个点时宏观因子并顺序标准化
  2. 按经济理论对每一资产类别采用概念平价平均
  3. 将资产支持分数与现金分数输入SoftMax并季度再平衡

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

机制是不同资产对增长、通胀、金融条件、期限溢价和避险环境敏感度不同;现金作为共同替代项可在支持分数普遍偏弱时提高权重。

最大限制

因子选择有理论及潜在事后偏差;可能遗漏因子;未计交易成本、滑点、容量和风险覆盖;工业金属单资产预测不显著;数据存在访问门槛。

复现与研究价值

取得JPMaQS数据,复刻35因子、SoftMax、季度再平衡及一天滞后;加入成本、风险目标、滚动窗口和半样本检验。

原文与核查

public-original-read

原始文章 ↗

推荐 83/100 · 问题 26/30 · 证据 25/30 · 方法 22/25 · 复现 10/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 策略开发文章

动量股只在回撤15%后买入,单策略指标不如追高版,却提供不同的入场时间与股票池;作者只给出机制证据,未公布完整回测表

Momentum Mini-Portfolio Development - Part 2: USA Pullback Momentum

TradeQuantiX

一句话先讲结论

一句话先讲结论:作者将传统横截面动量的“突破追高”改为“距年度高点至少回撤15%才买”,并明确承认该pullback版单策略总体指标不如无回撤过滤版;其主张是组合层面的入场与持仓分散,而非单策略alpha更高。作者报告回撤版平均盈利交易约+30%、平均盈利持有51日、亏损约-10%,5—10日固定持有也呈正期望,但没有公开完整年化、Sharpe、样本期、成本或明细表,因此只能把它视为待独立复现的策略假设。

它到底在问什么?

在高动量股票上等待回撤再进入,是否能形成与“创新高买入”不同的有效入场机制,并在动量系统簇中提高路径分散化?

作者具体怎么做?

  1. 以横截面动量排名产生候选池,再加入距离年度高点的回撤阈值,分别比较有无该条件。
  2. 扫描0%到30%的不同回撤深度,观察交易数量、闲置现金、净值路径和持仓重叠,而不是只挑单一最优阈值。
  3. 对入场后5、10、21、63、126日固定持有测试,并用回到不同N日高点的退出检验短期回撤是否快速修复。
  4. 将pullback、无pullback美国动量和TSX动量组合,比较相关性、股票重叠与风险调整组合指标。

关键结果

原文结果与口径
核对项结果意味着什么
作者的核心承认pullback版单策略总体指标低于无pullback版不能把回撤条件宣传成已证明提高独立策略收益。
15%版本的交易形态平均盈利交易约+30%,平均盈利持有51日;平均亏损约-10%作者将其解释为先赚回撤修复、再参与趋势延续的组合。
短期检验5日和10日固定持有均为正期望(作者描述,未给表格数值)若真实,说明信号的收益不完全依赖长期市场beta;但缺少数字无法核验显著性。
阈值扫描0%到30%回撤越深,平均暴露越低、闲置现金越多;作者称交易质量未明显恶化参数改变主要像暴露旋钮,是否稳健需完整曲线和样本外验证。
信息受限完整CAGR、Sharpe、回撤、样本期、交易成本和持仓明细未披露不应据此给出可交易收益预期或高分推荐。

怎么理解?

这篇的好处是作者没有把“分散化”偷换成“指标更高”:他明确说无回撤版单策略更强,想要的是不同的进入价、交易时点和持仓名单。问题也在这里——组合分散化只有在同一完整市场、相同成本、相同仓位下量化后才是可检验命题。文章强调“2026年YTD超过100%”同时承认想法源于当年3月讨论,这正是需要严格隔离事后观察与开发选择的场景。

最大限制

结果图表和原始数据不完整,无法核验样本期、股票池幸存者偏差、滑点、停牌/退市处理和参数搜索次数。15%阈值虽有扫参,但最终选择仍基于历史偏好;“正期望”没有置信区间或多重检验调整。与其他系统的相关性也不等于未来组合增益。

复现与研究价值

用点时点美国股票池重建12-1动量、15%回撤与无回撤规则;预注册样本外期、持仓数、换手和成本。对0—30%阈值做walk-forward参数冻结,报告暴露、空仓时间、交易重叠、因子暴露和组合边际Sharpe;然后以加拿大/欧洲市场作为真正独立验证。

原文与核查

公开文章正文完整阅读;完整图表数值与付费材料未取得。

原始文章 ↗

推荐 54/100(暂定) · 问题 22/30 · 证据 12/30 · 方法 16/25 · 复现 4/15

提供了有意思的机制与反向对照,但完整数值、数据、代码和成本口径不足,且有明显事后开发风险。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

赢过 80 个随机价位仍不够:两跳滑点让 PF 从 1.34 缩到 1.07

Two Strategies Past 80 Meaningless Versions of Themselves. Control Group Told Them Apart

Jan Heger

一句话先讲结论

作者把价位触发规则改成 80 个无意义偏移,发现朴素反应策略的 PF 1.03 被 31 个随机版本打败;更复杂的穿越规则 PF 1.34,80 个对照都没超过它。但加入两跳滑点后,后者 PF 也只剩 1.07,单笔利润从 7.03 美元降至 1.78 美元。统计上不像随机结果,与经济上足够厚,是两个门槛。

它到底在问什么?

一条价格规则的正回测,到底来自特定价位的信息,还是任何差不多的规则在这段市场里都能赚钱?

作者具体怎么做?

  1. 朴素“价位反应”规则样本内 PF 1.03、样本外 0.98,七年中四年为正;80 个随机桶中有 31 个产生更高的最佳单元成绩。
  2. 另一个加入穿越几何与状态过滤的规则有 514 笔交易,作者报告完成率或胜率 58.4%、PF 1.34,超对照约 3.29 个标准差,零个对照更好。
  3. 作者再看年度与样本外,称七年中六年为正,样本内外 PF 分别 1.29、1.38。
  4. 最后加入两跳滑点,胜率降至 53.1%,PF 降至 1.07,单笔收益只剩 1.78 美元,显示执行误差可能吃掉大部分优势。

关键结果

原文结果与口径
核对项结果意味着什么
朴素规则对照位置31 / 80 超过它其正 PF 并未明显超出无信息规则能产生的范围。
较强规则PF 1.34;0 / 80 超过有限随机对照提供支持,不等于真实成功概率 100%。
滑点后PF 1.07;$1.78 / 笔实盘净边际薄,还需检查佣金、延迟和不同市场时期。

怎么理解?

随机对照的价值在于让研究员回答一个更窄、更有意义的问题:不是“赚没赚钱”,而是“宣称有用的那部分信息有没有贡献”。但对照构造本身也是假设。偏移后若交易频次、距离或持仓时间明显不同,就不是只移除了信息,还改变了风险结构。 “零个超过”也不能写成绝对保证。八十个版本之间往往相关,标准差尾概率未必正态;有限样本置换检验通常还需要有限次数修正。文中较复杂规则已经调过几何和过滤条件,其全部搜索历史是否也在对照里重放,是决定证据强度的关键。

最大限制

文章未披露具体品种和完整触发规则,对照的独立性与搜索预算不能核查;完成率与胜率用词混合。作者称已进入实盘,不等于本次已经核验实盘收益。

复现与研究价值

为现有策略设计保留交易频次、持仓和波动暴露的置换对照,把所有参数优化放入每个对照内部;同时给出滑点曲线和打平成本。将“信息检验通过”与“可交易成本预算通过”分别标记,避免一个总分掩盖薄边际。

原文与核查

公开正文全文解析;未核验隐含规则和实盘账户。

原始文章 ↗

推荐 79/100 · 问题 27/30 · 证据 20/30 · 方法 23/25 · 复现 9/15

对照加执行检验的两层框架实用,具体规则和全搜索历史尚不透明。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究批判

优化器跑完还很分散,不代表已经找到稳健参数区

Metaheuristics for Rule Optimization — With Diversity as the Guardrail

Ali H. Askar

一句话先讲结论

四种优化器各跑 31 次,差分进化平均年化 107.36% 看似最强;统一到同一口径后,BTC 买入持有约 104.2%,领先其实只有约 3.2 个百分点。更有价值的是记录种群多样性,但文中 80%—85% 的剩余分散几乎全由均线长度贡献,止盈止损维度只占未标准化指标约 0.07%,不能据此宣布整个参数空间都稳健。

它到底在问什么?

找最优参数的算法是否稳定、探索了哪些区域、最优值是否只是随机种子的最大值?作者拆解一个八参数 BTC 均线策略研究,重点不在给优化器排榜。

作者具体怎么做?

  1. 每算法用 50 个个体、1,000 代、31 个随机种子搜索四均线长度和四出场参数。
  2. 训练用八个重叠窗口的平均收益打分,这属于样本内多阶段目标加单次留出,不是每次训练后独立测试的滚动外测。
  3. 记录各代参数分散,核对计量单位、年化与累计收益、最优种子选取位置和风险基准。

关键结果

原文结果与口径
核对项结果意味着什么
平均表现DE 107.36% 年化需与同为年化的约 104.2% 买入持有比较,而非与累计 397.93% 混用。
种群分散末期约 80%—85%未做各维范围归一化,主要度量均线长度。
样本外选择从验证期选最佳配置用于最终最佳配置排序的留出集不再是该选择的独立测试。

怎么理解?

种群轨迹值得保留,但高分散不是稳定平台的充分证据:可能有多个好区域,也可能是噪声大导致选择压力弱,甚至是算法尚未收敛。应同时观察每个区域的外测收益、邻域敏感度和种子分布,不能只看一个探索百分比。 文章对成交的解释也需谨慎:用上一根完整收盘确认交叉,同时假定成交在同一收盘,并不会自动消除时点问题。必须说明收盘前能否形成信号、实际下单方式和下一可交易价格。至于由最好减均值反推种子标准差,只是分布近似,真实偏态回测结果不必符合正态最大值公式。

最大限制

收录全文解析;底层优化论文、真实五分钟成交路径未独立重跑。部分表格最佳数值相互不一致,不能自行挑最有利版本。

复现与研究价值

未执行方案:先按参数范围归一化分散度,记录全部搜索和种子;用嵌套训练选择配置,最后留出不再调参;以对数财富、回撤和换手联合检验,并将信号成交推至下一可交易时点。

原文与核查

收录批判全文解析;底层试验未独立运行。

原始文章 ↗

推荐 86/100 · 问题 28/30 · 证据 24/30 · 方法 24/25 · 复现 10/15

目标函数和单位审计非常实用,但最佳收益及执行仍有争议。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究批判

先有理论也要记搜索账,方法论文章本身也得过检验

Model-Based or Data-Mined: Lotter's Framing of the Whole Problem

Ali H. Askar

一句话先讲结论

文章讨论 Lotter 的模型驱动与数据挖掘框架,最实用的结论是:从十种经济机制中挑一个赢家,也是在做多重搜索,不能因为先有理论就免检。文中依据课件直方图目测现实检验 p值约0.085,只能算图读近似;其进一步提出回撤按时间平方根机械换算,则不应作为通用规则使用。

它到底在问什么?

一张像趋势或双顶的图,能否区别于随机路径?一个有机制故事的规则,又能否在完整研究流程的试错后仍显示净优势?

作者具体怎么做?

  1. 将机制写成可证伪条件和数学或程序规则,先声明什么结果会否定它。
  2. 用随机或重采样对照检验统计量,并登记所有模型家族、资产、过滤器及窗口搜索。
  3. 把收益方向、执行成本与仓位复利分开;课件图读数只用于解释,不当作精确可复現绩效。

关键结果

原文结果与口径
核对项结果意味着什么
课件图读p约0.085作者目测直方图,不是提供原始样本后重新计算的精确p值。
小信号示例约0.4点信号对10点噪声假设性小时外汇动量示例,说明检测弱信号需要足够信息。
证据性质方法教学和图表复核没有本项目新策略或新实盘记录。

怎么理解?

我同意最核心的要求:机制能压缩搜索空间,却不能抹除试验次数。机制也应有反例,例如预期哪个资产、哪个时期无效,而不只是收益出现后解释得通。这样才可能让机制对未来研究产生约束。 但这篇值得保留批判距离。零漂移布朗运动某些极值尺度可与√T相关,不意味着有漂移、复利、自相关或路径依赖的策略最大回撤一律按√T换算;Calmar也不能据此自动修正。图上几个频谱柱的均值和标准差,更不能替代带依赖结构的正式多频率检验。审查别人课件的文章,同样需要满足自己提出的证据标准。

最大限制

课件本身未逐页独立核验,p值及仓位法回撤是作者图读近似;不应将约43%或48%的课件收益作为可部署预期。

复现与研究价值

未执行方案:建立完整试验登记,保留序列依赖的块重采样,并以固定长度外测比较回撤;不同资金管理只在同一底层交易信号、费用和风险预算下评价。

原文与核查

收录全文完整解析;底层课件未逐页复核。

原始文章 ↗

推荐 71/100 · 问题 25/30 · 证据 18/30 · 方法 21/25 · 复现 7/15

机制与搜索统一框架有用,但图读显著性和回撤缩放有明显边界。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 日历效应与行业动量研究

行业动量并非整月有效:月初第1日做多赢家有效、随后第2—3日应反转,三段拼接后长短年化5.99%、Sharpe 0.55

Sectoral Intramonth Momentum Cycle: Exploiting Turn-of-the-Month Patterns in Sector ETF Strategies

QuantPedia

一句话先讲结论

一句话先讲结论:以月末252日收益排名九只Sector SPDR、每次做多前三并做空后三,样本1998年12月—2026年6月显示动量只在新月第1交易日为正,随后第2—3日反转,且月末前第10至第5交易日再次为正;将三段按正确方向拼接,行业长短组合年化5.99%、Sharpe 0.55,市场中性版3.77%、0.54,月内实际持仓不足一半交易日。结论很有意思,但日历日多重筛选、未扣借券和交易成本、以及研究期包含异常发现后数据,都意味着它尚不是可直接实盘的alpha。

它到底在问什么?

行业横截面动量是否像个股动量一样集中在少数月内交易日?若月初存在快速反转,能否通过切换方向而不是整月持有提高动量的风险调整收益?

作者具体怎么做?

  1. 在每个交易日相对月末的位置上,汇总同一252日行业动量组合的平均收益,寻找月内收益集中和符号翻转。
  2. 分别交易新月第1日的动量腿、第2—3日的反转腿和月末前10至5日的动量腿。
  3. 三条腿使用同一个前一月末排名,避免在持有窗口内重新计算信号导致的前视问题。
  4. 将非重叠的三段拼接,并与只持有单腿的市场中性和行业长短版本比较年化、波动、Sharpe和回撤。

关键结果

原文结果与口径
核对项结果意味着什么
月初第1日动量行业长短年化2.83%、波动6.69%、Sharpe0.42;市场中性0.23%、Sharpe0.15首日的横截面赢家减输家比赢家减SPY更有效。
第2—3日反转反转行业长短年化3.26%、波动7.13%、Sharpe0.46同向动量在月初随后两日为负,反向交易略优于首日腿。
月末前窗口行业长短年化1.35%、波动4.16%、Sharpe0.32;市场中性0.80%、0.25独立的预月末动量腿较弱但与前两段不重叠。
三段合成行业长短年化5.99%、Sharpe0.55;市场中性3.77%、0.54作者的关键结果来自时序拼接,而非任一单独腿。
研究暴露每月实际持仓少于半数交易日低在场时间不等于低执行成本,仍需计入换向、借券和隔夜风险。

怎么理解?

这篇的真正研究价值是提出“信号方向取决于日历位置”,而不是又找到一个整月行业动量。第2—3日反转尤其需要谨慎:先在图上查看每天平均收益、再选出三段拼接,本身具有显著的数据挖掘自由度。Nathan、Suominen、Tasa的个股月末研究为预月末腿提供了外部动机,但不能自动验证行业ETF月初反转。

最大限制

窗口选择、前三/后三、252日回看和两种基准产生多重检验,文中未给出预注册或deflated Sharpe。交易成本未含ETF价差、空头借券费、月初换向和可执行收盘/开盘假设;相邻月收益和行业ETF共同冲击也降低独立观测数。样本末端2026年数据较短,跨市场和近年样本外均未验证。

复现与研究价值

用1998—2015发现、2016—2026冻结验证,或逐年walk-forward选择窗口而非全样本选日。实施时使用可成交价格和完整借券/融资成本,报告每腿贡献、换手、容量和因子暴露;在欧洲、A股行业ETF或行业期货上检验月初反转是否存在。

原文与核查

公开全文完整阅读;未独立重跑。

原始文章 ↗

推荐 79/100(暂定) · 问题 26/30 · 证据 25/30 · 方法 19/25 · 复现 9/15

规则和单腿结果透明、ETF实现直接;但日历窗口搜索和成本/样本外验证不足。

返回全年目录 ↑

Quantocracy / 导读完成

AI 因子确实拥挤,但不能因此断定是模型权重造成的

Your Research Agent Is an Undisclosed Factor Exposure - And So Is Everyone Else's

Jonathan Kinlay

这篇的反转是:AI 生成的组合很像,但按公开因子文献构造的对照组合更像。拥挤是真问题,归因不能跳步。

2 分钟看懂

两个 AI 团队交出相似策略,是共享模型导致的,还是它们都读了同一批经典论文?

只测 AI 与 AI 的相关性,无法区分模型特有偏差与公开投资知识本来就集中的事实。

编辑自设例子,非作者实验

自设例子:十位研究员都提出动量因子。若十个随机策略更分散,并不足以证明研究员互相抄袭;还要比较十位独立读过经典文献的研究员会多相似。对照组改变,结论就可能改变。

  1. 统一信号语言与股票数据
  2. 各研究运行生成策略组合
  3. 加入随机表达式与文献对照
  4. 分别检验拥挤现象和拥挤成因
关键结果与解释边界
核对项结果意味着什么
随机表达式组合相关性 0.15说明并非同一套工具下什么东西都高度相关。
LLM 研究组合相关性 0.62独立运行仍有较强共享风险。
公开异象组合相关性 0.82比 LLM 更拥挤,削弱“模型权重特有作用”的简单解释。

不能推出什么

单一模型家族、统一价格信号语言和小样本运行限制因果解释;不是跨所有大模型的定论。

研究用途

和 LLM Crowds 一起读:先看最终持仓与收益相关性,再讨论人格或模型的差异。

详细讲解

编辑理解

两个 AI 团队交出相似策略,是共享模型导致的,还是它们都读了同一批经典论文?

只测 AI 与 AI 的相关性,无法区分模型特有偏差与公开投资知识本来就集中的事实。

自设例子:十位研究员都提出动量因子。若十个随机策略更分散,并不足以证明研究员互相抄袭;还要比较十位独立读过经典文献的研究员会多相似。对照组改变,结论就可能改变。

原文证据

原文实际报告了什么

作者在价格信号的统一表达语言下比较组合:随机表达式平均相关性 0.15,LLM 研究组合 0.62,公开异象组合 0.82。8 次运行属于同一模型家族,股票样本也有幸存者限制;未能据此识别模型权重的独立作用。

原文位置:Setup;Results §1、§3;What this does and does not show
编辑理解

为什么值得讨论,哪里不能外推

对量化团队最实际的改变,是把“生成来源”与“风险来源”分开。两个策略由不同模型写出,甚至代码完全不同,也可能在同一天买入同一组股票。反过来,共同使用一个基础模型,也不意味着最终风险相同。更可信的验收是把策略放进组合,观察增量风险和净成本贡献,再问它究竟带来了什么新东西。

单一模型家族、统一价格信号语言和小样本运行限制因果解释;不是跨所有大模型的定论。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-08-16待核待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
随机表达式组合相关性 0.15说明并非同一套工具下什么东西都高度相关。
LLM 研究组合相关性 0.62独立运行仍有较强共享风险。
公开异象组合相关性 0.82比 LLM 更拥挤,削弱“模型权重特有作用”的简单解释。

原文位置:Setup;Results §1、§3;What this does and does not show

推荐 86/100 · 问题 28/30 · 证据 22/30 · 方法 24/25 · 复现 12/15

随机与经典文献双对照以及主动撤回过强归因值得读;单模型家族、小运行数和幸存者问题降低证据分。

尚未执行的实验思路

和 LLM Crowds 一起读:先看最终持仓与收益相关性,再讨论人格或模型的差异。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文解读

同样月涨幅,先涨后跌与先跌后涨不是同一因子

Price-Path Convexity: A New Cross-Sectional Anomaly

Ali H. Askar;研究:Huseyin Gulen、Michael Woeppel

一句话先讲结论

研究把股票月内起终价格中点与日收盘均值作比较,低凸性组下一月约1.24%,高凸性组约0.41%,多空毛差约0.84%/月;控制上月涨跌及常见特征后,每高一个标准差凸性,对应下月收益低约45bp。它值得研究的是路径信息的增量,但‘控制现有因子后仍显著’不等于已经排除所有风险,更不等于净成本可交易。

它到底在问什么?

传统一个月收益只看两端,会把月中冲高后回落和月中跌深后反弹视为一样。投资者是否过度外推最后一段走势,让路径形态包含下一期反转线索?

作者具体怎么做?

  1. 用一致复权口径的月内日收盘构造指标,月末形成截面,下一月观察收益。
  2. 在上月收益组内再比较凸性,检验是否只是传统短期反转重命名。
  3. 做截面控制和调查预期关联,再单独评估真实投资池、换手、借券及成本。

关键结果

原文结果与口径
核对项结果意味着什么
五组多空约0.84%/月;t=6.29论文毛结果,组均值显示数字有四舍五入。
特征控制每标准差约−45bp/月平均截面斜率,不是每只股票的确定预测。
调查关联解释力约40%与28%对应不同预期数据中的外推部分,不能当收益预测R²。

怎么理解?

这类因子最值得问的是信息压缩:一个月里按时间加权的涨跌,是否比只看月收益更好地描述近期买压。双重排序和控制最近1、5、10日收益有助于排除最直接的替代解释,但并不会穷尽所有路径特征或成本来源。 原博客说‘没有因子解释’和‘风险故事失败’过于绝对。有限因子集的残差、衰退期较强和调查相关支持行为机制,却不是唯一因果证明。博客给出的近似分解还存在量纲疑点:括号是价格变化而外部系数无量纲,不能直接等于无量纲凸性。实现应从清楚的首末中点定义入手,不照抄该近似式。

最大限制

收录解读完整阅读,原论文全样本和数据清洗未独立重跑;毛多空、短持有与全市场股票的交易成本是关键缺口。

复现与研究价值

未执行方案:在事前可交易个股池用复权价格构造原定义,与最近多日反转和日收益加权模型做同风险比较;固定月内采样和调仓时点,检查借券、涨跌停与费用后的增量。

原文与核查

收录正文完整解析;底层论文数据未独立复现。

原始文章 ↗

推荐 87/100 · 问题 29/30 · 证据 24/30 · 方法 23/25 · 复现 11/15

可直接计算且有明确增量检验,但原博客机制和公式表述需审慎。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究批判

黄金比特币轮动年化80%的背后,是选窗和高波动

Dual Momentum Between Gold and Bitcoin (Two Stores of Value)

Ali H. Askar

一句话先讲结论

黄金和比特币每周择强、两者都跌则现金,十个回看窗口里最好的8周版年化79.91%,最大回撤仍−43.94%;4/8/12周组合加20%预测波动上限后,年化降至12.01%、回撤−12.27%。前者是同一样本选出的高风险峰值,后者才展示风险约束的代价;两者都没有因此获得独立外测证明。

它到底在问什么?

把两种‘价值储藏’资产结合,究竟分散了风险,还是轮流承担比特币高波动?绝对动量的退场速度够不够,波动上限又如何改变资金使用?

作者具体怎么做?

  1. 在2018年底至2026年4月尝试1、2、3、4、6、8、12、20、24、28周窗口,公开整张参数表。
  2. 分别运行纯切换与4/8/12周组合,检查表现是否集中于2024年后的少数上涨阶段。
  3. 用选中资产过去12周波动缩放仓位,比较收益、波动和回撤下降幅度,并审计代理拼接和成本。

关键结果

原文结果与口径
核对项结果意味着什么
最佳纯切换79.91%;回撤−43.94%样本内十窗口峰值,不能当未来期望。
风险约束组合12.01%;回撤−12.27%对应4/8/12周组合,非同一个8周版本。
实现波动约8.77%现金与不加杠杆共同使波动低于20%上限。

怎么理解?

真正应复制的是整张参数表,而不是8周。若只有少数相邻窗口超过基准,应考察是稳定区域还是某轮币价行情的恰好匹配;组合窗口也若见过结果才选,不能自动消除选择偏差。基准还应做同风险控制,否则容易把降低仓位收益误说成模型优劣。 博客对 Sharpe 的批评也有一处不能照用:以复合年化收益除波动并非标准算术超额收益Sharpe,简单从全期年化减5%也不是重算历史无风险调整。应在每期加入实际现金利息并减同期无风险收益,再计算标准Sharpe;不能把文章的0.80敏感性算式当准确修正结果。

最大限制

收录批判文章完整解析,原Quantpedia实现未独立重跑;IBIT成立前是代理,现货、BITO展期和ETF实际收盘成本不能互换。20%历史估计上限也不能保证未来实现风险不超标。

复现与研究价值

未执行方案:固定窗口集合后保留新时段,统一可成交代理与现金收益,比较同波动基准;记录周三收盘信号至真实成交时滞,并对跳跃及突然相关性上升压力测试。

原文与核查

收录全文和参数表解析;原始代码未独立复现。

原始文章 ↗

推荐 84/100 · 问题 27/30 · 证据 24/30 · 方法 23/25 · 复现 10/15

参数与风险分解有用,但Sharpe口径和样本内选择须修正。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 策略研究

VIX 加速动量只在单选 ETF 上赢了,选两只就没了

VIX and Trend Following Revisited: Nearly a Decade of Out-of-Sample Evidence

David Mesicek

一句话先讲结论

2017 年 8 月至 2026 年 6 月,按 VIX 状态改变动量窗口、每月只持第一名 ETF 的策略,10bp 成本下年化 14.09%,超过固定十个月窗口的 9.87%;但各持两只 ETF 后变成 10.30% 对 10.40%,优势消失。前者经济差异明显,却由少数换仓月份贡献,配对 t 检验 p=0.1696,不足以宣布 VIX 普遍改善趋势策略。

它到底在问什么?

高波动时市场领导资产可能切换更快,能否缩短动量观察窗口,提高反应速度?文章重访 2017 年公开的想法,重点检查发表之后的新数据,而不是再挑一个最好看的历史窗口。

作者具体怎么做?

  1. 月末识别 VIX 状态并计算相应窗口的资产动量,下一月执行持仓;108 个信号月只对应 107 个已完成收益月。
  2. 同一资产池同时运行 Top 1、Top 2 与各自固定窗口基准,比较净收益和换手。
  3. 逐月分解相对收益,进一步做状态、年份、成本及显著性检验,区分几次关键选择和稳定普遍增益。

关键结果

原文结果与口径
核对项结果意味着什么
集中版本净年化 14.09% 对 9.87%每单位换手 10bp 成本假设;不是实盘结果。
分散版本10.30% 对 10.40%Top 2 没有显示净收益改善。
统计边界配对 t 的 p=0.1696样本不足以把月度差异认定为显著;不能只拿年化差值下结论。

怎么理解?

最有价值的设计是同时展示 Top 2。它说明信息价值可能集中在第一、第二名的少数排序反转,而不是所有资产趋势识别都变好了。对实际组合,如果既有配置本来就比较分散,不能直接套用全仓单选的改善幅度。 另一方面,不显著并不等于确定无效:月度差值稀疏,有效样本远少于 107。更合理的是把它保留为待验证假说,并问优势是否主要由疫情后的少数重排贡献。文章是旧想法的 ETF 代理延伸,不是原始资产和执行实现的逐项复现;‘发表后数据’比样本内强,但仍应审计这次代理和规则是否事后选择。

最大限制

极端 Red 状态只有三个完成收益月;公开正文未给出足以逐项重建的全部状态阈值与窗口映射。不能自行补一个 VIX 阈值当成作者参数。

复现与研究价值

未执行的研究方案:取得完整阈值与代理代码,冻结后做留年检验;报告去掉最大几个相对收益月的结果,再在相同风险与换手预算下比较固定窗口集成,检验收益究竟来自 VIX 还是一般的快慢动量混合。

原文与核查

收录全文解析;原始 2017 策略完整代码未核验。

原始文章 ↗

收录原文

推荐 84/100 · 问题 27/30 · 证据 25/30 · 方法 24/25 · 复现 8/15

样本外诊断充分且反例公开,但阈值实现不完整、增益集中。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究综述

A股因子择时没赢等权,不代表所有条件配置都无效

Factor Timing Mostly Fails — the Honest Version

Ali H. Askar;研究:Chuan Shi 等

一句话先讲结论

文章转述2000—2020年A股前1000只股票、七个多头因子的研究:估值、动量、波动和情绪择时都没可靠胜过等权,等权本身相对市场约0.27%/月、t=3.98。另一项美国研究却在主导共同因子上发现预测性;两者不矛盾,真正问题是你在给哪些风险维度择时,而不是‘择时’这个标签本身对错。

它到底在问什么?

已有一篮子有效因子后,是否还值得动态调整权重?即使理论最优权重依赖条件收益和协方差,现实估计误差会不会比理论增益更大?

作者具体怎么做?

  1. 对同一资产池构建因子,固定信息发布时间、权重归一化和等权基准。
  2. 比较各择时信号多种窗口的增量收益和稳健误差,而不是只选最好的窗口。
  3. 将个体因子择时与主成分降维后的共同风险择时分开,检查信息是否集中于少数可预测方向。

关键结果

原文结果与口径
核对项结果意味着什么
A股等权基准超市场0.27%/月;t=3.98不等于任意等权组合都有效;是该研究的七因子池。
波动共性相关约0.65或0.55不同因子集合的波动相关,不是因子收益相关。
美国主成分部分外测R²约4.82%、3.52%另一研究和另一市场,不能直接作为A股增量证据。

怎么理解?

这篇最实用的是把基准放严。我们不需要证明某个因子下月收益可预测,而是证明这种预测能改善既有组合的净效用;预测与其他仓位高度重复时,即使显著也未必值得换手。低维条件配置可以减少估计成本,但主成分必须只用训练数据形成,否则也会前视。 文中仍有夸张需要校正。共同波动高并不证明逆波动相对权重全是噪声;等权也不是‘没有任何可过拟合成分’,因子筛选本身就是研究选择。SDF方差由1.67到2.96,更不能直接说Sharpe上限近乎翻倍,在其他归一化相同时对应的是平方根关系。研究应保留这些条件,避免用口号替代比较。

最大限制

收录全文解析;两项底层研究未统一复算,市场、时间、长短仓与成本口径不同。失败的有限信号不能证明所有择时不可能,理论上限也不是已实现收益。

复现与研究价值

未执行方案:用当前A股个股因子库建立固定等权/等风险基准,只允许有限幅度偏离;在嵌套外测中比较个体和共同成分择时,记录选择次数、净换手收益与风险目标。

原文与核查

收录综述全文解析;底层论文尚未全部独立核验。

原始文章 ↗

Factor Timing and Factor Allocation

推荐 83/100 · 问题 28/30 · 证据 23/30 · 方法 23/25 · 复现 9/15

与实际因子配置直接相关,但跨研究泛化及理论数字需谨慎。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法短文

夏普估计不一定是钟形曲线;但拟合 5,000 次重抽样不等于拥有 5,000 份市场证据

Sharpe Ratio Distribution: When Normal's A No-Go, Why Not SHASHo?

Krzysztof Ozimek

一句话先讲结论

作者对两年标普日收益的夏普估计做 5,000 次 bootstrap,发现四参数 SHASHo 分布的 GAIC 优于正态,于是提出用它重写 p 值、临界值、检验功效和最低记录长度。值得关注的是夏普估计的偏斜和尾部,不是立刻替换标准检验:5,000 次来自同一短历史的重抽样,不能增加原市场样本的信息量,也不能保证尾部概率已校准。

它到底在问什么?

即使对自相关、偏度、峰度修正夏普方差,最后仍用正态近似是否会忽略估计分布形状?短样本尤其可能不满足漂亮对称的钟形直觉。

作者具体怎么做?

  1. 作者以两年标普日收益反复计算夏普,做 5,000 个 bootstrap 估计,再通过 GAMLSS 拟合其无条件分布。
  2. SHASHo 使用位置、尺度、偏斜与尾部四个参数,均值并非直接等于位置参数,需要由全部形状推导;作者称四参数显著、GAIC 比正态更好。
  3. 利用该分布到标准正态的变换,作者计划推导单侧检验、临界值、功效与最低记录长度;本篇是四篇系列的第一篇,没有完整展开后续校准实证。

关键结果

原文结果与口径
核对项结果意味着什么
原市场资料两年日收益短历史是可用信息的基础,重抽样次数并不能替代更多独立市场状态。
Bootstrap 次数5,000减少模拟误差,不消除经验样本偏差和重抽样方法的依赖假设。
模型比较GAIC 优于正态作者未在本篇列出详细数值和外部覆盖测试,不能判断改善量级。

怎么理解?

这个问题确实值得问:报告夏普 1.5 时,如果估计分布明显右偏,用对称误差条可能给错误印象。但让一种四参数曲线更贴合 bootstrap 直方图,只完成了拟合,不是检验有效性。真正重要的是在已知真夏普的模拟下,名义 5% 检验是否真的约 5% 误报。 还有一个实践陷阱:把 bootstrap 出来的 5,000 个高度共享同一原样本的估计,当作独立真实观察去计算参数显著性,会夸大证据。应区分条件于这份历史的拟合精度,以及换另一段市场后形状参数是否仍稳定。尾部越灵活,短样本估计风险也越需要控制。

最大限制

本篇只给研究动机和初步拟合,没有具体收益区间、重抽样保留时间依赖的方式、GAIC 数值或外部校准。不能凭系列开篇宣称 SHASHo 已普遍优于成熟夏普推断。

复现与研究价值

在厚尾、自相关和状态变化的已知生成过程上比较正态修正、块 bootstrap 与 SHASHo 的误报率和区间覆盖;把分布选择放在训练阶段,测试阶段只检验覆盖。若改善仅是样本内拟合,应保留更简单稳健方法。

原文与核查

系列第一篇全文解析;未将未读后续篇章内容算作已验证结论。

原始文章 ↗

所讨论夏普方法论文

推荐 63/100(暂定) · 问题 23/30 · 证据 14/30 · 方法 19/25 · 复现 7/15

提出合理推断问题,但当前只是单样本系列开篇,尚缺覆盖率和功效的系统验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文综述

预测市场会动多大,比预测涨跌更容易;但“趋势”标签可能只是幅度标签

Market Regimes and Changing Market Dynamics

Relative Value Arbitrage

一句话先讲结论

这篇比较两种状态识别:用神经网络判断次日 ETF 波动是否超过阈值,以及用熵识别收益分布是否变厚尾。前者最佳配置相对朴素分类器改善 15.4%,但“超过 0.5% 就叫趋势”并不说明价格有可持续方向;后者补充波动率看不到的形状,也没有直接证明能提前规避危机。两者更适合作为风险描述候选,而非现成择时 Alpha。

它到底在问什么?

只用牛熊或高低波动描述市场,是否漏掉了策略真正敏感的特征?均值回归系统关心路径形状,尾部风险系统关心极端概率,两者未必由同一个状态指标解决。

作者具体怎么做?

  1. 第一篇覆盖 SPY、QQQ、DIA、IWM 的 2000—2024 年日数据,输入包括宏观公告及 VIX、RSI、ATR,使用 0.5%、0.75%、1% 的移动阈值。
  2. 综述报告 SPY 在最低阈值下相对朴素模型改善 15.4%,不同阈值下 AUC 达 0.67—0.74;其他 ETF 改善较弱,不能只拿最好一格代表系统水平。
  3. 第二篇在 1998—2025 年巴西、美国、日本与中国指数上,用厚尾核估计滚动密度及差分熵,再与方差、尾指数比较;模拟与历史危机用于展示分布形状变化。

关键结果

原文结果与口径
核对项结果意味着什么
第一篇标签阈值0.5% / 0.75% / 1%是幅度分类规则,不能自动解释为方向预测正确率。
SPY 最佳改善15.4%综述相对朴素基准的报告,未给足以转换为百分点的基数,不混写。
SPY AUC0.67—0.74某些阈值配置的区分能力,不是策略胜率。

怎么理解?

第一类模型如果确实能预测高幅度环境,可以用于调整止损距离或风险预算,但不能只因状态叫 trending 就加方向仓。应看标签与最终交易路径的关系,并用只预测下一日波动的简单模型作为对照,检验复杂分类是否多做了有用的事。 熵的解释也应更严谨:差分熵随尺度改变,不是天然去除了波动率的“纯复杂度”。固定方差时正态分布的熵有特定极值性质,但厚尾与熵高低不一一对应。真正应检验的是标准化后的分布形状信息,是否在方差之外改善尾部概率或风险区间校准。

最大限制

已读综述全文,未逐表重算两篇底层研究。最佳格的搜索校正、宏观公告可见时点、熵窗口与核参数均需原文复核;回看能识别危机不等于事前预测危机。

复现与研究价值

分别冻结两个目标:次日幅度分类和下一期尾部覆盖。让前者与朴素波动预测比较,后者与标准化收益尾部指标比较,按危机前后而非全样本平均报告效果。只有改善风险决策后,再讨论是否加入交易系统。

原文与核查

公开综述完整解析;底层两篇论文未逐表审计。

原始文章 ↗

ETF 状态分类原研究(JRFM 19(4),262)

推荐 68/100(暂定) · 问题 23/30 · 证据 18/30 · 方法 20/25 · 复现 7/15

提供两种不同状态研究路线,但指标含义和事前预测证据必须进一步分开。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法审计

三篇机器学习交易论文都被自己的数字击穿:98.7%准确率可能不如‘什么都不报’,而且没有成本模型就没有交易结论

How to Spot a Fake ML Trading Paper

The Scientific Trader

一句话先讲结论

一句话先讲结论:作者逐项审计三篇宣称92%—98.7%准确率的ML交易论文,发现一个标签只是同一价格构造出来的均线交叉,零信息‘预测上一根’基准就有97.5%;另一个操纵检测样本的基准率是一笔操纵对638,000笔正常交易,什么都不报也有99.99984%准确率,说明分类准确率和交易收益都不能脱离基准率与成本。

它到底在问什么?

机器学习论文里的高准确率究竟代表可交易信息,还是类别不平衡、循环标签和缺少成本模型造成的幻觉?

作者具体怎么做?

  1. 从论文数据表提取正类基准率,先算什么都不报的准确率。
  2. 检查标签是否是特征的函数,寻找循环标签和未来数据泄漏。
  3. 要求把方向准确率转换成含点差、滑点、融资和换手的净收益,否则不接受交易edge结论。

关键结果

原文结果与口径
核对项结果意味着什么
操纵检测基准率1/638,000;不报任何信号准确率99.99984%98.7% headline反而低于多数类基准。
循环标签基准简单预测上一根达到97.5%,高于报告92.4%高准确率可能只是标签构造泄漏。
精确率反推97.9% precision需要少于每3,000万正常交易一次假阳性在极低基准率下几乎不现实。
成本审计三篇都未报告净P&L、Sharpe或摩擦模型分类指标没有自动转换成交易收益。

怎么理解?

这篇是今年最适合放在AI研究看板里的方法审计之一。它没有讨论哪个模型更强,而是先问:基准率是多少、标签怎么来的、预测时点是什么、成本有没有被减掉。对于LLM生成的交易论文,四个问题比模型架构名称更重要。尤其要警惕准确率很高与收益很高之间的偷换。

最大限制

文章是对三篇论文的二次审计,没有重跑其完整数据和代码;精确率反推假设论文指标口径一致,不能替代原论文复现。

复现与研究价值

为所有AI交易论文建立四项入门审计:多数类基准、标签因果方向、时点可得性、成本后净收益;任何一项缺失都只给方法分,不给可交易推荐分。

原文与核查

公开正文完整阅读;按公开数字复核算术,未重跑三篇原论文。

原始文章 ↗

推荐 95/100 · 问题 30/30 · 证据 29/30 · 方法 25/25 · 复现 11/15

数字可由论文表格直接核算,审计规则对AI研究高度通用;但不是原论文独立重跑。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

分批止盈让盈利变亏损?这篇案例最大的疑点是只改赢家、不重放路径

I Scaled Out to Raise My Win Rate. It Didn't Move — and It Cost Me $115,000

Jan Heger

一句话先讲结论

作者给 3,966 笔期货交易加上“盈利十点先平一半、剩余保本”的规则,称总收益从 +98,683 美元变成 −16,336 美元,胜率仍是 58%。它提醒我们提前兑现可能砍掉右尾,但文末复现步骤要求重新定价赢家、保持输家不变,这不是一般有效的分批退出模拟:输家也可能先碰止盈再反转,必须重放所有交易路径才能确认这 11.5 万美元差额。

它到底在问什么?

提升持仓体验的分批止盈,是否真正提高策略期望收益?衡量对象应是完整收益分布,不是平掉一部分后感觉更安心。

作者具体怎么做?

  1. 作者给出六年半、3,966 笔、单合约基准,胜率 58.0%、PF 1.75、总收益 98,683 美元,平均每笔 24.88 美元。
  2. 对同样交易应用半仓十点止盈与剩余仓保本,报告总收益 −16,336 美元、胜率仍 58.0%,差额约 115,019 美元,正文按 115,020 近似。
  3. 作者把损失归因于赢家右尾被提前截断,举例本来可赚较大目标的交易,途中回撤触发保本而错失后续上涨。
  4. 但公开“可复现”步骤仅要求入场、退出、方向、规模,并称重新定价赢家、输家不变;这些字段不足以知道中途路径与触发顺序。

关键结果

原文结果与口径
核对项结果意味着什么
作者报告总收益+$98,683 → −$16,336退出反事实模拟结果,路径处理未验证,不能直接认定差额全是分批规则造成。
胜率58.0% → 58.0%净赢定义、手续费和保本分类需要说明;半仓已盈利通常不自动等于整笔零收益。
样本3,966 笔 / 6.5 年笔数不解决路径缺失,也不表示这些交易相互独立。

怎么理解?

“砍右尾”确实是趋势和突破策略应检查的风险,但不是所有分批退出必然降低收益的定理。早平一部分同时改变亏损尾部、资金占用和再入场机会;只盯本来最大的赢家会产生反向选择偏差。 因此这篇最好的用法不是抄结论,而是把它当作反事实回测审计题。必须按同一价格路径对两套退出规则逐笔并行模拟,再解释哪些原赢家变小、哪些原输家转正、哪些触发保本。没有这张转移表,“体验优化损害收益”的故事仍可能混入不对称计算。

最大限制

未披露完整品种、价格频率和触发顺序,单合约如何实现半仓也需说明。文章对赢率不变的解释不足,公开复现步骤可能系统性低估分批变体;本次没有交易流水,不能确认原程序是否也犯了该错误。

复现与研究价值

获取逐笔或足够细的 OHLC 路径,保守处理同一根内同时触及止损止盈,并统一费用、最低合约和再入场约束。用原赢家/输家与新赢家/输家的四格收益归因验证差额;若路径不可得,就不能据终点收益模拟这种退出。

原文与核查

公开正文全文解析并检查复现逻辑;原始交易路径未取得。

原始文章 ↗

推荐 58/100(暂定) · 问题 23/30 · 证据 13/30 · 方法 15/25 · 复现 7/15

提醒收益尾部重要,但反事实路径和只改赢家的公开步骤存在重大审计问题。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

议员 ETF 跑赢 SPY 近 13 点,扣掉更高 Beta 后 Alpha 却接近零

Autopsy No.005: The congressional-trading ETF that beats the market

Morgue Labs

一句话先讲结论

NANC 在文中样本累计涨 108.8%,SPY 涨 96.1%,看上去证明跟随议员有效;但 NANC 对 SPY 的 Beta 为 1.138,回归年化 Alpha 为 −0.89%、t=−0.37。换 QQQ 作基准,Alpha 又变成 +1.84% 但仍不显著。最稳妥的结论是这 40 个月没有识别出超越风险暴露的选股能力,而不是证明议员信息永远无用。

它到底在问什么?

主题基金的跑赢究竟是主题信息有效,还是在行情有利时多承担了科技和市场风险?真实产品业绩也需要匹配风险的反事实基准。

作者具体怎么做?

  1. 以 2023-03-31 至 2026-08-11 的 40 个左右月度观测比较 NANC、SPY、QQQ,区间不含基金成立后的最初七周,末期也并非完整月末。
  2. 分别回归 NANC 对 SPY 和 QQQ 的月收益,报告 Beta、截距与 t 值,不只选择有利于结论的一种基准。
  3. 检查科技和通信权重及大型科技持仓,用持仓风格解释为何 Nasdaq 比大盘更相关;同时讨论另一议员主题产品 KRUZ 的表现。
  4. 作者承认这是收到问题后进行的描述性分析,没有预注册,也不是机械复制披露交易策略的干净实验,因为 NANC 还含主动管理决策。

关键结果

原文结果与口径
核对项结果意味着什么
累计收益NANC 108.8% / SPY 96.1%原始差额约 12.7 个百分点,尚未调整暴露。
SPY 回归Beta 1.138;Alpha −0.89%/年t=−0.37,不显著;不能称为确定负能力。
QQQ 回归Alpha +1.84%/年t=0.58,同样不显著,说明基准选择影响点估计。

怎么理解?

这篇适合用来训练对真实产品的归因习惯:回测可能有数据偏差,真实基金也仍可能只展示幸运风格暴露。收益来源解释应从简单可买基准开始,而不是先为主题编一个信息优势故事。 但作者一些修辞也比证据更强。不同党派组合表现不同不必然否定全部信息优势,它们可能持仓、执行和披露结构不同;相关基金是否停止、其价格终点是否代表清盘也应查基金正式公告。本解析保留回归能支持的窄结论,不把“另一产品失败”当因果实验。

最大限制

40 个月对 Alpha 的估计很不精确;作者给出的年化区间约 −5.5% 至 +3.9%。单因子、未扣无风险利率、可能非整月观测均需改进;本次未独立核验基金最新费率、存续状态和完整净值,因此不转述为当前产品事实。

复现与研究价值

用正式 NAV 总收益与完整月末数据复核,并加入市场、行业、规模成长等暴露;按披露可见日构造机械组合,与基金主动选择部分分离。至少报告两种匹配基准和置信区间,避免只展示战胜 SPY 的累计曲线。

原文与核查

公开正文全文解析;未独立下载基金净值或核查最新存续状态。

原始文章 ↗

推荐 80/100 · 问题 26/30 · 证据 22/30 · 方法 22/25 · 复现 10/15

风险归因与置信区间清楚,适合拆主题叙事;短样本及产品状态仍需官方核查。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / CTA与容量研究

CTA ETF不必因只做大市场就失效:控制大类风险预算后,容量加权趋势Sharpe 0.71,几乎追平全市场等权的0.69

The Rise of CTA ETFs

Concretum Research

一句话先讲结论

一句话先讲结论:作者在1995—2026年78个期货市场上比较等风险与容量加权趋势;若让所有市场共用一个总风险预算,等权Sharpe 0.93显著高于容量加权0.54,但这主要因为36个商品合约在等权下占近半风险。把股、利率、外汇、商品四大类各固定25%风险后,等权Sharpe 0.69、容量加权0.71几乎相同;与100% SPY叠加时,容量加权CTA将组合Sharpe从0.78提高到1.20、最大回撤从50.8%降到29.0%。所以ETF的流动性约束未必损害趋势alpha,真正关键是不要让容量权重改变经济风险结构。

它到底在问什么?

ETF型CTA只能交易深度高、容量大的期货,是否因此会失去传统CTA利用小众市场的分散化优势?

作者具体怎么做?

  1. 用5个月EWMA给每个期货做多/做空,按63日风险缩放,次日执行、每日再平衡。
  2. 先在全局1%日风险预算下比较EW与CW,再在四大类各25%风险、商品三子类均分的分层风险预算下重做。
  3. 以固定仓位至信号翻转替代每日调仓,检查结论是否依赖高频权重更新。
  4. 选择各框架最佳趋势流,与100% SPY以100%/100%资本效率叠加并月度再平衡,比较组合Sharpe与回撤。

关键结果

原文结果与口径
核对项结果意味着什么
未控制大类权重全局风险预算:EW Sharpe0.93,CW0.54小众市场的分散化价值很大,但该比较混合了容量和大类配置两个变化。
控制大类权重分层风险预算:EW Sharpe0.69,CW0.71容量加权在每一经济大类内部实施后,没有明显损害风险调整收益。
低频调仓稳健性持仓至信号翻转:全局EW/CW为0.87/0.55,分层EW/CW为0.61/0.63Sharpe普遍下降,但容量与等权的相对结论不变。
叠加SPYSPY Sharpe0.78、回撤50.8%;加EW CTA为1.24、30.4%,加CW CTA为1.20、29.0%较可扩展的CTA在股票组合中保留了大部分经验分散化价值。
成本边界所有策略毛收益、未扣交易成本作者推测薄市场成本会更高,但该判断未在净收益回测中验证。

怎么理解?

这篇最好的部分不是“CTA ETF可行”的营销结论,而是展示了容量研究最容易犯的错误:把市场内容量权重与市场间风险预算同时改变。全局EW的0.93并非纯粹是小市场更好,而是商品数量多、风险占比也更高。分层预算后0.69对0.71才回答了ETF投资者真正的问题。

最大限制

容量代理使用σ×成交量而非可交易参与率、冲击成本或持仓集中度;所有结果毛收益,ETF管理费、期货展期、佣金和融资均未全面计入。78市场的可得性随时间变化,趋势参数和风险目标也未做真正外部样本验证;100/100叠加隐含资本效率和杠杆约束未展开。

复现与研究价值

用合约逐日成交量、持仓量、价差和参与率限制构造真实容量约束,加入市场特异成本和ETF费用。分别冻结大类预算、市场内权重与趋势参数,在近年留出期验证;对叠加组合报告保证金、尾部相关性及2008/2020/2022启动期的实际风险。

原文与核查

公开全文完整阅读;未独立重跑。

原始文章 ↗

推荐 88/100 · 问题 28/30 · 证据 27/30 · 方法 24/25 · 复现 9/15

容量与经济风险预算的拆分清晰,稳健性和组合层结果具体;但毛收益、容量代理和专有数据限制真实可交易性判断。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

长期买虚值期权会付出波动溢价,但“月亏 68%”不能代替真实期权链检验

Autopsy No.003: Buying options for the big win

Morgue Labs

一句话先讲结论

作者用 2006—2026 年指数与波动率资料模拟每月买虚值宽跨,报告 5% 虚值组合平均每月损失约 68%,并把原因归为隐含波动长期高于随后实现波动。但这是用波动率模型给期权定价的模拟,不是逐张真实期权成交记录;它能提醒“有限亏损不等于便宜”,还不能证明所有买方策略都没有条件优势。

它到底在问什么?

反复付一笔小权利金等待大行情,能否靠少数彩票式赢家补足日常损耗?要比较的不只是收益凸性,还包括为了获得凸性实际付了多少钱。

作者具体怎么做?

  1. 作者比较隐含与随后实现波动,报告前者平均高约 3.4 个波动点,并在 82% 的日子差值为正。波动差与方差风险溢价并非完全相同量纲。
  2. 按模型模拟 5% 与 10% 虚值月度宽跨,称前者平均权利金收益约 −68%,后者接近完全损失。正文没有完整展示每月期权链与现金流。
  3. 再按期限结构倒挂的恐慌状态拆分,作者称最有利状态仍损失约 55%;具体筛选阈值和交易时点需看实现。
  4. 文章另批评 gamma squeeze 研究的未来事件定义与散户损失文献,但未在正文给出足够可核查书目信息,不能把这些不同市场样本自动合并为对全部买方的证明。

关键结果

原文结果与口径
核对项结果意味着什么
隐含减实现波动约 3.4 个波动点作者样本描述,不等于所有执行价、到期与状态的同一风险溢价。
5% 虚值月度宽跨约 −68% / 月模型中的权利金收益口径,不是完整资产配置组合月收益。
恐慌状态模拟约 −55% / 月未经真实期权报价与可见时点复核的条件结果。

怎么理解?

最基本的逻辑是正确的:凸性有价格,买到极端大涨可能性不代表得到正期望。截图只展示成功者,也确实会严重夸大买方长期体验。但风险溢价是对尾部风险和保险需求的补偿,不足以推导所有期权买入都错误;以保险目标买入和以独立获利目标买入,应使用不同评价基准。 研究上必须警惕“模型给出的坏结果”被描述成市场已彻底证伪。VIX 对应的是一篮子方差预期,不是任一虚值看涨或看跌的实际报价;忽略偏斜也不保证对两翼统一偏向买方。更不应从买方负期望直接跳成推荐卖方,卖方承担的极端损失和保证金压力正是溢价来源。

最大限制

公开正文缺少可运行定价代码、真实合约链和所引散户论文的完整验证;日内交易者损失比例不能自动归为期权买方结果。本文解析的是作者论证及局限,不独立确认其所有数值。

复现与研究价值

用真实点时期权链,固定 moneyness、到期日和入场时点,按买卖报价执行,分别报告权利金收益与资本占用收益。分离无条件长期买入、事件条件买入与保险用途,检验尾部收益和最大追加资金需求,而不是只看平均亏损比例。

原文与核查

公开正文全文解析;未取得完整定价代码和真实期权数据。

原始文章 ↗

推荐 57/100(暂定) · 问题 21/30 · 证据 14/30 · 方法 16/25 · 复现 6/15

警惕彩票式期权叙事有价值,但模型与真实合约的距离、过强结论和文献细节不足明显。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

新闻正负组次日差 0.45%,但只有三篇以上报道的公司日才出现

Does AI Still Read the News Better Than the Market?

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

作者在 2026 年约六周、850 家美国公司的新闻中发现:每天至少三篇报道的公司,正负新闻组次日收益差约 0.45 个百分点;少于三篇的组没有可辨识效果,第二天又回吐约三分之一。更关键的是周末新闻没有同样即时关系,提示模型可能部分在读“已经涨了”的报道。它支持继续研究新闻覆盖与信号可信度,不支持把 0.45% 当每日可赚收益。

它到底在问什么?

大模型新闻效应是否随着普及消失?作者进一步发现,情绪分数的分母把一条新闻和许多条一致新闻混成同样强的分数,可能遮蔽真正有信息的样本。

作者具体怎么做?

  1. 夜间收集约 850 家公司的标题,让模型只确认新的、具体、可核实且与目标公司相关的信息,约八成被视为中性;六月末增加公司归属过滤,排除代码歧义。
  2. 按公司日形成情绪分数,再分至少三篇和少于三篇两组,分别观察当日、次日与后续收益差。
  3. 作者报告覆盖充分组次日差 +0.45%,第二日方向部分反转;还检查大公司,认为反转不只是微盘报价反弹。
  4. 用一千次两类打乱对照:公司内跨日期打乱破坏时点,公司日内跨公司打乱破坏对象。真实结果超过两类随机范围,但这是六周内的统计证据。

关键结果

原文结果与口径
核对项结果意味着什么
覆盖充分组次日差+0.45 个百分点正负新闻组均值差,不是投资组合的日净收益。
分组门槛每天至少 3 篇本次分析里的发现性阈值,需新样本冻结验证,不能视作普适常数。
样本长度约 6 周横截面公司多不等于拥有许多独立市场环境。

怎么理解?

实务上最有价值的是保留证据数量。仅输出 −1 到 +1 的标准化情绪,会让稀疏公司的极端值冒充高信心;可以把条数、独立媒体数、新事件数与分数一起交给预测系统,而不是只按幅度排序。 不过,多篇新闻也可能是同一消息复制,而非独立确认。覆盖数还与公司规模、财报日和波动有关,三篇门槛可能是在选择更活跃事件。周末对照提出逆向因果疑问,但周末与交易日的新闻类型不同,不能单靠它证明当日关系全部来自报道价格。标题时点与交易时点仍是更直接的检验。

最大限制

不同模型、币池之外的公司样本和价格频率与原论文不一致,作者也不称精确复现。新闻归属过滤中途改变、样本短、分组门槛事后发现;没有实施交易策略、费用与隔夜日内分解,不能据此宣布原论文的效应衰减预测已被推翻。

复现与研究价值

冻结公司归属与新闻去重规则,按最早公开时间分盘中、盘后和周末,并让三篇阈值接受后续数据检验。比较独立事件数与转载数,按行业与财报日匹配对照,再检验从实际可下单时刻起的增量收益。

原文与核查

公开正文完整解析;作者更详细技术附录未取得,未重跑新闻模型。

原始文章 ↗

推荐 81/100 · 问题 28/30 · 证据 21/30 · 方法 23/25 · 复现 9/15

证据数量与时间戳的拆解贴近实务,随机对照不错;六周和流程变动限制外推。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究方法与因果发现

30个品种、5个日滞后时,全条件Granger要塞149个控制变量而失明;PCMCI用父节点筛选把检验能力从约40%恢复到80%以上

Stop Using Pairwise Granger: PCMCI for Financial Causality

Ali H. Askar

一句话先讲结论

一句话先讲结论:对30个金融时间序列、5个日滞后的网络,pairwise Granger会把共同风险因子和间接链路误报为因果,FullCI虽控制这些伪边却需149个控制变量、在高维模拟中检测能力从5变量约80%降至20变量约40%。PCMCI先用PC1筛出少量候选父节点,再用MCI同时控制目标与驱动的父节点;文中引用实验显示高维时真实链接检出仍超过80%、且假阳性率回到名义水平。它不是可直接交易信号,而是把“宏观/跨资产谁驱动谁”的候选关系从相关性噪声中缩小的研究工具。

它到底在问什么?

如何在大量、高自相关金融序列中识别有方向的滞后关系,同时避免pairwise Granger的共同因子伪边和FullCI的维度灾难?

作者具体怎么做?

  1. PC1从所有变量的滞后项出发,逐步条件化并剔除独立项;阈值故意偏松,以避免漏掉真实父节点。
  2. 对每条候选边做MCI检验,同时条件化目标的父节点和驱动变量的父节点,后者用于吸收自相关。
  3. 按关系近似线性/非线性选择ParCorr、GPDC或CMI条件独立检验;非线性检验需要更多样本。
  4. 将存活边当作下一轮可检验假设,而非直接把网络边转成交易规则;在滚动窗口、不同变量集和缺失共同因子压力下复核。

关键结果

原文结果与口径
核对项结果意味着什么
维度陷阱30序列、5滞后需约149控制;示例中FullCI功效从5变量约80%降至20变量约40%金融样本短且非平稳,直接“控制一切”常使真正边也检不出来。
PC1筛选100变量实验中仍找回超过80%真实父节点,但候选中可有超过80%假阳性第一步目标是高召回而非最终网络,假边由第二步清理。
MCI高维检验高维例中效应约0.10、p约0.036且检测能力保持80%以上仅控制相关父节点能保留功效,并通过驱动端父节点控制自相关假阳性。
因果强度标准化强度为|c|/sqrt(1+c²)MCI统计量可用于排序边强度;普通相关性不等于直接因果强度。
方法边界只处理滞后边,要求共同驱动已被观测;信号级噪声会破坏假阳性控制输出应是候选机制,不是对金融因果的最终证明。

怎么理解?

对量化研究员,最可迁移的结论不是“换成PCMCI就发现因果”,而是不要把变量宇宙扩张后仍用pairwise显著性画关系图。PCMCI的价值在研究治理:明确候选父集、控制维度、FDR和变量遗漏。它也很适合AI研究:先让模型提出变量,再用点时点数据和因果筛选压缩为少量可验证假设。

最大限制

文章主要是方法解释,性能数字来自气候/合成网络实验而非金融实盘;金融中潜在共同驱动、结构突变和同期反馈更严重。父集选择本身有阈值、最大滞后和变量宇宙自由度,滚动重复尝试仍会产生多重检验。PCMCI不解决交易成本、预测稳定性或经济可解释性。

复现与研究价值

用tigramite在预先冻结的跨资产变量池运行:先以ParCorr、固定滞后和FDR阈值得到候选边,再只对候选做经济机制与样本外预测检验。把变量遗漏、窗口长度、滞后上限和结构断裂做敏感性矩阵;任何存活边都要在不同市场/时期和可执行交易成本后再评估。

原文与核查

公开文章完整阅读;引用方法论文和实验未独立运行。

原始文章 ↗

推荐 90/100(暂定) · 问题 28/30 · 证据 25/30 · 方法 25/25 · 复现 12/15

高维因果问题重要、算法与失败模式解释具体且有开源实现路径;但本文非独立金融实证,核心性能来自外部方法实验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 资产定价方法论

若把股价当作长期现金流现值,市场隐含的贴现率减增长率年际波动只有约±20bp;而国债利率本身常动±50bp——“精确”到令人不可信,说明不能把平滑估值比直接当预期收益率

Excessively Volatile? Or Inexplicably Precise?

Alex Chinco

一句话先讲结论

一句话先讲结论:Chinco用长期现金流现值逻辑反问一个估值悖论——从指数价格与长期增长预期反推的贴现率减增长率,年际变化看似可被锁定在约±20bp;但无风险利率一条腿本身常年动约±50bp。若风险资产的折现率和增长预期必须以超过0.9的相关性逐年精确抵消,才能维持这种稳定,就比“市场过度波动”更难解释。对量化估值,这篇的警告是:不要把价格/股利、CAPE或任何平滑比率机械翻译为一个精确的预期回报点估计。

它到底在问什么?

股票市场到底是“价格过度波动”,还是在给长期贴现率与现金流增长的差分定价时表现出不合理的精确性?这一悖论会如何限制估值信号的解释?

作者具体怎么做?

  1. 从股权现值恒等式出发,将价格变化拆为现金流、预期增长与贴现率的联合变化,而不是把价格/股利的倒数直接命名为预期回报。
  2. 量化所需精度:在给定估值倍数和目标误差下,r−g只允许很小漂移;文章给出约±20bp的精度示例。
  3. 把该精度与政府债券风险自由利率年际约±50bp的可观测波动对照,指出风险资产折现率不太可能更稳定。
  4. 检验替代解释:若r与g共同移动抵消,需要增长预期与利率长期相关性超过约0.9;文章认为观测长期增长预期不支持这种持续强共振。

关键结果

原文结果与口径
核对项结果意味着什么
隐含差分精度文中示例:r−g似乎须在约±20bp内这不是观测到的真实预期收益误差,而是用估值恒等式反推时所要求的精确度;关键结论是识别脆弱。
无风险腿的尺度政府债券利率典型年变化约±50bp若安全资产贴现率已有此量级变化,股票总贴现率与增长预期的差却只有20bp,需要很强的共同移动。
共同移动门槛为抵消而维持差分稳定,文中估算增长预期与利率相关需高于约0.9这是机制挑战而非直接回归估计;须以调查预期、宏观预测或期权市场数据单独检验。
估值误差放大文中以约7.70/年增长、1.5%等数值例示,小贴现差会映射为很大的现值区间分母接近零时,几十bp的参数误差足以大幅改变合理价格区间,因此不宜把倒数估值指标做点预测。

怎么理解?

这不是“估值无用”的结论,而是对解释口径的约束:估值比率可作为缓慢移动的状态变量、横截面排序或风险情景输入,却很难在时间序列上给出精确的未来年化回报。最常见错误是把r−g当r、再假设g固定;文章提示这会把不可观测的增长变化错误归为风险溢价变化,也会使均值回复回测显得比经济含义更确定。

最大限制

本文不是预注册实证研究,使用的数值为说明性尺度,未给完整样本、数据版本、估计器、标准误或交易成本;长期增长预期不可直接观测,Gordon近似对股利/回购、期限结构、结构性断点都敏感。相关性0.9的讨论是模型条件,不能当成已被拒绝的统计检验。

复现与研究价值

把估值研究改为区间和情景:对r、g分别设定可观测代理和误差带,报告P/D隐含r−g而非单一“预期收益”。在收益预测回测中加入期限利率、增长预期修订、通胀和股利/回购定义的逐步消融;横截面估值与时间序列估值分开评估,并以长期持有、成本后效用而非短期t值判断。

原文与核查

公开网页正文阅读;网页抓取结构受限,未独立重算。

原始文章 ↗

推荐 76/100 · 问题 25/30 · 证据 20/30 · 方法 22/25 · 复现 9/15

提出了对估值信号非常重要的识别与数量级问题,适合校正解释;但属于研究笔记,完整数据、图表和正式统计检验不足,不能直接转为策略。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 长期全球资产回报研究

长期股票回报不是“约7%”:16国共同1900—2020样本从美国实际年化+6.7%到葡萄牙-0.3%,11国出现过亏损的30年窗口

150 Years of Global Stock Returns - The Birthplace Lottery

Beyond Passive Investing

一句话先讲结论

一句话先讲结论:JST数据库16个可连续观察股票市场中,早期完整样本澳洲实际年化7.2%、葡萄牙0.9%;在所有市场共同的1900—2020窗口,美国+6.7%、葡萄牙-0.3%、法国也为负,11/16市场曾有实际财富下降的30年期。对1989年日本投资者,单押本国31年没有一个年末回到起点、2012年实际-63%,而等权持有16国、年度再平衡的世界组合约增至8倍。所谓长期股权溢价是跨国家路径平均,不是单个出生国投资者的保证。

它到底在问什么?

长期持有本国股票的风险是否被“股票长期约7%回报”这一跨国/跨样本平均数系统性掩盖?真正按投资者本币与本国通胀衡量时,全球分散化买到了什么?

作者具体怎么做?

  1. 对各国股票计算真实复合增长率而非年收益算术均值,避免把波动拖累误称为投资者实际收益。
  2. 统计最长实际水下期和最差30年实际年化,以投资寿命而非全样本均值衡量尾部。
  3. 为每个本国投资者构造未对冲全球等权组合,转换成本币并以本国CPI通缩,和本国股票直接比较。
  4. 对1948德国货币改革、战时行政汇率和缺失/消失市场做标注、剔除和幸存者偏差讨论。

关键结果

原文结果与口径
核对项结果意味着什么
共同样本离散度1900—2020实际年化从美国+6.7%到葡萄牙-0.3%,法国也为负“长期股票回报为正”在完整跨国共同窗口并不成立。
投资寿命尾部11/16市场出现过实际亏损的30年窗口;法国1942峰值到2020仍未恢复长期不足以自动消除单国路径风险。
日本反例1989后31年未有年末高于起点,2012实际-63%事前长期赢家也可能成为几十年的失败集中仓位。
生存者偏差俄罗斯、1949年前中国等外资股东归零的市场不在连续样本中16个可观测市场已经是较乐观的历史样本。
全球化结果日本案例中全球等权约8倍;法国最差30年中本国100单位剩6、世界约145全球分散化主要是防止单国毁灭性路径,而非保证提高美国投资者收益。

怎么理解?

文章最重要的提醒是区分ensemble average与time average:跨国平均回报不是任何一个投资者实际能经历的路径。它并不证明等权全球组合永远优于市值权重或本国市场,但强烈反驳“长期就无需分散化”的叙事。对于A股投资者,外推时更需单独处理资本管制、汇率可得性与投资者实际可买的海外资产。

最大限制

早期指数、汇率和通胀数据质量不均,十六个连续市场有明显幸存者偏差;战时行政汇率和德国1948货币改革难以完全可比。世界等权年度再平衡忽略税费、资本流动限制和真实可投资性,样本也不能直接代表新兴市场。

复现与研究价值

用可投资的本币全球ETF/期货或MSCI历史代理,按中国投资者的资本项目、额度、汇率对冲和税费重建可执行版本。用市值权重、等权、区域上限与再平衡成本做并列压力测试,并把本国集中度写入长期情景与退休风险预算。

原文与核查

公开全文完整阅读;未独立重建数据库。

原始文章 ↗

推荐 85/100(暂定) · 问题 29/30 · 证据 26/30 · 方法 22/25 · 复现 8/15

长期跨国口径与投资者本币视角很有价值,且主动讨论数据断点;历史可比性、生存者偏差和可投资性限制严格复现。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 交易成本与微观结构研究

OHLC成本模型在稀疏交易资产上会把真实1.00%有效价差估成0.04%;EDGE用离散成交修正后在160万股票月中相关性78.9%

Bid-Ask Spread From OHLC: The GMM Estimator That Beats Roll/CS

Ali H. Askar(解读Ardia、Guidotti、Kroencke)

一句话先讲结论

一句话先讲结论:传统Roll、Corwin–Schultz等OHLC价差估计默认价格连续观察,交易稀疏时会把“没有成交导致没有bid-ask bounce”误读为低价差;模拟里Corwin–Schultz在真实1.00%价差、极稀疏成交下仅报0.04%。EDGE以开盘/收盘碰到高低点的概率修正离散性,并用GMM组合多组矩;在1993—2021年约164万美国股票月对TAQ有效价差基准的相关性为78.9%,高于Abdi–Ranaldo的68.1%、Roll的55.2%和CS的45.5%。

它到底在问什么?

没有逐笔报价数据时,如何仅用OHLC估计资产特异的有效价差,且不系统性低估低流动性资产的回测成本?

作者具体怎么做?

  1. 从OHLC构造价格跳动与高低点关系,估计多种价差矩;对负估计按惯例截断为零。
  2. 用开盘/收盘恰为高低点的频率修正成交不连续造成的协方差衰减。
  3. 根据估计方差以GMM组合不同OHLC矩,令小价差和大价差状态自动偏向更精确的构件。
  4. 在已知真实价差的模拟中改变成交频率,再在CRSP股票月对TAQ交易-报价匹配的有效价差验证。

关键结果

原文结果与口径
核对项结果意味着什么
稀疏成交偏差真实1.00%时,CS从100笔/日的0.75%降至极稀疏时约0.04%;EDGE仍约1.00%低流动性资产的连续价格假设会极大低估成本。
真实数据准确性EDGE与TAQ基准相关78.9%;AR 68.1%、Roll 55.2%、CS 45.5%EDGE不只在作者模拟中好,在大样本美国股票月也更接近高频基准。
误差EDGE MAPE 16.2%,CS 35.9%使用更好估计器可显著缩小OHLC成本代理误差。
提高频率困难样本中EDGE从日线到分钟线相关性56.17%→88.79%,非正估计34.15%→0.02%有可靠分钟OHLC时,提高采样频率比堆更多日线历史更有效。
报价与有效价差日末quoted spread约为effective spread的两倍直接用报价价差成本可能过度保守,但EDGE也不含冲击成本。

怎么理解?

这不是一个alpha因子,而是回测中最容易被忽略的“成本输入质量”问题。对小盘、币圈、海外市场和分钟策略,若价差估计在最差的资产上系统趋零,任何漂亮净Sharpe都不可信。EDGE应当进入成本敏感策略的基础研究管线,但不能替代市场冲击、参与率和限价成交模型。

最大限制

EDGE仍假设基本价格无序列相关、bid-ask bounce均值为零且与基本收益无关;强动量、跳跃和微观结构噪声会造成偏差。它估的是样本窗平均有效价差,不是特定订单、特定规模的可成交成本;负估计截断仍可能有小样本上偏。美国股票TAQ结果也不保证迁移至A股、期货或加密资产。

复现与研究价值

在自己的OHLC数据按日/小时/分钟分别估计EDGE,并用少量真实成交/报价做校准;将有效价差、冲击、佣金、融资和成交概率拆开。对每个策略按流动性分组重算净收益与容量,并将估计窗口和频率冻结后做样本外成本压力测试。

原文与核查

公开解读完整阅读;未独立复现原论文模拟或TAQ结果。

原始文章 ↗

推荐 97/100 · 问题 29/30 · 证据 29/30 · 方法 25/25 · 复现 14/15

理论修正、模拟、160万股票月外部基准和开源实现链条完整;仍需按交易品种和订单规模校准。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research

Bond indices and systematic duration management

Bond indices and systematic duration management

Elena Sueppel

一句话先讲结论

五类点时宏观因子构成的久期信号,通过期限桶再权重或利率互换覆盖可提升GBI Broad历史收益,但预测优势和实际净收益仍需成本复核。

它到底在问什么?

能否利用通胀、信用、房价、曲线估值和经济意外动态调整被动政府债指数久期?

作者具体怎么做?

  1. 构建五类宏观因子并顺序标准化、截尾至±3标准差
  2. 五因子等权形成综合久期信号
  3. 分别在1—5年与10年以上期限桶间换权,或用10年IRS payer/receiver覆盖

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

高于目标通胀、房价快速增长和偏紧融资通常降低久期;较高期限溢价、较陡曲线及通胀/消费下行意外支持增加久期。

最大限制

因子和权重未统计优化;存在隐性事后偏差;主要覆盖G4;未完整披露冲击成本、保证金、融资和互换滚动成本;方向准确率仅略高于50%。

复现与研究价值

复刻五因子、tanh映射、期限桶和IRS覆盖;加入DV01、保证金、融资、滑点和交易成本,并做单国、半样本和危机期检验。

原文与核查

public-original-read

原始文章 ↗

推荐 85/100 · 问题 26/30 · 证据 26/30 · 方法 23/25 · 复现 10/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

策略 B 是否优于 A,要看收益分布;但事后市场状态不是可提前下单的信号

Trading Strategy Comparison: Is B Really Better Than A?

Krzysztof Ozimek

一句话先讲结论

论文把 2002—2025 年标普样本分成 146 个向前测试窗口,发现 SVM 与买入持有的优劣会随状态和评价维度改变。最值得注意的不是某个模型赢了,而是它比较的 IR* 把负均值窗口全部压成零,且“状态”取自当段已经实现的收益与波动;所以它更适合事后解释表现,不能直接据此说知道下一段该选哪条策略。

它到底在问什么?

用一个全样本夏普给策略排名,会把不同环境下的均值、离散程度和失败概率压在一起。是否可以分别建模这些维度,让研究员知道优势来自更高平均表现还是少数极端好窗口?

作者具体怎么做?

  1. 策略层以 160 日训练、40 日测试非重叠推进;技术指标只用滞后值,缩放与多空阈值在训练内确定。
  2. 每个测试窗口计算非负 IR*,再用包含零点质量与正值 Gamma 部分的 ZAGA 分布,把位置、离散和零概率与策略及市场状态联系起来。
  3. 作者在六个状态点比较条件均值、方差和均值/标准差,报告不同维度不必由同一策略占优。本文关注的是这套比较结构,不把拟合值当交易收益率。

关键结果

原文结果与口径
核对项结果意味着什么
向前评估窗口146 个是同一指数历史的窗口,并不是 146 个独立市场。
训练 / 测试160 / 40 日策略回测的设置;后续状态解释模型仍需独立验证。
绩效变量负均值窗口 IR*=0适配零调整分布的同时丢弃了亏损大小信息。

怎么理解?

从单一分数升级到分布,方向有用,但首先要选对被建模的对象。如果原指标把亏损尾部截掉,漂亮的条件密度也可能掩盖投资者最关心的差异。建议同步保留窗口净收益、最大回撤和亏损严重度,不让 IR* 成为唯一判决变量。 状态变量的时点尤其关键。用窗口结束后才知道的涨跌和波动解释谁赢,是合理的归因;拿同一状态去安排窗口开始时仓位,就是未来信息。另一个推断疑问是文中用拟合分布直接抽样、统计两者差值符号,再称 p 值:这与在零假设约束下构造频率学检验并非自动等价,还应把参数估计误差和同窗口配对依赖纳入。

最大限制

本次读作者介绍并核查原论文关键方法和结果,未复算;没有可据此确认的扣费实盘优势。条件点可能组合各变量相同分位而非实际常见联合状态,极端外推与模型分离问题需要谨慎。

复现与研究价值

先用配对窗口差值做简洁诊断,再考虑分布模型是否增加解释力;若用于策略配置,所有状态必须在窗口开始时可知,且分布模型只能在更早窗口训练。以保留配对和时间依赖的重抽样检验差异,并报告模型不确定性而非只报拟合参数的模拟结果。

原文与核查

作者短文完整解析;原论文关键定义、方法和结果核查,未独立复算。

原始文章 ↗

原论文与 PDF

SSRN 版本

推荐 77/100 · 问题 25/30 · 证据 21/30 · 方法 21/25 · 复现 10/15

分布化比较有方法价值,但指标截断、事后状态和参数模拟检验仍有关键边界。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-summary

Skewness as a Hidden Driver of Anomaly Returns

Skewness as a Hidden Driver of Anomaly Returns

Larry Swedroe

一句话先讲结论

许多异象可能隐含暴露于少数极端正偏股票;偏度管理提高了18类异象的毛收益,但交易成本后增益大幅收缩,需核查多重检验和规模暴露。

它到底在问什么?

经典异象是否由少数极端右尾股票驱动,显式管理预期偏度能否改善多空组合?

作者具体怎么做?

  1. 对形成后的股票收益按99%、95%、90%分位数winsorize,检验右尾贡献
  2. 用滞后波动率、动量、过去收益、规模、行业和交易所变量预测下一月偏度
  3. 多头取高预期偏度tercile,空头取低预期偏度tercile并做因子/ spanning检验

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

行为机制是投资者为彩票型正偏资产支付溢价,压低其未来平均收益;偏度管理通过多头偏向右尾、空头回避右尾捕获不对称性。

最大限制

这是二次解读;文章未完整说明多重检验校正、退市处理、借券成本和空头约束;第一阶段偏度预测能力可能弱,收益可能混入规模、流动性和动量暴露。

复现与研究价值

取得原论文和CRSP/Compustat数据;复刻18异象、三种winsorize和偏度预测;加入成本、借券、容量、多重检验和大市值子样本。

原文与核查

public-secondary-summary-read

原始文章 ↗

推荐 76/100 · 问题 25/30 · 证据 23/30 · 方法 20/25 · 复现 8/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

通胀罗盘押注单一行业:最重要的不是高收益,而是 TIPS 信号究竟代表什么

Taming the Wildcard: David Varadi's "Inflation Compass"

Allocate Smartly;策略 David Varadi

一句话先讲结论

Inflation Compass 用股票趋势判断增长,再用五年盈亏平衡通胀和行业相对表现判断通胀,月度选择一个主要行业或国债。独立测试发现换成通胀互换或央行预测后表现下降,尤其慢速预测更弱;这说明市场价格信号很重要,却不能证明赚到的全是通胀信息,也可能包含流动性和危机路径。原文自己提醒它经常全仓单一行业,是高波动风险资产,不是完整配置方案。

它到底在问什么?

增长与通胀四象限要实时交易,究竟用什么可见信息判断当前象限?用市场隐含通胀可能更快,却混入风险溢价和流动性。

作者具体怎么做?

  1. 用 S&P 500 趋势代理增长;行业通胀信号比较能源、金融、工业、材料与必需消费、医疗、公用事业的相对表现。
  2. 定义通胀上行为五年 breakeven 高于 2%,且 breakeven 或行业隐含通胀至少一个在上升,再按增长通胀状态选能源、科技、公用、消费或国债等工具。
  3. 每月末收盘更新,原版扩展至 1990 年,增强版平均不同窗口减少单一参数风险;作者把 2003 年以前视作未用于原策略的历史扩展,但不是未来实时样本。
  4. 替换为五年通胀互换和 Cleveland Fed 预测再测。互换替代降幅较小、央行预测较大,提示速度与市场特有因素都可能重要。

关键结果

原文结果与口径
核对项结果意味着什么
通胀水平门槛五年 breakeven >2%还需满足至少一个趋势上行条件,不是单一超过 2% 就交易。
调仓频率月度月末信号与收盘成交仍要核验实际可执行时点。
替代信号检验互换替代弱于原版、优于慢速预测替代正文方向性结论;图表完整数值本次未逐格核验。

怎么理解?

代理替换是很好的稳健性检验,因为经济故事若真是通胀,就不该只在一种带特殊流动性扭曲的指标上成立。但不同代理不完全等价,互换有交易对手和供需因素,月度预测有滞后;表现变差不能自动判为过拟合,也不能自动证明原指标拥有独家 Alpha。 另一个更实质的风险是状态到行业的映射。能源在过去的再通胀环境强,不保证结构变化后仍是最佳表达。参数平均只分散窗口风险,不分散行业定义、工具选择和经济机制风险;把多个窗口平均后仍全仓能源,不是组合已经充分分散。

最大限制

公开正文未逐格核验全部绩效图片、原始策略完整参数及早期 breakeven 代理;ETF 成立前历史拼接需审计。历史扩展与未来样本外必须区分,单一行业大仓位也有显著路径风险。

复现与研究价值

把通胀代理、增长代理、行业映射分别做替换检验,固定风险目标并与简单行业动量及静态风险资产对照。检查 2008、2020 等少数节点贡献,考虑多行业分散,而不是只选历史最好的通胀工具。

原文与核查

公开正文和风险讨论完整解析;图表全数值及原始实现未核验。

原始文章 ↗

推荐 78/100 · 问题 26/30 · 证据 22/30 · 方法 22/25 · 复现 8/15

代理替换和集中风险讨论好,具体历史拼接与参数仍需核查。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 技术教程

均值回归筛选别只看 p 值:教程的半衰期代码也需修正

Testing for Mean Reversion: ADF, Hurst Exponent and Half-Life

Quantt

一句话先讲结论

这篇把 ADF、Hurst 和半衰期串成筛选流程,但不能原样复制代码:它用 −ln2/(ρ−1) 近似半衰期,却拿精确公式 −ln2/lnρ 作示例。ρ=0.4 时前者约1.16期,后者约0.76期,差距不小。适合当诊断清单,不适合把‘三项通过’直接当成可交易证据。

它到底在问什么?

价差看起来在来回波动,究竟是稳定回复、随机游走,还是一次结构变化?即便统计上回复,速度和幅度又是否足以覆盖持仓成本?

作者具体怎么做?

  1. 根据经济含义预先选择是否含常数、趋势及差分滞后,运行 ADF 并检查残差;不能为了显著反复换设定。
  2. 在指定尺度区间估计增量方差斜率,观察 Hurst 对窗口与微观结构噪声的敏感性。
  3. 拟合 AR(1) 时用正确离散半衰期并给区间,再单独做成本、结构稳定与样本外交易检验。

关键结果

原文结果与口径
核对项结果意味着什么
公式校核ρ=0.4:0.76期,而非约1.16期精确离散半衰期与一阶连续近似不同;这里为公式计算,不是新回测。
慢回复近似ρ=0.95:约13.5期ρ接近1时近似才较接近精确值。
本文证据类型模拟教学,无真实策略绩效没有可据以报告的年化收益或 Sharpe。

怎么理解?

另一个重要代码问题是‘趋势’示例只给随机游走加了固定漂移。对增量方差而言,固定漂移不会改变随机部分的尺度律,不能用它证明 H>0.5;Hurst 反持续也不等同于存在稳定、可交易的长期均值。读教程时要把对象是价格、增量还是残差说清楚。 对配对残差尤其应使用协整检验对应的临界值,不能把拟合出来的残差当预先固定序列直接套普通 ADF。扫描上千配对后最显著的 p 值还经过了选择,需要校正或保留独立外测。日内买卖价反弹会形成漂亮的反持续,却可能正好等于付出价差,交易经济性必须另证。

最大限制

原教程部分说法过于绝对:统计显著并非所有交易策略的必要条件,长期半衰期也不在所有投资期限下无用。半衰期是条件均值衰减,不是保证或平均首次回归时间。

复现与研究价值

未执行方案:修正公式与漂移示例,对预设经济价差分别进行协整、结构变化和块重采样检验,再用可成交买卖价评估净回归幅度及持有成本。

原文与核查

收录教程正文及代码解析;未运行模拟。

原始文章 ↗

推荐 74/100 · 问题 24/30 · 证据 18/30 · 方法 19/25 · 复现 13/15

诊断链条实用且代码公开,但存在公式近似和示例解释错误。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 机器学习方法论

机器学习在金融里的复杂度税并不会靠更炫的模型消失:200根bar从5个参数扩到40个,OLS方差项由0.025升至0.20;搜1000个模型、仅500个独立样本时,泛化误差上界约0.20

The Mathematics of Machine Learning, for Traders

Ali H. Askar

一句话先讲结论

一句话先讲结论:这不是一篇发现新alpha的论文,而是一份给交易研究员的“复杂度定价表”——在线性平方损失的理想设定下,估计d个参数的额外方差精确为σ²d/n;作者举例n=200、σ²=1时,5参数为0.025、40参数为0.20,后面35个参数必须额外降低至少0.175的偏差才值得。更一般地,若从1000个候选配置中挑选、只有500个近似独立样本,95%置信下有限类泛化界约为0.20;样本扩至50,000才约0.02。对金融ML,含义不是“不能用复杂模型”,而是必须把有效独立样本、搜索自由度和成本后的冻结样本外表现放在同一张账上。

它到底在问什么?

为什么一个在历史样本上拟合得很好的预测器会在下个月失效?交易研究中,参数、特征、模型网格和模型集成各自通过什么机制消耗样本外可信度?

作者具体怎么做?

  1. 先区分不可消除的Bayes误差、函数形式造成的偏差,以及有限样本估计参数带来的方差。
  2. 在线性OLS特例中以σ²d/n量化每增加一个自由度的方差成本;复杂度只有在足够降低偏差时才有净收益。
  3. 用交叉验证估计未知风险,但金融时间序列不得随机打散;采用按时间切分、purge和embargo,避免标签区间重叠造成泄露。
  4. 将模型搜索的选择偏差用有限类界或VC维表达:候选集合越大、有效独立样本越少,训练—真实风险差越大。
  5. 对随机森林区分树数与树间相关:B增大只能消除(1−ρ)/B项,ρ项是不可由堆树数消除的下限;再据稀疏性选择L1/L2并做冻结样本外检验。

关键结果

原文结果与口径
核对项结果意味着什么
参数的可计算价格n=200、σ²=1:d=5时方差0.025;d=40时0.20新增35个参数先带来0.175的保证方差成本,只有偏差下降超过它才值得。该等式依赖OLS与理想假设,不能直接当作树模型的精确值。
搜索自由度的税|H|=1,000、n=500、δ=5%时界约0.20;n=50,000时约0.021000组参数中挑最佳者的样本内优势可以很大一部分只是选择噪声;增加样本的改善仅按1/√n,速度很慢。
集成不是免费去噪单树方差=1、ρ=0.3、B=100时森林方差0.307;B→∞仍为0.30继续加树几乎无效,降低成员相关性才有边际价值;同一数据、同一标签、同一特征的多persona/多模型也有同类问题。
稀疏性的条件价值p=1,000、s=10、n=2,000的示例:L2量级约0.71,L1约0.19Lasso的优势来自“真信号稀疏”这一可证伪假设,不应把L1当成默认的万能降维器。
交叉验证的错位5-fold、500条记录时,每次只用400条训练CV有意估计较小训练集的误差;金融数据更关键的风险是随机折叠会让相邻、重叠标签泄露未来,得到偏乐观而非保守的数。

怎么理解?

这篇材料最有用的地方,是把研究流程里的直觉变成量纲:alpha研究不是“能否把模型做得更复杂”,而是“独立信息量能否支付复杂度税”。它也解释了两个常见误判:第一,树很多不代表集成充分独立,相关性ρ决定方差地板;第二,CV分数不是策略收益,尤其不能用随机K折替代带purge/embargo的时间序列验证。实务上,应该把候选数、特征版本、调参次数、调仓规则和成本假设都登记为搜索自由度,而不是只对最后胜出的模型报告Sharpe。

最大限制

全文为作者的教学型理论说明,未给出可下载数据、完整代码或某一金融策略的可复现绩效;σ²d/n、有限类界和VC维率依赖独立性、损失函数与模型类假设,在重尾、非平稳、强自相关金融序列中只能提供方向性约束。文中给出的泛化界通常较松,不能反推出某策略“真实alpha为零”。

复现与研究价值

将现有每个ML信号接入研究账本:记录有效独立样本估计、特征数/模型数、所有试验与停止规则;采用walk-forward的purged CV作为调参层,最后保留一段从未参与选择的冻结样本。对集成额外报告成员预测相关矩阵和加入第N个成员后的边际IC/净Sharpe;若收益来自稀疏特征假设,用稳定选择与跨市场/跨期验证检验s远小于p是否真的成立。

原文与核查

公开全文完整阅读;理论/算例已核对,未独立回测。

原始文章 ↗

推荐 87/100 · 问题 26/30 · 证据 25/30 · 方法 25/25 · 复现 11/15

理论链条和量纲表达非常清楚,直接约束金融ML研究设计;但不是资产级实证研究,且没有数据、代码和成本后组合结果供本站独立复跑。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 技术教程

OU 给你回复速度,不会自动给你一条套利策略

The Ornstein-Uhlenbeck Process in Finance: Theory, Simulation and Calibration

Quantt

一句话先讲结论

OU 模型最实用的地方是可用精确离散转移做模拟和标定:半衰期等于 ln2/θ,长期方差等于 σ²/(2θ),不是把瞬时波动 σ 直接当价差的长期波动。本文是模型工具教程,没有真实交易收益;是否有稳定均值、结构是否变化,必须在把模型变成仓位之前另外验证。

它到底在问什么?

如何用尽量少的参数描述价差被拉回中心的速度与不确定性,并从离散行情反推出连续模型参数?

作者具体怎么做?

  1. 使用精确离散公式:下一期为长期均值加衰减后的当前偏离,再加具有正确转移方差的高斯噪声。
  2. 拟合 x下一期=a+b×x当前,按 θ=−lnb/Δt、μ=a/(1−b) 和创新方差恢复连续参数。
  3. 检查参数、残差、采样间隔和结构稳定,再考虑用于价差风险或利率模型,而非仅凭拟合成功判断交易机会。

关键结果

原文结果与口径
核对项结果意味着什么
半衰期ln2/θ条件均值的衰减时间,不是首次触达均值时间。
离散系数b=exp(−θΔt)标准标量 OU 要求0<b<1;其他平稳AR过程不一定能映射为它。
证据类型公式与模拟示例文章没有用真实价差证明扣费套利有效。

怎么理解?

原文代码在 b≤0 时称序列‘非均值回归’,这句话太宽:负系数且绝对值小于1的 AR(1) 仍可平稳振荡,只是不符合这个连续标量 OU 的采样形式。把模型不适用与经济现象不存在分开,是使用模型的基本边界。 另外,文中 OLS 用残差自由度校正方差,而条件高斯极大似然使用不同分母,所以有限样本波动参数并非严格完全相同;更重要的是 b接近1 时 μ和θ高度不稳定。只输出一个漂亮半衰期不足以管理真实仓位,应同时给参数区间和不同窗口敏感性,并检查价差构造是否提前看过全样本。

最大限制

高斯、常参数和连续路径会低估跳跃及厚尾;观察间隔不等时不能直接套等间距代码。物理测度标定的利率回复参数也不能不加处理直接用于风险中性债券定价。

复现与研究价值

未执行方案:先做预设价差的稳定性检验,再比较精确OU与简单AR基准;使用参数重采样区间、跳跃压力和真实价差成本检验交易门槛,不把理论标准差直接当止损保证。

原文与核查

收录教程全文及代码解析;未执行模拟或实际策略。

原始文章 ↗

推荐 79/100 · 问题 24/30 · 证据 20/30 · 方法 22/25 · 复现 13/15

解析和实现清楚,但模型适用性及有限样本边界需要补充。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

触及整数位概率多 14.7 个百分点,为什么还不是能赚钱的交易?

The Statistic That Passed Every Test I Had And Still Isn't an Edge

Jan Heger

一句话先讲结论

作者发现价格位于整数位下方时,首日到达该价位的比例为 67.4%,随机位置对照为 52.7%,样本 11,697 个;但把这个现象变成订单后,入场延迟、先触止损再到目标和盈亏比让优势消失。有一个版本胜率从 62.1% 升到 62.7%,总收益反而少了 1,160 美元:最终到达目标的概率,不等于在交易约束下先赚钱的概率。

它到底在问什么?

一个统计现象即使显著,是否存在可以实际捕捉它的订单结构?本文区分终点事件发生概率与完整交易路径收益。

作者具体怎么做?

  1. 作者在日间缺口相关观察中记录整数位附近的首日路径完成,报告 N=11,697,真实与随机位置差为 14.7 个百分点。
  2. 尝试用实际交易规则捕捉现象,发现成交太晚、途中先止损或盈亏比恶化等问题;文章未完整公开这些交易变体。
  3. 进一步判断首日以后所谓磁吸更可能只是区间中回访近期价位,而非整数本身吸引价格;这属于作者解释,不是本文独立证实的微观机制。
  4. 最终把信号放入只记录、不下单的前向账本,等待冻结后真实新数据,而不是因为一个统计值漂亮就投入资金。

关键结果

原文结果与口径
核对项结果意味着什么
目标触及率67.4% vs 52.7%首日形态完成,不是成交后的净盈利概率。
样本量11,697相邻事件是否重叠未披露,有效独立样本量可能更小。
一项交易变体胜率 +0.6pct;收益 −$1,160说明提高胜率可以同时降低收益,金额是作者案例而非通用效应。

怎么理解?

这个区分能直接改进信号研究。到达目标、最终收涨、未来最高价超过某水平,都可能是有信息的标签,但它们并不指定可执行路径。研究员应在模型训练前确认标签与最终下单决策的关系,否则分类成绩越高,可能只是更擅长预测自己无法捕捉的事件。 同时作者说“随机对照已经排除多重比较”太强。若在很多距离、时间、整数级别和样本里试过,只挑这一个对照差最大的结果,仍有选择问题。对照提供必要背景,不自动替代全研究流程的搜索校正;缺少机制也不必直接否定统计套利,但需要更严格的可迁移证据。

最大限制

具体市场、随机位置如何匹配距离、波动与时间、交易费用及全搜索历史都未充分公开;作者的无机制判断不能证明效果不存在。前向账本尚未给出足够后续样本。

复现与研究价值

先把事件改为在固定时间内先触目标还是先触止损,并用可成交价格计算收益;随机位置必须匹配距当前价距离和日内时点。锁定规则做只读前向记录,记录未成交与取消单,最后评价净期望而不是目标完成率。

原文与核查

公开正文完整解析;未独立重跑价格事件或前向记录。

原始文章 ↗

推荐 74/100 · 问题 26/30 · 证据 18/30 · 方法 22/25 · 复现 8/15

统计可预测与交易可捕捉的区别非常实用;原始实验细节和多重比较仍不透明。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 策略否定性结果

947个MNQ交易日、14类五分钟OHLCV信号,没有一类在2点成本后通过样本外、交易数与年度稳定性五道门

The Signal Ceiling: Why No Single-Bar OHLCV Edge Beats Costs in MNQ

Ali H. Askar

一句话先讲结论

一句话先讲结论:对MNQ连续近月947个完整交易日、72,604根5分钟RTH bar,作者以bar收盘出信号、下一根开盘成交、每笔往返2点成本和扩张walk-forward检验14类热门日内OHLCV信号;没有一类同时满足样本外T≥2、至少30笔、成本后为正、各年稳定和置换p<0.05。最好的真实OHLCV信号毛边际通常仅1.05—1.50点,低于2点摩擦;结论是这类单bar公开特征在MNQ的可提取边际已接近交易成本,而不是“所有日内alpha不存在”。

它到底在问什么?

论坛常见的开盘区间、跳空、成交量、流动性抓取和亚洲盘扩张等5分钟MNQ信号,若禁止同bar成交并加入保守成本,是否仍有可部署的样本外净边际?

作者具体怎么做?

  1. 对14类单bar/短持有OHLCV模式按固定规则生成信号,所有入场滞后一根bar。
  2. 每个参数仅在当期以前样本选取,再对下一年样本外评分,逐年扩张训练。
  3. 要求同时通过T≥2、N≥30、2点成本后为正、逐年稳定、可用时置换p<0.05五道门。
  4. 保留全部失败规则,并以两个已知结构信号作正控制,验证测试框架不是无差别拒绝。

关键结果

原文结果与口径
核对项结果意味着什么
总检验14类信号,零个通过五道门否定结果本身是研究产出,不能只发布其中最漂亮的一条。
成本天花板多数可靠信号最佳毛收益约1.05—1.50点,往返摩擦2.0点公开OHLCV的短线方向信息往往低于可执行成本。
最诱人但失败的ORB15bar ORB多头毛+4.82、净+2.82,但447笔样本外T仅1.50,2022净-1.3单个正净收益不等于统计稳定;年度分裂否决该规则。
高T陷阱gap continuation short净+14.52、T3.23,但仅22笔交易数低于30且逐年萎缩,无法承载可部署结论。
正控制RTH Confluence净+15.77、T5.83、538笔、样本外T3.11;London Signal B净+5.77、T5.15、289笔框架能接受较慢的结构状态信号,拒绝的不是所有alpha。

怎么理解?

这是值得放在研究库里的高质量负结果。它把“有一点预测内容”和“成本后可部署”分开:Asia expansion等模式的方向效应可能真实,但在bar收盘后只剩1—2点毛边际,无法覆盖摩擦。对AI自动挖掘尤其重要:模型能轻易发现十四个故事,却只有完整失败日志能阻止挑一个幸存样本过度解释。

最大限制

2点成本对不同经纪商、时段和规模只是近似,且2025样本并未完整覆盖;连续合约、RTH限定和单一MNQ品种限制外推。门槛严格但仍含多个家族和参数选择,非正式多重检验校正;正控制本身也需独立复核。

复现与研究价值

在逐笔或一秒数据上把信号、可成交价、排队和冲击统一模拟;按波动状态和时段设定动态成本。对任何候选规则先记录完整搜索账本和所有失败变体,再以冻结的未来季度做walk-forward;若转向结构信号,必须明确其状态变量及延迟而非把它伪装为单bar形态。

原文与核查

公开全文完整阅读;未独立重跑。

原始文章 ↗

推荐 91/100 · 问题 29/30 · 证据 27/30 · 方法 25/25 · 复现 10/15

可执行时点、成本、walk-forward、失败全量记录和正控制都很强;但数据/代码未公开且仍需逐笔成本验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

五资产月度轮动规则很简单;12.5 万次搜索才是 11% 年化背后的关键成本

Quick 5 ETF Rotational Strategy Returns the Upside of Stocks with Half the Risk

Stuart Farmer

一句话先讲结论

每月把股票、债券、地产、商品和黄金五只 ETF 按 1、3、6、9、12 个月平均收益排序,等权持有前三只,作者报告约 11% 年化、0.87 夏普和约一半的股票回撤。规则看起来只要六步,但文章最后才披露它来自 12.5 万多个轮动组合的搜索;因此好看的是获胜配置的历史表现,不是未经筛选的策略证据。

它到底在问什么?

把多个动量窗口平均,再在资产类别间轮动,能否兼顾股票收益与较低回撤?真正需要回答的是,这个特定五资产集合和前三名持有数,在未参与选型的数据里是否仍有优势。

作者具体怎么做?

  1. 每月最后交易日对五只 ETF 分别计算过去 1、3、6、9、12 个月的累计收益,取五个收益的算术平均作为混合动量。
  2. 从高到低排序,选前三个,每个配置三分之一资本,持有到下个月末再平衡。没有绝对动量为负时退出到现金的规则,因此差环境也仍然满仓某三类资产。
  3. 正文宣称低换手,并展示不加费与按换手 10bp 收费的结果;具体图表的区间和全部数值没有在文本逐项列出。
  4. 作者称该篮子来自 125,000 多个轮动策略组合的搜索,完整搜索与策略实现放在付费文件夹,而非公开正文可独立审计的冻结实验。

关键结果

原文结果与口径
核对项结果意味着什么
作者报告绩效CAGR 11%;Sharpe 0.87尚未核验完整图表和搜索后的真正持出结果,不是可承诺预期。
搜索规模125,000+候选组合存在相关性,不能机械当成独立检验次数,但必须计入研究自由度。
资产与仓位5 选 3,等权始终选择相对强者,不保证所选资产绝对收益为正。

怎么理解?

这是一条容易实现、也容易误读的规则。多窗口平均并非独立五次确认:这些收益窗口高度重叠,长期涨势会同时抬高多个分量。五资产本身的分散可能已经减少大量回撤,应通过静态组合对照将资产配置与择时贡献分开。 最重要的披露其实是搜索次数。不能因为最终策略简单,就把产生它的研究过程也视为简单。加入新 ETF、换掉地产、选前一还是前三,都是模型选择;只有把整个搜索步骤放进训练集,并在外层独立验证,才知道这个赢家是否只是幸运路径。

最大限制

完整代码和搜索记录需要订阅,本次未取得;公开文字未充分交代样本区间、总收益复权、调仓时点和严格外层样本外。评论区的负面复现意见也未独立验证,不作为本文事实结论。

复现与研究价值

按公开规则先复现基线,同时加入五资产静态等权、简单单窗口动量和随机篮子分布。以较早区间完成全部资产与参数选择,后段只执行一次;对不同月内交易日和次日成交检验稳健性,而不是再挑最好日期。

原文与核查

公开正文全文解析;付费代码和完整绩效表未核验。

原始文章 ↗

推荐 66/100(暂定) · 问题 22/30 · 证据 16/30 · 方法 17/25 · 复现 11/15

规则透明易实现,搜索规模披露诚实;但未经完整搜索校正的获胜绩效证据有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research_digest

Quantitativo weekly #4

Quantitativo weekly #4

Quantitativo

一句话先讲结论

收益取决于拥挤、宏观状态和组合方式;单因子平均回归不足以解释可交易性。

它到底在问什么?

五篇研究分别考察行业内因子组合、拥挤股票、风格反馈、市场状态相似度轮动及因子ETF与行业ETF配置。

作者具体怎么做?

  1. 行业内因子组合与timing→rotation→selection三层系统
  2. 以Days-ADV衡量机构拥挤,构造拥挤多头/非拥挤空头
  3. 用style反馈、k-means和主成分降维检验因子动量
  4. 用quantile regression与相似历史市场状态做行业轮动
  5. 对因子ETF和行业ETF进行多窗口、多约束、含成本的头对头比较

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

主要含义是拥挤可能是风险补偿,尾部条件效应会被OLS平均掩盖,因子/行业优劣具有regime依赖。

最大限制

周刊是二手摘要;原论文数据、代码、定义与成本假设未统一,部分研究为新稿,需逐篇核验。

复现与研究价值

取得五篇原论文和数据,逐篇复现排序、Days-ADV、style、相似月和ETF配置;做点时、幸存者偏差、成本、危机压力与多重检验。

原文与核查

public_full_digest

原始文章 ↗

推荐 79/100 · 问题 27/30 · 证据 23/30 · 方法 20/25 · 复现 9/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

Supertrend 一小时亏 92.9%:换成四小时赚钱,也不等于入场信号有效

Supertrend, flipped to death: the most-taught indicator on the internet

The Refutation

一句话先讲结论

在作者的 BTC 一小时样本里,Supertrend(10,3) 每次变色就反向持仓,1,239 次翻转后累计亏 92.9%,买入持有同期涨 940%;改成四小时虽然赚 238%,仍落后买入持有的 828%。文章最有用的检查是固定交易节奏再随机方向或入场,说明正收益可能只是持有上涨资产,而不是指标选对时机。

它到底在问什么?

图上紧跟趋势的线,按下一根开盘真实执行后是否仍有择时信息?视觉上解释过去行情,与提前给出可执行优势并不是同一件事。

作者具体怎么做?

  1. 作者用 BTC 一小时数据运行公开常见参数和始终在场规则,手续费按来回 0.11%,共 1,239 次翻转;文中说样本约 6.3 年,未完整列出起止日。
  2. 移除最好五笔后损失 −97.8%,移除最差五笔仍 −87.5%,说明失败不只由个别极端交易推动。
  3. 固定同样交易时点、持有期和成本,随机方向 5,000 次,与真实指标比较。作者报告随机中位数约 −91.2%,真实 −92.9%。
  4. 再比较四小时及其他资产,并对四小时多头入场做同持有期限的随机对照;作者称所有测试持有期的入场差均为负。

关键结果

原文结果与口径
核对项结果意味着什么
BTC 一小时−92.9% vs 持有 +940%特定参数和执行方式的回测,不是所有趋势策略结论。
BTC 四小时+238% vs 持有 +828%正收益没有自动转化为相对市场的择时优势。
成本前后单笔均值−0.024% → −0.134%费用约占算术单笔损耗的 82%;不能直接解释复利净值的同比例下降。

怎么理解?

文章好的地方是没有停在“亏钱所以没用”,而是进一步问亏损来自成本还是方向判断。如果毛单笔本来就略负,高频反向交易的费用会持续侵蚀;降低频率可以改善结果,却不代表信号突然有了新信息。 不过,随机对照表述有一处内部疑点:若真实收益 −92.9% 低于随机中位数 −91.2%,按通常定义至少一半随机结果应比它高,正文却说只有约 44% 超过,需查图或代码。类似细节提醒我们,“打假文章”也需要审计。长期多空与买入持有的风险不同,还应比较波动匹配基准。

最大限制

未提供本次可执行代码与完整数据区间;手续费在翻转时如何计算、现货或永续空头资金费、随机试验百分位需核查。删除好坏交易是敏感性描述,不是可交易的策略修正。

复现与研究价值

冻结参数,用真实可交易工具加入融资或资金费,对比波动匹配持有与固定信号时点随机方向。核验随机百分位和成本复利账本,再做更换频率但不重新选最优参数的独立验证。不要将某个失败配置直接推广成整个指标家族无效。

原文与核查

公开正文全文解析;完整订单和随机实验未独立复核。

原始文章 ↗

推荐 74/100(暂定) · 问题 24/30 · 证据 20/30 · 方法 22/25 · 复现 8/15

成本与随机入场对照实用,但随机中位数和胜出比例存在内部不一致需复查。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 统计短评

六七月连跌后,13 次九月有 11 次下跌;小样本季节性不是 85% 的预测概率

Down June & July: 11 of 13 Septembers Closed Lower

Rob Hanna

一句话先讲结论

作者统计 1950 年以来标普指数六月、七月都收跌的年份,发现随后九月 13 次里有 11 次下跌,而八月方向不明显。它提供了一个具体的条件季节性观察,但 11/13 只是历史频率;如果月份组合和触发条件是从许多候选里挑出来的,就不能直接把约 85% 当成下一次下跌概率。

它到底在问什么?

在通常偏强的六月和七月连续走弱后,传统偏弱的八九月是否会进一步恶化?作者尝试把季节性与前期价格状态结合,而不只看无条件月份均值。

作者具体怎么做?

  1. 以 1950 年以来 SPX 月收盘变化筛选六月和七月均为负的年份,这是本次条件样本的定义。
  2. 观察这些年份的八月、九月表现。作者称八月有涨有跌,九月不论八月是否反弹都偏弱。
  3. 正文给出九月 13 次中 11 次收低,并提到部分跌幅较大;逐年表格以图片呈现,本次未从正文得到平均跌幅、最差值或每个年份。

关键结果

原文结果与口径
核对项结果意味着什么
条件样本13 次是较长历史中少量触发事件,不能把全部月度数据当成有效样本量。
九月收跌11 / 13约 84.6% 的历史频率,不是经样本外校准的预测概率。
八月方向不明确作者文字判断;未报告可复核的完整收益矩。

怎么理解?

研究员可以把它当成需要解释的现象,而不是即刻变成空头仓位。连续两个月下跌可能已经代表某些危机环境,而这些环境往往也影响后续收益;用日历名称包装后,不代表机制来自日历本身。 短文的优点是问题和计数清楚,没有复杂模型遮挡。缺点是筛选自由度没有账本:可以试很多月份、连续长度和涨跌阈值,最终只报道一个漂亮条件。即使简单二项检验显得有意义,若忽略这层选择,也会高估证据。

最大限制

没有逐年原始表、完整收益分布、多重检验校正或预注册规则的核验。当前行情与未来月份判断不在本解析范围;本文只分析作者统计设计,不给出仓位建议。

复现与研究价值

按同一规则重建所有月份的相邻两月下跌事件,对比无条件季节性与趋势条件,并做逐事件剔除检查。若效果集中于两三场危机,应报告这一事实;只有冻结规则后的后续事件才可增加真正样本外证据。

原文与核查

公开短文完整阅读;图片逐年统计未逐格核验。

原始文章 ↗

推荐 55/100(暂定) · 问题 16/30 · 证据 15/30 · 方法 13/25 · 复现 11/15

问题明确且容易复核,但 13 次事件和未披露搜索过程不足以支持高置信度择时。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法教程

给波动预测加 90% 区间很有用,但示例代码把测试段用于早停了

Conformal Prediction in Quantitative Finance

Vertox

一句话先讲结论

文章把单点波动预测改为上下分位数,再用 CQR 与自适应校准追踪 90% 覆盖率,方法方向比只报一个预测值更实用。但公开代码先把 val_data 分成校准和测试两半,训练时却仍把整个 val_data 用于早停选择权重;所以展示的测试覆盖并不是完全未见数据上的验证。学方法可以,漂亮区间图不能直接当独立样本外证据。

它到底在问什么?

一个波动点预测无法告诉仓位系统自己有多不确定。能否给任何预测器套上有明确覆盖含义的区间,同时允许波动误差偏斜、厚尾和随时间变化?

作者具体怎么做?

  1. 把 NARX 网络改成两个输出,用 pinball loss 训练 5% 和 95% 条件分位数,避免同一宽度套在安静与高波动阶段。
  2. 在校准集计算真实值超出上下界的最大距离,再用带有限样本阶数修正的分位数扩张或收缩区间。交换性是普通 conformal 的关键条件,金融时间顺序通常不满足。
  3. ACI 按当期是否漏覆盖更新 alpha_t,步长示例为 0.01;漏太多就扩宽。它追求长期平均错误率控制,不是无条件恢复逐点、任意状态的有限样本保证。
  4. 示例使用 30 个滞后、370 隐单元等原点预测超参数,训练早停却监控整个 val_data;其中后半随后又称 test_data,构成模型选择层面的测试污染。

关键结果

原文结果与口径
核对项结果意味着什么
名义区间90%设计目标,不是本次独立验证的实际测试覆盖率。
自适应步长gamma=0.01作者示例设定,响应快慢需要训练内选择,不能反复用最终测试调。
验证缺口测试半段参与早停公开代码可直接识别的依赖关系,影响漂亮测试图的解释。

怎么理解?

方法层面最值得带回的是把区间宽度也当成模型质量。随便给出极宽区间总能高覆盖,但没有仓位价值;必须同时报告覆盖、宽度和按波动状态分组的漏覆盖,才能知道系统是否只靠保守保住一个总比例。 代码层面还有两点值得复核。它把 alpha 限制到 [0,1],并对超出分位数范围返回无穷界,必须确认这与所引用 ACI 定理的边界处理一致,不能只口头引用保证。校准分数在测试中固定而只调 alpha,也不等于完整滚动重新校准。文章方向正确,工程实现仍需与数学假设逐项对齐。

最大限制

未独立执行神经网络;前序训练数据和模型说明依赖另一篇文章。当前示例测试早停污染、时间序列交换性及 ACI 边界处理,都使无条件覆盖宣传需要收窄。

复现与研究价值

按时间分为训练、超参数验证、校准、最终测试四段;模型训练和早停只接触前两段,校准不参与权重选择。冻结 gamma 后向前运行,报告总体与危机段覆盖、平均宽度、无穷区间比例及连续漏覆盖长度,再评估仓位用途。

原文与核查

公开正文及全部示例代码已读;发现早停与测试段重叠,未独立运行。

原始文章 ↗

推荐 86/100 · 问题 28/30 · 证据 23/30 · 方法 23/25 · 复现 12/15

教程和代码具体、可审计,区间思想实用;发现的测试污染必须修复后才可相信展示。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文综述

把动量加入期权模型之前,先分清预测真实收益与无套利定价

Making Option Pricing Models More Practical

Relative Value Arbitrage

一句话先讲结论

文章介绍两种扩展:在随机波动模型的漂移项加入日内动量,以及在真实世界测度下用 Heston/Bates 模拟波动目标组合。它们解决的不是同一个问题:真实世界的上涨预测不能直接替换风险中性漂移去给可交易期权定价。第一篇只有模拟结果,第二篇的 10% 波动目标只是较低风险、也较低收益的一档,不是已经发现的最优配置。

它到底在问什么?

经典定价模型的简化假设如何放松,才能服务真实市场?必须先明确是计算无套利价格,还是预测资产路径并评估风险,不同目标需要不同测度和风险溢价假设。

作者具体怎么做?

  1. 动量模型用近期相对价格变化或其均线构造漂移调整,让波动本身随机且均值回复,模拟高正负动量时的路径与期权估值差异。
  2. 综述称模型在低动量或低波动条件趋近经典 BSM,但没有给出足够参数限制证明一般收敛;即便动量为零,随机波动本身也未必自动消失。
  3. 真实测度应用采用有效矩方法校准 Heston 和 Bates,比较不同波动目标的风险、收益和波动的波动;目标越高,收益与风险均上升。

关键结果

原文结果与口径
核对项结果意味着什么
动量定价证据数值模拟没有真实期权链样本外定价误差或对冲损益的公开比较。
较低目标档10% 波动目标在所比较设置里风险和收益都较低,不能认定经济上最优。
模型范围Heston / Bates加入随机波动及跳跃是建模选择,不保证参数能稳定从有限数据识别。

怎么理解?

这篇最有价值的是提醒风险管理不能只生活在风险中性世界:资产配置需要真实发生概率、预期收益与路径分布。反过来,真实测度下拟合得好的路径,也不能未经风险价格转换直接拿来给期权报价。把这条边界说清,比在 BSM 上多加一个名为动量的参数更重要。 对模型比较,模拟中的显著价差只说明新假设改变了输出,不说明改变更接近市场。应该分别检查期权误差、动态对冲误差与策略尾部风险。波动目标减少极端损益是可预期的风险缩放结果,若收益同时下降,应在相同风险水平比较才知道有没有效率增益。

最大限制

本次读完整公开综述,没有逐式核验两篇原研究的测度变换和校准。第一篇明确模拟而非实证,第二篇也未在综述中给出完整收益和成本数字,不能据此宣称可交易改进。

复现与研究价值

先锁定用途:期权定价需真实报价与风险中性校准、风险模拟需真实收益和样本外分布检验。用同风险、同成本比较波动目标与静态持仓,再衡量随机波动或跳跃是否改善风险预测,而不是只展示曲线不同。

原文与核查

公开综述全文解析;两篇原研究公式和代码未完整核验。

原始文章 ↗

推荐 63/100(暂定) · 问题 22/30 · 证据 16/30 · 方法 19/25 · 复现 6/15

测度和应用边界值得学习,但综述不足以证明新定价模型的市场有效性。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

58.4% 胜率通过四道检验,却死在限价单成交规则上

The 58% Win Rate That Was My Own Code Lying To Me

Jan Heger

一句话先讲结论

MNQ 在特定尾数价位买入、止盈止损各 25 点,作者得到 58.4% 胜率,跨年份和样本外都看起来稳定;但将“碰到价格即成交”改成必须穿过限价 2 点,胜率降至 53.1%,每笔收益从 7.03 美元降到 1.78 美元。问题不在预测模型,而在回测把最难成交的反弹赢家全算进去了。

它到底在问什么?

一个通过随机价位对照、逐年稳定性和样本外检查的策略,为什么仍可能完全不可交易?

作者具体怎么做?

  1. 最初池化的 5,551 笔交易胜率 51.5%,随机水平约 50.7%;筛出的 x466 桶有 514 笔、胜率 58.4%、利润因子 1.34。这里已经发生过选优,因此必须比较同样被搜索的对照。
  2. 80 个对照桶最高胜率 55.2%;x466 在七个年份中六年盈利,以 2024 年为界的样本内外胜率为 57.9% 和 58.8%。这些检验沿用同一个成交假设,不能识别共享的模拟错误。
  3. 把所需穿透幅度从 0 调到 1、2、3、5 点,胜率依次为 58.4%、57.2%、53.1%、51.9%、45.6%;利润因子同步从 1.34 降到 0.79。
  4. 在更保守成交下扫描 5 档止盈与 4 档止损,20 格中 19 格亏损;最佳利润因子 1.03,而对照桶各自最佳值均值 1.01,80 桶中 31 桶比候选更好。

关键结果

原文结果与口径
核对项结果意味着什么
穿透 0→2 点58.4%→53.1%胜率下降 5.3 个百分点,反映成交筛选而非手续费简单上调。
每笔收益$7.03→$1.78仍是作者模型报告值,未独立核对逐笔成交。
同样选优后的负对照31/80 更优参数扫描后的候选并不突出,不能只看它自己的最佳格子。

怎么理解?

这篇的实用价值,是说明样本外不能修复结构性错误:如果历史与未来都使用“触价必成交”的代码,两个区间会一起虚高。首先应审查订单能否成交,再研究显著性。 不过,穿透 2 点也不能被命名为已验证的真实成交率,穿透更多必然改变入选交易的路径分布;它是有方向的压力测试,不是订单簿回放。作者把单调衰减视为伪优势指纹很有启发,但最终仍需报价、成交量、排队与实际委托记录确认。

最大限制

未取得逐笔数据和代码,美元损益、滑点与微型合约摩擦未独立重算;x466 缺少事前经济机制,初筛与后续检验亦非完全独立。

复现与研究价值

在自己的限价策略中同时保留触价、穿透与成交量约束三套结果,再用真实小额委托校准填单概率;候选和随机水平必须采用完全相同的参数扫描预算。这是建议,未执行实盘或回测。

原文与核查

公开全文和全部文字表格已读,未运行作者脚本。

原始文章 ↗

推荐 86/100 · 问题 29/30 · 证据 23/30 · 方法 24/25 · 复现 10/15

执行偏差案例具体,负对照设计有用;缺少订单级独立验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

LAFO 的贡献是定义价格滤波目标,不是证明夏普 11 的反转策略

Fair Value as an Adaptive Low-Pass Filter: LAFO for Mean Reversion

Ali H. Askar;原论文 Zhichen Xu 等

一句话先讲结论

这篇导读中的两层 CNN 在两个月、2 分钟标普数据上得到夏普 11.049,EMA(10) 却为 −18.265;但没有正式样本外评估,所以不能据此认定神经网络找到可交易的公平价值。值得研究的是 LAFO 把“拟合每个价格点”改成“控制局部平均残差”,让平滑尺度和价格结构假设变得明确。

它到底在问什么?

均值回归策略先要回答“回到哪里”:移动均线只是一个平滑基准,不是经济学上的真实价值,过慢会把永久价格变化误认成暂时偏离。

作者具体怎么做?

  1. LAFO 对长度 K 的窗口内残差先求均值,再对均值平方求和;K=1 退回逐点平方误差,较大 K 更强调低频匹配。
  2. 通过总变差、一阶平方差或二阶绝对差约束,分别表达分段常数、平滑漂移或分段线性价值路径。正则项不只是技术附件,也是在选择市场状态变化的形状。
  3. 交易根据现价相对滤波线的偏离反向持仓,设 0.0005 的入场死区和 200 的仓位缩放;小偏离不交易,超过死区后才逐渐放大至上限。
  4. 演示统一 K=80、每单位换手 3 bp 成本,约 6,000 个样本;两层 CNN、WaveNet、深度 Kalman 的报告夏普分别为 11.049、8.005、4.920。原作者将研究定位为方法展示,未给出系统样本外结论。

关键结果

原文结果与口径
核对项结果意味着什么
CNN 演示夏普11.049短单资产样本内展示,不是可部署业绩。
样本尺度两个月、2 分钟高频观测很多不等于独立市场状态很多。
交易死区5 bp偏离阈值,不是显著性门槛或风险预算。

怎么理解?

研究员真正可以借用的是把“均线多少天”拆成两个决策:保留什么频率、允许价值路径怎样转弯。这样模型优劣就能追溯到可检验的假设,而非只比较一张平滑图。 还要比导读再谨慎一步:损失对滤波输出凸,不意味着神经网络参数训练凸;全样本离线曲线转弯快,也不代表在线因果滤波没有延迟。K 很大只约束平均残差,若没有正则,平坦全局均值亦不必是唯一解。将这些层次混在一起,会把漂亮数学变成错误交易直觉。

最大限制

已读完整导读并核对正确原论文摘要,尚未取得逐页全文及代码;所有细项为导读报告。未核查在线因果性、训练测试切分和成交工具,不能把标普指数直接视为可成交资产。

复现与研究价值

先在每个时点只能用历史数据的管线中实现 LAFO 与 EMA,冻结 K 和正则选择,再比较跨期预测残差、换手及可交易期货净收益;方法验证和策略选择分开。

原文与核查

公开导读完整解析;正确原论文书目与摘要核验,未逐页审计。

原始文章 ↗

原论文:Advanced Signal Filtering for Mean Reversion trading

推荐 76/100(暂定) · 问题 27/30 · 证据 18/30 · 方法 23/25 · 复现 8/15

目标函数有研究价值,短样本内收益和正文引用错误要求审慎。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

50/100 均线带的 55 种交易版本:视觉上的趋势,未能跨过手续费

We tested the 50/100 MA ribbon 55 different ways over five years

The Refutation

一句话先讲结论

作者把 BTC、ETH 的 50/100 均线带翻色交易做成 55 种配置,2021 年 2 月至 2026 年 7 月扣费后总收益全部为负;其中 37 种连扣费前也亏损。60 分钟反手版本亏 59%,5 分钟版本约 11,000 次交易后接近归零:这首先否定这组频繁翻色规则,不是否定所有趋势策略。

它到底在问什么?

均线带看起来能区分趋势和震荡,但颜色改变发生后,是否还有足够的未来收益覆盖反复交易的成本?

作者具体怎么做?

  1. 以五年多的一分钟 BTC、ETH 数据生成多时间尺度信号,测试三种翻色严格度和反手/中性空仓两种退出模式,共 55 格配置;每次只允许一个持仓。
  2. 信号在 bar 收盘确认,下根开盘成交。每边 taker 费约 0.055%,往返约 11 个基点;未模拟永续资金费,因此不是包含全部持有成本的完整实盘损益。
  3. 分解毛收益与费用:37 格扣费前亏损,12 格毛收益为正但被费用吃掉;另六格平均净单笔优势略正,但复利总收益仍负且无显著性。两者不能混称同一收益指标。
  4. 反手模式随频率提高,60/30/15 分钟分别约 854/1,737/3,421 次交易,总收益约 −59%/−88%/−98%;5 分钟约 11,000 次后几乎损失全部。

关键结果

原文结果与口径
核对项结果意味着什么
扣费后总收益为正0/55只适用于作者测试的规则家族和样本,不能概括均线所有用途。
毛收益也为负37/55多数配置问题并不只是手续费贵。
网格内胜率约 14%—29%低胜率本身不是失败证明,关键是少数大盈利不足以支付亏损和费用。

怎么理解?

应把它看作一个信号增量检验:多画几条均线并没有引入新的信息源,反而可能把同一价格噪声重复投票。交易周期缩短,使每段行情能支付的收益与固定往返费之间的比例恶化。 但文中“冷却期只能慢一点亏”比证据走得更远,作者并未直接测试冷却时间,而更严格的确认规则并不等价于时间冷却。真正严谨的结论是已测试网格不值得直接部署,不是任何降频、持仓或风险预算改造都无效。

最大限制

完整格子、仓位复利约定和代码未核验;未建模资金费与额外冲击。文章标注 8 月 1 日而目录收录在 7 月,保留两种日期,不把发布时间倒改。

复现与研究价值

复现时先固定信号、下根成交和仓位,再同时报告算术单笔收益与复利净值;若测试冷却期,把它当新假设,用新的时间段验证而不是继续在原网格选优。

原文与核查

公开全文已读;图表依正文说明解读,未独立重跑。

原始文章 ↗

推荐 75/100 · 问题 24/30 · 证据 21/30 · 方法 21/25 · 复现 9/15

负面结果和成本分解具体,但公开实现与部分泛化判断有局限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

比特币“美股隔夜收益”预测 VIX:关键是时间切分,而不是币价全天涨跌

Bitcoin's Overnight Returns Forecast the VIX

Ali H. Askar;原论文 Ming Gu / Juan Lin / Siyi Liu

一句话先讲结论

把比特币按美股交易时段切开,2018—2023 年样本里,隔夜收益对随后日间 VIX 对数变化的系数为 −0.262,t 值 −2.49;交易时段那段收益加入后却不显著。导读报告相关模型交易 VIXY 扣费后信息比率 0.986,但基准是长期持有 VIXY,并不能直接理解为接近 1 的纯预测 Alpha。

它到底在问什么?

股票市场关闭时仍交易的比特币,是否提前吸收了下一次美股开盘才反映的情绪信息?全天收益会不会把有用与无用时段混在一起?

作者具体怎么做?

  1. 五分钟 BTC 数据按美国市场时钟分段,研究期为 2018—2023 年。全文样本隔夜均值约 +0.093%,交易时段约 −0.029%。
  2. 以 Google 搜索和活跃地址相对过去月均值衡量关注度;高低关注组隔夜收益差约 1.133% 与 0.987%,t 值约 2,但该排序关系不足以单独证明散户因果机制。
  3. 回归控制标普期货收益、隔夜 VIX、VIX 滞后项、节假日和 FOMC;隔夜 BTC 系数约 −0.262,加入控制后约 −0.255。
  4. HAR 结合 VIX 日、周、月记忆与 BTC 分段信号进行样本外预测;交易演示使用 VIXY/VXX、每交易美元 9.7 bp 摩擦,按预测方向多空。

关键结果

原文结果与口径
核对项结果意味着什么
隔夜预测系数−0.262,t=−2.49回归方向性证据,不是 BTC 涨 1% 就保证 VIX 跌固定点数。
VIXY 信息比率0.986相对买入持有 VIXY 的主动收益比率,不等于对现金的夏普。
VXX 替代工具0.894有跨工具检验,但两者都受波动率期货结构影响。

怎么理解?

最有启发的是信息时钟:24 小时交易资产的日线切点可以把先导信息与随后反转相互抵消。与其盲目加更多资产,不如先保证每条数据在目标决策时点已经可见。 需要拆掉的叙述是“比特币导致 VIX”。即使控制股指期货,仍可能是共同新闻在市场间不同步反映。VIXY 买入持有受期货期限结构影响,偏空策略超越它不稀奇;应与静态空头、期限结构和风险匹配基准比较,才知道 BTC 提供多少增量。

最大限制

原文详细数字依据完整导读,期刊全文及 SSRN 下载未取得;样本外包含疫情,后疫情子期很短。夏令时、交易日对齐、做空借券与跳空风险尚未独立审计。

复现与研究价值

冻结隔夜定义和 HAR 规格,用未参与选择的后续年份比较 BTC 隔夜、股指期货和静态短波动基准;先验证预测误差增量,再做相同尾部风险预算的净收益比较。

原文与核查

导读完整解析,出版书目核对;未逐表审计原论文。

原始文章 ↗

原论文 DOI

早期 SSRN 版本

推荐 81/100(暂定) · 问题 27/30 · 证据 22/30 · 方法 23/25 · 复现 9/15

时间切分与风险基准问题值得研究,显著性和经济收益外推有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

先换采样时钟再换指标:2,021种新K线的胜出者,仍缺公开公式

I Invented 2021 Candle Types to Find the One Holy Grail

Stuart Farmer

一句话先讲结论

作者用大模型生成3,600种采样方案,去重后测试2,021种,179种盈利且击败对应时间K线;但快采样优势加入费用就消失,前三名主要帮助均值回归而非趋势。标题的夏普提升不能直接当作可复现结果:冠军公式与代码收费,文中留出测试仅称第一名继续领先,没有公开完整数值口径。

它到底在问什么?

日内策略效果差,到底是指标不行,还是固定一分钟、十五分钟把有用交易活动切碎?文章把优化对象从指标转向决定何时收盘一根K线的规则。

作者具体怎么做?

  1. 从一分钟OHLCV出发,由大模型生成60个家族、每族60个方案,允许自由重采样;1,579个重复项剔除,留下2,021个实际方案。
  2. 在2020—2025年八个外汇品种上跑布林均值回归、RSI反转、唐奇安突破和均线交叉,每方案获得32条策略—资产曲线。
  3. 按输出K线根数匹配时间采样基准,用夏普增量排序,再检查换手、费用、随机时钟以及更多交易规则。
  4. 快K线税前优势最强但费用后失效,较慢冠军集中在反转规则;作者称留出集第二、第三名不稳,第一名仍领先。

关键结果

原文结果与口径
核对项结果意味着什么
搜索规模2,021个去重方案不能把获胜方案当作事前单次假设。
初筛胜出179个盈利并击败时间基准,不等于经多重检验仍显著。
风险口径仅收盘到收盘曲线作者明示未展示持仓中的回撤。

怎么理解?

最有意思的是收益形态发生选择:采样规则可能有意等待价格走到某种局部状态才结束K线,于是下一根出现机械反转。这不一定是假信号,但必须证明收盘时点完全因果、触发后真实可成交。如果采样实现回看未来来合并K线,再漂亮的反转都没有交易意义。 根数匹配是有价值的控制,却不是完整公平实验。指标参数按根数固定,意味着事件时钟同时改变观察频率、暴露和换手。更干净的归因应把美元K线、成交量K线和随机时钟都列入,同样约束交易次数与风险。文章关于传统K线历史及“此后没有进展”的表述也过强,不能代替事件采样文献综述。

最大限制

具体冠军公式未公开、费用数值和留出分割未完整列出;同时搜索2,021方案后继续增添指标与筛选条件,存在反复看数据的选择偏差。标题+1.2夏普缺少可核验的完整表格,不能直接引用作业绩承诺。

复现与研究价值

先复现公开可定义的时间、成交量、金额和随机K线,逐笔检查K线结束时间与下一笔执行;冻结一组参数、用后续年份和另一外汇数据源验证净收益,再考虑购买复杂公式。此处未执行这些实验。

原文与核查

已解析公开文章全文;冠军实现与图表底层数据未取得。

原始文章 ↗

推荐 67/100(暂定) · 问题 25/30 · 证据 16/30 · 方法 21/25 · 复现 5/15

研究问题新鲜,采样基准有改进;关键公式和完整样本外证据不公开。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

路径签名的4.4夏普值得追踪,但“加速度”解释在代数上站不住脚

Path Signatures: Does the Shape of Price Paths Predict Returns?

oracle / Delphic Alpha

一句话先讲结论

27个品种、400余配置的样本内扫描中,五分钟加密资产FadeVolRet报告毛夏普4.4、每次仓位变化3.4bp,八个币均为正;但没有样本外或费用验证。更重要的是,文中把S(1,1)解释为收益加速度存在数学错误:同一组收益的排列不会改变它,真正值得研究的是跨维度的先后关系。

它到底在问什么?

先波动放大、再价格上涨,与先上涨、再波动放大,即使最终涨幅相同,下一段收益是否不同?路径签名试图保留被总收益压缩掉的先后信息。

作者具体怎么做?

  1. 样本为2021年7月至2026年7月的期货、外汇与加密资产,构造累计对数收益、累计(H−L)/C二维路径,在每个窗口内按维度标准化。
  2. 计算一级、二级项及交叉项之差,用500根滚动z-score,正值做多、负值做空;五分钟频率每三根才更新签名,其余前填。
  3. 测试2、4、8、24小时等窗口,信号收盘产生、下一根计收益;资产类内等权,先汇总日收益再乘√252年化夏普。
  4. 比较跨年、跨币、行情状态与1,000次日收益自助抽样,但所有配置与符号选择来自同一完整样本,作者明确没有训练测试切分。

关键结果

原文结果与口径
核对项结果意味着什么
最强宣传结果毛夏普4.4 / 3.4bp3.4bp按仓位变化计,不等于扣完买卖两边成本后的收益。
时间一致性52/56个月为正仍是被扫描过的样本,而非56次独立前瞻验证。
关键对照S(1,1)排列不变其盈利不能被归因为捕捉路径加速度。

怎么理解?

跨项确实能编码两条流的相对顺序,因此核心问题没有被上述错误完全推翻。不过作者将“累计区间幅度”不时写作“波动变化”,而累计正数与波动上升下降不是一回事。窗口标准化也使一级项不再原封不动等于未经缩放的简单动量,控制组需要重新对齐。 统计段另有混淆:围绕观测收益重采样后95%夏普为正,不自动等于对零收益假设的有效5%检验,更未校正400余配置搜索。应使用保留依赖的区块抽样并处理模型选择。此外各配置夏普轮廓相关低,不等于两个真实交易组合的收益相关低。

最大限制

纯样本内、无费用、信号当根收盘执行;现货做空实现缺失。结论段对VolLeadRet的“0个配置”与前文最强信号叙述冲突,未擅自纠正数字。加密全年交易仍用√252,跨资产年化需统一。

复现与研究价值

先用人工两条反向排列路径做单元测试,核验iisignature输出和文字公式;再将交叉项对短期反转残差化,冻结符号和窗口,以未来时段检验扣费后的增量。此处是待执行计划。

原文与核查

公开全文已解析,指出可直接代数核验的问题;未独立重跑行情。

原始文章 ↗

推荐 66/100(暂定) · 问题 25/30 · 证据 16/30 · 方法 17/25 · 复现 8/15

路径先后关系有研究价值,但数学解释与统计口径存在实质错误。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 工作论文解析

短趋势衰退并非一刀切:最小报价单位相对波动,可能比资产类别更重要

A Microstructural Account of the Demise of Short-Term Trend-Following

Jutta G. Kurth、Zoltan Eisler、Adam Rej、Jean-Philippe Bouchaud

一句话先讲结论

5/20指数均线趋势夏普从1995—2009年的0.84降至2009—2025年的0.12;50/200慢趋势则从0.70降至0.40。更关键的拆分不是股票、商品,而是tick/波动:小tick组衰退最明显,大tick组保留更多收益。不过“高频做市撤单导致趋势消失”仍是解释性机制,不是已完成因果识别的结论。

它到底在问什么?

一个策略变差,要分清预测关系消失、执行成本增加、还是样本结构改变。本文逐层排查短趋势衰退,给研究员的价值是改变分组变量,而非提供一条新的均线交叉规则。

作者具体怎么做?

  1. 以约101个期货日线构造风险缩放的EWMA趋势,快参数5、10、20、50,慢参数为四倍;另用53个合约的五分钟盘口资料观察交易流。
  2. 把tick/波动按月分上下半组,比较各组断点前后收益,并用流动性分组、资产类内分组检查是否只是资产构成替身。
  3. 把执行滞后降到零作诊断,短趋势仍弱;再用容量冲击的数量级、电子化时间与订单流变化逐一检查备选解释。
  4. 作者提出撤单使小tick薄盘口更难承接趋势订单,趋势资金退出又削弱反馈;附录进一步拆分波动状态和大涨跌日,但大涨跌日是事后归因。

关键结果

原文结果与口径
核对项结果意味着什么
快速趋势夏普0.84 → 0.12是两个历史区间,不是参数优化前后。
慢速趋势夏普0.70 → 0.40不能把快速趋势衰退说成所有趋势策略死亡。
关键新分组tick / 波动比名义tick或简单资产类别更贴近盘口约束。

怎么理解?

这里要特别更正二手解读:Quantpedia开头把小tick盘口说成密、大tick说成稀,而论文机制恰好相反。对小tick,很多价格档位可竞争,但单档深度薄;大tick的排队租金支持更厚挂单。把这点读反,整个撤单故事也会理解反。 我的保留是因果链最后一跳:同期订单不平衡与价格相关,不能单独证明是CTA退出而非信息环境共同变化。零滞后仍失效只能排除某类机械实施损耗,不能把所有容量反馈都排除。作者也承认缺少实际HFT库存与CTA执行分布。这个研究最可用的部分是横截面诊断,不是断言“任何被动执行都无救”。

最大限制

原始微观数据专有,未独立复现。月分组需在实施时明确使用上月信息,不能误用全月排名交易本月。附录按当日涨跌大小分解收益只能解释历史,不能拿来预知当天是否应交易。工作论文并非确定的市场定律。

复现与研究价值

对已有期货趋势回测增加滞后tick/波动分位标签,固定速度后比较净收益与成交成本;优先用交易所tick规则变更做同品种事件对照,而不是再搜索一批最优均线。上述只是未执行研究计划。

原文与核查

已解析论文HTML全文与附录;未重跑原始数据。

原始文章 ↗

原论文 arXiv 2607.01550

推荐 87/100 · 问题 29/30 · 证据 25/30 · 方法 24/25 · 复现 9/15

机制与对照丰富,足以改变策略诊断;因果和专有数据限制仍在。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 数据工具说明

宏观事件日历真正有用的是时点骨架,不是“事件越多越赚钱”

A Database of Historical Macroeconomic Events

Concretum Research

一句话先讲结论

Concretum 开放宏观事件 CSV,示例中标普 500 自 1990 年以来日均收益约 4.8 个基点,五项以上宏观事件同日出现时超过 30 个基点;但后一组只有 15 天。这篇最值得拿走的是可合并的事件日期和对重建发布时间的提醒,不是一条已经验证的“买入密集发布日”策略。

它到底在问什么?

研究策略在 CPI、非农、FOMC 等日子的表现,需要一个一致的历史事件表,而网页日历往往很难直接并入回测。

作者具体怎么做?

  1. 可选择 FOMC、CPI、NFP、PCE、GDP、ISM 等事件及日期区间,导出 long 格式的一行一事件,或 wide 格式的一行一交易日、每类事件一列 0/1。
  2. 数据包含未来预定日期。可选的 assumed_time_et 按惯常美国发布时间重建,默认关闭,作者明确不把它当核实后的真实时间戳。
  3. 示例把 wide 日历连接到标普 500 总收益指数,从 1990 年开始计算各类事件日平均收益,以约 4.8 个基点的全样本均值为基准。
  4. 再按同日事件数量分组,信息更密集的组平均收益更高;五项及以上组超过 30 个基点,但仅有 15 个观测,作者没有据此主张因果或可交易规则。

关键结果

原文结果与口径
核对项结果意味着什么
全样本日均收益约 4.8 bp标普总收益的无条件均值,是描述性比较基准。
五项以上事件日超过 30 bp,n=15极小样本条件均值,远不足以稳定估计尾部或置信区间。
意外值和初值未包含不能直接用此表测试经济超预期的价格影响。

怎么理解?

它的工程价值高于示例收益:维护稳定事件标识和日期,可以让不同策略使用同一信息环境标签,避免每名研究员手工录出不同日历。尤其是默认不补日内时间,体现了“不知道”比伪精确更可靠。 解释收益时要避免重复计数:同一天同时含 CPI 和其他事件,多个事件组可能都收到同一笔收益。所谓密集事件溢价还可能混有星期、月底和市场状态效应。工具解决的是数据连接,不会自动解决识别问题。

最大限制

未下载核对整个 CSV 与官方历史公告;惯例时间可能随年份调整、停摆或会议安排改变。没有预期值、初值及修订快照,示例亦未提供稳健性检验。

复现与研究价值

先抽样对照官方发布记录并区分预告日期与实际日期;事件研究按日聚类,控制星期/月末,报告非重叠事件组和剔除极少样本后的结果。日内应用必须另建真实发布时间。

原文与核查

公开工具说明及完整示例已读;未审计导出数据。

原始文章 ↗

推荐 83/100 · 问题 27/30 · 证据 22/30 · 方法 22/25 · 复现 12/15

日历与时点警告直接可用,示例收益不构成策略证据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

同一根 K 线先止盈还是先止损:82.54% 的乐观盈利配置过不了压力测试

Does Your Backtest Survive the Adverse Same-Bar Fill? A 48.8 Million-Pair Stress Test

Rulyfi

一句话先讲结论

对 4,882.5 万个相同配置,只把同根 K 线触及止盈止损时的优先次序由止盈改成止损,76.13% 的总收益发生变化;在原先盈利且交易数达标的配置中,82.54% 变成不盈利。这不是证明它们实盘必亏,而是说明小时 OHLC 不够判定这些策略是否赚钱。

它到底在问什么?

OHLC 告诉你高低点都出现过,却没告诉你哪一个先出现;如果策略盈利依赖这个缺失的信息,怎样分配更细数据的验证资源?

作者具体怎么做?

  1. 测试 Binance 五种 USDT 永续的独立多头与空头,2020-11-13 至 2026-07-29 共 50,000 小时;20 种指标×14 周期产生 280 种变化,再两两组合并配 125 组止盈、止损和存续期。
  2. 冻结行情、方向、费用、滑点、资金费及四折前推设置。每个配置跑两次,只切换同 bar 出场次序,按不可变配置键一一配对,总计 9,765 万次回测。
  3. 费用设 taker 0.04%、滑点 0.01%,资金费按 bar 对齐纳入。交易数与资金费贡献在配对中不变;SOL 缺少部分预热,作者单独提示。
  4. 以总收益为正且两模式均至少 30 笔为筛选:802.55 万个乐观盈利项中仅 140.09 万两边都盈利,662.46 万只在乐观模式盈利。

关键结果

原文结果与口径
核对项结果意味着什么
总收益受影响76.13%参数网格占比,不是独立策略在真实世界失败的概率。
受影响配置的中位变化−13.50 pct总收益差,非年化;胜率中位下降 1.94 pct,回撤加深 5.80 pct。
原盈利项仍盈利17.46%其余应优先补充日内路径,而非立即断言均不可交易。

怎么理解?

最好的设计不是数字巨大,而是把实验单位从排行榜名次换成同一配置:成本、资金费和交易次数不变,才能把变化归因于路径假设。几千万参数高度相关,不会让统计证据自动变成几千万独立样本。 实际应用应采用三级决策:两边都通过才进入下一道检验,只乐观通过就买更细数据,两边都失败则在当前规则下淘汰。高频、窄止盈止损更敏感,是验证优先级线索;它并未单独识别频率的因果作用。

最大限制

厂商自有引擎与扫描结果未独立审计;SL-first 不能模拟跳空、排队和部分成交。即使更低周期也仍可能存在 bar 内路径歧义,且通过本检验不代表已解决多重检验或样本外过拟合。

复现与研究价值

给现有回测输出加入执行假设键,同一候选保留两套净值;先在受影响且经济价值较高的候选上回放逐笔数据,再校准真实执行。不要用重新排序后的 top 榜配对。

原文与核查

公开全文、完整参数与配对表已读,未运行扫描。

原始文章 ↗

推荐 89/100 · 问题 30/30 · 证据 24/30 · 方法 24/25 · 复现 11/15

可直接转成回测质量闸门,控制变量清楚;大规模厂商结果仍需独立验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 论文导读

用标普超卖信号择时空波动率,比反过来读 VIX 更有用吗?

Chicken and Egg: Use the SPX to Time the VIX, Not Vice Versa

Ali H. Askar;原研究 Robert Hanna

一句话先讲结论

公开部分报告:2007—2023 年无过滤空一份 VX 累计赚 213.52 点、最大回撤 68.86 点;只在标普 RSI(2)≤20 时空 VX,收益 178.6 点、回撤降到 21.04 点。它提示标普短期价格状态可能帮助筛选空波动率时机,但点数收益不等于投资组合年化回报,更不能忽略保证金和危机跳升。

它到底在问什么?

研究通常用 VIX 判断股票;把方向反过来,用股票的超买超卖状态预测波动率期货,是否更合适?

作者具体怎么做?

  1. 长期部分对标普使用一年涨跌、200 日均线和 50/200 日交叉过滤,再构造相反方向的 VIX 过滤;公开报告中 VIX 长期过滤未改善股票收益风险比。
  2. 短期用 RSI(2) 分桶:标普超卖后次日胜率约 57.66%、利润因子 1.41;改用 VIX 超卖读数预测标普,则约 55.51% 与 1.14,接近无过滤的 54.79% 与 1.11。
  3. VX 连续合约在到期周前一周二换月,比较无过滤空头与只在标普/VIX 各 RSI 桶内持有空头。
  4. 标普超卖过滤的点数收益/最大回撤为 178.6/21.04,恢复因子约 8.49;无过滤为 213.52/68.86,约 3.1。原 SSRN 摘要确认还包含其他 RSI 周期、高低点与示例模型。

关键结果

原文结果与口径
核对项结果意味着什么
过滤后点数收益178.6 vs 213.52收益略少,同时在场时间变化;不是等风险比较。
最大点数回撤21.04 vs 68.86风险下降明显,但未反映保证金占用与危机流动性。
恢复因子8.49 vs 约3.1净利润除最大回撤,对样本路径高度敏感。

怎么理解?

它把一个有用问题具体化了:不是预测市场方向越准越好,而是寻找更适合被预测的交易对象。空波动率的条件收益可能比股票下一天涨跌更容易分层,但承担的是不同风险。 导读把 VIX 说成只能被动反应、不能包含先行信息,因果语气过强。期权价格本来含预期风险和风险溢价;一组技术指标预测效果的差异,不足以证明信息永远从股票单向传到期权。连续合约的长期下移也不能不经资金和换月口径就转化为可领取的收益。

最大限制

导读后半仍在订阅墙;已定位公开原研究与 IFTA 期刊版本,但尚未完整逐页读取。可见数据属于条件回测,仓位、成本、全部参数敏感性和最终模型未核全,因此保留部分解析状态。

复现与研究价值

优先用原论文完整交易规则建立固定合约名义与风险目标两套净值,对比空 VX 基准、期限结构过滤和标普 RSI;单列 2008、2018、2020 危机损失与保证金需求。

原文与核查

公开部分已深入解析,付费后文未读;原论文摘要与出版地址已定位。

原始文章 ↗

Robert Hanna 原研究(2024)

IFTA Journal 2025 原文版本

推荐 73/100(暂定) · 问题 26/30 · 证据 18/30 · 方法 21/25 · 复现 8/15

对照角度有价值,但全文和执行风险核验尚不完整。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 因子研究导读

低波动不是低回撤:26%长期年化背后,还有超过50%的历史损失

When Risk Is Not Rewarded

Concretum Research

一句话先讲结论

文章1963—2026等权低波动多空回测报告26%年化、0.87夏普,却也有超过50%的回撤。2026年截至5月,市值权重高波组涨83%、低波组跌5.3%;换成等权则为17.2%和5.4%,两腿各自波动缩放后的多空约跌1%。这说明先核对权重和杠杆,比争论“低波因子是否失效”更重要。

它到底在问什么?

高风险股票为何长期未必高收益?作者用十分组展示低波动异象,并解释同一因子在不同权重构造下能出现完全不同的短期结果。

作者具体怎么做?

  1. 每月按历史方差排序,先展示等权十分组CAPM alpha和夏普;低方差组与高方差组夏普分别0.71和0.03。
  2. 构造做多D1、做空D10,两腿各自缩放到20%年化波动。整段1963—2026报告年化26%、夏普0.87、CAPM alpha约21%。
  3. 检查历史路径而不只均值,1966、互联网泡沫与疫情后反弹等阶段出现严重亏损,一些回撤超过50%。
  4. 再改用市值权重观察2026截至5月,发现大型科技集中使多空落后明显;等权分散了少数大市值股票的影响,但增加小股票权重。

关键结果

原文结果与口径
核对项结果意味着什么
长期模拟CAGR26%,夏普0.87两腿各20%目标波动的历史组合,不是普通低波ETF。
历史尾部回撤曾超过50%beta接近零并不等于无系统性风险。
2026权重差异D10:83% vs 17.2%前者市值权重,后者等权;不是同一因子忽然出现两种事实。

怎么理解?

经济解释有三层:杠杆受限者追逐高beta,彩票偏好抬高高波动股票价格,难借券又阻止价格快速纠偏。但文章的数据本身没有识别三者谁主导,也没有证明高方差收益关系就推翻CAPM。把多种异象合写成一句“风险不获补偿”适合入门,却不够严谨。 两腿波动中性也不自动beta中性,beta与波动的比值依赖相关性。报告的近零beta应当是事后估计结果,而非构造必然。2026等权更抗跌也可能源于规模和行业差异,并不能直接推导等权更优;对机构,借券、冲击和风险预算都可能让漂亮长期曲线无法实现。

最大限制

方差回看长度、缩放估计时点、退市及融资借券成本未完整披露。原文将2026集中度解释为主要原因,但没有给出逐股归因;因子择时可能减损亦只是引述另文,不能当作本策略已验证改进。

复现与研究价值

用同一股票池并排报告等权、市值权重、beta中性及波动中性四组合,分解行业、规模与少数头部贡献,再加历史可借券约束。保持两腿实际杠杆和净资金收益透明,尚未执行。

原文与核查

文章正文已解析;Factor Tracker底层数据及引用学术论文未逐篇核验。

原始文章 ↗

推荐 74/100 · 问题 26/30 · 证据 20/30 · 方法 20/25 · 复现 8/15

权重对照很有价值,但高长期收益须补齐杠杆、成本与因子定义。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / podcast_transcript

Why I stopped trying to predict the market

Podcast: Why I stopped trying to predict the market

Quant Beckman、House of Quants

一句话先讲结论

相比预测经济变量和市场方向,识别机构因 mandate、合约、风险限额或运营约束而必须执行的行为,更可能形成可交易的结构性预测。

它到底在问什么?

为什么长期市场预测经常失效,研究者应如何寻找可持续且可证伪的结构性低效?

作者具体怎么做?

  1. 区分新基本面信息驱动的价格变化与机构被迫交易驱动的结构性变化
  2. 从规则手册、监管披露、清算规格、执行窗口和订单簿研究强制交易假设
  3. 以执行延迟、宽点差、交易成本、流动性消失、容量和不利市场状态主动摧毁策略
  4. 上线后监测滑点、成交率、执行模式和机制是否衰减,并设定模型退役条件

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:该框架把研究对象从‘市场会涨跌吗’转换为‘谁在什么规则下必须交易’,更便于写出可证伪机制。

最大限制

播客没有给出可复算数据、参数、代码、交易成本数值或OOS绩效;不能据此证明具体结构策略有效。

复现与研究价值

选择一个有公开规则与时间表的强制交易事件,建立点时订单/成交数据,预注册方向、窗口、容量和成本,再做延迟、流动性、容量和机制衰减测试。

原文与核查

public_full_transcript

原始文章 ↗

推荐 76/100 · 问题 28/30 · 证据 17/30 · 方法 22/25 · 复现 9/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 宏观行业轮动

月末四象限只持一个ETF:2003—2026作者报CAGR23.5%、Sharpe1.41、月频回撤−16.2%,但日频实际波动约19%、回撤−23.6%,且走步参数选择Sharpe降至0.902甚至0.668

The Inflation Compass Model

David Varadi

一句话先讲结论

一句话先讲结论:Inflation Compass以SPY相对200日均线判增长、5年breakeven高于2%且上升/行业相对强势判通胀,月末在XLE、XLK、XLU或50/50 XLP+IEF间全仓切换;作者报2003—2026年CAGR23.5%、Sharpe1.41、月频最大回撤−16.2%,远胜SPY的11.6%/0.80/−50.8%。但作者随后承认日频重算约19%波动、−23.6%回撤;外部评论者走步选择参数Sharpe仅0.902、连同象限选择仅0.668,对照SPY 0.663。可读结论是经济象限值得研究,超高原始回测却不能直接当可部署收益。

它到底在问什么?

能否用市场隐含通胀(5年breakeven)和增长趋势在月末判断四类宏观状态,并只持有最适合该状态的行业/债券ETF来降低股债同跌风险?

作者具体怎么做?

  1. 月末用SPY/200日SMA决定增长方向,T5YIE相对2%锚和60日变化、加行业相对强弱决定通胀状态。
  2. 四个状态只持一个高流动性ETF或防御性50/50组合,持有到下月末,以避免日频噪声但带来月末执行依赖。
  3. 对2%阈值、40/60/80日窗口和100—252日增长均线做敏感性表,并估算10/20bp每次切换成本及一天延迟。
  4. 以当月实现CPI分桶检验机制,并在评论区回应独立检验:同参数等权组合、走步参数/地图选择、月频对日频风险口径和2003年前代理测试。

关键结果

原文结果与口径
核对项结果意味着什么
原始月频绩效Compass/SPY:CAGR23.5%/11.6%,Sharpe1.41/0.80,MDD−16.2%/−50.8%极强结果来自单一行业轮动,不能与多资产均衡组合直接比较;月度采样会低估持有期内风险。
日频口径修正作者承认日频约19%波动、MDD−23.6%比月频表更接近真实风险预算,仍需用可执行月末成交价和ETF历史重算。
成本与延迟10/20bp每次切换CAGR23.5%→23.1%/22.8%;整日延迟后18.7%、Sharpe1.15低周转使费用不大,但一天延迟损失4.8pct CAGR,显示结果对月末信息/成交时间高度敏感。
参数敏感性手动网格Sharpe约1.2—1.5;等权全参数网格Sharpe1.37对基准1.41无单一尖峰是积极证据,但不等于避免了规则、资产映射和样本期选择。
外部走步反例读者报告走步阈值/窗口Sharpe0.902;连同四格地图0.668,SPY0.663若需通过历史不断选择配置,优势几乎消失;作者也接受等权参数集成优于选择的解释。

怎么理解?

这是一篇罕见的自我修正型策略帖:原文把超高收益和经济叙事写得很强,评论区却暴露了两个真正要害——月频风险压缩与选择规则不稳定。值得保留的核是“2%锚+价格状态”的简单经济假设;不应保留的是单ETF全仓和用同一历史同时证明参数、象限资产映射与样本外。最终产品更适合作为多资产风险预算/行业覆盖的一个信号,而非替代核心权益。

最大限制

2003起样本仅约280个月,包含科技与能源两次异常强领导;XLE/XLK选择可后见,T5YIE混入流动性、风险溢价,公允的通胀swap历史难取得。单一持仓导致15.5%跟踪误差、最差三年相对落后−27%;现代公用事业通胀敏感性也可能与70年代不同。

复现与研究价值

用公布后下一个可成交价、日频净值、真实ETF股利和10/20/50bp成本独立复跑;预先固定2%阈值与资产篮子,或以等权参数/资产映射集成替代走步挑赢家。添加固定60/40、风险平价、12月动量、同波动行业轮动对照,并分离2003—12、2013—18、2019—26;把T5YIE替换为通胀swap/调查预期进行机制消融。

原文与核查

公开全文与评论区完整阅读;作者及评论者回测未独立复跑。

原始文章 ↗

推荐 87/100 · 问题 28/30 · 证据 25/30 · 方法 22/25 · 复现 12/15

规则、数据代理、成本、延迟、敏感性和反例讨论均公开,研究可操作;但原始收益极强且有走步选择失效,代码和独立复跑仍缺失。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / strategy_research_article

Crafting a Trading Strategy

Crafting a Trading Strategy

Dr. Sebastian Schmidt

一句话先讲结论

策略由经济逻辑、信号诊断、统计验证、执行鲁棒性和组合整合中的小改进构成,而非一次性发现。

它到底在问什么?

如何从第一性原理构建可交易的跨资产趋势期货系统,并控制过拟合、未来函数和实现风险?

作者具体怎么做?

  1. economic rationale:信息渐进进入价格、资本渐进再配置
  2. signal design:EWMA趋势差、波动率归一化、fast≤150日且slow=4×fast
  3. signal analysis:先检查跨资产分布、5–95%区间、尖峰、平滑性和burn-in,不先看收益
  4. statistical validation:成本、延迟0–5日、walk-forward、时间稳定、显著性和收益模拟
  5. portfolio integration:趋势/均值回归固定60%/40%并检查相关性

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

先写经济机制再限定参数;信号诊断、成本、滚动、延迟和基础设施都属于策略定义,而非事后补充。

最大限制

原站反爬导致图表和代码无法完整抓取;连续合约、成本模型、数据质量和非平稳性仍是复现风险。

复现与研究价值

取得原文图表/代码,重建1975至今连续期货与EWMA/vol/burn-in,做信号分布审计、延迟和成本冲击、walk-forward及组合相关性。

原文与核查

public_indexed_text_cloudflare_on_direct

原始文章 ↗

推荐 86/100 · 问题 28/30 · 证据 25/30 · 方法 23/25 · 复现 10/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 情绪与资产配置

经理—散户股票仓位差做月度配仓:年化9.19%低于SPY的11.31%,但波动8.92%对15.31%、月度回撤13.3%对50.8%;优势主要是少持股票而非已证明的择时alpha

The NAAIM-AAII Equities Allocation Spread: Smart Money Relative Sentiment Indicator

Portfolio Optimizer;引用Kevin Zatloukal、Ray Micaletti

一句话先讲结论

一句话先讲结论:把26周平滑的NAAIM主动经理股票仓位减去2个月平滑的AAII散户股票仓位,并将该差的历史分位数直接作为SPY权重,作者报告2006年7月至2026年6月CAGR 9.19%、Sharpe 1.03、月度最大回撤13.30%,对比满仓SPY的11.31%、0.78、50.80%;但策略平均只有64%股票,未和固定64/36或同波动SPY比较。因此它更像一个低波动权益降仓规则,尚不能把0.25的Sharpe差直接称为“聪明钱择时”。

它到底在问什么?

主动经理相对散户的实际股票配置差,能否在不使用主观情绪文本的情况下形成可执行的美国权益月度风险预算?

作者具体怎么做?

  1. 以最后一周NAAIM读数匹配同月AAII股票配置,避免把月内未来的周度调查并入已知信息。
  2. 分别用26周与2个月移动平均缓和两个调查频率、波动幅度不同造成的频繁翻转。
  3. 计算相对仓位差S=NAAIM平滑值−AAII平滑值,并仅用当期及以前的S生成其历史百分位r。
  4. 月度持有r% SPY和(1−r)% SHY;以CAGR、波动、Sharpe和月度回撤与100% SPY比较,并讨论此前二元持仓版本。

关键结果

原文结果与口径
核对项结果意味着什么
策略与满仓权益策略/SPY:CAGR 9.19%/11.31%,年化波动8.92%/15.31%,Sharpe 1.03/0.78,月度MDD13.30%/50.80%风险调整指标改善很大,但绝对收益较低,且比较对象承担了约56%更多平均股票风险。
平均风险预算平均股票权重64%最直接的替代对照应是固定64% SPY+36% SHY、同波动SPY,以及不含相对情绪的简单移动平均规则;原文未报告。
原始二元规则作者转述Zatloukal:自2007年中起年化领先SPY约0.7pct,最大回撤21%对56%二元规则与分位数连续权重并非同一策略;不可将两组数字混为一个样本外证据。
频率错配NAAIM 2007-08-29至09-05一周−2.11→39.63;AAII 2003-05至06月51.8→64.0周度经理仓位远比月度散户配置跳动,平滑是实现选择而非中性处理,会影响信号的有效延迟和风险暴露。
可交易性提示AAII在下月首个工作日发布;作者称滞后1—2日对结果影响不大这是待复核的关键主张,不能用无滞后月末净值直接接受。

怎么理解?

这篇的好处是信号定义透明,也诚实点出了调查发布滞后;但最重要的解释必须收紧:从100%股票降到平均64%股票,本来就会降低波动和回撤。相对情绪是否提供增量,应在相同平均股票暴露、相同波动与同样的债券/现金替代中比较。另一个实务问题是两份调查都来自自选受访人:NAAIM并非全部机构资金的资产加权仓位,AAII也不是全体散户账户,指标更适合作为慢变量的风险覆盖层,而非独立预测模型。

最大限制

样本从2006年开始且包含一次长牛市与数次危机,月度点位很少;26周/2月平滑、历史分位数、SPY/SHY代理和全历史扩张归一化均是设计选择。原文没有交易成本、税费、再平衡阈值、调查修订与完整数据可得时间的可复核记录;月度最大回撤会低估月内尾部风险。

复现与研究价值

下载并版本化两项调查每次网页发布时间,采用“公布后下一交易日收盘”成交;复现连续权重后加入固定64/36、同波动SPY、60/40、12月动量和仅NAAIM/仅AAII对照。用日频价格重算回撤,按2006—15/2016—20/2021—26滚动样本检验;若相对指标仅通过减少beta改善Sharpe,应把它定位为风险预算而非市场方向alpha。

原文与核查

公开全文完整阅读;作者回测未独立复跑。

原始文章 ↗

推荐 75/100 · 问题 23/30 · 证据 22/30 · 方法 20/25 · 复现 10/15

调查定义、时间匹配与持仓规则透明,适合作为低频配置候选;但关键同风险对照、完整可得时间和独立代码均缺失,且绝对收益未胜满仓权益。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 工作论文

不要只给策略一个分数,但“熊市机器学习更好”在这里是事后解释,不是择时模型

GAMLSS/ZAGA: Conditional IR* Distribution For Trading Strategies

Krzysztof Ozimek

一句话先讲结论

作者将标普 2002—2025 年分成 146 个前推测试窗:SVM 策略的调整信息比率为零的窗口占47.9%,买入持有为26.7%。进一步拟合条件分布后,SVM在低动量状态占优、强牛市则买入持有更好;但这里的“状态”用测试窗内部已经实现的涨跌和波动定义,因此不能直接拿来决定下一期选哪种策略。

它到底在问什么?

两个策略的长期平均分数可能相近,失败频率、成绩离散度与状态依赖却不同;能否评价整个分布而非只排一个夏普?

作者具体怎么做?

  1. 训练160个交易日、测试40日、每次前移40日;特征和归一化只用训练数据,输出多/空/现金。
  2. 每个测试窗形成IR*,两策略合并292行;用含零点质量的Gamma混合分布,分别解释位置、尺度与零概率。
  3. 解释变量是同一测试窗的已实现波动和累计涨跌,不是窗开始前已知状态;因此当前用途是归因和诊断。
  4. 模型在六个波动/动量配对点比较分布,报告低动量下主动策略相对较好,高动量下买入持有占优;主动策略多数状态的指标方差更大。

关键结果

原文结果与口径
核对项结果意味着什么
IR*=0的窗口47.9% vs26.7%是自定义指标零质量,不应直接称亏损概率或胜率。
独立测试窗146×40日相邻训练窗重叠,两个策略同窗也相关,292行不等于292独立实验。
全部交易成本未计入比较是毛结果,不支持可部署策略排序。

怎么理解?

从单点升级到分布是正确方向,但应先问分布里的随机变量是否保留自己关心的经济信息。把所有负收益折叠成零,既能形成适合ZAGA的形状,也会让严重尾部损失在指标上消失;最好同时展示原始损益和回撤分布。 还有两层推断不能跳过:事后状态解释不是实时预测;固定拟合参数生成大量模拟,也不能代替对参数估计和模型选择不确定性的重估。论文称模拟比例为p值,但若未在原假设下重新校准,不能直接按经典假设检验读其0或1。

最大限制

单一指数、单类模型、未扣成本;同窗状态与指标机械相关。分位数配对可能构成历史上少见的联合状态,近完全分离导致部分统计量退化;PDF截图工具失败,表格按完整文字读取。

复现与研究价值

先把评估层用于已有策略诊断,另设滚动训练的下一期状态预测层;比较真实损益分布与IR*结果,使用配对区块重采样并在每轮重新拟合分布,检验结论是否稳健。

原文与核查

作者说明及arXiv论文正文、结果、结论完整读取,未重跑R代码。

原始文章 ↗

原论文全文(arXiv)

版本与摘要

推荐 82/100 · 问题 26/30 · 证据 23/30 · 方法 22/25 · 复现 11/15

条件分布视角有用,指标截断与事后状态要求明确使用边界。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 策略复现与研究纠错

网络动量最初回测的2.12毛夏普,删去12个异时区期货后降至0.97,且低于同期个体动量1.07:看似+1.0 Sharpe的网络溢价主要是收盘时点前视

Network Momentum

Quantitativo;原研究Pu、Roberts、Dong、Zohren

一句话先讲结论

一句话先讲结论:作者最初用60个连续期货复现图网络动量(GMOM)得到毛Sharpe 2.12、显著高于个体动量回归1.13;但读者指出不同市场的“日收盘”不是同时发生后,作者把12个非美国时段合约从特征、图学习和回归的全流程剔除,GMOM降至0.97、个体动量为1.07,原先约+1.0 Sharpe的网络增益消失。原因是美国收盘已知信息被拿去预测亚洲/欧洲那段在墙钟时间上已部分发生的“下一日收盘”收益;这是一篇比初始高Sharpe更值得读的复现纠错案例。

它到底在问什么?

仅以日频连续期货价格学习跨资产网络,再把邻居的动量传播给目标资产,能否产生独立于经典时间序列动量的、可在真实收盘时点交易的预测增益?

作者具体怎么做?

  1. 以连续期货的比率调整指数计算1日、1/3/6/12月波动调整收益和三组MACD,避免换月跳空被误当收益。
  2. 在每个时点按资产特征轨迹相似度求稀疏非负邻接矩阵,平均五个252—1260日窗口并度数标准化。
  3. 用邻居加权特征预测下一日波动调整收益,与只使用自身特征的LinReg、MACD和多头基准共用组合代码。
  4. 初版做成本、参数、随机图placebo与年度分解;读者提出时区异步后,进一步按交易所结算时间做P&L分解、方向性lead-lag检验,再以48个同步合约从头重跑。

关键结果

原文结果与口径
核对项结果意味着什么
初版表面结果GMOM毛Sharpe 2.12,LinReg 1.13;GMOM最大回撤约−18%同管线比较看上去图层新增约+1.0 Sharpe,但这是修正前结果,不能再作为可交易结论。
时区暴露的直接证据12个非美国时段腿单独Sharpe约4.4,48个美国时段腿仅0.88仅占约五分之一的异时区标的承载了大部分组合表现,模式与正常跨资产分散不相称。
时间方向检验美国当日均值→非美国“次日”平均相关+0.07;反向仅+0.004;美国→美国+0.02预测力随收盘先后而非经济关系变化,是异步close-to-close标签污染的指纹。
全流程同步化重跑GMOM 2.12→0.97;LinReg 1.13→1.07网络相对个体动量的增量消失;前视偏差定位在邻居信息传播,而非单资产信号。
成本与平滑(修正前诊断)2日EWM令换手1.46→1.03、毛Sharpe2.10→1.97这说明原信号很快且成本敏感,但不能修复时间戳错误;任何在污染标签上完成的成本/参数稳健性都不构成有效验证。

怎么理解?

研究价值不在于“图模型失败”,而在于展示了为什么常规稳健性检查可能全漏掉同一个数据时间轴错误:随机图placebo、参数平台、walk-forward、成本扫点都复用了同一份按日期而非按可得时刻对齐的数据。日频跨市场研究不能把“同一天”当成同步信息集;若不能取得统一可交易cutoff与逐资产可得时间,cross-asset特征应默认疑似泄露。该文也提供了一个很好的编辑规范:作者在读者提出反例后公开复跑并撤回核心解释,最终修正比最初高收益更有参考价值。

最大限制

修正后的0.97与1.07仍来自同一作者的数据、合约拼接、超参数和实施选择,未独立复现;剔除异时区合约是保守但粗粒度的处理,会同时丢失真实且可执行的跨时区信息。要检验网络动量是否有剩余价值,应使用UTC时间戳、各交易所实际收盘/可下单时点和不重叠的目标区间,而非仅比较日历日close。

复现与研究价值

复现时为每个合约建立“信息可得时间—下单时间—收益计量区间”三列表,所有邻居特征只允许早于目标下单时刻;用统一UTC cutoff或对每个市场定义可成交的next-session收益。先复现48个同步宇宙的GMOM/LinReg差,再逐个加入异时区标的并把美国信息滞后一日,检验任何增量是否仍为正;同时报告按时区、资产类和结算时差分组的P&L。

原文与核查

公开全文完整阅读;原始与修正结果均为作者报告,未独立重跑。

原始文章 ↗

推荐 95/100 · 问题 30/30 · 证据 28/30 · 方法 25/25 · 复现 12/15

有明确原始主张、反例、全流程消融和量化修正,且作者公开更正;但数据和代码未公开,修正后策略仍需独立时间戳级复现。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读解析

直接学排序能改善选篮子,但3.40夏普降到0.54不能全怪交易成本

Momentum Is a Ranking Problem: Learning-to-Rank vs Regress-then-Rank

Ali H. Askar;原研究Tom Burdorf

一句话先讲结论

导读引用的股票指数实验里,LambdaMART日频毛夏普3.40、MLP为3.08;改周频后分别只有0.54和0.64,排序模型优势反转。它支持“直接优化排序值得测试”,却没有证明提升来自损失函数本身,也没有证明周频0.54已是可交易净收益。

它到底在问什么?

组合只买前三、卖后三,训练模型却要求每个资产收益预测准确,目标是否错位?文章引入搜索引擎排序模型,把有限学习能力集中到组合两端。

作者具体怎么做?

  1. 原研究覆盖2000—2023年四类资产,股票为26个指数,另有商品、债券及货币;每侧三资产,63日指数加权波动估计,单资产目标波动15%。
  2. 共同特征包含不同期限归一化收益和MACD。MLP预测次期波动缩放收益,LambdaMART以排序相关性标签训练。
  3. 每五年训练、下一五年应用,训练内90/10验证及提前停止;分别观察日频与周频,不把二者看作同一信号简单加费用。
  4. 报告两端NDCG@3、夏普、回撤,并检查跨资产是否稳定;债券偏好MLP,周频货币甚至随机排序夏普高于学习排序。

关键结果

原文结果与口径
核对项结果意味着什么
股票日频夏普3.40 vs 3.08LambdaMART与MLP,无摩擦研究结果。
股票周频夏普0.54 vs 0.64降频后MLP反而领先,模型结论不是普遍定律。
股票NDCG0.556 vs 0.555两种学习器非常接近,随机0.540;不能用数字大小代替经济显著性。

怎么理解?

日频降到周频至少同时改变信号衰减、样本量、再平衡机会和预测目标,不能把夏普差机械归为“原来全是交易成本”。反过来,只有六个持仓也绝不意味着周频成本可忽略,期货换月、指数可投资映射与空头融资仍要逐项算。 真正干净的实验应在同一个树模型中比较回归损失和排序损失,并保持训练预算与标签一致。NDCG依据离散名次而不是可赚价差:两个回报几乎相同的资产换位可能被重罚,方向正确但极端亏损的空头却可能未被充分处罚。直接学排序更贴近组合,但离直接学净效用仍有一步。

最大限制

原始表格未独立复核,指数筛选有存续偏差,日频无费用。导读末尾债券不等式1.12>1.34明显写错,实际数值应为MLP1.98、JT1.34、LambdaMART1.12。周频数值不是保证下限。

复现与研究价值

先在可实际交易且时点一致的股票池,以同架构回归/排序为对照,加入换手惩罚和行业中性,报告边界换仓的增量净收益;不需要照抄五年训练窗。此处未回测。

原文与核查

导读全文已解析;底层论文已核对摘要,尚未核验完整实验。

原始文章 ↗

Tom Burdorf原论文

推荐 77/100(暂定) · 问题 26/30 · 证据 20/30 · 方法 22/25 · 复现 9/15

排序目标很实用,但原导读对归因和成本存在过度推断。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

给炼油策略加 Carry,价值不只分散:小账户更需要一个不爱交易的信号

Part (3/3) - Refiner Trade: A Second Signal and the Case for Trading Less

Beyond Passive Investing

一句话先讲结论

在裂解价差动量之外加入近月减次月的 Carry,5 万美元账户从每日追仓的净夏普约 0.6,改善到 43% Carry、1% 无交易区下的 1.11,佣金约降至原来的四分之一。亮点是第二信号让组合更少交易,而不只是预测更准;但这些最优权重仍取自历史表面,不能因费用已知就免除样本外检验。

它到底在问什么?

弱一些但更慢、更便宜的信号,是否能在实际账户里比毛收益最好的组合更有价值?

作者具体怎么做?

  1. 将 Carry 水平按截至当时的扩展历史做 z-score,截断 ±2 并映射到 ±1;与动量分数做凸组合,沿用 2% 目标波动及能源 ETF 对冲。
  2. 十分位中最低 Carry 组随后季度约 −2%,最高超过 +12%;Carry 自身动量更弱且与水平相关约 0.7,故不作为第三个独立信号。
  3. Carry 与价格动量分数相关约 0.25;无摩擦最优 Carry 比例约三分之一,但 Carry 越多,换手越低。文中某处称每年 trades,与后文实际订单数口径不同,不混作统一成交次数。
  4. 5 万美元账户同时扫描权重和带宽,较好区间为 Carry 三分之一至一半、带宽约 0.5%—1%;10 万美元展示净夏普 1.20、年化约 2.3%、波动 1.9%、最大回撤 3.2%。

关键结果

原文结果与口径
核对项结果意味着什么
5万美元净夏普约0.6→1.11同时改变信号权重与执行带宽,不能全部归因于 Carry 预测力。
10万美元年化/波动2.3% / 1.9%低风险预算的作者结果,不是高收益套利。
未计股票借贷成本明确未计所谓净收益仍非全部成本后的实盘回报。

怎么理解?

这是成本感知组合的直观例子:互补不止表现为收益相关低,也表现为信号生命周期不同。较慢信号可以抵消快信号的小幅调仓,让账户在同一笔固定费用面前更有耐心。 但正文把调参峰值宽解释为“不是拟合”,仍不够。Carry 权重、无交易区和回测路径共同决定收益,参数平台只能降低尖峰疑虑,不能替代未见数据。扩展标准化亦可能有长期结构变化;Carry 季节性与期货换月规则需要单独处理。

最大限制

继承第二篇收盘信号同收盘成交时序疑问;借券、价差、冲击及现金收益未充分说明。季度收益分组重叠、共同行业风险与历史幸存篮子仍可能夸大稳定性。

复现与研究价值

在下一可执行价格上比较动量、Carry、组合三者;权重和带宽在训练期固定,测试期不按账户结果回调。报告净收益中信号分散、订单减少和风险敞口三项贡献。

原文与核查

全文及两篇前序均已读,未独立回测。

原始文章 ↗

第一篇:产业机制

第二篇:账户成本

推荐 83/100 · 问题 29/30 · 证据 22/30 · 方法 23/25 · 复现 9/15

信号生命周期与固定成本结合有价值,但联合参数和执行验证不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research

Portfolio optimization with macro factors and neural networks

Portfolio optimization with macro factors and neural networks

Rushil Gholkar、Ralph Sueppel

一句话先讲结论

点时宏观因子、时间序列验证和神经网络可直接学习行业权重;加入美国国债后作者报告长期财富接近翻倍,但回测不含交易成本且高度依赖专有数据。

它到底在问什么?

在缺少明确行业理论先验时,能否让神经网络直接从宏观因子和行业收益面板学习组合权重,并避免前视偏差?

作者具体怎么做?

  1. 使用自1992年起的34个美国概念宏观因子作为输入
  2. 训练1—3层、每层8—64单元的MLP,以SoftMax产生多头权重
  3. 按时间序列验证、早停和换手惩罚训练,并按验证表现SoftMax集成候选网络

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

神经网络直接学习宏观状态到行业相对表现和组合权重的非线性映射;直接优化组合目标并集成多个网络,减少单一模型切换噪声。

最大限制

依赖JPMaQS专有点时数据;忽略交易成本;网络网格较小且为节省运行时间每季度重训;候选网络未稳定收敛;行业横截面有限;多空版本需要杠杆、借券和空头交易。

复现与研究价值

取得两个Notebook和数据,复刻34因子、MLP、时间序列验证、Sharpe/收益/多空三种目标;加入ETF交易成本、借券、杠杆,并与线性模型比较。

原文与核查

public-original-read

原始文章 ↗

推荐 85/100 · 问题 27/30 · 证据 25/30 · 方法 23/25 · 复现 10/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 策略分析研究综述

研究综述|2026年7月24日|策略分析

Research Review | 24 July 2026 | Strategy Analytics

James Picerno / The Capital Spectator(综述编辑)

一句话先讲结论

策略信号的失效可能来自会计口径、宏观状态或市场定价分解,而不是因子本身永久消失;研究重点应从静态信号转向可比口径、状态条件和可解释的价格分解。

它到底在问什么?

如何判断估值、动量和宏观因子是否仍然有效,以及市场对美联储政策和通胀的定价变化是否存在结构性状态转换?

作者具体怎么做?

  1. 逐项读取4篇论文的摘要和Capital Spectator编辑Takeaway,提取研究对象、时间状态和核心识别方式。
  2. 将传统估值/动量指标拆分为会计可比性、可预测持续项与意外创新项,并比较不同宏观周期下的条件表现。
  3. 把名义国债重定价进一步分解为实际利率和通胀补偿,检查2022与2023的政策反应构成是否不同。

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

机制含义是一个表面上失效的因子可能被会计口径、宏观风险暴露或状态条件掩盖。估值信号需要历史可比的盈利口径,动量需要区分持续性与冲击创新,因子配置则需要识别承担宏观风险的策略,而债券分析不能只看名义收益率。

最大限制

这是二次综述,不是统一数据集或统一回测;公开页面没有给出四篇论文的完整样本构造、交易成本、表格系数和代码。不同论文的时间区间与识别目标不一致,不能直接把四项结论合并为单一交易策略。

复现与研究价值

逐篇下载原始论文,复建CAPE与CAPE-H、动量持续/创新分解、宏观中心性组合和实际利率/通胀补偿指数;用滚动外样本、状态留出和成本后收益检查综述结论能否迁移到当前样本。

原文与核查

public_full_review_verified

原始文章 ↗

推荐 82/100 · 问题 27/30 · 证据 24/30 · 方法 21/25 · 复现 10/15

公开综述提供4项研究的明确机制、年份和方向性结果,但核心统计量和代码仍在原论文中,因而复现与证据分数保守。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

先改入场还是出场?胜率看止盈止损,样本外表现却主要取决于两者配合

What Should You Change First in a Crypto Backtest? 99.75 Million Tests

Rulyfi

一句话先讲结论

9,975 万个加密回测中,胜率在十个市场方向组全部更受退出规则影响,最大回撤全部更受入场规则影响;但所谓样本外评分的变化,平衡子样本里中位90.8%来自入场×出场交互。不能单独选最佳入场和最佳出场再拼起来,也不能把提高胜率当提高收益。

它到底在问什么?

研究预算应花在换指标、微调周期,还是改止损?先要明确希望改变的是哪个结果,而不是不停追求每项都更好。

作者具体怎么做?

  1. 五种永续、长短分开十组,2021-05-28至2026-07-21小时数据。400种指标周期变化两两配对成79,800入场,乘125种止盈止损存续期,共9,975万格。
  2. 主比较只用76,000种跨指标家族配对;入场和出场敏感度分别除以该组全部结果的IQR,比值<0.8判入场主导、>1.25判出场主导。
  3. 胜率出场/入场敏感度中位约20.8倍,最大回撤和交易数则十组全由入场主导。更换指标家族远大于同指标周期前进一步,两者不应都混叫调入场。
  4. 完整125退出均有效的入场子集上做主效应/交互分解;OOS log-rate proxy交互占79.5%—95.7%,中位90.8%。该分数不是OOS账户收益。

关键结果

原文结果与口径
核对项结果意味着什么
胜率:退出主导10/10组只说明能改变胜率,不说明改善经济价值。
回撤:入场主导10/10组在这个特定参数覆盖宽度下成立,不是普遍因果定律。
OOS交互份额中位90.8%评分方差分解,不是90.8%的收益来自交互。

怎么理解?

最大的用途是给研究流程排序:先确认目标与结构,再细调周期。高维网格常让人误以为每一个参数同等重要,配对差异和交互图能识别哪些动作只是浪费计算。 但敏感度取决于研究者给每个轴多宽的范围。把入场从RSI换成SMA,与止损只挪一档,并非同等干预。主扫描还采用同bar先止盈,保守重放没有重建OOS折,因此90.8%的交互不能声称已通过成交稳健性验证。

最大限制

五币和十方向组仍高度相关;OOS指标为代理值。主扫描有乐观成交,资金费虽纳入,完整实现未独立审计。结果只提供搜索地图,不认证任何盈利策略。

复现与研究价值

在自有策略的小网格中复刻IQR与单变量配对,最后整格验证;用真实OOS净收益替代代理值,并在保守成交下重新计算交互而非只验证胜率。

原文与核查

全文所有表和限制已读,未重跑扫描。

原始文章 ↗

推荐 85/100 · 问题 28/30 · 证据 23/30 · 方法 24/25 · 复现 10/15

结果目标与参数交互拆分实用,设计依赖和OOS口径需警惕。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 机器学习与横截面选股

35国、8万余股票、1994—2024:把ML预测目标从原始收益换成截面rank,月度alpha约1.0%升至1.9%;但小盘/高偏度环境反而应保留幅度信息

Getting the Target Right in Return Prediction

Nusret Cakici、Adam Zaremba;Quantpedia导读

一句话先讲结论

一句话先讲结论:Cakici与Zaremba在35个市场、1994—2024年、逾80,000只股票上比较特征和目标变换,发现改变预测目标比处理特征更重要:用横截面rank/高斯化rank替代原始未来收益时,大盘组合月度alpha约由1.0%升至1.9%,收益与Sharpe大致翻倍;但高离散度、高偏度、小微盘和新兴市场中,rank压扁极端回报信息,去均值/标准化等保留幅度的目标反而更好。因此“rank目标优于raw return”应是以市场状态和组合容量为条件的结论。

它到底在问什么?

做股票横截面ML时,模型究竟应拟合原始未来收益、标准化收益还是未来收益的截面排名;这个看似预处理细节会怎样改变最终多空组合?

作者具体怎么做?

  1. 在全球股票面板中固定ML模型集,分别变换输入特征和未来收益目标,避免把目标处理的效果误归功于模型架构。
  2. 使用raw、去均值、标准化、rank映射和高斯化rank等目标,按预测值构建横截面组合并比较预测准确度与经济收益。
  3. 按市值、等权/市值权、国家及收益分布的离散度和偏度分组,观察rank的鲁棒性与信息压缩成本。
  4. 尝试根据过去表现动态选择目标变换,报告其仅约30—50bp/月的温和增益及相对表现的不稳定。

关键结果

原文结果与口径
核对项结果意味着什么
平均目标选择效应rank目标月度alpha约1.6—1.9%,raw目标约0.9—1.1%量级远大于常见特征微调,说明目标定义属于核心模型设计;具体净收益、交易成本和组合构造需以原文为准。
样本范围35个市场、1994—2024、80,000余股票广覆盖降低单一市场偶然性,但不同国家交易成本、退市处理、可做空性和数据可得性会决定真实可部署性。
rank的机制robustness与排序组合对齐;同时丢失幅度信息rank削弱异常值和异方差的干扰,却会压缩尾部;它优化的是排序,不是收益水平预测。
异质性稳定发达市场/大盘rank更强;新兴、高波动高偏度和小微盘中幅度保留变换更强不能在全市场使用单一标签;选择应以可在当期观测的分布状态和容量约束为依据。
动态挑选按过去表现选择仅增约30—50bp/月,且相对表现不稳定事后选择标签本身会产生新的选择噪声,动态规则需要嵌套样本外验证。

怎么理解?

这篇给金融ML的实际改动非常明确:先问投资组合需要什么排序,再决定训练标签,而不是默认回归下月raw return。rank目标可降低尾部噪声、贴近long-short排序,但不能把所有信号归一化后就忽略大小。一个稳妥的工程方式是并行训练rank与幅度保留目标,把市值、离散度、偏度和流动性作为事前门控变量,而非每月按历史收益追逐“本期最佳标签”。

最大限制

导读未披露所有模型、预测期、调仓、交易成本、delisting处理、shorting约束和统计检验;标题数字可能是毛alpha或特定大盘设置。目标变换改变损失函数的隐含权重,未必在A股/小盘/高换手环境保持;对小微盘的优势也可能不可交易。

复现与研究价值

在目标市场建立同一特征与模型下的raw、z-score、rank、Gaussian-rank四标签试验,冻结所有其他组件;按可交易市值与成本做分组,计算IC、top-bottom净收益、turnover和容量。用仅截至t的离散度/偏度预先决定标签或做软加权集成,采用嵌套walk-forward和SPA/现实检验校正全部标签与门控搜索。

原文与核查

Quantpedia导读完整阅读;SSRN论文未在本站完整取得。

原始文章 ↗

推荐 92/100 · 问题 30/30 · 证据 27/30 · 方法 24/25 · 复现 11/15

问题直接影响所有横截面ML,样本全球且对照系统,结论包含重要的反例条件;但全文/代码未取得,实施成本与原始统计仍需独立验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 算法交易与市场稳定性

HFT 的影响不是单向的:一次交易所基础设施故障显示,低延迟交易被临时阻断后,成交量和笔数只小幅变化,但流动性显著变差、波动中度上升;另一篇公司层面研究则发现算法交易强度更高与未来个股崩盘风险更高相关

Algorithmic Trading, HFT, and Market Stability

Relative Value Arbitrage(Harbourfront Technologies;二手文献综述)

一句话先讲结论

一句话先讲结论:这不是一篇新的实证论文,而是对两项研究的二手综述;其中交易所故障这一自然实验显示,低延迟交易暂时退出时,成交量/笔数仅小幅变化,流动性却显著恶化、波动中度上升,说明HFT基础设施对盘口供给有正向作用;但另一篇公司层面研究又发现算法交易强度越高,未来特质性崩盘风险越高,且在管理层更有动机或能力藏坏消息的公司更强。对量化交易员,正确结论不是“高频有害”或“高频有益”,而是把日常流动性贡献与信息披露/尾部风险这两条机制分开建模。

它到底在问什么?

当低延迟算法交易参与度提高时,它究竟改善还是恶化市场稳定性?这种影响在日常做市流动性与公司层面的尾部崩盘风险之间是否相同?

作者具体怎么做?

  1. 把问题拆为两个层次:市场级的即时流动性/波动,和公司级的未来崩盘风险,避免用一个稳定性指标概括两种机制。
  2. 在交易所基础设施异常中,低延迟交易因技术原因被暂时受限;以故障前后或受影响与未受影响标的为对照,观察交易活动、流动性与波动的变化。
  3. 在公司层面,将算法交易强度与以后期间的特质性崩盘风险相连,并检查管理层隐藏坏消息动机/能力较高时的异质性。
  4. 使用工具变量与SEC 2016 Tick Size Pilot作为识别增强,但需回到原文核实工具定义、第一阶段和排除限制。

关键结果

原文结果与口径
核对项结果意味着什么
低延迟交易退出的交易活动成交量与成交笔数仅小幅变化(综述转述)交易是否发生不等于交易成本不变;仅用量或笔数衡量市场质量会漏掉盘口供给。
低延迟交易退出的市场质量流动性显著恶化,波动中度上升(综述转述)这支持HFT基础设施对日常流动性有正向外溢;但综述未给出点估计、窗口或显著性,不能用于校准交易成本。
公司层面尾部风险算法交易强度较高与未来特质性崩盘风险更高相关(综述转述)可能渠道是短期业绩压力和坏消息延迟披露;这是一项相关/识别研究结论,不是对所有做市活动的因果定论。
异质性管理层更有动机或能力隐藏坏消息时关系更强(综述转述)若原文检验可靠,风险并非均匀分布,可与治理、信息透明度因子交叉。
识别增强公司研究报告IV与SEC 2016 Tick Size Pilot检验工具变量和政策试验可以缓解反向因果,但须审阅原文的工具相关性、排除限制与样本覆盖。

怎么理解?

这组证据最值得量化团队吸收的是“双层风险账本”。执行团队应把低延迟参与者退出当作流动性压力情景:监测有效价差、盘口深度、短时冲击和撤单率,而不是只看成交量。选股或风险团队则可把算法交易暴露视为需与治理、信息不透明度、应计质量和跳空风险共同检验的候选条件,而非独立卖空因子。自然实验对“基础设施—流动性”更有说服力;公司崩盘结论的经济机制和可迁移性仍取决于原始识别。

最大限制

本站阅读的是博文综述,不是两篇原始研究;没有故障日期、交易所、样本数、流动性指标定义、回归系数、标准误或交易成本结果。公司层面“算法交易强度”的测量、崩盘风险定义及IV有效性均未在二手来源中充分展开。不同市场的tick size、做市义务、费率和基础设施不同,不能直接外推到A股。

复现与研究价值

先取得两篇原文,建立证据表:样本、事件窗、因变量、处理定义、点估计、标准误、识别假设与代码可得性。对自身逐笔数据做低延迟供给压力回放:按高/低盘口更新率分组,比较有效价差、深度、短时价格冲击、成交率和尾部滑点;另在股票横截面中,以治理/信息不透明度分层检验算法活动代理变量对未来跳跌、偏度和极端收益的预测力,并采用滚动样本和行业固定效应。

原文与核查

已读公开二手综述;两项被引原始研究待获取全文核验。

原始文章 ↗

推荐 59/100(暂定) · 问题 20/30 · 证据 16/30 · 方法 16/25 · 复现 7/15

议题重要且同时指出流动性与尾部风险的相反方向;但当前条目是二手短综述,缺少原始回归数字、数据和代码。推荐作为原文阅读导航,不宜直接据此形成交易规则。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 策略复现

3.275 Sharpe的FX混沌策略更像一个待审计的研究原型:10年1分钟数据、网格搜Theta、两次重训后样本外仍需独立复现

I Mastered Chaos Theory to Develop a 3.275 Sharpe FX Strategy

QuantInsti

一句话先讲结论

一句话先讲结论:作者用10年1分钟外汇数据复现基于方向变化阈值Theta的三阶段策略,训练2024—2025、测试2025—2026,报告最好的合成CNH/MXN样本外Sharpe超过3;但Theta和决策树都通过网格和交易表现选出,且30条有效曲线中有6个无效符号,3.275首先是需要审计的候选结果,不是已验证alpha。

它到底在问什么?

把价格拆成方向变化和overshoot阶段,能否比固定K线更好地识别外汇反转?重训触发和小决策树是否能跨越市场状态?

作者具体怎么做?

  1. 按论文实现三阶段方向变化、overshoot和反转规则。
  2. 训练期搜索Theta与过滤阈值,并用价格标准差与overshoot持续时间训练二分类器。
  3. 以2024—2025训练、2025—2026测试,另汇总30条有效曲线形成分散组合。

关键结果

原文结果与口径
核对项结果意味着什么
最佳结果FX样本外Sharpe约3.275作者报告的候选结果,未独立复核。
训练/测试2024—2025训练;2025—2026测试有时间切分,但测试期较短。
数据清洗30条有效曲线,6个符号无效资产筛选和数据质量会影响组合结果。
重训机制样本外回撤超过样本内时重训Theta可适应状态,但也增加了模型自由度。

怎么理解?

这篇最值得读的不是‘混沌理论很神奇’,而是它把一套复杂的事件型策略做成了可复现假设:Theta、overshoot、分类器和重训触发都应该单独审计。3.275 Sharpe在1分钟FX上极其醒目,越醒目越要追问交易成本、报价合成、跨市场同步、样本外长度和无效品种处理。作者自己也承认跨regime是关键考验。

最大限制

样本外窗口不足两年;最优Theta和分类器存在搜索自由度;交易成本、延迟、报价质量和6个无效标的处理未完整披露。

复现与研究价值

固定Theta搜索网格与重训规则,使用逐笔可成交报价、点差和延迟重跑;按货币对留一、按波动状态分层,并与简单方向变化基线比较。

原文与核查

公开正文完整阅读;未独立重跑。

原始文章 ↗

推荐 70/100(暂定) · 问题 25/30 · 证据 16/30 · 方法 22/25 · 复现 7/15

研究思路和时间切分清楚,但高Sharpe、短样本和执行细节使证据仍偏初步。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读解析

弱信号需要强收缩,但“Lasso永远输给零”是把渐近理论说过头了

Can Machines Learn Weak Signals? Ridge > Zero > Lasso

Ali H. Askar;原研究Zhouyu Shen、Dacheng Xiu

一句话先讲结论

导读所列股票风险溢价预测,Ridge样本外R²为0.80%,Lasso为−12.19%;但个股截面里两者是0.19%和0.10%,Lasso并没有输给零。正确结论是:弱信号下保留并收缩许多特征通常比激进筛变量更稳,而不是任何数据、任何Lasso都不可能赚钱。

它到底在问什么?

上百个特征,每个都弱,应该挑出少数“最重要”的,还是把所有估计压小后保留?文章介绍一个高维弱信号理论,解释为什么筛选容易把噪声当作强者。

作者具体怎么做?

  1. 原理论研究维数增长、总信号强度趋小的渐近环境,先比较预测风险的一阶极限,再放大高阶差异;零估计一阶最优不等于不存在微小增益。
  2. Ridge的适当惩罚可使相对零基准的高阶误差为负;Lasso在所研究条件下不能取得同类改进。结论依赖假设,不能扩展成有限样本普遍不等式。
  3. 导读汇总六类经济数据;风险溢价、GDP等弱信号任务里Ridge领先,个股920项特征中L2神经网络和Ridge也领先稀疏方法。
  4. 再将个股预测转成十分组多空,比较投资表现。低R²可以支持分散组合,但费用、相关性和组合约束决定预测微优势能留下多少。

关键结果

原文结果与口径
核对项结果意味着什么
风险溢价R²0.80% vs −12.19%Ridge与Lasso,导读转述原表。
个股截面R²0.19% vs 0.10%此任务Lasso也超过零,直接反驳导读开头的绝对化说法。
个股多空夏普Ridge1.64 / L2网络2.13不等于预测R²,也未在此核实净成本口径。

怎么理解?

最重要的洞见不是“世界一定稠密”,而是即便真实有很多零系数,剩下的非零项也可能弱到无法可靠识别。观察到Ridge胜Lasso,不能反推真实因子一定很多;这是把估计困难与经济结构分开。 原导读还有一个容易误导的类比:随机森林不等同于L2惩罚,提升树也不等同于L1,二者之间经验比较不能简单包装成一个普适正则化定理。对时间序列,理论中的K折有效也不自动授权随机打散金融面板;标签重叠、共同时点冲击与预处理都必须留在训练边界以内。

最大限制

84页修订论文未逐页读完,本文解析的是公开导读并核对原摘要;数值暂按导读标注,不冒充完整原表审计。理论条件、风险基准和版本可能影响精确数值。

复现与研究价值

在现有特征管线加入零、历史均值、Ridge、Lasso四基准,用同样时间切分与调参预算,报告预测损失、系数稳定性和净组合表现;先看信号是否弱,再决定是否有必要变量筛选。未执行实验。

原文与核查

导读全文已解析;原论文摘要和修订信息核对,完整证明未审阅。

原始文章 ↗

Can Machines Learn Weak Signals? 原论文

推荐 84/100(暂定) · 问题 28/30 · 证据 22/30 · 方法 24/25 · 复现 10/15

对高维金融预测很重要,须保留理论适用条件并纠正导读夸大。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立回测研究

期货0.73、股票0.42:这不是所有市场公平擂台,而是样本内冠军扫描

Daily Long/Short Trend Following: Parameters, Asset Classes, and Universe Depth

oracle / Delphic Alpha

一句话先讲结论

同一类截面动量扫描中,期货最佳净夏普0.73、加密0.56、股票0.42、外汇0.24;但每个资产池规模都重新挑最优持仓数和再平衡频率,且各市场年份不同。结论应读成“值得从哪些市场继续验证”,而不是期货天然优于股票的严格证明。

它到底在问什么?

策略不好,可能不是换一个指标就能解决,而是资产池给不了足够独立趋势。本文同时观察品种数量与交易频率怎样影响同一套动量排序。

作者具体怎么做?

  1. 均值信号半衰期10/30/120日,除以半衰期32日EWMA波动;每速度截面排名,再以25/50/25混合。
  2. 期货111、币80、股票2,627、外汇79个品种,各按流动性逐渐扩大池;多空各取N只,腿内逆波动配置。
  3. 股票测试每腿5/10/20/50只、10/21/63日再平衡;其他市场测试3/5/7/10只、5/10/15/21日。每池选全样本净夏普冠军。
  4. 费用每单位换手期货5bp、股票3bp、外汇2bp、币5bp;期货09:00ET对齐,收益开到开,极端日收益截断后计算。

关键结果

原文结果与口径
核对项结果意味着什么
期货最佳80品种 / 净夏普0.73样本内挑选结果,并非事前固定80。
加密最佳70币 / 0.56 / 回撤−41%高波动和尾部风险仍明显。
股票最佳0.42,季度调仓不是短期反转普遍压倒股票动量的证明。

怎么理解?

同样搜索流程不保证跨市场排序更可靠:四市场的样本长度、有效自由度、资产相关性和成本误差不同,冠军偏差也不同。特别是外汇79个货币对大量共享基础货币,增加pair不等于增加独立风险源;股票行业与币的市场beta也有类似问题。 原文把期货/币收益裁到±30%、股票±50%,这是很强的数据处理。它可能清除坏点,也可能删除真实崩盘和退市收益,方向不能预先假定。作为研究基准必须逐条解释被裁记录,而不是让统一clip默默修饰净值。流动性选池若使用全样本均量,还会有存续和未来信息偏差。

最大限制

没有独立样本外、每点都优化N与H,各资产时期不同;融资借券、币永续资金费和合约滚动成本未完整覆盖。底层成员时点和截断记录没有披露。

复现与研究价值

在共同年份固定信号与一组仓位规则,使用当时可交易资产池,单独比较池扩展的边际贡献;将真实大跌与坏数据分开处理,保留未截断压力结果。本文没有替用户回测。

原文与核查

已解析文章全文,原始数据与图表数值未独立复核。

原始文章 ↗

推荐 71/100(暂定) · 问题 24/30 · 证据 18/30 · 方法 19/25 · 复现 10/15

参数和费用透明度尚可,但冠军选择和极值裁剪削弱结论。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

193 个 SPY 周三并不足以证明 0DTE“稳定贵13%”:分布假设和尾部更重要

Are 0DTE Straddles Overpriced? We Tested 193 SPY Sessions (2022-2026)

Tomasz Dobrowolski / FlashAlpha

一句话先讲结论

作者取 193 个 SPY 周三,10 点隐含一倍标准差区间覆盖收盘 71.0%,高于正态基准 68.3%;实际绝对涨跌/隐含幅度的中位数为 0.589,低于正态的 0.674。但这只是分布覆盖比较,不是期权净收益;而正文“超出区间25.9%”与“区间内71.0%”不互补,必须先核对数据再接受稳定溢价结论。

它到底在问什么?

到期日跨式收取的权利金是否系统性超过随后实现波动?要区分隐含标准差、跨式盈亏平衡点和卖方实际收益。

作者具体怎么做?

  1. 抽取 2022-07-06 至 2026-04-01 每个有完整数据的周三,193 场;用 10:00 ET 平值跨式报价推算隐含幅度,对照当日 16:00 中间价相对 10 点现价的变动。
  2. 正文中位隐含幅度为现价 0.72%,中位绝对实际变动为 0.37%;另一个比率 0.589 是逐日比值的中位数,不能直接由两个中位数相除替代。
  3. 逐年覆盖率 2022下半年/2023/2024/2025 约69.2%/69.2%/70.0%/71.2%,2026一季度84.6%但只有13场。
  4. 报价用 mid,未计费用滑点;只检验终点不检验日内路径。原文提供 CSV 和付费 API 重播入口,本次未使用账户或购买数据。

关键结果

原文结果与口径
核对项结果意味着什么
区间覆盖71.0% vs 68.3%差约2.7个百分点,193场下不能只看点估计便宣布稳定显著。
绝对幅度比率中位数0.589 vs 0.674约低13%,不是权利金利润率或卖方年化收益。
最大披露尾部8.72% vs 3.51%实际幅度约2.5倍隐含,揭示卖方需要承担非线性尾部。

怎么理解?

文章比只晒胜率好,至少给了明确时点和尾部案例;但它把“真实分布与正态基准不同”直接叫过度定价,逻辑仍缺一环。定价还包含风险补偿,跨式价格对应绝对偏移期望而不直接等于标准差。 正文内外覆盖率相加仅96.9%,后面又写约74%,这种口径冲突不能省略。买保护翼能限制最坏损失,却同时支付保险成本,不能据此断言铁蝶和铁鹰保留同样优势。要推荐交易,必须用真实报价构造每笔可执行损益。

最大限制

周三选择、样本缺失条件、覆盖率不一致和正态映射需核验;未下载逐日CSV,未证实隐含幅度转换。无滑点、费用、风险预算与完整损益分布,不支持裸卖或定义风险组合获利断言。

复现与研究价值

先复核193行的inside/outside互补性,再按实际卖价买价回放跨式及保护翼组合;报告尾部损失、条件收益与置信区间,而非只对比覆盖率。

原文与核查

全文数字表与局限已读,发现一致性问题已保留,尚未审计逐日CSV。

原始文章 ↗

推荐 73/100(暂定) · 问题 25/30 · 证据 17/30 · 方法 20/25 · 复现 11/15

时点和样本清楚、可作为核验练习,口径冲突使稳定溢价结论不可靠。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

RSI 70/30 是价格状态标签,不能自动变成反转预测

Is RSI Overbought a Sell Signal? We Tested 70/30

The Refutation

一句话先讲结论

四种加密资产、六个周期上,RSI(14) 穿越 70/30 后的短期平均收益大多接近零;4 小时“超卖”后,未来 10/20 根反而约跌 1.06%/1.54%。作者的完整交易版本六个留出行情阶段均未通过。证据否定的是固定 70/30 反向交易,不是 RSI 在任何条件下都没有信息。

它到底在问什么?

超买超卖描述过去单边走势,为什么应当意味着接下来反转?文章直接测这个最基础的方向假说。

作者具体怎么做?

  1. BTC、ETH、SOL、XRP 一分钟数据重采样到 5 分钟至 4 小时六档,只记录 RSI(14) 穿入 >70 或 <30 的那根 bar。
  2. 测随后 1、2、3、5、10、20 根的原始前瞻收益;信号可聚集,持有窗口重叠,作者因此不以单个 t 值作为证据。
  3. 快速周期样本数较多,平均移动约 ±0.01%,5 分钟近八千信号的多数格子约零;较慢 4 小时超卖后继续下跌而非反弹。
  4. 交易版本另用 BTC/ETH/BNB,买超卖、空超买,止盈止损在五个行情阶段拟合、留一个测试,轮换六次,所有周期均 0/6 通过。资产菜单前后并不相同。

关键结果

原文结果与口径
核对项结果意味着什么
快速周期前瞻均值约±0.01%多数原始优势不足支付现实往返摩擦。
4小时超卖后10/20根−1.06% / −1.54%提示趋势延续,不可把全表挑一格改成新做空策略。
交易版本留出阶段0/6通过依作者自定门槛;阶段留出不完全等于时间前推。

怎么理解?

优点是先测信号,再让退出规则复杂化。若相对无条件基准没有未来方向增量,就不应把优化止盈止损后的幸运格子归功于 RSI。 但作者“任何退出都无法制造优势”的论断过强:无条件固定期限均值为零,不排除路径条件、波动或状态信息。六阶段留出若训练包含测试期之后的数据,也不是实时可实行的 walk-forward。严谨结论必须限定到测试家族、资产、门槛和回测程序。

最大限制

无完整代码、数据日期和通过阈值;快速样本仍可能相关,跨资产池化会掩盖异质性。未见先验明确、独立验证的状态交互规则。

复现与研究价值

先把同资产同期限基准和重叠窗口聚类做对,固定 RSI 跨越定义,再测试少量事前状态条件;不要从负面表里重新挑一个最漂亮反向格子。

原文与核查

全文与方法脚注已读,未重跑。

原始文章 ↗

推荐 75/100 · 问题 24/30 · 证据 21/30 · 方法 22/25 · 复现 8/15

信号与交易区分有用,但内部验证未完全开放,泛化措辞需收紧。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究周览解析

周览#3:平滑器让年化5.6%变15.9%,但对等权基准优势仅边际显著

Quantitativo weekly #3

Quantitativo

一句话先讲结论

本期最值得看清对照的是行业轮动:换平滑器后年化5.6%变15.9%、夏普0.304变0.820,看似大胜;但简单等权行业组合已有10.6%和0.739,增量t值约1.8。工程改进有价值,却不能把“修好一个弱基准”讲成已经稳定战胜市场。

它到底在问什么?

本期五条线索都在回答何时、怎样使用已有信息,而不是再堆因子。宏观状态、基金持仓、过滤器、宏观日彩票股、统计方向预测,各自面临不同的信息时点与基准问题。

作者具体怎么做?

  1. 异常配置把212个异常分八族,依据宏观状态配置。关键待核查点是状态当时是否可识别,而非后来给历史贴标签。
  2. 基金技能差用强弱基金的持仓因子暴露差预测收益;周览明确主要结果样本内且季报有披露滞后,日收益代理是不同信号。
  3. 行业轮动固定九行业ETF月度单选,用四个市场信号比较六个单边平滑器;Perona-Malik减少状态切换,但对等权基准增益不大。
  4. 彩票股线索研究宏观消息的信息外溢,已找到正确出版商地址;最后ARIMA与随机游走融合报告大盘股9/9方向正确,小样本不能当准确率定律。

关键结果

原文结果与口径
核对项结果意味着什么
平滑后 vs 原信号15.9% vs 5.6%同轮动框架里的处理方式比较。
真正简单基准等权10.6%,夏普0.739新模型夏普0.820的增量远小于标题感受。
基金技能信号HML t=3.99样本内且持仓有时滞,不是实时信号已验证。

怎么理解?

过滤器是模型的一部分,不是中性预处理。既然比较六种,就必须把筛选也放入样本外流程;用了DSR、SPA等名字并不等于结果被自动认证,尤其t约1.8本身提示不确定性。减少切换带来的收益可能来自费用节省,也可能来自错过某些坏交易,需要分开。 基金的强弱分组同样有选择偏差风险:技能分数必须在预测时点以前形成。去掉大流量基金后更强,不足以证明全部收益来自信息而非价格压力。最后“零机器学习”也是宣传标签,ARIMA和随机游走参数依然估计;方法是否叫AI,与是否过拟合没有必然关系。

最大限制

本条为完整周览解析,不是五篇论文全文核验。第一节流动性回报“+1.41变1.79”缺清楚符号,未自行猜测;彩票股周览原链接被读者指出错误,已用正式出版记录替代。

复现与研究价值

优先复核ETF滤波的因果实现和基金披露滞后,再读取全部附录确认样本切分;对彩票事件重建公告后可执行时间,9/9方向结果扩大到跨期盲测后再评价。未执行实验。

原文与核查

周览全文已解析,底层论文未全部全文核验。

原始文章 ↗

When Do Anomalies Deserve Capital?

Factor Timing: Evidence from Mutual Fund Skill

Edge-Preserving Macro-Financial Signal Extraction

彩票股正式论文(纠正链接)

推荐 70/100(暂定) · 问题 26/30 · 证据 16/30 · 方法 22/25 · 复现 6/15

对照和时点教训鲜明,周览式绩效仍须原文核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

MACD 看起来有效,可能是旁边的趋势过滤器在赚钱

MACD: The Indicator Is a Passenger

The Refutation

一句话先讲结论

作者测试 360 项测量、320 个 MACD 变体后,标准交叉系统六个留出阶段全部失败;加入趋势过滤后改善,但在同样高于 200EMA 的时点随机做多,也拿走了几乎全部改善。最有价值的结论不是“MACD 永远无效”,而是组合赚钱时,要证明入场指标比条件随机入场多贡献了什么。

它到底在问什么?

一个包含 MACD、趋势过滤与持仓管理的系统赚钱,怎样分清到底是哪一块在创造收益?

作者具体怎么做?

  1. 作者先写下四项预测,再在主要加密资产多周期测试交叉、柱状图、背离和趋势过滤;只在信号 bar 完成后行动,称已扣现实摩擦并考虑多重试验。
  2. 柱状图拐点在约一年 5 分钟数据有逾 23,000 个测量,六年小时数据约 14,000 个,相对基准增量约零;周线 BTC 仅 16 笔,样本又过少。
  3. 小时看跌背离在全历史一度显著,但在后续 249 日下跌窗口三种资产均亏损,与同样退出的随机空头接近;这是事后精彩单元格未能维持的案例。
  4. 高于 200EMA 的随机多头吸收了多数过滤后改善;内部更复杂状态模型的 MACD 版本六阶段中四阶段盈利,横盘和另一熊市失败,作者仍不接纳。

关键结果

原文结果与口径
核对项结果意味着什么
标准交叉留出通过0/6针对作者网格与验证规则,不等于所有市场 MACD 的数学定理。
内部状态过滤版本4/6盈利盈利阶段不等于通过作者完整验收,也非指标独立贡献。
横盘阶段150笔,单笔−0.33%来自池化交易表,反映过滤器在横盘失效后费用消耗。

怎么理解?

这篇可转成一条很实用的研究规范:每加一项组件都做条件消融。先留住过滤器和退出,只替换入场为随机,再问复杂指标是否优于这个公平对照。否则所谓复杂系统可能只是重复支付交易费用来持有一个简单敞口。 仍需警惕作者把“周期换了符号就不是真实效应”说成普遍规律。短期反转、长期动量完全可能并存;不稳健需要结合经济机制和预设频率判断。内部阈值和状态模型不公开,也使外部无法完全复核其强烈否定语气。

最大限制

测试网格、完整门槛和内部状态过滤器保留在厂商内部;所谓预注册未核实时间戳。阶段轮换可能用到未来时期训练,不是严格实时前推。

复现与研究价值

在自己的市场复制“过滤器+随机入场+相同退出”对照,保留净值、换手和风险匹配;只有增量稳定后才把 MACD 当必要组件,否则直接简化。

原文与核查

全文及所有文字表格已读,未取得内部测试台。

原始文章 ↗

推荐 80/100 · 问题 27/30 · 证据 21/30 · 方法 24/25 · 复现 8/15

条件对照和组件归因很值得借鉴,完整实现透明度不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

融资余额创新高不等于卖点:醒目的历史图,只有三个已完成事件

Margin Debt Is at an All-Time High, What Does That Mean?

Allocate Smartly

一句话先讲结论

把融资余额相对 GDP 的一年变化超过 1% 作为信号,历史三个已完成事件后的 12 个月收益分别为 −0.8%、−13.2%、+23.2%。再加“冲高后回落”条件,18 个月年化均值约 −20.1%,图景更悲观;但只有三轮危机附近样本,而且阈值是看过长期数据后选的,远不足以证明可提前定位市场顶部。

它到底在问什么?

市场杠杆处于极端水平,是可执行的择时信号,还是只能说明潜在脆弱性的背景指标?

作者具体怎么做?

  1. 作者先指出 1990 年代初融资/GDP 序列有结构变化,直接比较全部年份的水平容易用后来的尺度改写当时认知。
  2. 第一版事件定义是一年变化超过 1%,已完成历史事件为 2000-01、2007-06、2021-01;分别计算之后 12、18、24 个月收益,超过一年者年化。
  3. 三个事件的 12 个月收益分化很大,几何平均约 +2.0%;18/24 个月年化均值为 −10.0%/−8.1%。
  4. 第二版要求越过 1% 后出现任意下降,信号移到 2000-04、2007-08、2021-04;12/18/24 个月几何平均为 −7.7%/−20.1%/−9.0%。最新信号后尚未完整走完的窗口保留问号。

关键结果

原文结果与口径
核对项结果意味着什么
原始信号后一年−0.8% / −13.2% / +23.2%同一极端条件并不稳定指向下一年下跌。
加回落条件后的18个月几何平均年化 −20.1%三个事件的描述统计,不能当未来预期收益。
已完成独立周期3 次关键有效样本量是事件,不是月度数据行数。

怎么理解?

文章难得之处是没有把更漂亮的第二张表包装成卖出信号。加一条回落条件很容易事后贴近危机起点,但每加一条都在使用已有事件的信息;只有三次事件时,规则微调的自由度可能比证据还大。 对风险管理仍有意义:杠杆加速可作为压力情景的背景变量,例如提高流动性冲击测试强度。但“脆弱性升高”与“未来某月收益为负”是不同命题。前者可帮助设计风险预算,后者需要独立时点和多周期证据。

最大限制

阈值 1% 与“任意回落”未经真正事前冻结;GDP 修订和融资数据发布时间未做 point-in-time 核验。三次事件的长期持有窗口不能支撑精确置信区间或复杂参数。

复现与研究价值

保留原始发布时点和 GDP 历史版本,预先冻结规则;后续只记录新事件,不继续调到贴合旧峰值。将其作为风险分组变量,与趋势、信用和波动指标比较增量。

原文与核查

全文及两张数字表已读,未重新获取融资/GDP 序列。

原始文章 ↗

推荐 75/100 · 问题 23/30 · 证据 20/30 · 方法 22/25 · 复现 10/15

诚实呈现小样本和事后选阈值,适合校准择时直觉而非直接交易。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立因子回测

因子动量的价值,是旧因子不再齐涨后少买失效者

Timing Equity Factors with Momentum

Concretum Research

一句话先讲结论

15个美股因子等权配置在1985—2005年夏普2.33,因子动量仅1.18;2006—2026年基准降到0.63,动量仍1.18。市值权重版本后段则为0.10对0.82。最有意思的不是择时突然变神,而是始终持有所有已发表因子的优势在后段明显变弱。

它到底在问什么?

已知价值、动量、盈利等因子,并不意味着应该永远同时持有。作者研究能否依据因子近期收益,在因子层面买强卖弱,或按自身趋势翻转方向。

作者具体怎么做?

  1. 使用French月度十分组总收益,统一把已知溢价方向标作D10−D1;各腿用过去12个月对数收益标准差缩放到20%年化波动。
  2. 计算每因子过去12个月复合收益,月末排名,下一月买前三、卖后三,九个中间因子不配。
  3. 另构建时间序列版本,所有因子按各自12个月收益正负决定正向或反向持有;与始终正向持有全因子比较。
  4. 分1985—2005及2006—2026截至5月,分别考察股票腿等权和市值权重;绘图还做各子样本事后波动匹配。

关键结果

原文结果与口径
核对项结果意味着什么
早期等权夏普基准2.33 / 动量1.18做空弱因子可能放弃它仍为正的漂移。
后期等权夏普0.63 / 1.18主动并非明显变强,主要是无条件配置变弱。
后期市值权重0.10 / 0.82在更偏大盘构造下也观察到差别。

怎么理解?

这是用户此前“指数择时”与“个股个券”区别的另一层:这里交易对象是因子组合的历史收益,并没有直接对每只股票重新打分选股。要落地个股,必须把因子权重映射回各股票、合并重叠、处理卖空约束后重新计费,不能直接把学术序列收益当作账户收益。 作者以2006划界解释为发表后衰减,这个经济解释合理,但15个因子的真实发现、发表、数据库可得日期并不一致,统一切点不是严格逐因子发表事件研究。两腿同目标波动也不保证每个因子总波动相同,因为多空腿相关性不同;因此动量排序仍可能混入风险尺度差别。

最大限制

学术组合不能直接买卖,借券与小盘冲击未完整建模。各子期事后匹配波动只适合展示,不是可前瞻交易的缩放规则;现成全套因子与方向选择也含历史筛选。

复现与研究价值

对可投资股票池构造少量明确定义的因子,按实际持仓合并后比较始终持有、只减仓、不做反向和完全翻转四种规则,保持同风险并扣费;不需照搬20年训练窗。尚未执行。

原文与核查

公开研究正文已完整解析,未独立重跑French因子。

原始文章 ↗

推荐 84/100 · 问题 28/30 · 证据 22/30 · 方法 23/25 · 复现 11/15

前后时期及权重对照清晰,适合因子配置研究;执行映射尚需补齐。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 策略方法导读

0.85进、0.55出是教学算例:真正贡献是把进出场阈值拆开

Percentile-Rank Momentum With Hysteresis: Low-Churn Signals

Ali H. Askar;导读Landolfi框架

一句话先讲结论

这篇不是又发现一种动量收益,而是展示怎样避免分数在门槛附近来回交易:教学示例用0.85入场、0.55退出,一段模拟路径由28次翻转降为2次。但这两个数不是证明过的最优参数,文中BTC累计290%—350%也缺成本和基准,最值得移植的是状态机,不是收益曲线。

它到底在问什么?

单阈值信号只要从0.86跌到0.84就平仓,再涨回0.86又买,方向没变却不断交费。能否让仓位记住自己是否已经持有,从而减少不必要的边界交易?

作者具体怎么做?

  1. 对多个期限收益用滞后波动归一化,正收益只和历史正收益比较,负收益绝对值与历史负收益比较。
  2. 用非负、和为一的权重组合各期限百分位,分别形成多空分数;只有越过较高入场线才开仓,跌破较低退出线或触及最长持有期才退出。
  3. 导读列12—60个月训练、1/3/6个月更新及滚动/锚定组合,比较多条walk-forward曲线,而不是只挑一个切分。
  4. BTC曲线累计约290%—350%、ETH约500%—620%,这些都是导读转述白皮书;未展示完整费用、回撤和实际换手明细。

关键结果

原文结果与口径
核对项结果意味着什么
教学门槛进0.85 / 出0.55解释机制的例子,不能包装成作者验证的最优参数。
模拟翻转28 → 2教学路径,不是BTC实际年度交易次数。
BTC曲线区间累计290%—350%同一历史上的切分敏感性,不是独立市场重复验证。

怎么理解?

双阈值会降低换手,也会延迟退出。若市场真正反转,保留仓位可能扩大损失;所以不能单看交易少就判定更优,要在等风险下比较少付的费用与错过的退出。它本质上是用路径依赖换取交易稳定性,不是免费提高预测准确率。 历史百分位也不是无参数:回看多久、历史分布何时重估、同号样本不足怎么办,都决定分数。导读文字先谈波动归一化,公式又用原始收益符号,实施前需明确排名到底基于哪一个。多个验证切分共享大量样本,不能把曲线条数当成独立证据数。

最大限制

白皮书精确参数与费用未核验,导读没有给出可定位原始链接。百分位分布发生漂移时固定门槛可能失灵;最长持有期会叠加另一种换手来源。公司案例不是同行评审结论。

复现与研究价值

在已有策略只改进出场状态机,保持信号、资产和风险规模不变,测试一小组预先规定的门槛间隔,拆分毛收益损失与费用节省;不沿用长训练窗口,不声称已经回测。

原文与核查

已解析公开导读全文,原白皮书参数未核验。

原始文章 ↗

推荐 75/100(暂定) · 问题 26/30 · 证据 16/30 · 方法 23/25 · 复现 10/15

执行规则可直接理解,性能证据仍不够完整。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

同一炼油策略,100 万美元净夏普 1.25,1 万美元却 −1.3:最低佣金改变执行方式

Refiner Trade: From Gross Sharpe to Net

Beyond Passive Investing

一句话先讲结论

沿用毛夏普 1.48 的炼油股策略,每日追踪目标仓位时,100 万美元账户扣佣金后约 1.25,1 万美元却降至 −1.3;加入仓位偏差无交易区后,小账户可回到约 0.4。核心是最低每单佣金惩罚订单数量,而不只是换手金额;但本文“收盘信号同收盘成交没有前视”的说法需要重点质疑。

它到底在问什么?

小资金是否能复制大资金的同一百分比策略?当费用含每单固定下限时,按比例缩小持仓会不会根本改变净收益?

作者具体怎么做?

  1. 作者按每单最低 0.35 美元或每股约 0.0033 美元较高者计费,交易八只炼油股及能源对冲 ETF,整数股处理使小资金离散误差更明显。这里是作者费用假设,不是本解析核实的当前券商报价。
  2. 不设缓冲时,每日紧跟目标,净夏普随账户变小急跌;对 25,000 美元账户约为 0.2,对 10,000 美元约为 −1.3。
  3. 仓位差超过无交易区才调整,小账户较有用区间约净值 1%—1.5%,较大账户可更窄;25,000 美元约改善到 0.9,10,000 美元约 0.4。
  4. 同时扫 EWMA 平滑与无交易区,平滑并未改善,因为减少单量而未充分减少单数,还延迟了短期信息;超过约 50,000 美元时作者报告净夏普约 1—1.25。

关键结果

原文结果与口径
核对项结果意味着什么
每日再平衡:10万美元以上非统一值100万美元约1.25不能把一个账户的净夏普套给所有账户。
1万美元:加无交易区−1.3→约0.4改善来自减少佣金支付频率,未覆盖全部执行成本。
2.5万美元约0.2→0.9仍基于同一历史路径挑选执行设置。

怎么理解?

这篇把成本函数拆得很好。比例费用惩罚成交额,最低佣金惩罚动作次数,适合的降成本控制并不相同;不能机械地把所有信号低通平滑。 然而成本已知不等于执行参数没有过拟合。带宽决定错过哪些行情,最优净夏普仍依赖历史收益路径。更严重的是,若使用最终收盘价算股数和信号,再声称以同一收盘价通过 MOC 成交,通常无法满足真实下单截止时间。必须证明输入在截止前已知,或将成交推迟。

最大限制

所谓净结果仅覆盖声明的佣金与整数股,未完整计入价差、冲击、借券及可能的融资。收盘信号/收盘委托时序未核实,当前结果不能直接称可执行。

复现与研究价值

把信号截点前移到收盘竞价截止前或下一开盘成交,对照净值;执行带宽依据冻结成本模型校准并留样本外。逐笔输出订单数、成交额和每类摩擦,而非只给一条净夏普。

原文与核查

全文及公开评论已读,执行逻辑已审视,未独立重跑。

原始文章 ↗

信号构造原篇

推荐 81/100 · 问题 29/30 · 证据 21/30 · 方法 22/25 · 复现 9/15

最低佣金与平滑的区别重要,但同收盘成交和不完整成本限制很大。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research_review

Two Accounting Anomalies: One May Be Risk, the Other Is Mispricing

Two Accounting Anomalies: One May Be Risk, the Other Is Mispricing

Larry Swedroe、Stephen Penman、Julie Lei Zhu

一句话先讲结论

在Penman-Zhu的跨期资产定价框架下,应计异常更像多期风险暴露,而PEAD仍留下显著alpha、较像错定价;但两者都随样本、市场结构和模型而变化。

它到底在问什么?

应计异常和PEAD究竟是市场未充分反应信息,还是一周期模型遗漏的理性多期风险?

作者具体怎么做?

  1. 用市场组合与会计信息基本面对冲因子建立两因子模型
  2. 按earnings-to-price、accruals、momentum、PEAD/SUE、revenue surprise和analyst revisions分组
  3. 检查各分组市场beta、对冲因子暴露和alpha是否被解释
  4. 比较跨期模型下的风险解释与PEAD残余alpha,并结合后续文献检验衰减

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

作者报告:应计异常在其跨期模型中是风险,PEAD更像错定价。编辑判断:这是模型依赖的解释,不是对‘真实经济来源’的最终裁决;需将衰减和交易成本纳入投资结论。

最大限制

这是对单篇论文的评论而非原始代码复现;两因子设定、样本窗口和异常定义可能决定结论,外部研究对PEAD/应计持续性存在冲突。

复现与研究价值

获取Penman-Zhu论文与数据,重建对冲因子和分组alpha;做跨期/一周期模型、子样本、规模、交易成本和公告时点的点时检验,并追踪现代市场衰减。

原文与核查

public_full_reprint

原始文章 ↗

推荐 86/100 · 问题 28/30 · 证据 26/30 · 方法 22/25 · 复现 10/15

正文给出样本、模型和多项结论,证据较完整;但属于评论转载,未提供可直接运行的代码和原始数据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / AI论文导读解析

CryptoMamba的262美元终值,首先要和同一年的买入持有比较

State-Space Models for Price: CryptoMamba vs Transformers (Skeptical)

Ali H. Askar;原研究Sepehri等

一句话先讲结论

CryptoMamba用14天OHLCV预测BTC次日价格,导读转述测试MAPE2.034%、最强交易规则把100美元变262.78美元。但测试约350个日样本、仅一个随机种子,原实验缺简单价格延续和买入持有基准。可保留的判断是模型紧凑,不是已证明有稳定交易Alpha。

它到底在问什么?

新序列架构预测价格线很贴合,是否就能赚钱?问题在于今天价格已包含绝大部分明天价格水平,学习价格水平与预测下一天变动完全不是同一难度。

作者具体怎么做?

  1. 选择性状态空间模型把历史压进隐状态,再由输入决定部分记忆更新与读取;它不是简单把传统Kalman滤波换名字,输入依赖让系统更灵活。
  2. 原研究输入14日OHLCV,预测下一日收盘;导读比较LSTM、GRU、iTransformer和S-Mamba等架构。
  3. 测试段2023年9月至2024年9月,约350个可预测日;报告价格误差以及Vanilla、Smart、Extended Smart三种交易映射。
  4. 最强规则允许一定BTC空头,导读列终值262.78美元、最大回撤11.09%;Smart仅213.20美元,说明最终业绩同时依赖仓位规则。

关键结果

原文结果与口径
核对项结果意味着什么
参数规模约13.6万相对S-Mamba33万更小,是工程效率证据。
价格误差MAPE2.034%不直接测量方向与可交易价差。
交易规则敏感性262.78 vs 213.20美元同架构两种映射差别很大,不能把所有收益归于模型。

怎么理解?

导读的质疑方向正确,但也不该拿未跑过的基准宣布模型无效。它用价格路径估出被动225美元,却未严格对齐预测起始日、现金比例、空头杠杆与成本;因此只能提出待检验问题。原文MAPE分母是实际价格,naive误差严格说为|Pt−Pt−1|/|Pt|,并非通常以Pt−1为分母的绝对收益,二者只在变动很小时近似。 验证集和测试集排名颠倒说明估计不稳定,却不能单独证明没有技能。同理1598与1651的RMSE差是否显著,要用同日成对误差和时间依赖检验,不能凭肉眼说“肯定在噪声里”。严谨解析应把证据不足与反证区分开,而不是把研究审计写成先验否定复杂模型。

最大限制

日频单资产单年份、一次种子不足以确定架构优势;原交易费用与杠杆明细未核验。线性序列复杂度的优点在仅14步输入上未必重要,训练时间也依赖硬件实现。

复现与研究价值

固定完全一致的时间和持仓约束,补naive价格、线性收益回归与买入持有,重复多种子并逐年滚动,最后比较净收益与尾部损失。此处未实际训练或回测。

原文与核查

导读全文已解析,原论文实验未完整核验。

原始文章 ↗

CryptoMamba原论文

推荐 72/100(暂定) · 问题 25/30 · 证据 18/30 · 方法 21/25 · 复现 8/15

很好的价格预测基准审计教材,尚不能认定交易优势成立或不成立。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / podcast_transcript

How quants separate edge from noise

How quants separate edge from noise

Quant Beckman、House of Quants

一句话先讲结论

可信策略必须同时通过数据完整性、现实执行、跨状态稳健性、统计检验和反证压力测试,而不是凭一项回测指标。

它到底在问什么?

如何区分持续性信息优势、随机噪声、短期异常和由数据错误制造的假策略?

作者具体怎么做?

  1. 从经济学、行为金融、市场微观结构或另类数据提出具体、可测量、可证伪假设
  2. 在看结果前固定方法和成功标准,主动防止确认偏误、叙事谬误、曲线拟合和移动门槛
  3. 用点时/无泄漏数据和现实成本、滑点、融资、流动性、冲击与仓位规则测试
  4. 使用OOS、walk-forward、purged cross-validation、bootstrap、多重检验校正和Deflated Sharpe Ratio
  5. 要求策略跨不同市场状态并经反复反证后仍存活

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:节目最可复用的贡献是把‘发现alpha’改写为一套可审计的失败模式清单;它不提供新的可交易信号。

最大限制

播客未提供具体数据、代码、样本和收益数值;无法单凭文字稿评估某一方法的统计功效,也不能据此推断其在不同资产、频率或成本假设下仍然有效。

复现与研究价值

为目标策略建立数据血缘和泄漏检查,预注册成功标准;依次运行现实成本、OOS/walk-forward、purged CV、bootstrap、DSR和多重检验。

原文与核查

public_full_transcript

原始文章 ↗

推荐 81/100 · 问题 29/30 · 证据 18/30 · 方法 24/25 · 复现 10/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

这篇不是‘AI已经找到alpha’,而是提出把LLM当成假设发现器:真正的检验仍要靠结构化因子、样本外和成本审计

Can AI Do Financial Research?

QuantPedia / SSRN论文导读

一句话先讲结论

一句话先讲结论:这篇导读指向的SSRN论文研究的是‘LLM能否帮助发现资产定价假设’,而不是让模型直接选股;公开页面没有提供足够的论文全文结果表,因此当前只能把它作为研究流程假说,不能把‘AI做金融研究’当成已证实的超额收益。

它到底在问什么?

LLM能否把文本、经济叙事和已有文献转成可检验的资产定价假设,并在避免重复已知因子的前提下产生增量信息?

作者具体怎么做?

  1. 用LLM从文献和文本提出候选机制。
  2. 把自然语言转成变量、时间戳和形成/持有规则。
  3. 用预先锁定的样本外、因子分解、交易成本和多重检验校正判断是否有增量。

关键结果

原文结果与口径
核对项结果意味着什么
研究对象假设发现流程,而非直接选股不能把模型生成候选等同于获得alpha。
必需转换叙事→变量→形成/持有规则任何一步不明确都无法复现。
必需验证样本外、因子控制、成本、多重检验LLM的语言能力不会替代统计检验。

怎么理解?

这篇导读的正确位置是AI研究方法,而不是策略推荐。LLM最有价值的环节可能是扩大假设空间、整理文献和把模糊叙事变成可审计卡片;最危险的环节是模型把熟悉的市场故事包装成新因子,研究者再反复优化。由于当前没有完整论文结果表,我不补写任何收益率或显著性数字。

最大限制

公开导读未展开完整论文,原论文结果、数据、代码和样本外口径未核验;不能作为效果结论。

复现与研究价值

取得论文全文后逐表补齐变量、样本、因子回归、样本外和成本;在此之前只作为AI研究流程参考,不给策略推荐分。

原文与核查

公开导读完整阅读;原论文全文未取得。

原始文章 ↗

推荐 58/100(暂定) · 问题 24/30 · 证据 10/30 · 方法 21/25 · 复现 3/15

研究问题重要,但当前证据只有导读和论文入口,不能做效果判断。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

新闻 AI 的漂亮收益怎样消失:补齐回报、修正并列排序后,次日信号不再成立

The Mechanism Survives, the Magnitude Doesn’t

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

作者审计约 850 只股票的新闻管线后,发现旧次日收益列只覆盖约半数信号日,周末还有人为零收益;补齐数据并去除十分位并列排序问题后,Claude 次日正负组差从前窗口 +0.200% 到后窗口 −0.108%,置信区间都跨零。仍然显著的是同日 +1.98% 和 +1.20%——新闻与涨跌一起出现,不等于新闻能预测下一天。

它到底在问什么?

早期情绪模型看起来有收益,是模型真正识别了未来信息,还是收益对齐、新闻归属和统计量实现共同制造了幻觉?

作者具体怎么做?

  1. 前窗口 2026-05-15 至 06-28 有 863 个代码、24,329 个股票日;后窗口 06-26 至 07-12 有 846 个代码、每模型 8,454 个股票日,但只含 10 个已实现次日交易日,不能把面板行数当独立时间样本。
  2. 6 月 26 日加入新闻主体相关性门,修正代码歧义与误归属;同时补齐因夜间作业早于次日收盘造成的收益缺失、周末前填和少数串股报价。前后窗口既变时间也变新闻总体,作者不把未复制称为反转。
  3. 旧分位差仅改并列顺序,就能在 +0.098% 与 +0.354% 间变化;改用 sign spread 后,前窗口 Claude/FinBERT/hybrid 为 +0.200%/+0.050%/+0.259%,所有次日区间与两两差都跨零。
  4. 各做 1,000 次置换:同日打乱股票归属破坏公司对应;同股打乱日期破坏时序。真实同日关系超过置换,次日关系则可由股票构成重现,后窗口多数垃圾信号反而更强。

关键结果

原文结果与口径
核对项结果意味着什么
Claude 次日收益差+0.200% / −0.108%前后窗口均不显著,亦非可直接执行的组合收益。
Claude 同日收益差+1.98% / +1.20%关系显著但时序不证明预测;可能是报道已经发生的行情。
FinBERT 中性池正/负漏检1.74:1 / 1.95:1相对 Claude 催化标签的非对称遗漏稳定,不是独立人工真值准确率。

怎么理解?

这篇最值得量化研究员读,不是因为给出新因子,而是把错误测量本身公开成可复用的检查。置换不能只用于显著性检验,还能逼真实样本和假样本通过同一代码,从而发现统计量实现不稳定。 同时要守住作者更正后的边界:小模型门卫确实不对称删除大模型识别的催化,但这不证明它使收益反向。原先所谓混合收益反转被并列排序解释掉;比较全量 Claude 与混合的次日收益,当前根本没有可靠排名。机制标签证据与交易收益证据必须分开。

最大限制

后窗口只有 10 个有效交易日,聚类与重采样实现未独立运行;Claude 仍被用作部分标签参照。尚未证明任何扣费交易价值,不能把同日关系或未来期权研究提案包装成策略。

复现与研究价值

优先按收盘后至开盘前、盘中分别对齐首次新闻与下一可成交价格;按公司和日期聚类,保留置换最大值基准、并列稳健性及开发/验证公司隔离。未来数据只用于确认冻结假设。

原文与核查

55,204字符公开全文分块完整阅读,包含撤回结论与未来计划。

原始文章 ↗

早期提示词实验:须按本篇修订理解

早期 FinBERT 门卫实验

推荐 90/100 · 问题 30/30 · 证据 25/30 · 方法 25/25 · 复现 10/15

主动撤回旧结论、数据修复和双重置换极具审计价值;不是推荐其交易信号。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

抄底陷入回撤的策略,可能只是撞上所有策略都更好做的月份

Investing in "Distressed" TAA Strategies (Redux)

Allocate Smartly

一句话先讲结论

作者追踪 100 多种 TAA,发现接近历史最大回撤的策略之后确实常有更高收益;但当至少一种策略走到历史最大回撤的 70% 时,所有策略下月平均收益也比其他月份高约 50%。因此“困境策略随后反弹”大部分可能是共同市场环境,而不是挑中了更便宜的策略。

它到底在问什么?

买入最近不顺、接近历史最大回撤的策略,是否类似买入被低估资产?真正该比的是它自己其他月份,还是同一时点可选的其他策略?

作者具体怎么做?

  1. 每个策略先用至少 20 年历史形成到当时为止的最大回撤基准,因此最早可选月份从 1990 年开始;截至 2026-04-30 的数据是研究范围,不是用户必须采用的窗口。
  2. 月末设置 1—5 个等权槽位,按当前回撤/历史最大回撤排序,挑达到 50%—100% 门槛且最接近历史极值的策略。
  3. 未被困境策略填满的槽位赚下月平均策略收益,避免把没有信号时的现金差异混成选择能力。比较年化、夏普、最大回撤及同时关注回撤深度和持续期的 UPI。
  4. 低门槛且至少三槽时有小幅改善,严格门槛时信号太少;进一步发现困境会成群出现,而且这些月份非困境策略也表现更好。

关键结果

原文结果与口径
核对项结果意味着什么
共同环境效应下月均值约高50%是所有策略条件均值相对其他月份,不是收益多 50 个百分点。
选择困境策略的增量小幅且局部有限改善集中于较分散、较低门槛区域,未构成强选择证据。
额外切换摩擦未计入个别策略内成本已计,策略间切换成本没有,会进一步压缩增量。

怎么理解?

这是一个非常值得保留的研究纠错:同一策略“差时买比平时买好”,不代表同一天“买它比买别的好”。投资者的问题属于横截面机会成本,前一问题只是在挑市场环境。 历史最大回撤本身也不是价值锚。它随样本长度、策略波动和杠杆变化,一种策略更接近旧极值,可能只是新的风险状态或结构失效。应先判断机制是否还在,再讨论反向配置,不能把越跌越接近旧回撤线当作安全边际。

最大限制

策略数据库存在回溯构建与入库选择问题,未独立审计;使用历史回测策略并不等于当时真实可选菜单。未计策略切换摩擦,网格小幅改善还可能含参数选优。

复现与研究价值

按策略族而非单一变种分组,保留同月平均与风险匹配基准;区分共同冲击、策略特异损失和长期失效,再在可实际获得的策略历史上检验净选择收益。

原文与核查

全文和所有文字计算说明已读,未逐格重建图片网格。

原始文章 ↗

推荐 85/100 · 问题 29/30 · 证据 23/30 · 方法 24/25 · 复现 9/15

识别条件基准错误、直接影响策略配置决策,数据库与成本仍有限制。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / AI辅助策略研究

LLM生成361个均线公式后筛出Reflux,作者称替换OLMAR的EMA使CAGR提高33%且回撤不变;但候选池、筛选规则和最终验证高度重叠,33%只是待独立复跑的研究假设

Moving Averages and Harness Engineering for +33% CAGR on Portfolio Optimization

Stuart Farmer

一句话先讲结论

一句话先讲结论:作者让LLM按“函数家族”生成361个移动平均公式,以HP filter滞后、转折点和简单交易表现筛选,后在SPY/QQQ/IWM/TLT/GLD/USO的2000—2021日频数据、5bp成本、参数平台与block bootstrap上称Reflux在6项测试中胜过Hull,并把OLMAR内EMA替换为Reflux后报告CAGR提升33%、最大回撤不变。最该保留的是“先建评测harness再广搜”的研究框架;最该暂停相信的是+33%——最终函数由同一研究管线反复选择,代码与完整表格又在付费墙后,尚没有独立、冻结的多市场验证。

它到底在问什么?

能否把“均线看起来更平滑、反应更快”的主观判断拆成可重复的多目标测试,并用LLM扩大函数搜索空间,在不同策略模板中寻找比传统Hull/EMA更稳健的滤波器?

作者具体怎么做?

  1. 先按相同平滑度而非同一窗口长度校准SMA、HMA、KAMA等,避免把“用更长数据”误当成滤波器优越性。
  2. 以HP趋势作非因果oracle,对lag、turning point确认延迟/overshoot和单指标交易表现分别打分。
  3. 要求LLM先给出函数家族再给成员,生成361个候选;用多指标筛选精英而非只挑最高Sharpe。
  4. 在较大六资产集上用未触及的2000—2021历史、5bp成本、参数平台、三种构造模板和block bootstrap复评;最后尝试替换OLMAR的EMA。

关键结果

原文结果与口径
核对项结果意味着什么
基准筛选HMA在多项交易测试中胜出,KAMA在lag/转折反应中常更好不同目标会给出不同冠军,支持多目标harness;却也引入了如何汇总分数的额外研究自由度。
LLM候选搜索361个公式,第二轮保留8个;Reflux称在6项测试中5项胜过Hull大规模候选搜索要求完整搜索日志和最终未参与选择的验证集;否则“5/6”可能是选中后叙述。
第二阶段设置六资产、日频2000—2021年中、5bp成本、三类策略模板、block bootstrap设计方向正确,尤其成本和策略模板迁移测试;但原文未公开各测试的具体Sharpe、CI和持仓/换手。
应用主张用Reflux替换OLMAR的EMA后,作者称CAGR+33%、最大回撤不变这是最吸引人的数字,也是最需要独立复核的数字:替换可能改变调仓频率、交易成本和参数适配,不能仅由单张曲线确认。
AI的真实角色LLM用于产生函数家族与候选,而非直接预测收益这是较合理的AI用法:扩展假设空间;但生成模型并不降低multiple testing,反而扩大了选择惩罚。

怎么理解?

这篇对AI量化最有启发的不是新均线名称,而是把LLM放在“候选生成器”而不是“证明器”的位置。一个好的harness应预先固定:因果性、平滑度等效定义、每个评分目标、聚合方式、候选预算、训练/验证/最终测试隔离和停止规则。否则LLM一次生成361个想法,会比手工调一堆均线更容易挖到偶然赢家。HP filter尤其应只在训练期内作离线诊断,最终交易评价必须完全因果。

最大限制

候选公式、评分权重、各资产数据处理、OLMAR原始参数、完整成本/换手、bootstrap区间及最终样本外结果不可审计;“未见历史2000—2021”与第一阶段“日频至当前”之间的实际隔离描述不够清楚。HP趋势存在端点与未来信息问题,且六资产相关性很高,不等同六个独立市场。

复现与研究价值

在开源环境重建harness:固定训练期生成候选,验证期仅一次选型,留出从未触及的2021年后样本;所有指标使用只到t的因果滤波。报告361个候选的完整分布、候选家族、选择次数、turnover和每资产净收益;把Reflux与SMA/EMA/HMA/KAMA在相同OLMAR参数、相同执行延迟与5/10/20bp成本下比较,并做White reality check或SPA调整。

原文与核查

公开文章完整阅读;付费代码/结果未取得,未独立复跑。

原始文章 ↗

推荐 69/100(暂定) · 问题 25/30 · 证据 18/30 · 方法 20/25 · 复现 6/15

AI辅助候选生成与多目标评测的框架值得借鉴,且尝试了成本、平台和bootstrap;但关键公式、代码和完整结果被付费墙遮蔽,多重选择与独立样本外尚未解决。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

RMP 不是赚钱概率:它把单次显著性抬高到整个搜索的幸运冠军门槛

The Random-Max Percentile: Grading Every Backtest Against Its Search's Random Maximum

Rulyfi

一句话先讲结论

RMP把单条调整后证据q转换成Φ(q)的N次方;2万次搜索要过0.95,q需约4.6,而不是常见1.645。作者1.01亿条至少30笔交易结果仅780条超过0.95。它是既有多重检验方法的产品实现,不是新发现的成功概率,也不能挽救错误成交和相关交易。

它到底在问什么?

把不同交易频率策略放在一个DSR总体里,低交易数的高方差夏普会不会抬高所有人的门槛,让忙碌但每笔优势小的策略被压扁?

作者具体怎么做?

  1. RMP=Φ(q)^N,q按偏度峰度校正每笔夏普×√交易数,N为扫描记录的有效试验数;1−RMP与Šidák校正相联系。
  2. 合成实验固定整体t约6,交易数从30至3,000,DSR检出率从100%到0,RMP仍约94%以上;这些结果针对作者特定混合频率零分布,不是DSR普遍失效证明。
  3. 300笔以上、带止盈止损的模拟中,搜索级误报约3.5%—5.8%;无界单侧彩票型收益可能达到名义误报的1.5—2倍。
  4. 7月21日补充署名:最接近金融先例为López de Prado 2022,相同外层Φ(z)^K构造;产品记录N与呈现方式不是统计优先权。

关键结果

原文结果与口径
核对项结果意味着什么
2万次搜索门槛q约4.6以假设零分布和独立试验近似为条件,不是普适阈值。
真实导出通过780/约1.01亿参数行高度相关,不能解释成真实策略成功率。
非有界彩票收益误报约名义1.5—2倍尾部校正不是万能保证,需重采样校准。

怎么理解?

这篇最该提醒的是指标单位。作者界面把每笔夏普乘√252称年化,对交易频率不固定的策略,这不是按日历时间计算的标准年化夏普;读者不能拿它与基金夏普比较。RMP移到证据尺度缓解一类比较问题,却并未修复收益序列的时间依赖。 外层独立试验公式在高度相似网格中可能偏保守,但同一策略内部交易相关又可能偏乐观,两者不能互相抵消当作安全。重复多次设计扫描也应计入研究总预算,不能每次重新把N归零。

最大限制

新指标合成校准与真实导出均由厂商完成,未独立审计;极端分布、小样本、持仓重叠与跨次搜索未完全解决。通过0.95不等于有95%赚钱概率。

复现与研究价值

对候选保留完整按时间收益,使用区块置换校准整个搜索的最大统计量;把单次N扩成研究项目试验台账,并用未见行情验证通过者,而不以哪个指标更好看选择指标。

原文与核查

全文、公式、模拟表及署名更正已读。

原始文章 ↗

推荐 83/100 · 问题 27/30 · 证据 22/30 · 方法 23/25 · 复现 11/15

多重搜索尺度解释有用,署名更正及依赖性边界必须一起读。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research_review

The Intramonth Momentum Cycle

The Intramonth Momentum Cycle

Elisabetta Basilico、Daniel Nathan、Matti Suominen、Joni Tasa

一句话先讲结论

美国股票动量收益集中在每月月末前六个交易日,主要来自机构为获得结算现金而卖出输家;T+1改革造成的窗口平移提供了机制识别。

它到底在问什么?

传统动量收益究竟来自慢信息扩散/风险补偿,还是机构现金管理和结算规则造成的月内流动性压力?

作者具体怎么做?

  1. 按过去收益形成赢家/输家并计算价值加权WML
  2. 按月内交易日分解收益,识别PreTOM窗口与月初崩溃窗口
  3. 利用交易级数据、共同基金流量和机构持股检验‘dash-for-cash’机制
  4. 用T+2→T+1结算改革作为自然实验,检验卖压窗口是否向月末平移一天
  5. 做流动性、机构持有、19国、基金流出和崩溃时点稳健性分析

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

作者报告:现金需求、税损、低股息和易清算性使输家成为可处分资产。编辑判断:机制证据较强,但实施仍须处理结算制度切换、窗口选择和交易成本,不能把历史窗口直接当作无摩擦策略。

最大限制

文章是论文解读;论文样本与窗口可能存在选择风险,实际交易需考虑做空、借券、点差、冲击和结算制度变化;Alpha Architect披露图表为假设结果。

复现与研究价值

使用CRSP/基金流量和点时结算日历复现WML,分别实现T+2/T+1窗口;加入交易成本、借券和规模约束,并检验窗口外反转、跨国稳定性及发表后衰减。

原文与核查

public_full_article_and_paper_abstract

原始文章 ↗

推荐 94/100 · 问题 29/30 · 证据 29/30 · 方法 24/25 · 复现 12/15

公开正文、SSRN摘要和附录提供样本、窗口、机制识别与多项数字;复现仍需CRSP/基金流量和交易成本数据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读解析

网络动量1.51是毛夏普:每次5bp成本就变−0.67

Network Momentum as a Cross-Asset Factor

Ali H. Askar;原研究Pu、Roberts、Dong、Zohren

一句话先讲结论

64个期货的网络动量在2000—2022年报告毛夏普1.51,对照自身动量回归1.13;但成本敏感性在5bp时变−0.67。最有价值的对照是股票只看股票网络夏普0.30,加入跨资产邻居变0.95;它提示跨市场信息可能有增量,而不是一个可以无成本拿走的22%年回报。

它到底在问什么?

预测一个合约,是否只该看它自己的历史?如果债券、外汇和商品共享信息传播,邻居的趋势可能比本品种自己更早或更稳。

作者具体怎么做?

  1. 每资产构造五个期限波动缩放收益与三个MACD,波动用60日指数估计,让不同风险级别资产可比较。
  2. 从历史动量特征学习非负、对称、无自环邻接矩阵;平滑项偏好相似节点,连接约束避免孤点,权重惩罚控制复杂度。
  3. 平均不同历史窗的图,用邻居特征进入 pooled OLS预测下一日波动缩放收益;符号决定方向,逆波动决定规模。
  4. 按原文设定重训并比较2000—2022样本外,分解类内、类间和完整网络,最后施加不同单位成本检验。

关键结果

原文结果与口径
核对项结果意味着什么
网络 vs 自身毛夏普1.51 vs 1.13同特征回归对照,但仍需净成本比较。
5bp情景网络夏普−0.67pseudo-cost敏感性,不等于所有真实合约统一收费5bp。
股票网络范围0.30 → 0.95单类网络改完整跨类网络,范围改变带来增量。

怎么理解?

“不使用资产自己的过去”也需限定:预测输入没有自环,但目标自己的历史参与建图,决定它连接谁,因此并非完全剥离本资产信息。图是对称相似性图,不是有方向的因果传播图;看见边不能认定一个市场领先另一个。 完整网络优于只看同类,既可能有经济信息传递,也可能只是降噪和分散。一个必要对照是随机邻居、行业均值以及市场共同因子,而不仅去掉某组边。类间单独夏普0.91低于类内1.21,又说明“Alpha全来自跨类”也不准确:互补才是主要故事,网络并没有废除传统趋势。

最大限制

原完整论文表格未逐页核查,当前数值来自全文导读并以原摘要验证主题和主结果。期货连续合约、跨时区收盘、交易成本单位与调参历史都需要复现审计;不能直接挪成A股个股参数。

复现与研究价值

在同一风险预算下先比较本资产、简单邻居均值、学习网络三组,加入时间对齐和真实成本;只保留网络相对简单平滑器的净增益,尝试降低换手但不重新挑赢家。未执行回测。

原文与核查

导读全文已解析,原论文摘要核对,完整实验未独立复现。

原始文章 ↗

Network Momentum原论文

推荐 82/100(暂定) · 问题 28/30 · 证据 22/30 · 方法 23/25 · 复现 9/15

有清晰消融和成本边界,网络的经济因果解释仍需克制。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究综述

五篇研究共同提醒:组合平均收益,会把行业、拥挤与市场状态混在一起

Quantitativo weekly

Quantitativo

一句话先讲结论

本期串联五篇研究,最值得抓住的共同问题是收益究竟在什么条件下成立:行业内选股在压力期更强,拥挤股票贡献了异常组合的大部分收益,而因子 ETF 全样本赢行业 ETF、危机期却可能反过来。它不是五条可以直接叠加的 Alpha,而是一份提醒研究员拆暴露、拆状态、拆尾部的文献地图。

它到底在问什么?

一个总体回测好看,可能来自特定股票、特定时期或某种共同资金行为。怎样把平均表现拆成可解释、可反驳的条件关系,而不是只积累更多策略标题?

作者具体怎么做?

  1. 行业内选股部分转述 Uyar 对 25 个因子和 11 种组合模型的比较,强调简单组合、短仓兴趣和压力期的条件作用;不应把十股浓缩版本视作未经选择的通用配置。
  2. 拥挤部分介绍 Days-ADV,即机构仓位相对日成交量的退出难度,称去掉拥挤股票后 11 条异常不再有正 Alpha;同时强调 2008 与疫情的尾部损失。
  3. 风格部分讨论 312 个特征和由资金追逐风格形成的反馈,随机会计比率作为安慰剂;策略数很多,原始搜索过程和随机对照如何匹配特别重要。
  4. 最后两篇分别用市场状态相似性做行业轮动,以及比较因子和行业 ETF 配置。前者强调下行尾部,后者显示全样本与衰退子样本排名不同,检验的对象并不相同。

关键结果

原文结果与口径
核对项结果意味着什么
拥挤研究范围11 条异常综述称其收益集中于拥挤样本,需原文核查风险控制与持仓披露时滞。
行业轮动回撤54% → 26%综述转述某一策略与基准的历史最大回撤,不是本看板独立复现。
因子/行业 ETF 比较41 个配对全样本因子胜配对共享数据和模型,不是 41 次独立证据;危机期例外重要。

怎么理解?

读这种综述的正确产出应是研究问题清单。比如把一条新因子分成拥挤与不拥挤组,或把配置表现拆成扩张与危机,再判断所谓 Alpha 是否只是承担别人不愿承担的流动性风险。不能看到几篇都说有效,就把它们默认当成独立来源。 也要对简洁叙事保持戒心。“去掉拥挤股后异常消失”可能同时改变规模和流动性;“因子全胜”可能被长扩张期主导;“简单模型胜出”不代表估计永远没用。应回到每篇的对照,问条件变量何时可见、是否事后定义、成本和尾部如何处理。

最大限制

本次完整解析的是公开周综述,不是五篇原论文的联合全文审计。摘要中的样本、控制和参数不足以独立复现,尤其不能根据文中 2021 年旧论文把全部内容列成 2026 年新发表。

复现与研究价值

优先按已有研究瓶颈选择原文:做选股先查行业内信号和拥挤,做配置先查状态与因子/行业对照。为每篇建立样本日期、披露时滞、风险暴露、搜索规模四项核查;本文综述数字不进入策略绩效数据库。

原文与核查

本期公开综述完整解析;五篇底层论文未在本条逐表审计。

原始文章 ↗

推荐 66/100(暂定) · 问题 25/30 · 证据 16/30 · 方法 19/25 · 复现 6/15

主题组织有启发,适合作为文献路线;原论文细节尚未逐篇核验,不宜据摘要下强结论。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 理论方法导读

趋势收益不只靠正自相关:还有漂移平方,公式不是预测器

Trend-Following P&L Is a Function of Autocorrelation (Closed Form)

Ali H. Askar;原研究Artur Sepp、Vladimir Lucic

一句话先讲结论

导读引用的2000—2025趋势系统,扣交易成本和管理业绩费后夏普约0.45,单看不比60/40突出;组合价值来自不同收益路径。理论更重要:线性趋势收益可拆成滤波器加权的滞后自相关与漂移平方,所以“只有正自相关才赚钱”这句导读总结漏掉了它自己写出的第二项。

它到底在问什么?

趋势赚钱是因为持续上涨、连续涨跌相互跟随,还是仓位和风险缩放?公式把这些机制拆开,帮助解释某个速度为何适合某类收益过程。

作者具体怎么做?

  1. 先写日收益为滞后信号与当前归一化收益的乘积,固定滤波与风险缩放,展开累计交叉项。
  2. 将结果重写为不同滞后自相关的加权和及均值平方;减去lag0的1是去除自相关恒等项,不是扣了一笔真实交易费。
  3. 分别研究白噪声、AR(1)和ARFIMA长记忆过程,说明短期反转与长期趋势可同时存在。
  4. 用更快滤波更高换手的约束讨论成本,再比较European、American、TSMOM及与60/40搭配;导读所列历史数字不是闭式保证。

关键结果

原文结果与口径
核对项结果意味着什么
历史扣费夏普约0.45导读所述2000—2025历史结果,不是未来收益承诺。
理论第一项滤波加权滞后自相关需看整个期限结构,不只正负一阶系数。
理论第二项漂移平方零自相关也可能有趋势收益,反驳绝对化总结。

怎么理解?

一条精确历史恒等式不等于可事前准确估计的交易信号。用全样本自相关解释同一段策略收益当然有用,但如果再据此挑最优窗口,就重新引入参数搜索。真正难点是这些很小的相关在下一段是否稳定,以及估计误差有多大。 “方向对称”也不等于无条件买波动;来回剧烈震荡可以伤害趋势,持续方向才有利。类似地,公式中的风险调整换手不能替换实际成交额换手,更不能一概说真实换手与市场无关。改变波动估计、仓位上限和非高斯结构,会影响实际成本。把假设写出来,比给闭式公式加上无条件结论更重要。

最大限制

原论文有多个修订版本,本轮未逐页核查完整证明和实证表;导读250/20窗口是其引用案例,不能推广为最优参数。40%搭配带来的历史改善需另核对风险和费用一致性。

复现与研究价值

先把现有趋势净收益拆成漂移暴露与相关贡献,再用固定速度比较邻近期数据的稳定性;按实际成交成本判断是否值得加快信号。作者公开实现可作单元测试参照,此处未运行。

原文与核查

导读全文及原摘要、仓库简介已核查;完整理论证明未审阅。

原始文章 ↗

原论文

作者复现仓库

推荐 85/100(暂定) · 问题 28/30 · 证据 21/30 · 方法 24/25 · 复现 12/15

能把趋势故事变成可审计归因,必须区分恒等式、过程假设和未来预测。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

裂解价差领先炼油股:毛夏普 1.48 的产业链信号,不能直接叫市场中性 Alpha

A Cross-Asset Lead-Lag Trade in US Refiners

Beyond Passive Investing

一句话先讲结论

用原油、汽油和馏分油期货构造炼油利润,再预测八家美国炼油商相对能源 ETF 的收益,作者报告毛夏普约 1.48;同一信号交易原油几乎无效,交易裂解价差或股票自身动量仅约 0.5。产业联系比通用趋势解释更有说服力,但结果未扣执行成本,等金额对冲也不自动等于风险中性。

它到底在问什么?

炼油利润先在流动的商品期货中变化,股票投资者会不会反应稍慢,留下跨市场信息传递窗口?

作者具体怎么做?

  1. 使用 Norgate 期货与 Yahoo 股票价格,篮子含 VLO、DINO、DK、CVI、MPC、PSX、PBF、PARR;八家同时可用从 2012 年底开始,更长历史实际使用较少公司。
  2. 股票篮子与能源 ETF 等金额反向持仓,减少行业共同涨跌;用裂解价差的 1、5、10、21 日变化分别按波动率标准化、截断 ±2 后平均。
  3. 信号十分位对应后续股票残差收益约从 −18 bp 到 +42 bp;作者把整体约 +6 bp 的长期炼油股相对能源漂移与梯度区分,不把两者统称择时。
  4. 目标波动率设 2%,毛回撤低于 3%;单只股票检验八家均正,但换成全球炼油 ETF 后效果消失,提示利润区域匹配很重要。

关键结果

原文结果与口径
核对项结果意味着什么
跨资产信号毛夏普约 1.48未扣费,与后续净值不能混称。
自身趋势对照约 0.5支持跨资产增量,但各对照需相同风险和执行口径。
全球炼油ETF替代效果消失区域经济联系有限,不能把美国裂解价差推广到所有炼油公司。

怎么理解?

这篇优点是有可证伪的经济链:利润变化应主要解释受该利润驱动的股票,而不是对什么资产都有效。把共同水平与条件收益梯度分开,也比只展示长期上涨的多空净值更诚实。 但等金额卖出能源 ETF 只消掉名义净敞口,不保证市场、油价或行业 Beta 为零。并购退出也不能被作者一句“幸存偏差较小”豁免:收购溢价、事件时点和退市收益都会改变样本。八家公司分享同一商品冲击,其结果也不是八次独立验证。

最大限制

未独立核验期货拼接、股息、标准化窗口和历史篮子;作者未完整公开代码。正文资金中性措辞强于风险中性证据,毛业绩更未覆盖借券和成交。

复现与研究价值

建立包含并购退出的历史篮子,使用实际当时可知商品价格;比较等金额、滚动行业 Beta 和油价双重对冲。先检验信号在下一可成交时点仍有增量,再讨论容量。

原文与核查

全文、全部文字对照和系列关联已读,未独立回测。

原始文章 ↗

第二篇:执行与成本

第三篇:期限结构信号

推荐 84/100 · 问题 29/30 · 证据 23/30 · 方法 23/25 · 复现 9/15

经济机制和邻近目标反证清楚,风险中性与成本仍待核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

同一笔交易,DSR 从0.035变0.919:改变的是搜索参照总体,不是策略变强

How Many Backtests Is Too Many? We Ran the Same Search Twice to Find Out

Rulyfi

一句话先讲结论

一条完全相同的空头交易序列,在A扫描DSR为0.035,在移除部分稀少触发配置的B扫描却为0.919;搜索门槛从1.165降到0.378每笔夏普。变化主要来自总体夏普方差缩小,而非试验数减少。这是统计参照敏感性实验,不是删掉低频策略就发现了真实优势。

它到底在问什么?

多重检验门槛除了取决于试验数量,还受参照策略的频率与方差影响;怎样知道评价变好是策略改善还是标尺变动?

作者具体怎么做?

  1. A含1,176个指标变体、每方向约2,487万结果;B含920个、约1,522万。每格配36种退出,费用0.04%、滑点0.01%,不含永续资金费。
  2. 共同策略的每笔夏普与交易数完全相同,作者可以从A导出预先算出B的N和门槛,再跑B验证算术一致。
  3. 有效试验数减少约28%—33%,数量项仅下降约1%;方差平方根下降约2.13/3.04倍,解释大部分多/空门槛降低。
  4. B中至少30笔、超过门槛的多/空条数为3,798/840,但最强单策略DSR仍约0.925/0.919,均未过0.95。长短组合约0.97只是矩合成,未完整重跑。

关键结果

原文结果与口径
核对项结果意味着什么
相同空头DSR0.035→0.919参照总体变化,不代表交易数据增加或模型进步。
空头门槛1.165→0.378单位为每笔夏普,非标准日历年化。
单策略0.95通过仍无不是A失败、B找到已证实策略的故事。

怎么理解?

最实用的输出是研究收据:不仅保存冠军,还要保存试验数、总体方差、交易次数和门槛。否则同一个DSR看起来权威,实际可能依赖一个任意搜索菜单。 作者强调B按交易次数而非收益删规则,有助于避免最直接的结果筛选,但它仍是看过A后重新设计的实验,不能把A的研究历史消失。尤其不能用“重新跑了一遍”替代真正新行情:算术可预知证明引擎确定性,不证明统计标尺更接近真相。

最大限制

单次约90/10切分且两次边界差约55根;资金费遗漏,乐观同bar执行继承旧扫描。组合DSR为近似矩计算,未验证交易重叠、资本分配和联合尾部。

复现与研究价值

先用不读取收益的规则冻结最低触发频率与网格,保留全部历史搜索预算;对混合频率采用可比证据尺度与区块重采样,同时报告不同合理参照总体下的敏感性。

原文与核查

全文与脚注全部已读,未取得配对导出独立核对。

原始文章 ↗

推荐 84/100 · 问题 28/30 · 证据 23/30 · 方法 23/25 · 复现 10/15

解释统计总体敏感性很有价值,但不能以改总体洗白同一历史结果。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

一亿回测筛出3,130个候选,不等于发现3,130个Alpha

Skill or Luck? We Ran 100 Million Bitcoin Backtests to Show You How to Tell

Rulyfi

一句话先讲结论

约9,988万BTC回测中,33.68万条通过单次PSR>0.95,但加上至少30笔、DSR>0.5及样本外过滤只剩3,130。收益最亮眼的百笔以上策略涨684%,DSR却仅约0.10;所谓长短合并后0.9502也只是矩合成估计,未重跑账户净值,所以这里得到的是候选清单,不是交易系统。

它到底在问什么?

当计算极便宜,漂亮回测几乎必然出现;怎样把“比零好”改成“比同样搜索规模的幸运冠军好”?

作者具体怎么做?

  1. 2020-10-19至2026-07-03约50,000根小时BTC现货;1,443变体两两配对,乘48种退出,再分别建模长短,共99,878,688回测。
  2. 费用0.04%、滑点0.01%;空头直接作用于现货价格序列,未包含真实借券或永续资金费。同bar同时到止盈止损时优先止盈。
  3. 候选要求至少30笔、DSR>0.5、walk-forward效率为正及无负折,3,130条通过;这与更严格DSR>0.95不同,不能把筛后计数称95%显著。
  4. 作者把417多头×2,713空头候选共1,131,321对按矩合成,额外搜索也加进N;仅三个相近组合略过0.95,最好0.9502、共72笔,并无独立合成净值。

关键结果

原文结果与口径
核对项结果意味着什么
基本候选通过3,130/99,878,688不是3,130个独立策略,也不是未来成功概率。
百笔以上冠军+684%,DSR约0.10收益大不等于经搜索修正后证据强。
最佳组合DSR0.9502(估计)依赖非重叠假设与矩重建,未端到端回测。

怎么理解?

文章的教育价值在于把筛选门槛显式写出来,而不是依靠“看上去稳”。但候选几乎集中于30—63笔,说明偏度、峰度与高胜率仍处在很脆弱的小样本区;30不是统计安全线。 组合部分尤其不能只接受“零新增回测就增强证据”的叙述。把交易样本混起来与把两个资金账户组合不是同一对象,净值取决于时间重叠、保证金和权重。作者界面每笔夏普×√252的展示也不是真正日历年化,不能引用约12的组合值宣传业绩。

最大限制

样本外仅两折,未purge/embargo;同bar乐观执行、空头融资遗漏,策略共享同一BTC行情。组合0.9502紧贴阈值且采用近似,难以承受执行和相关性误差。

复现与研究价值

将候选去重成经济策略族,再用保守成交、真实融资和时间对齐账户重跑;冻结规则后等待新数据。搜索记录必须保留失败项及组合次数,不能只保留过门槛名单。

原文与核查

公开全文、网格、公式和全部限制已读,未独立运行。

原始文章 ↗

推荐 81/100 · 问题 27/30 · 证据 22/30 · 方法 22/25 · 复现 10/15

多重检验入门例子清晰,但巨量数字和组合近似容易被过度解读。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 数据方法说明

财务因子的“提前66天”:改公告日期还不够,修订值也不能穿越

Lookahead Bias in Fundamental Backtests: 66 Days, Measured

Tradevo Data

一句话先讲结论

厂商在 2026-07-23 快照的 283,363 条可靠日期记录中,测得年报申报比财年末平均晚 66 天、中位 60 天;若按财年末加入回测,就把数据提前给了模型。但公告日期正确仍不够:18,734 条记录后来被改写超过 0.5%,把最新值贴回旧日期仍会泄漏未来。

它到底在问什么?

真实财务数值为什么也能制造假 Alpha?关键不是数字真假,而是当时何时可见、可见的是哪个版本。

作者具体怎么做?

  1. 完整快照共 313,406 行、5,194 家公司,只有可靠日期行用于66天统计;QA 将可靠滞后限制在120天内,所以90分位90天不代表全体最迟申报时点。
  2. 40家大盘股样本均值仅43天,说明以大盘验证得到的统一延迟不宜外推到小公司。
  3. 检查相同 XBRL tag 后续值变化,超过0.5%标记restated;文中既有会计修订,也有拆股后历史每股指标回溯调整,不能全叫财务造假。
  4. 提供按申报日期审计join及统一延后90天的压力检查;API当日包含语义仍要求处理盘后发布,且只保存原始/最新两值未必覆盖中间每次修订。

关键结果

原文结果与口径
核对项结果意味着什么
可靠行平均/中位滞后66 / 60 天是财年末到10-K日期,不是所有财务事实第一次公开的精确延迟。
大盘样本平均43天样本覆盖会改变时点风险估计。
超过0.5%的后续变动18,734行包括拆股等调整;需要分类判断,不能一概当错误财报。

怎么理解?

这篇最值得落实的是双时间轴:一个时间回答数字属于哪个期间,另一个时间回答研究者何时知道这个版本。审计应逐字段、逐版本做,而不是只给整张财务表一个延后常数。 同时要警惕厂商过强推论。加90天后收益下降,可能是提前信息被修正,也可能是合法早已公布的数据被额外延迟;差额不能全部叫虚假Alpha。原始值与最终值两端也不一定足以重建任意历史日的中间修订。价格数据同样可能受复权和更正影响,并非天然免疫。

最大限制

厂商自测未独立重算,原文日期后有7/23快照更新;可靠行筛选截断尾部,年报申报不必等于所有指标首次披露。商业价格与覆盖是原文信息,本解析不作当前采购推荐。

复现与研究价值

在实际因子管线保存公告接受时间、字段值、版本生效时点和来源文件;使用严格as-of连接并对盘后顺延。比较报告日、真实首次披露日和固定延迟,只把可归因的差异记为前视影响。

原文与核查

正文和审计代码完整阅读,未下载或重算厂商样本。

原始文章 ↗

作者公开样本与方法

推荐 87/100 · 问题 29/30 · 证据 22/30 · 方法 24/25 · 复现 12/15

可直接转为PIT数据验收规则,厂商口径仍需核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 因子知识导读

便宜股2020涨53%不是HML赚53%:价值入门最容易混淆的口径

Quantitative Value

Concretum Research

一句话先讲结论

作者称最高账面市值比的等权股票组2020涨53%、2021涨91%,但这是便宜股一条多头腿,既不是HML多空收益,也不能证明价值跑赢成长。本文最适合作为“如何把价值理念变成可测试组合”的入门,而非现成策略业绩说明。

它到底在问什么?

价值投资的叙事是买低于内在价值的公司;量化实施只能先用可观察特征近似。账面市值比能否识别被过度悲观看待的企业,又会混入哪些风险?

作者具体怎么做?

  1. 将股票按账面市值比分十分组,用1926—2026历史比较CAPM alpha及高低组曲线。数值来自作者Factor Tracker,非本文新跑。
  2. 随后给出按过去盈利增长分组的说明:便宜组此前增长较差、未来增长可能恢复,作为投资者过度外推的行为解释线索。
  3. 同时列风险解释,包括财务困境、行业衰退和宏观敏感性;两类解释并存,文章没有通过一个实验排除其中之一。
  4. 提出价值与动量组合以缓解长期落后,但未提供本文自身统一资产池、同成本的混合组合实证表。

关键结果

原文结果与口径
核对项结果意味着什么
2020便宜组+53%(作者报告)等权多头组,不是价值多空因子。
2021便宜组+91%(作者报告)须核对成员、再平衡和小盘影响。
盈利恢复均值回归叙述原图未给可核验误差区间,不能推成每只便宜股会变成长股。

怎么理解?

未来盈利增速高可能受低基数、亏损转盈和存续样本影响;它不自动意味着股价低估。要从行为解释走向交易证据,还需证明当时价格没有补偿困境风险,而且改善幅度超过市场预期。将“平均恢复”写成“价值股会成为最快成长者”过于跳跃。 账面价值对无形资产密集公司的可比性也是实务核心:同一B/M排序可能同时在选行业、规模和会计资本化方式。组合价值与动量有合理互补性,但也可能借用了小盘空头和市场中性杠杆;机构可投资版本与学术等权十分组不能一笔带过。

最大限制

文章书名正文写Quantitative Value,图注却写Quantitative Momentum,引用来源存在混用,未把书籍当已核对证据。缺估值排序时点、费用、退市与误差区间;两年高收益没有独立验证。

复现与研究价值

先在可得的时点财务数据上做价值十分组,逐一报告多头、空头、多空和行业中性结果;再比较原始B/M与无形资产调整口径,价值加动量单独列净增益。未执行回测。

原文与核查

公开导读已完整解析;引用书页与Factor Tracker底层未独立核验。

原始文章 ↗

推荐 68/100(暂定) · 问题 23/30 · 证据 17/30 · 方法 19/25 · 复现 9/15

适合建立价值研究框架,引用与收益口径不能直接接受。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 交易实施研究

突破策略要不要挂限价单?0.75跳时追价更好,2跳时才接近

Intraday Breakout Details That Matter: Exits, Slippage and 0DTE Options

Peter / CrackingMarkets

一句话先讲结论

同一NQ、ES、MBT突破组合,滑点每边0.75跳时止损触发入场优于延迟限价,2跳时两者曲线接近;这说明限价不是免费省成本,而是在成交价格与错过趋势之间交换。作者偏好盈利到2R才启动1R跟踪,并非该规则总收益最高,而是更容易坚持执行。

它到底在问什么?

突破收益由少量趋势日贡献,过早止盈会截掉右尾,追价却增加滑点。真正要优化的是从信号到成交到退出的完整流程,而不是孤立入口。

作者具体怎么做?

  1. 以开盘价加减ATR倍数定义突破,每市场通常一天一次,方向过滤沿用此前文章;本文没有重新完整给出所有入口参数。
  2. NQ、ES、MBT组合每笔风险1%,比较固定、立即跟踪与2R后跟踪。固定总收益最高,延迟跟踪路径相近。
  3. 延迟限价等待一分钟收盘突破,下一分钟按该收盘价挂单;回测需穿过至少一跳才算成交,未成交按下一分钟收盘更新。
  4. 进一步用价内0DTE看涨/看跌表达突破,限价入场持至尾盘;作者计划与ETF/微型期货版本各半风险,不是本文已验证最优配比。

关键结果

原文结果与口径
核对项结果意味着什么
低滑点比较0.75跳/边:触发单领先更早成交的价值超过限价节省。
高滑点比较2跳/边:曲线接近这是该样本情景,不是普遍切换门槛。
退出选择2R后才跟踪1R行为可执行性折中,不是最高收益赢家。

怎么理解?

这篇最实用的是把未成交视为成本:突破之后真正一路上涨的交易,恰恰可能不回头给限价成交。穿一跳比触价即成交保守,但还没有建模排队、撤改单延迟与盘口数量;头寸放大后这几项会决定结论。 0DTE降低名义入场资金不等于降低风险。付权利金获得凸性,也同时付时间价值与隐含波动,标的同涨幅在不同时间和波动环境下期权盈亏不同。风险上限为权利金只适用于纯期权头寸;若到期自动行权后形成标的,应另处理。两种表达高度共享信号,50/50分配分散的是部分执行路径,不是两个独立Alpha。

最大限制

本文依赖先前策略过滤器,完整复现参数不全;图中账户截图未独立审计,0DTE历史更短且成本模型只定性称真实。每笔1%若多市场同日同向触发,组合风险会集中。

复现与研究价值

按实际订单逐笔记录触发价、首次可成交价、挂单排队和放弃成交的机会损失;同风险预算比较期权与期货,单列theta、波动变化和方向贡献。这里未下单或回测。

原文与核查

公开正文和全部图注已解析,未核查实盘或底层回测。

原始文章 ↗

推荐 80/100 · 问题 28/30 · 证据 21/30 · 方法 23/25 · 复现 8/15

实施取舍具体,完整订单级证据仍缺。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

把 Claude 调得更像分析师后,相关系数由 +0.24 变 −0.06;但后续审计削弱了收益结论

How We Tried to Teach Claude to Read Like an Analyst, and the Market Said No

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

在八家公司、六周新闻样本中,放宽 Claude 对催化事件的要求,让它更贴近人工判断,一致率从 36% 提高至 43%,报告的次日相关却从约 +0.24 降至 −0.06。但这不是“严格提示词已经有 Alpha”:作者 7 月 16 日扩大审计后,所有模型的全样本次日关系都不显著,早期分位收益指标也被撤换。

它到底在问什么?

金融新闻模型到底应该最大化专家认同,还是识别决策时点以后尚未计价的信息?两个目标可能并不一致。

作者具体怎么做?

  1. 第一名人工标注者阅读 560 条八家公司标题,第二名阅读 192 条,后者富集前者与 Claude 分歧样本并混入对照;这种抽样不能当一般新闻的随机准确率样本。
  2. 严格 v2 默认大部分新闻中性,只认可具体、可验证、新增催化;v4 放宽合作、战略动作等规则,并降低中性先验锚点。与人工一致率提高,不代表金融目标改善。
  3. 4,296 条文章在同一八股六周窗口同时用两套提示评分,原文报告相关 +0.24 对 −0.06;严格版本单项显著性接近 0.05 边缘。
  4. 更严格变体中,只认可数字的版本相关约 +0.34,却只有 17 个有效信号日;来源白名单版本相关接近零。90% 中性锚版本约 +0.29,随后进入与 80% 锚版本的前瞻并行比较。

关键结果

原文结果与口径
核对项结果意味着什么
与人工一致率36%→43%优化了人工偏好,不等于优化未来收益。
开发样本相关约+0.24→−0.06小型开发面板结果;不能推广为全股票可交易信号。
定量专用提示约+0.34,17个信号日点估计最高却证据最薄,不能按数字大小选冠军。

怎么理解?

最重要的可迁移经验是对齐评估目标。人工可以可靠标注事件和事实,但“明天是否赚钱”还受到预期、发布时间与已实现价格变动影响,不能把专家共识直接当价格真值。 也不能反过来把一次负相关说成“人类错而机器对”。同一窗口里反复修改提示词,本身就是模型选择;六种提示共享样本和大部分规则,并非六次独立验证。后续审计说明,好的故事和局部对照仍可能在全样本或更稳健指标下失去收益支持。

最大限制

本文为开发过程记录,八股新闻密集且样本短;文中 days/ticker-days 表述并不完全一致。后续完整审计纠正收益缺失和分位排序,故旧分位收益幅度不再作为可依赖结果。

复现与研究价值

冻结两套提示、模型版本与新闻首次时间戳,预先确定基于事件而非语气的人工标签;前瞻比较决策后净收益并保留中性池,不能继续用同一开发样本微调到显著。

原文与核查

本文与7/16后续审计全文均已读,结论按版本链解释。

原始文章 ↗

必须连读:7/16后续审计与更正

推荐 82/100 · 问题 28/30 · 证据 20/30 · 方法 24/25 · 复现 10/15

目标错配案例有启发,必须连读后续纠错,不能单独引用早期收益。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 组合构建与日历效应

五个低频日历效应各自不强,按约100%峰值敞口合并后作者报Sharpe 1.77、回撤7.71%、平均只暴露12%;叠加动量则CAGR 12%→15.6%,但最大敞口97%→127%

Building the Market Effect Mini-Portfolio

TradeQuantiX

一句话先讲结论

一句话先讲结论:作者将股票假日、能源假日两套、月末和Turnaround Tuesday共五个低频方向性规则合并;把各子策略放大到组合约100%峰值敞口后,报告CAGR近11%、Sharpe 1.77、最大回撤7.71%、平均市场暴露12%。但把它叠加到原本最大敞口97%的美国动量系统时,CAGR由12%升15.6%,最大敞口升至127%,回撤15.43%升16.86%;收益改善必须与新增杠杆、日历规则共用beta和同源数据挖掘一起看,不能只看平滑后的组合曲线。

它到底在问什么?

一组单独看只有数个百分点CAGR、全年很少交易的日历效应,是否能以低占用资本的卫星组合形式提升已有动量组合的风险收益特征?

作者具体怎么做?

  1. 将五个单策略按不同效应、资产与持有窗口汇集,但不把历史最漂亮的单一策略单独放大。
  2. 用等权或逆波动权重分配,随后按峰值总敞口而非权重和归一化,考察约100%峰值和较低40%/30%卫星敞口。
  3. 对子策略采用跨相邻入场/退出日的scale-in、scale-out,意图降低单一“最佳日”随时间漂移带来的参数风险。
  4. 将约30%峰值敞口卫星叠加到100%配置的动量基准,比较CAGR、波动、最大/平均回撤、回撤持续期和实际峰值总暴露。

关键结果

原文结果与口径
核对项结果意味着什么
组合归一化后的表面绩效约100%峰值敞口:CAGR近11%,MDD 7.71%,Sharpe 1.77,平均暴露12%这些数字来自将原本低使用率策略杠杆化后的组合,不能与未按同一峰值/波动缩放的满仓基准直接比较。
为何要放大五策略各20%等权时峰值暴露仅47%低平均敞口留下大量现金,也意味着“资本效率”改善本质上需要接受更高的偶发总敞口。
等权vs逆波动逆波动Sharpe 1.77,对等权约1.71;Calmar 1.52对1.41两种权重接近,说明结果不完全靠权重精调;但均使用同一批历史发现的规则,家族选择偏差仍在。
叠加动量的增量基准CAGR 12%→15.6%,波动14.78%→15.58%,MDD15.43%→16.86%,峰值敞口97%→127%3.56pct CAGR并非免费分散化:组合新增约30pct峰值方向性杠杆,需比较同样加杠杆的动量/指数替代方案。
极端重叠所有五个系统同时符合条件约每1.5—2年一次均值指标可能掩盖罕见但决定生存约束的敞口堆叠。

怎么理解?

可取之处是作者没有把低频效应伪装成机构级alpha,明确承认它们低周转、持有beta、容量有限,适合作为卫星风险预算。真正的研究问题是组合边际贡献:在固定总风险、相同最大杠杆、相同成本下,五个日历规则是否仍然降低基准动量的回撤或提高预期效用。若仅把空闲现金变成更多方向敞口,收益相加是预期现象,不是独立因子。

最大限制

样本、交易标的、所有规则、参数搜索范围、成本、税费与out-of-sample切分缺失;五个效应很可能共享权益beta和同一日历数据挖掘过程。最大回撤对杠杆路径、再平衡和日内重叠敏感,文中未给月度/日度风险序列;“实盘运行”主张未构成可审计业绩记录。

复现与研究价值

将每个子策略还原为逐日仓位,先算与SPY、基准动量及彼此的条件相关和重叠时的净敞口;固定组合的ex-ante波动与峰值杠杆,对比“加30%动量”“加30%SPY”“加现金”三种基准。用滚动或purged样本重新选择权重并把所有日历变体纳入multiple-testing账本;以最差重叠日压力测试保证金、滑点和强平阈值。

原文与核查

公开全文完整阅读;付费关联材料及原始结果未独立核验。

原始文章 ↗

推荐 67/100(暂定) · 问题 23/30 · 证据 19/30 · 方法 18/25 · 复现 7/15

组合思路、暴露约束和风险讨论有实务价值,且作者披露了部分叠加数字;但数据、规则、完整样本外和同杠杆对照不足,不能直接部署。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究周览解析

周览#1:先看组合尾部和换手,不要被“零过拟合”吸引

Quantitativo weekly

Quantitativo

一句话先讲结论

五篇研究线索里,最值得追问的是“收益从哪里来”:偏度覆盖层改变尾部,面板预测改变换手,而不只是换指标。周览称iTransformer配对夏普1.94、OU基准0.57,但不同Transformer经多重检验后无法区分;这比追逐冠军架构更有研究价值。

它到底在问什么?

周览把多个惊艳结果集中展示,读者很容易以为它们同样可靠、都已可复现。这里逐项拆解研究对象,区分组合改善、预测提升和资产定价解释,不把五条摘要当五篇已读全文。

作者具体怎么做?

  1. 偏度管理研究:对18个异常组合调整高正偏股票暴露。要区分事前预测偏度与事后选中大赢家,后者会制造明显前视。
  2. 协偏度研究:给动量增加尾部覆盖层,周览列偏度−2.58变+0.21、回撤−76%变−30%;要核对是否因总风险下降而非纯择股能力。
  3. 配对研究:同60日窗口下用残差面板预测对照OU,关键是跨资产建模与换手。52周锚研究则使用过去赢家内部的相对锚位置,不是直接买52周新高。
  4. 加密七因子研究:把链上质量、反转和资金费等放入定价框架。解释当期收益的R²不能读成预测明日收益的命中率。

关键结果

原文结果与口径
核对项结果意味着什么
配对交易夏普1.94 vs 0.57周览转述,同60日窗口;成本精确单位未核验。
尾部覆盖层回撤−76% → −30%需在同风险预算下核对,不能只看下降幅度。
七因子表述“零过拟合”不成立内外样本R²接近不能排除数据泄漏或模型选择。

怎么理解?

五篇里两篇都在处理偏度,但经济对象不同:股票自身右尾与动量组合对市场的协偏度并不等价。高彩票需求可能抬高估值,也可能使极少赢家贡献长期回报,必须看选择是在何时、如何完成,不能把两种叙事硬拼成单一交易规则。 周览最需降温的是最后的“zero overfitting”。一个模型在相似环境中内外样本拟合接近,最多说明观察到的性能落差小;并不能证明历史数据版本、token存续池、链上数据时点与因子构造没有泄漏。作为研究员,更合理的下一步是复核标签和交易时点,而不是被9.80的t值说服。

最大限制

这是对完整周览的实质解析,不是五篇底层论文全审;多个源站403,数值保留为周览转述。未核验交易费、退市和借券口径,不能直接复用收益数字制定策略。

复现与研究价值

按问题建复核清单:偏度先查事前预测,配对先拆预测和换手,52周锚先控制原动量,七因子先区分解释和预测。下一阶段逐篇取得正文后再提升论文核验状态,本轮未跑任何实验。

原文与核查

周览正文已解析;五篇底层论文未取得全文,不计作五篇全文已读。

原始文章 ↗

Skewness Managed Portfolios

Coskewness and Reversal of Momentum Returns

Pairs Trading with Time-Series Deep Learning Models

52-week price anchor

Crypto Has Fundamentals

推荐 66/100(暂定) · 问题 26/30 · 证据 15/30 · 方法 20/25 · 复现 5/15

研究地图有价值,摘要式绩效需回到原文逐一审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 期权市场微观结构综述

美股期权零售量已超60%,偏好的短到期OTM期权平均报价价差约12%;券商宕机的82个事件显示零售买盘减少时短期期权IV下降、长期IV反升

The Market Impact of Retail Options Trading

Relative Value Arbitrage;综述Bryzgalova、Pavlova、Sikorskaya及Eaton、Green、Roseman、Wu

一句话先讲结论

一句话先讲结论:该综述引用两项研究称,美国零售投资者已占期权总成交量60%以上,集中交易廉价、短到期、虚值尤其是call的合约,而这些合约平均报价价差约12%;在2019—2021年82次券商故障/限制的差分中的差分中,高零售股票的短期和OTM call隐含波动率在故障期下降,长期IV反而上升。对波动率交易者,含义是零售流量可能重塑期限、行权价与call-put维度,但原文是二手综述,不能直接据此建立可交易IV策略。

它到底在问什么?

零售期权交易是否不仅改变成交量,还会系统性地改变隐含波动率曲面;若会,影响集中在哪些期限、行权价与方向?

作者具体怎么做?

  1. 用交易级数据与新监管披露识别零售订单,和其他零售代理变量交叉验证,并以平台故障/限制时显著下降检验指标有效性。
  2. 刻画零售成交的合约截面:短到期、虚值、call及低名义价格合约,并记录其报价价差。
  3. 把券商故障作为零售参与下降的外生冲击,在高/低零售股票与冲击前/中间做DiD,观察期权买卖量和IV曲面的差异变化。
  4. 按期限、moneyness和call-put分解:零售偏好合约的IV故障期下降;长到期合约因零售通常净卖出,故障期可能上升。

关键结果

原文结果与口径
核对项结果意味着什么
零售规模与渠道零售占美国期权成交量逾60%;约90% PFOF来自三家主要批发商订单流高度集中,零售代理变量与批发商/券商规则变化可能共同反映渠道结构,而非纯粹的投资者需求。
最昂贵的偏好零售偏好廉价周度期权;其平均报价bid-ask spread约12%报价价差不是实际成交成本,但已提示这些合约的摩擦与跳价很高,不能把“零售需求”直接等同于可套利的预期收益。
故障期IV方向高零售股票中,call、短期和OTM合约的IV在故障期下降;长期IV上升方向与零售净买短期凸性、净卖部分长久期的描述一致,影响覆盖IV水平、期限结构、微笑和call-put差。
识别设计2019—2021年82个券商故障/交易限制事件事件提供比横截面相关更强的因果线索,但故障是否随机、事件窗口如何定义及并发市场压力仍需查看原论文。
行为摩擦零售客户常在除息日前未最优行权call,套利者可做“dividend play”这是持仓/行权机制造成的局部价格压力,不等于所有期权零售流量都产生同方向alpha。

怎么理解?

对量化研究最值得借用的不是“散户做错”叙事,而是曲面维度的流量假设:同一只股票的1周OTM call、6月ATM put和LEAP可以面对相反的零售供需。若要交易,信号应以可观测的订单流或可靠代理连接到对冲压力、库存与IV相对价值,并明确何时平仓;仅用股票的散户热度去做long/short波动往往过于粗糙。

最大限制

网页并未提供原研究的完整回归表、事件窗口、标准误、合约筛选、经济量级或成本后组合收益;60%成交量、12%报价价差和方向性结果均为二手转述。券商故障可能同时改变流动性、报价义务和信息环境,DiD平行趋势需要原文图表支持。

复现与研究价值

先直接取得两篇SSRN的版本和数据附录,预注册合约bucket(期限、delta、call-put)及故障窗口;以OPRA逐笔/报价数据计算mid-IV变化、有效价差和成交方向,并配对低零售股票。交易测试以delta-hedged IV相对价值为对象,纳入点差、冲击、跳跃风险与企业事件;若无可观测的零售流量,最多将该结论用于风险过滤而非独立开仓。

原文与核查

公开综述全文完整阅读;两篇被引论文未直接完整核对。

原始文章 ↗

推荐 66/100(暂定) · 问题 21/30 · 证据 18/30 · 方法 20/25 · 复现 7/15

问题和识别思路对期权微观结构有价值,但该条目是二手综述,核心实证、代码和数据均未在本站核对;适合原文跟读而非直接交易。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 代码方法文章

把+40%修成接近零之后:250行验证框架仍有样本外复用问题

Your Backtest Is Lying to You: Building a Walk-Forward Validation Harness in Python

jdivilly930

一句话先讲结论

作者原先两年+40%的扫描策略,修正未来信息、过拟合和成本后接近零;随后把次日开盘成交、0.30%双边成本、简单漂移基准与资金约束放进验证框架。但其“一改进H2就上线”仍会反复消耗同一测试集,不能把一次前后切分称作持续免疫过拟合。

它到底在问什么?

很多策略改进实际上是尺子不一致:用未完成K线生成实盘信号、同根收盘买入、漏费,再把每笔收益平均当作账户表现。文章给出了可检查的代码断点。

作者具体怎么做?

  1. 免费行情按日期×股票面板组织,使用完成日线,t日信号t+1开盘买;对历史门槛明确shift,避免把未来值加入决策。
  2. 200日预热后将可用区间分H1/H2,H1研发H2验证;样例为200日线上RSI2低于10等教学条件,不是作者实盘参数。
  3. 每笔按买卖各边费用乘入价格,双边0.30%;加入简单漂移比较,区分信号挑选能力与牛市普涨。
  4. 组合模拟逐日处理退出和下一开盘入场,限制仓位、行业和资金;跳空跌穿止损时用开盘而非理想止损价成交。

关键结果

原文结果与口径
核对项结果意味着什么
作者调试经历+40% → 约零作者自述,不是本文独立复现的审计数。
示例成本往返0.30%含作者券商换汇环境,不是所有市场通用费率。
反例胜率54%仍亏胜率不含盈亏比与成本,不能单独优化。

怎么理解?

代码最应进一步修的是训练测试边界。以入场索引划分H1/H2,如果H1末尾交易持到H2,选择参数就看到了测试收益,需要按标签结束日purge。多只股票同日交易的t统计也不能假定独立,应该按日期聚类或区块重采样。 用整个下载期是否有280条记录筛股票,会排掉部分短命证券;“当前下载两年”也不是历史时点可得的股票池。文中反复用H2决定改进,久而久之它变成验证集,应另留冻结后的新数据。这个框架是好的卫生起点,不是完成全部统计验证的认证器。

最大限制

未运行外部代码、无独立绩效核实。教学RSI用简单滚动均值而非Wilder递推,复现要保持定义一致;单次二分不等于多折walk-forward。止损触发后的日内滑点仍可能被低估。

复现与研究价值

在框架加交易结束日purge、日期聚类统计、时点股票池和不可反复使用的最终测试段;保留每次尝试日志,并用相同账户约束跑基准。此处仅解析和提出改进,未改用户系统。

原文与核查

正文与展示代码已解析,仓库未执行。

原始文章 ↗

作者公开验证框架

推荐 85/100 · 问题 28/30 · 证据 22/30 · 方法 22/25 · 复现 13/15

示例具体且代码可追踪,边界与测试复用尚需修正。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 组合优化方法研究

优化预测权重时,按资产类别池化在多数样本窗优于全池化、逐品种和权重距离聚类:5年训练/1年测试中位Sharpe 0.557

Jumping back in the pool(ing): pooling by asset class and portfolio weight distance

Rob Carver

一句话先讲结论

一句话先讲结论:作者在214个期货工具中随机抽50个、滚动5/10/20年训练和1/5年样本外,比较不池化、全部工具池化、按资产类别池化和按组合权重距离池化的预测权重估计;5年训练/1年测试中,资产类别池化中位Sharpe 0.557,高于全池化0.425、不池化0.046和权重距离池化0.184;5年/5年为0.731,对应0.391、0.418、0.376。但20年/5年全池化0.569略胜资产类别0.551,结论是资产类别池化是短至中样本的实用默认,而非普遍最优定律。

它到底在问什么?

多资产趋势/预测组合中,每个工具各自估计权重太噪,全市场一起池化又可能抹掉真实差异;应如何在样本量与异质性之间选择池化层级?

作者具体怎么做?

  1. 随机抽50个工具,选择5/10/20年训练和1/5年样本外区间,形成多条历史路径。
  2. 在不池化、全池化、资产类别池化、权重距离k-means池化下估计规则SR和相关性,并使用相同收缩优化。
  3. 对每次实验构造工具等权组合,比较中位样本外Sharpe与最佳方案的t检验p值。
  4. 额外测试将三种权重平均,以降低选择单一池化方法的元拟合风险。

关键结果

原文结果与口径
核对项结果意味着什么
5年训练/1年测试资产类别池化0.557;全池化0.425;不池化0.046;权重距离0.184短样本下资产类别先验显著降低估计噪声。
5年训练/5年测试资产类别0.731;不池化0.418;全池化0.391;权重距离0.376更长持有期下资产类别池化仍领先。
10年训练/5年测试资产类别1.028;不池化0.855;全池化0.575;权重距离0.559中等样本中资产类别池化优势最大。
长期反例20年训练/5年测试:全池化0.569,资产类别0.551样本充分时复杂层级并非总有增益,且可见工具数减少使该组证据较弱。
平均权重5年/1年平均法中位0.650但25%分位-0.067,资产类别0.620且25%分位+0.045均值最好不等于下行情形最好,方法选择应看分布而非只看中位数。

怎么理解?

这是一篇很实用的估计误差研究:先决定哪些回报可以共享样本,再谈均值方差优化。它也反驳了“数据驱动聚类一定优于领域分类”的直觉——当权重本身估计不稳时,用权重距离做第二层聚类会放大噪声。

最大限制

实验随机抽样而非全部工具全排列,样本区间有重叠,且作者是在同一研究系列内选择方案;交易成本和工具权重尚未纳入。资产类别定义也不是天然真相,AHL经验不自动迁移到其他资产或A股因子。

复现与研究价值

在自身策略池上固定资产类别与训练窗口,复现四种池化的嵌套walk-forward;分别报告中位、25%分位、换手和成本后Sharpe。再以层级贝叶斯/部分池化作为对照,并把池化层级视为需在未来样本验证的超参数。

原文与核查

公开全文完整阅读;未独立重跑。

原始文章 ↗

推荐 86/100(暂定) · 问题 27/30 · 证据 26/30 · 方法 24/25 · 复现 9/15

多个训练/测试设计和反例透明,问题直接关联组合优化;但数据代码未公开、成本未纳入且仍可能有研究系列选择偏差。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法复现

三盏风险灯决定 SPY 仓位:8% 年化背后,先看减仓是否真有增量

The Market Regime Filter

Petra Volkova;框架 Gaetano Di Prima / Fabio Baruffa

一句话先讲结论

作者用三项条件给 SPY 配 100%、50% 或 0% 仓位,2008—2026 年回测报告约 8% 年化、18% 最大回撤。规则清楚可重写,但它首先是减仓型风险控制:没有与相同平均仓位或波动率的简单组合比较前,不能把较小回撤全算成识别市场状态的能力。

它到底在问什么?

价格趋势、隐含波动率期限结构和信用风险能否提供互补信息,把“一根均线控制仓位”扩展成多维风险状态?

作者具体怎么做?

  1. 趋势灯:SPY 收盘价高于 200 日简单均线。它描述已有价格方向,不直接判断估值。
  2. 波动率灯:VIX 小于 VIX3M,即近端隐含波动率低于三个月端;信用灯:HYG/IEF 比值的 100 期 z-score 高于 −2。后者是 ETF 相对价格指标,并非直接观测企业债信用利差。
  3. 每天相加三项得分,Score=3 配满仓、Score=2 半仓、Score<2 零仓;演示初始资金 10,000 美元,杠杆 1。
  4. 作者用 Zorro 从头实现并展示约 8% CAGR、18% 回撤,称与原 TASC 结果接近;正文附关键函数与调仓代码,随后评论确认脚本已补上传。

关键结果

原文结果与口径
核对项结果意味着什么
报告年化收益约 8%是复现作者报告,不是本站独立跑出的业绩。
最大回撤约 18%需与同风险水平基准比较,避免把少持股票当择时 Alpha。
仓位规则100% / 50% / 0%离散风险预算,不含空头或动态杠杆。

怎么理解?

这篇可用性在于规则短:每一项通过还是失败都可以追溯,不必先相信一个黑箱状态标签。信用比值有可能补充价格趋势尚未反映的融资压力,但 HYG 和 IEF 对久期也有不同敏感度,因此其含义不只信用。 下一步不是再加第四盏灯,而是拆贡献。趋势、期限结构、信用往往在危机一起变坏,三票可能高度重复。分别删去一项,再与等平均仓位和目标波动率基准比,才能判断多维信息是否真的改善损失尾部。

最大限制

图中业绩未独立重跑,正文没有充分说明现金收益、交易成本、复权以及收盘信号的下一时点成交规则。TASC 标注 2026 年 9 月而博客发表于 7 月,属于原作者版本信息,不改成已经正式逐页核验。

复现与研究价值

按公开代码实现逐日信号,统一下一交易日成交、现金利息和 ETF 总收益;做三项消融、阈值附近测试及平均仓位匹配,不追求单一最优阈值。

原文与核查

正文及全部内嵌核心代码已读,未运行。

原始文章 ↗

共同作者的框架说明

推荐 82/100 · 问题 26/30 · 证据 21/30 · 方法 22/25 · 复现 13/15

核心代码公开、复现门槛低,缺少等风险对照与执行细节。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / backtest_research_article

Silicon vs. Satoshi:NASDAQ-100与Bitcoin战术资产轮动

Silicon vs. Satoshi: Tactical Asset Rotation Between NASDAQ-100 and Bitcoin

Cyril Dujava、Quantpedia

一句话先讲结论

QQQ/BTC突破轮动加现金回退在2019–2025回测中显著压低回撤并提高Sharpe,但未计交易成本且样本只有七年。

它到底在问什么?

能否用半主动突破轮动捕获QQQ与BTC之间的趋势/注意力迁移,并优于被动配置的风险调整收益?

作者具体怎么做?

  1. 按QQQ交易日筛选并把BTC小时价格对齐到QQQ收盘时间
  2. 测试w=5/10/15/20/25/30/40/50交易日Donchian突破
  3. Variant A按QQQ→BTC→cash优先,Variant B按BTC→QQQ→cash优先
  4. 用CAGR、年化波动、Sharpe、最大回撤、Calmar比较被动基准
  5. 建议对10/20/30日信号做组合平均以减小参数敏感性

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

现金回退是回撤压缩的结构来源;5–30日平台比单挑最佳参数更有解释力。

最大限制

未计交易成本、滑点、税费和现金利息;0%无风险率低估现金机会成本;七年样本短;仅多头无杠杆且无实时OOS验证。

复现与研究价值

下载QQQ日线和Bitfinex小时BTC,逐个lookback复算;加入手续费、点差、ETF跟踪误差、现金利息和一日延迟,做滚动walk-forward及分阶段检验。

原文与核查

public_full

原始文章 ↗

推荐 90/100 · 问题 28/30 · 证据 28/30 · 方法 23/25 · 复现 11/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立复现研究

九个美股异象在清洁样本外全部失效:真正的AI价值不是给出更高夏普,而是把构造错误抓出来

Guardrails Make the Researcher: What an AI Agent Got Right (And Wrong)

QuantPedia / PolyQuant AI

一句话先讲结论

一句话先讲结论:在1998—2025年、包含约3万只存活股和3.1万只退市股的无生存偏差样本里,九个已发表美股异象没有一个在2023—2025样本外同时通过显著性与可交易性检验;最初看似样本外Sharpe 1.95的策略,最后被查出是把论文的低52周高点内反转误写成了高52周高点角排序。

它到底在问什么?

大型语言模型能不能真正完成量化研究,而不只是把论文改写成一段看起来合理的回测代码?作者把问题拆成两层:异象在干净数据上是否复现,以及AI代理能否知道自己什么时候复现错了。

作者具体怎么做?

  1. 先给代理九篇论文和点时数据,要求它提取股票池、信号、持有期、换仓日、权重和费用;在回测前把这些定义写成逐篇 dossier card,并与论文原文逐句核对。
  2. 再做两轮独立检查:代码保真检查入口、出口、再平衡和费用;交易日志检查实际成交数量、时间、缺失数据、异常交易以及是否真的按论文描述在交易。
  3. 最后对候选结果做点时流动性与陈旧价格过滤、换手成本压力测试、因子分解、第二引擎复跑,并把所有九个异象放在同一张样本内—样本外 alpha 图上比较。

关键结果

原文结果与口径
核对项结果意味着什么
样本与时间约30,000只存活股 + 31,000只退市股;1998—2025通过保留退市标的和点时成分,降低生存偏差与未来成分泄漏。
九异象样本外结论2023—2025没有一个同时显著且可交易作者报告样本外没有异象通过 t>2 或更严格 t>3 门槛;36个样本外月的多重检验校正后也没有单点显著。
错误构造的假赢家Sharpe 1.95 → 按论文重建后显著为负这个数字不是论文策略的结果,而是角排序、等权和信号定义错误共同制造的假阳性。
低价异象的价格字段实验拆分调整价曲线约500倍;真实成交价曲线趋近于零同一个排序只替换价格字段,就能把未来拆股信息偷偷带进当前排序,说明看似强劲的异象可能只是字段级前视偏差。
可交易性压力某微盘停牌股单月+76%,过滤后约+0.1%;反转组合年换手约2,200%极端单月和真实成本足以改变策略的经济含义,不能只看零成本净值。
被动基准2023—2025 SPY年化约22.9%、Sharpe 1.43、最大回撤18.8%在窄幅大盘科技股上涨阶段,长-only异象即使不亏,也很难在收益或风险调整收益上胜过被动基准。

怎么理解?

这篇真正有用的地方不是“AI发现了一个能赚钱的异象”,而是把研究流程里最容易被忽略的三个环节做成可审计对象。第一,论文中的自然语言定义必须在回测前逐句落地;第二,代码检查不够,交易日志能发现零交易、错误成交日、异常订单和数据请求失败;第三,所有漂亮结果都要经过现实成本和独立引擎检验。 对量化研究员,最值得记住的是那条1.95 Sharpe的假阳性:模型不是简单地把数字算错,而是把研究对象换了。它把“低52周高点内的短期反转”换成了“高点附近回撤”,而后者恰好在2023—2025大盘科技上涨环境里受益。这个错误如果只看代码能否运行、净值是否平滑,很难被发现。 文章也没有证明“所有异象都不存在”。它只是在一个固定数据起点、固定九篇论文和36个月样本外窗口下,没有发现可交易的存活者;数据从1998年开始,不能回答原论文更早历史是否曾经有效。正确的结论是:在今天准备把论文异象交给AI自动复现时,防错流程比让模型再多试几个参数更重要。

最大限制

这是QuantPedia/PolyQuant AI的独立复现,不是对九篇论文的正式期刊再审计;正文没有公开每个异象的完整逐月收益、全部成本参数和第二引擎代码。样本外只有2023—2025约36个月,多重检验后不能把‘未显著’解读为数学上的不存在。

复现与研究价值

最适合落地成内部研究门禁:每篇论文先生成原文定义卡,再生成代码与交易日志双审计卡;候选信号必须同时报告零成本、现实成本、换手、借券、单月异常贡献和样本外表现。下一步应对一个已知有正、负复现结果的盲测论文集评分,直接测量AI代理识别“可复现/不可复现”的准确率。

原文与核查

公开正文完整阅读;按文章公开数字整理,未独立运行九个异象。

原始文章 ↗

推荐 95/100 · 问题 29/30 · 证据 29/30 · 方法 25/25 · 复现 12/15

有点时数据、固定样本外、错误构造反例和独立引擎复核,研究流程证据很强;但完整逐篇数据与代码尚未全部公开。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-blog

Pooling rule p&l estimates

One of These Things Is Not Like the Others. Or is it? Pooling rule p&l estimates

Rob Carver

一句话先讲结论

将统计上无法区分的工具按收益序列池化可以提高估计精度,但作者强调当前实验尚未纳入交易成本。

它到底在问什么?

如何在不同交易规则和工具之间估计P&L/Sharpe,并避免对单个工具的噪声估计过度反应?

作者具体怎么做?

  1. 逐个工具估计各规则Sharpe向量
  2. 按可用数据长度计算配对临界值并比较Sharpe距离
  3. 将统计上无法区分的最近工具收益合并为伪池化工具,重复直至无可合并对

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:这是估计稳定性和数据共享方法,而非独立交易信号;核心价值在于把相似工具的信息用于降低参数方差。

最大限制

原文摘要未给出完整样本表、净收益、统一OOS统计或最终推荐池化方案;临界值依赖样本长度和检验设定;未含交易成本。

复现与研究价值

取得系列前后文和代码,复刻距离/临界值算法;加入交易成本、滚动OOS、工具相关性及不同临界值敏感性。

原文与核查

public-original-read

原始文章 ↗

推荐 70/100 · 问题 22/30 · 证据 18/30 · 方法 21/25 · 复现 9/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 组合优化与否定性结果

用指数加权更新Sharpe并未系统胜过全样本:20年训练/5年测试时全历史估计SR 0.149,高于5/10/20/30年EWM的0.093/0.119/0.134/0.132

Rolling, rolling, rolling.... updating statistical estimates yes or no

Rob Carver

一句话先讲结论

一句话先讲结论:Carver随机抽取品种与9条预测规则,在10/20/30/40年训练、1/5年样本外的组合优化中比较5/10/20/30年EWM Sharpe估计和全历史估计;并没有“越新数据越好”的普遍证据。最清楚的一格是20年训练、5年测试:全历史SR 0.149,高于5年0.093、10年0.119、20年0.134和30年0.132;结论是除非有强且可验证的失效机制,缩短Sharpe历史往往只是增加估计噪声。

它到底在问什么?

策略/规则Sharpe可能非平稳时,组合优化是否应对近期收益加更高权重,还是保留全部可用历史以降低估计误差?

作者具体怎么做?

  1. 随机化品种、规则和样本窗,而不是挑选一个已知失效案例;每次在同一训练窗上跑所有EWM及全历史选项。
  2. 对每种设置估计规则Sharpe,相关性仍用全训练样本,并以固定收缩后做样本内优化。
  3. 在1年或5年未来窗计算组合样本外Sharpe,跨重复子样本取中位数,再比较最优设定相对其他设定的p值。
  4. 额外加入每条规则的反向版本,令优化能机械挑正Sharpe,检验结论是否只是先知道规则方向的隐性拟合。

关键结果

原文结果与口径
核对项结果意味着什么
20年训练、5年测试全历史0.149;5/10/20/30年EWM为0.093/0.119/0.134/0.132在这组最直观表格中,较短记忆没有赢;差异部分显著,方向支持更长估计。
10年训练、1年测试最优20年span SR0.033;全历史0.017,二者差异不显著(p=0.131)短窗口下可见微小表面优势,但不足以作为选择20年span的证据。
30年训练、1年测试全历史0.042,5/10/20/30年span为−0.073/−0.078/−0.031/−0.005慢更新在这一配置明显劣于全部历史;负SR也提醒单年测试噪声很大。
隐性拟合检查加入反向规则后,多数短窗优势仍不显著预先只保留历史上正确方向的规则会放大乐观偏差,作者明确把此作为对照。
EWM尺度30年span半衰期约10.3年;40年span约28年SMA若确要遗忘,应非常慢;短EWM等同把本来稀少的规则绩效样本再大幅削薄。

怎么理解?

这是一篇很有价值的“不要为非平稳而非平稳”反例。参数更新有偏差—方差权衡:最近数据可能更相关,但Sharpe本身估计误差极大,组合权重会把误差放大。结论不是永远不用滚动,而是默认全历史/慢更新,只有当结构变化的外部证据和预先规定的变点规则存在时才削减历史;相关性与预期收益也应分开决定记忆长度。

最大限制

作者的10—40年训练窗不适用于短历史资产或当前高频信号;成本被明确设为零,固定收缩不随EWM有效样本变动,且相关性一律全历史。随机抽样重复次数、规则族和统计检验细节未完全披露;非平稳极强的制度变革场景未被单独识别。

复现与研究价值

对现有策略逐参数建立全历史、慢EWM、短EWM和预先定义变点四组,不以同一段样本选赢家;将有效样本量映射到随窗口变化的Sharpe/协方差收缩。用嵌套walk-forward检验,并报告权重周转与成本;若短记忆胜出,要求它在相邻未来窗口和不同规则池中持续胜出,且与可解释的市场结构变化相吻合。

原文与核查

公开全文完整阅读;作者实验未独立复跑。

原始文章 ↗

推荐 92/100 · 问题 29/30 · 证据 26/30 · 方法 25/25 · 复现 12/15

随机化子样本、多个训练/测试长度、反向规则对照和显著性比较构成很强的研究设计;缺完整数据和代码,无法独立核对数值。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 趋势跟踪与个人资产配置

三ETF风险溢价核心按自身趋势0—100%倾斜并慢速放大后,作者报1970—2026年Sharpe 1.23对核心约1.0、CAGR10.1%对8.1%、回撤−15%对−32%;但2008年以来Sharpe反而1.03对1.08

Trend Following (4/4): The Poor Man’s Trend Program

Beyond Passive Investing

一句话先讲结论

一句话先讲结论:作者把SPY/TLT/GLD式的长期风险溢价核心按各自趋势从0%到100%权重倾斜,再用10年实现波动率把整体慢速放大到8%,报告1970—2026年CAGR 10.1%对被动核心8.1%、Sharpe 1.23对约1.0、最大回撤−15%对−32%,均称已计融资;但只看真实ETF期的2008—2026,趋势倾斜Sharpe 1.03低于核心1.08,只把最差回撤从16%降至10%。这更像为股债同跌/滞胀设计的长期保险,而不是近年稳定增收的择时策略。

它到底在问什么?

无法以小账户直接持有十个期货部门时,能否把趋势信号嵌入一个长多风险溢价核心,保留危机去风险功能而不做空或高频杠杆?

作者具体怎么做?

  1. 先用按风险而非名义金额的方式计算十个期货部门的最小可实施粒度,说明为什么少选几个“高Sharpe部门”不能复制广度。
  2. 构建三资产长期核心,以逆波动权重和共同规模因子确定被动基线;每个资产只由自身趋势把持仓在0—100%间倾斜。
  3. 现金头寸获得Fed Funds、偶发借款付Fed Funds+1.5%,在净融资后比较被动核心与趋势倾斜核心。
  4. 避免短窗反应式vol targeting:用拖后10年波动率一次慢放大到8%,1970年代burn-in固定约1.5倍,再分解长期和2008后表现及股债正相关/下跌阶段。

关键结果

原文结果与口径
核对项结果意味着什么
可实施性门槛十部门理想下限约$711k;考虑相关性与更细粒度约$1.0–1.4m限制来自合约整数粒度和风险预算,不是零售无法交易期货;但金额依赖波动、保证金和合约规格,随时间变化。
未放大时的现金效应深历史图示Sharpe 1.50,剔除闲置现金利息后1.12高利率70—80年代的现金收益显著抬升表面风险调整表现,必须与纯趋势贡献拆开。
慢放大长期结果1970—2026:Sharpe 1.23对核心约1.0,CAGR10.1%对8.1%,MDD−15%对−32%这是作者最强主张;策略收益集中在股票下跌且股债正相关的滞胀/2022型环境。
现代ETF检验2008—2026:倾斜/核心Sharpe 1.03/1.08,MDD约10%/16%近代样本显示了保险的成本:平静股债牛市中略牺牲Sharpe,换取较浅的尾部回撤。
风险预算缺口未放大组合约5.5%波动;10年尺度放大约1.5倍至8%放大应被视为长期风险预算校准;若用短窗频繁调整,可能抵消趋势在弱信号期主动降风险的设计。

怎么理解?

文章把“趋势是独立alpha”改写为更可用的资产配置语言:在核心资产本身走弱时少持,而不是预测明天涨跌。关键条件是比较必须在同一融资、同一长期风险预算下进行;尤其要把闲置现金收益、合成历史和慢放大前后分开。对家庭/低换手投资者,它可作为风险覆盖层;对追求近期绝对收益者,2008后样本不支持把它当作增强器。

最大限制

深历史很可能依赖代理序列与回填,三资产选择、趋势指标、逆波动窗口和1970年代固定1.5倍burn-in均有研究自由度;Fed Funds融资假设忽略ETF税费、滑点和真实保证金。2008以来仅一次2022型股债同跌,现代样本对“保险”本身也不充分。

复现与研究价值

以公开SPY/TLT/GLD从2008起严格复现,披露趋势定义、滞后、波动估计、现金/借款与再平衡;同风险对比静态60/40、风险平价、12月动量覆盖和仅降低总波动的版本。对深历史逐段替换可交易代理并报告数据来源;压力测试股债相关转正、利率归零及融资利差上升,重点比较条件回撤而非全期Sharpe。

原文与核查

公开全文完整阅读;作者回测未独立复跑。

原始文章 ↗

推荐 83/100 · 问题 27/30 · 证据 24/30 · 方法 22/25 · 复现 10/15

规则、融资处理、账户约束及现代反例都清楚,且不回避保险成本;但长历史、信号与代码不可审计,关键数字未独立复现。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 交易成本与容量

同一日内均值回复在不同AUM不是同一策略:作者的单次MIT执行下,$20k是费用下限、$50k净Sharpe峰值、$100k以上冲击主导;若假设拆成4单,最优AUM才升至$500k

Estimating the Capacity of a Trading Strategy

Concretum Research

一句话先讲结论

一句话先讲结论:作者以单股票日内均值回复为例,不把容量定义成一个“最大资金”,而是同时问最小、最优和上限AUM:在$0.0035/股、每笔最低$0.35(卖出翻倍)及I-Star冲击假设下,单次MIT执行约$20k以下被最低佣金侵蚀,$50k净Sharpe最高,$100k以上冲击变得不可接受;但若能把订单拆成4份且假定不损失价格,最优可推到$500k。真正结论是容量由执行算法、Q/ADV和信号允许延迟共同决定,不能从一个零成本Sharpe外推。

它到底在问什么?

给定一个有历史毛Sharpe的信号,如何在资金随净值变化、费用有最低门槛、冲击非线性的情况下,分别估计最低可运行资本、净收益最优资本与需要升级执行算法的容量上限?

作者具体怎么做?

  1. 先预设离散参考AUM,而不是从历史净值自然增长中事后读出容量。
  2. 在每个AUM上重算固定佣金和非线性市场冲击,并以tcost_norm=AUM(t−1)×tcost(AUM_ref)/AUM_ref令成本口径可比。
  3. 绘制净成本后Sharpe随AUM的侵蚀曲线,分别定位最低可行、净Sharpe最优和无升级执行时的上界。
  4. 把执行复杂度显式写为Q/ADV和信号到成交容许时间的函数,模拟订单切片对右侧冲击曲线的影响,但不把理想切片直接当实盘结果。

关键结果

原文结果与口径
核对项结果意味着什么
容量三点约$20k最低、$50k净Sharpe峰值、$100k单次MIT上界同一策略同时存在“太小不划算”和“太大冲击高”,容量不是单调越大越好。
毛Sharpe起点理论Sharpe略高于1作者只报告量级未给完整净Sharpe曲线;任何“最佳$50k”均依赖股票池、交易频率和费用方案。
成本函数IB $0.0035/股、最低$0.35/笔;卖出按两倍;I-Star a1=708、a2=.55、a3=.71参数将佣金门槛与冲击同时纳入,但I-Star估计、ADV/波动窗口和MIT实际滑点需要独立数据验证。
切片的条件提升假设4个子单同价成交,净Sharpe最优AUM约$500k十倍提升来自强假设;现实切片会面对信号衰减、排队、未成交和不同市场状态,不能直接外推。
执行变量复杂度=f(Q/ADV, signal-to-execution时间T)容量应作为策略×执行方式×允许延迟的联合函数,而非研究报告中的单一AUM数字。

怎么理解?

这篇最值得抄的是报告框架:每个策略都应输出容量曲线而不是容量点估计,并把下限(固定费)与上限(冲击)分开。对低频大盘股策略,下限可能无关;对高频/小单策略,下限足以改变组合选择。对大资金,提升容量通常不是“加钱”,而是牺牲部分信号时效换更低Q/ADV;这是收益预测与执行共同优化的问题。

最大限制

完整策略、股票筛选、交易次数、实际MIT成交、完整I-Star校准及净Sharpe表不可见;MOC无滑点、fractional shares和4单同价均属理想化。冲击在危机/拥挤时会非线性跳变,单一ADV和波动窗口不足;税费、借券、延迟成交风险未覆盖。

复现与研究价值

对每个候选策略以固定AUM网格重放逐笔/分钟级订单,分别记录最低佣金、spread、短期冲击、延迟和未成交;按正常/高波动/低流动性分层报告容量。将执行算法作为独立策略版本,要求切片后仍在冻结样本保留信号half-life;比较在同一净风险下“扩AUM”“扩股票数”“降换手”“延迟执行”的边际净Sharpe。

原文与核查

公开可读部分完整阅读;付费策略规则和完整表未取得。

原始文章 ↗

推荐 83/100 · 问题 28/30 · 证据 23/30 · 方法 23/25 · 复现 9/15

把容量拆为最小/最优/上限并提供明确AUM、费率和冲击参数,实务框架很强;但策略规则和完整结果受付费限制,理想执行假设需独立验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / quant_research

Systematic FX trading with regression learning and transaction cost analysis

Systematic FX trading with regression learning and transaction cost analysis

Ralph Sueppel、Stefan Swandel、Palash Tyagi、Macrosynergy

一句话先讲结论

逐期、无前视的面板回归学习可把10个宏观因子组合成FX信号;在8个开发市场货币上,成本后收益仍为正,但规模提升会压低Sharpe。

它到底在问什么?

如何在点时宏观信息下顺序选择回归模型和超参数,并把仓位变动、展期和规模相关成本纳入FX远期回测?

作者具体怎么做?

  1. 用JPMaQS点时宏观信息状态构造并标准化、缩尾因子
  2. 以面板结构、滞后特征和Rolling/ExpandingKFold做逐月模型与超参数选择
  3. 用Sortino与正负预测balanced accuracy组成交叉验证评分,生成下月信号
  4. 将信号映射为USD名义仓位,按中位/90分位ticket size估计交易及展期成本
  5. 在不同模型、杠杆和AUM下比较预测显著性、PnL、Sharpe、成本和基准相关性

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

作者报告:低频、流动性较好的FX策略具规模化潜力且与股债基准近零相关。编辑判断:成本参数由提示生成并假设静态,不能替代真实交易场所报价和冲击模型。

最大限制

JPMaQS/DataQuery为受限数据;交易成本主要是静态、提示生成的中位/90分位参数,未完整建模时变流动性、融资、容量和真实成交。

复现与研究价值

取得可用JPMaQS数据与Notebook,逐步复现面板切分、模型选择、ProxyPnL和成本;替换为历史点差/成交数据并做真实AUM、冲击、滚动和时变成本压力测试。

原文与核查

public_full_article

原始文章 ↗

推荐 92/100 · 问题 29/30 · 证据 28/30 · 方法 24/25 · 复现 11/15

原文方法、样本、模型、成本函数和多组绩效均公开,且提供Notebook;主要扣分来自专有数据和成本参数的可获得性。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-summary

The Impressive Markets Hypothesis: Prices Still Know the Future

The Impressive Markets Hypothesis: Prices Still Know the Future

William Ezratty、Gerald Garvey、Timothy McDade、Andrew Robinson

一句话先讲结论

2004—2024年美国股票数据并不支持市场因社交媒体和信息过载而显著失效的叙事;价格仍能预测未来经营现金流,但对收入预测增强、对利润率预测减弱。

它到底在问什么?

价值价差扩大是否意味着市场变得更不有效?股价今天包含的估值信息是否仍能预测未来现金流,且这种能力是否随时间下降?

作者具体怎么做?

  1. 用当前book-to-price预测一年后经营现金流
  2. 控制当前盈利能力并检验价值价差交互项
  3. 将整体盈利能力拆成资产周转率和利润率,比较两者的时间趋势

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:文章不是宣称市场完全有效,而是把“市场效率”改写为价格对未来基本面的预测能力;当前潜在主动管理机会更可能在成本、供应链和利润率信息。

最大限制

公开来源为二次解读;需核对论文的样本筛选、固定效应、聚类和经营现金流定义;20年美国样本不能直接外推全球市场。

复现与研究价值

获取JPM论文原文,复刻book-to-price预测、价差交互和收入/利润率分解;加入行业、规模、流动性、替代数据覆盖及2025年后样本。

原文与核查

public-secondary-summary-read

原始文章 ↗

推荐 83/100 · 问题 27/30 · 证据 24/30 · 方法 22/25 · 复现 10/15

问题清晰且全文公开,结果披露较充分;但当前可核验材料主要是二次解读,论文细节和原始数据仍需补齐。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-summary

Why Mean-Variance Optimization Breaks Down

Why Mean-Variance Optimization Breaks Down

VertoxQuant

一句话先讲结论

原始插件式MVO将均值和协方差估计误差通过逆协方差算子放大,导致极端权重、高换手和样本外崩溃;收缩、因子结构和约束是降低权重方差的主要手段。

它到底在问什么?

为什么理论上优雅的MVO在真实数据中经常产生不稳定、过度杠杆化且样本外表现差的组合?

作者具体怎么做?

  1. 从经典MVO和KKT条件解释均值/协方差估计误差如何进入权重
  2. 说明逆协方差会把看似低风险但实际由噪声主导的方向赋予极端权重
  3. 将修复方法分为输入正则化和优化器正则化两类

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:文章的核心是统计决策观点——实际最优不是估计参数下的最优,而是不确定性、非平稳性和可实施性约束下的稳健决策。

最大限制

公开正文主要是理论解释和方法综述;模拟数据、资产、窗口和成本假设披露有限;“效用提升超过100%”未在摘要中给出可核验表格。

复现与研究价值

复现样本均值/协方差MVO,比较Ledoit-Wolf收缩、因子模型、Black-Litterman、ridge/LASSO、鲁棒优化和换手惩罚;统一成本和OOS评估。

原文与核查

public-original-and-summary-read

原始文章 ↗

推荐 78/100 · 问题 25/30 · 证据 20/30 · 方法 23/25 · 复现 10/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立回测

七个主要货币对的趋势跟踪有薄薄的边:只有USDJPY和EURUSD超过Sharpe 0.5交易门槛,等权组合反而只有0.43

FX Trend-Following: A Walk-Forward Validation Study

QuantInsti

一句话先讲结论

一句话先讲结论:2003—2025滚动样本外的21个‘策略×货币对’组合里,只有USDJPY时间序列动量Sharpe 0.78和EURUSD 0.54超过作者设定的0.5交易门槛;所有组合整体样本外Sharpe仅0.14,最佳策略等权组合0.43,说明这是广而薄的边,不是普遍可交易的强信号。

它到底在问什么?

经典外汇趋势跟踪在加入walk-forward、波动率目标、交易成本和swap后还剩多少?危机窗口是否真的提供危机alpha?

作者具体怎么做?

  1. 使用2000年起的Stooq数据,保留2008危机和2022加息周期。
  2. 对三类策略、七个货币对和四个波动率目标运行23个walk-forward折,报告中位数样本外Sharpe。
  3. 单独做危机窗口、融资杠杆和交易成本敏感性,观察边际是否来自杠杆放大。

关键结果

原文结果与口径
核对项结果意味着什么
超过Sharpe 0.52/21:USDJPY 0.78、EURUSD 0.54只有两组达到作者的交易门槛。
整体边际全组合总体Sharpe 0.14多数货币对和策略虽为正,但幅度很小。
最佳组合Best Strategy Equal Weight Sharpe 0.43组合分散提高稳定性,但仍低于0.5交易门槛。
成本结论基础交易和swap可控;加杠杆后成本/清算风险侵蚀明显不能用线性放大收益替代路径依赖的融资和清算模拟。

怎么理解?

这篇的优点是把‘趋势有效’和‘值得交易’分开:正收益的组合很多,但过0.5门槛的只有两组。walk-forward的中位数也比挑一条最好的完整历史曲线更诚实。 外汇趋势的危机alpha同样不能只靠危机窗口图来证明;作者对杠杆的路径依赖处理说明,融资成本、波动率目标和清算规则会改变结论。对实盘而言,0.43的组合Sharpe更像分散化模块,不能直接当成高收益策略。

最大限制

数据来源为Stooq,完整代码与逐笔交易未在本文完全展示;23个fold和阈值设定仍需独立核验;swap成本依赖经纪商与时间。

复现与研究价值

使用点时FX swap曲线和真实可成交价重新跑walk-forward;按货币对留一验证,并报告净收益、换手、融资、最大杠杆和清算频率。

原文与核查

公开正文与结果表完整阅读;未独立重跑。

原始文章 ↗

推荐 89/100 · 问题 28/30 · 证据 25/30 · 方法 25/25 · 复现 11/15

样本外折叠、成本、阈值和组合结果均有具体数字,研究结论克制。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-blog

Breaking Badly: finding the structural breaks in parameter estimates

Breaking Badly: finding the structural breaks in parameter estimates

Rob Carver

一句话先讲结论

自动结构断点识别能找到少数明显制度变化,但在作者的七组样本外优化实验中,不使用断点往往同样好甚至更好,说明断点筛选不能默认改善参数估计。

它到底在问什么?

参数估计既需要长历史提高显著性,又可能受制度变化污染;如何自动识别相关断点而非凭图形挑选?

作者具体怎么做?

  1. 对候选首段与其后样本做顺序切分,最短估计窗口设为5年
  2. 标准化两段收益后以独立样本t检验判断断点
  3. 找到断点后递归处理后段,并比较全样本与断点后样本的样本外Sharpe

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:该文最重要的负结果是“看起来合理的断点识别”未必带来更好的样本外优化;断点可能反转时,递归算法也无法重新合并旧制度。

最大限制

t检验假设、临界值和最短窗口是作者情境设定;算法无法识别A-B-A反转制度;样本外实验数量有限且依赖作者交易规则。

复现与研究价值

复刻伪代码和七组OOS实验;比较QLR、Bai-Perron、贝叶斯变点及反转断点算法;加入相关性参数、交易成本和跨工具池化。

原文与核查

public-original-read

原始文章 ↗

推荐 82/100 · 问题 25/30 · 证据 24/30 · 方法 22/25 · 复现 11/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立复现

2006—2025样本外的简单200日均线TAA仍有Sharpe 0.68,但再平衡日选择本身能制造约220bp CAGR差异

Global Tactical Asset Allocation, Automated With Python and IBKR

Concretum Group

一句话先讲结论

一句话先讲结论:五类资产、200日均线、月末再平衡的全球战术配置在完全未调参的2006—2025样本外实现年化6.05%、Sharpe 0.68、最大回撤11.7%,但仅改变每月再平衡日就能造成约220bp CAGR差异,说明这部分表现很可能混入了再平衡时点运气。

它到底在问什么?

一个在1972—2005样本内表现很好的简单TAA规则,跨过全球金融危机、疫情和通胀冲击后还剩多少?实施细节会不会比信号本身更重要?

作者具体怎么做?

  1. 先复现1972—2005样本内结果,再把相同规则冻结到2006—2025。
  2. 比较不同月内再平衡日,量化结果离散程度;随后引入一天信号滞后和10bp成本。
  3. 用Python notebook连接IBKR,展示从数据、信号、订单到实时执行的完整链路。

关键结果

原文结果与口径
核对项结果意味着什么
样本外表现CAGR 6.05%;Sharpe 0.68;最大回撤11.7%简单规则在多种压力期仍有正的风险调整收益。
样本内对照Sharpe 0.81;CAGR 11.7%;最大回撤9.5%样本外下降符合预期,不能用样本内数字部署。
再平衡择时最好/最差日CAGR相差约220bp不是信号alpha,而是月内价格路径造成的实施差异。
成本10bp成本约拖累41bp/年;一天滞后略改善流动性好时摩擦可控,但仍不能忽略。

怎么理解?

这篇最适合提醒研究员:简单规则即使样本外表现不错,实施日期也可能贡献很大一部分差异。220bp的再平衡时点离散不是小数点误差,它足以把一个不错的回测变成普通结果。 作者提供可执行notebook是加分项,但连接IBKR并不等于已经有真实成交验证;仍需把信号生成时点、收盘价可得性、滑点和税费逐项锁定。

最大限制

正文主要展示指数级回测;最大回撤按月观察可能低估日内回撤;再平衡日选择的完整分布与代码需独立核验。

复现与研究价值

把月内再平衡日做成预先固定的多日组合,或直接用分层再平衡降低时点运气;独立报告日级回撤、真实收盘成交和税费。

原文与核查

公开正文、结果和实现说明完整阅读;未独立连接IBKR运行。

原始文章 ↗

推荐 93/100 · 问题 29/30 · 证据 28/30 · 方法 25/25 · 复现 11/15

有明确样本外、实施敏感性、成本与公开notebook,结论可直接转为复现任务。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 初步事件研究

新闻情绪和财报情绪在极端端点同向,但21个事件去掉四个角点后相关系数从0.63降到0.25,不能当预测信号

News and earnings sentiment agree, mostly at the extremes

Tommi Johnsen

一句话先讲结论

一句话先讲结论:在2026年5月下旬至6月初、21个有完整事后窗口的财报事件里,新闻情绪与模型财报情绪的相关系数约0.63,主要由强多和强空两端支撑;去掉两个空头事件后降到0.42,去掉四个角点后仅0.25,因此它目前证明的是事后叙事一致,不是股价预测。

它到底在问什么?

新闻报道的语气是否和模型从财报及电话会提取的情绪一致?这种一致是互补信息、同一叙事的不同表达,还是能预测后续收益?

作者具体怎么做?

  1. 新闻管线从5月16日开始,选取同时有事前/事后覆盖的Q1财报事件。
  2. 按情绪桶比较新闻和财报分数,观察中间Neutral与Buy是否真正分开。
  3. 删除两个空头事件和四个端点事件,检查相关性是否由少数极值驱动。

关键结果

原文结果与口径
核对项结果意味着什么
完整样本相关r约0.63主要体现情绪桶从空到多的顺序,不等于收益预测。
去掉两个空头r降至0.42负向关系几乎依赖LULU和WMT两个样本。
去掉四个端点r降至0.25低于作者阈值,中心样本并没有明显线性关系。
样本量21个事后、13个事前事件只能作为基线快照,不能作为稳定规律。

怎么理解?

这篇最值得保留的是作者自己把‘相关’拆成了‘端点驱动的排序’。如果Neutral和Buy几乎重合,只有Strong Sell与Strong Buy把回归线拉开,那么相关系数看起来不错也不意味着中间的大多数事件可区分。更重要的是,事后新闻跟随财报是描述性一致,不是可交易的领先信号。 对量化研究员,下一步必须从相关性转到事件窗口收益,并预先定义新闻发布时间、财报发布时间、异常收益基准和端点处理。

最大限制

样本只有三周左右,新闻覆盖从5月16日开始;端点样本极少,未给出收益预测、交易成本或多重检验。

复现与研究价值

扩展到至少数百个事件,严格区分公告前/后新闻,按行业和市值分层;报告异常收益、信息发布时间延迟和删端点后的置信区间。

原文与核查

公开正文完整阅读;未独立获得情绪原始数据。

原始文章 ↗

推荐 69/100(暂定) · 问题 22/30 · 证据 20/30 · 方法 20/25 · 复现 7/15

端点敏感性披露得很诚实,但目前只是小样本一致性快照。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文公告

变量比样本还多时,协方差估计的第一步是选假设,不是直接求逆

Covariance Estimation for Wide Data

Eran Raviv

一句话先讲结论

这篇是作者对已发表于WIREs Computational Statistics的高维协方差综述的介绍:它把因子模型、收缩、阈值、图模型和随机矩阵等方法放进统一框架,核心问题是变量数超过样本数时如何得到可用的矩阵。公告没有比较哪种方法带来最高组合收益,因此它是方法选型入口,不是一个新Alpha结果。

它到底在问什么?

当资产数量多于有效历史观察,样本协方差难以稳定估计甚至不能直接求逆,研究员究竟应该减少维度、收缩噪声,还是对相关结构加限制?

作者具体怎么做?

  1. 作者从变量数超过观察数的宽数据问题出发,梳理统计、计量与机器学习中通常分开讨论的协方差估计路线。
  2. 内容包括因子模型、线性与非线性收缩、阈值估计、分块平均、图模型和随机矩阵理论,尝试统一符号与框架,使不同假设可比较。
  3. 另设部分讨论实际应用中如何保证估计矩阵有效,例如可逆性;这决定矩阵能否安全进入优化器,而不只是拟合样本相关系数。

关键结果

原文结果与口径
核对项结果意味着什么
材料类型期刊综述发表公告已知研究主题与方法目录,不代表本页给出了完整综述的证明和结果。
困难场景变量数大于观察数高维估计需要结构性假设,普通样本矩阵不适合作为无条件默认答案。
收益比较未报告公告未报告任一方法在交易组合中的净收益优势。

怎么理解?

对研究员,这类综述的价值不在于多记几个估计器名称,而在于说清自己的数据适合什么约束。因子模型把共同变化压缩到少数方向;稀疏或图结构则假设很多条件关联可以忽略;收缩是在样本信息与较稳定目标之间折中。不同路线不是可随意互换的“降噪按钮”。这些是方法层面的编辑解释,不是公告中的实验结论。 组合优化还会放大估计问题:看起来误差不大的协方差,求逆后可能给出巨大权重。即使矩阵已经正定可逆,也不意味着预测稳定或组合合理。方法选型必须同时观察权重敏感性、换手与极端敞口,不能把成功求逆当成验证通过。

最大限制

本次阅读的是完整公告,尚未取得和逐章审核综述全文;不评价各方法证明完整性或实际排名。公告没有提供可复现的数据与统一基准,因此此条按公告范围完成解析。

复现与研究价值

将它作为阅读导航:先明确自有数据的资产数、窗口长度、缺失结构与优化目标,再选样本协方差加约束、收缩和因子模型做冻结基准。用真正未来窗口比较风险预测、权重稳定性及成本,不只比较训练期拟合误差。

原文与核查

作者发表公告完整解析;综述全文未取得和逐章审核。

原始文章 ↗

推荐 57/100(暂定) · 问题 22/30 · 证据 12/30 · 方法 18/25 · 复现 5/15

选型导航有价值,但公告不是全文,不能给实证或复现高分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 组合研究

十只ETF等权不等于十个风险来源:风险平价和聚类把高波动资产降权后,回撤更小但收益也更低

Why Most Portfolios Are Under Diversified

QuantPedia

一句话先讲结论

一句话先讲结论:十只ETF各配10%看似分散,但股票、信用和比特币的高波动与相关性主导了组合波动;风险平价明显降低回撤、牺牲绝对收益,聚类风险平价在作者的样本中进一步改善风险调整指标,但正文没有给出可独立核验的完整数值表。

它到底在问什么?

资本权重分散是否真的等于风险分散?如果多个资产属于同一风险簇,应该按单资产还是按独立风险来源配置?

作者具体怎么做?

  1. 先用Portfolio Risk Parity报告拆解等权组合的风险贡献与相关矩阵。
  2. 计算资产级风险平价,压低比特币和股票权重,提高低波动债券权重。
  3. 再按收益特征聚类,比较聚类稳定性和簇级风险贡献。

关键结果

原文结果与口径
核对项结果意味着什么
等权组合资本分散,风险集中高波动资产主导组合轨迹,10%权重不是10%风险。
资产级风险平价回撤显著下降,绝对收益下降稳定性改善伴随收益机会成本。
聚类结构比特币独立;股票/信用同簇;债券成簇真实独立风险来源少于资产数量。
聚类风险平价作者报告收益更高且风险受控方向性结果有启发,但需完整数值和样本外重跑。

怎么理解?

文章的价值是把‘我有十个资产’改写成‘我到底有几个风险来源’。资产级风险平价已经能修正波动率差异,但相关资产仍会重复贡献同一风险;聚类是更接近组合真实结构的做法。 不过正文把图表结论说得比数字更具体,缺少下载数据和完整回测表,因此这里不补填作者未列出的收益率、Sharpe和最大回撤。

最大限制

没有统一时间区间、成本和逐月权重表;聚类方法、距离和再平衡频率仍需独立核验,不能据图表判断净收益。

复现与研究价值

固定资产池和聚类距离,在滚动样本外比较等权、资产风险平价、簇风险平价,并将现金收益、交易成本和聚类漂移纳入。

原文与核查

公开正文与图表说明完整阅读;未独立重跑。

原始文章 ↗

推荐 66/100(暂定) · 问题 22/30 · 证据 15/30 · 方法 22/25 · 复现 7/15

问题重要、方法直观,但公开数字不足以支持精确效果判断。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

薄股票的Sharpe 3.15主要是流动性溢价和交易不可达性:同一信号从最液态到最薄,Sharpe 0.67跳到3.15,但这是毛收益

Should You Trade Thin Stocks?

Concretum Group

一句话先讲结论

一句话先讲结论:同一短期个股信号按流动性五分位分组后,最液态Q1的Sharpe为0.67,最薄Q5升到3.15、最大回撤约-16.5%,但这些是毛成本结果,作者明确认为大资金很难实现,所谓高Sharpe更像流动性补偿而不是免费alpha。

它到底在问什么?

薄股票是否因更难交易而提供额外预期收益?如果同一信号在最不液态股票上最好,这个溢价能否覆盖价差、冲击和容量限制?

作者具体怎么做?

  1. 在同一股票选择和组合构建规则下,仅改变流动性分组。
  2. 比较五组毛收益和风险调整指标,检查是否随流动性单调变化。
  3. 再核对入场前后流动性、单股P&L和可执行时点,判断收益是否能被成本和容量实现。

关键结果

原文结果与口径
核对项结果意味着什么
Sharpe分组Q1 0.67 → Q5 3.15薄股票的毛收益风险调整表现极高,但不能视为净收益。
Q5最大回撤约-16.5%高毛Sharpe并不代表没有大回撤。
入场频率Q1—Q4约5.4—5.9次/日;Q5约7.3次/日机会数差异不足以解释全部收益差距。
执行问题入场日成交量收盘后才可见用当日成交量做过滤会有时间泄漏。

怎么理解?

这篇最重要的结论是‘流动性不是纯执行变量,也可能是收益来源’,但收益来源同时意味着交易成本、容量和价格冲击。Q5的Sharpe 3.15不能脱离毛收益和小资金语境;对大资金,可能恰恰因为无法交易才留下这个数字。 文章把平均入场次数和入场日流动性时间点写清楚,避免了最常见的收盘后指标前视;但仍需要逐笔模拟和盘口数据才能回答净收益。

最大限制

毛收益、缺少完整价差/冲击/容量曲线;入场日成交量无法事前获得;样本股票池和持有期需独立核验。

复现与研究价值

用入场前可得ADV、价差和盘口深度做实时过滤,分别按资金量模拟成交;报告净收益、容量、未成交率和冲击后的Sharpe。

原文与核查

公开正文与结果表完整阅读;未独立重跑。

原始文章 ↗

推荐 89/100(暂定) · 问题 28/30 · 证据 27/30 · 方法 25/25 · 复现 9/15

流动性分组的对照数字很具体,但核心结果是毛成本,执行可实现性仍待复现。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法研究

组合优化里聚类几乎没有改变结果:在20/30/40资产和多种样本外窗口下,聚类不是免费提升

To Cluster Or Not To Cluster That is the Question...

Rob Carver

一句话先讲结论

一句话先讲结论:在20、30、40个资产,1/5年样本内和1/5年样本外的组合优化网格中,作者报告‘聚类程度基本不影响结果’,说明把资产先分组并不能自动解决权重估计噪声,收缩和样本长度可能比聚类层数更关键。

它到底在问什么?

组合优化前把相似资产聚类,能否降低协方差估计噪声、提高样本外权重稳定性?还是聚类本身又引入一层模型选择?

作者具体怎么做?

  1. 随机抽取有2—15年历史的工具,确保训练和测试长度足够。
  2. 在多种资产数量和样本内/外长度上运行聚类与权重优化。
  3. 只报告有统计意义的结果,并比较聚类层数、收缩和计算时间。

关键结果

原文结果与口径
核对项结果意味着什么
资产规模20/30/40覆盖从小组合到接近实务组合的维度。
样本长度样本内1/5/10年;样本外1/5年把窗口噪声与聚类选择分开观察。
核心结论聚类程度基本不影响结果没有发现稳定的聚类增益。
计算成本约28—294秒/次更多资产、较少收缩和更小簇会明显拖慢优化。

怎么理解?

这是一篇很有价值的负结果。聚类看起来符合直觉,但如果样本外表现不随聚类层数稳定变化,就不能把它当作组合优化的默认增强。尤其是在资产只有1—5年历史时,聚类距离的估计本身可能比协方差问题更噪。 作者没有挑出一个漂亮参数,而是承认组合太多、只报告显著结果;这比只展示某个聚类版本的净值更可靠。

最大限制

完整结果主要在图表;资产抽样和优化细节依赖作者代码,且未独立复现,不能把负结果外推到所有聚类方法。

复现与研究价值

先做不聚类、简单收缩和风险平价基线,再把聚类作为嵌套模型;按时间滚动检验簇稳定性和权重变化,而不是只比较最终Sharpe。

原文与核查

公开正文完整阅读;未独立重跑。

原始文章 ↗

推荐 74/100(暂定) · 问题 23/30 · 证据 18/30 · 方法 24/25 · 复现 9/15

负结果和实验网格有价值,但关键数字与完整实现未公开。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / methodology_critique

Academic Confirmation Bias

Academic Confirmation Bias

Anton Vorobets

一句话先讲结论

研究若预设旧框架、选择有利指标或从单一历史路径泛化,结论可能由设计决定;应以现实合成数据和多维验证检验方法。

它到底在问什么?

学术研究如何通过状态 quo偏好、模型假设和指标选择产生确认偏误,并把预设结论包装成实证发现?

作者具体怎么做?

  1. 识别将旧方法结论包装成新洞见的论文类型
  2. 检查风险分布假设、评价指标与研究问题是否逻辑一致
  3. 对具体案例计算方差、CVaR并检验是否只是共同排序
  4. 对单一历史路径和精心切分的回测要求使用适当合成数据验证
  5. 用逻辑一致的投资框架替代预先偏向方差的评估

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

作者报告:学术确认偏误常通过数学术语和指标选择遮蔽逻辑假设。编辑判断:文章是立场鲜明的方法论评论,10指数案例仅说明一个风险度量关系,不能证明整个学术体系普遍偏误。

最大限制

没有统一样本外实验或可比较的策略绩效;FGIF替代框架部分指向付费课程/书籍;结论包含大量作者判断,需与具体论文逐一核验。

复现与研究价值

对目标研究预注册假设、指标和反证标准,构造合成数据与多路径回测;比较均值-方差、CVaR和其他风险框架在非椭圆、厚尾和时变相关环境中的差异。

原文与核查

public_full_article

原始文章 ↗

推荐 75/100 · 问题 27/30 · 证据 18/30 · 方法 20/25 · 复现 10/15

正文完整且有一个可追溯的10指数案例,但主要是方法论评论,缺少系统的跨研究证据和独立样本验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / AI辅助研究实验

AI找出的多资产回撤策略:200日均线加两天回撤Sharpe 0.95,但三天回撤把回撤压到-13.69%也牺牲了收益

Testing an AI-Assisted Research Workflow for Multi-Asset Pullback Strategy Discovery

QuantPedia / Claude与ChatGPT辅助研究

一句话先讲结论

一句话先讲结论:在六只ETF的公开AI辅助实验里,收盘价高于200日均线后等待连续两天下跌、次日持有的动态等权组合Sharpe约0.95;改成更保守的三天下跌后,Sharpe降至0.78、年化收益少3.6个百分点、交易数从2,152降到1,030,但最大回撤可压到-13.69%,相比等权买入持有的-33.28%小约2.4倍。

它到底在问什么?

能否用AI协助提出、编码和比较一个跨资产短期回撤策略,并通过参数扫描与分段测试,避免只挑一条最漂亮的净值曲线?

作者具体怎么做?

  1. 先由AI生成六只ETF的单品种统计与候选参数,再用最低跨品种Sharpe挑选参数,而不是只看组合平均值。
  2. 扫描均线长度、连续下跌天数和持有期;随后把推荐规则拆到四个不重叠五年区间,检查是否只有某个历史阶段贡献收益。
  3. 比较动态等权、静态买入持有和10%波动率目标,另用RSI阈值替代连续下跌天数,观察信号定义改变是否仍然保留结论。

关键结果

原文结果与口径
核对项结果意味着什么
单品种Sharpe0.11—0.22六只ETF的个体风险调整收益不高,组合收益不能简单归因于某个单品种的极端表现。
两天→三天回撤Sharpe 0.95→0.78;年化收益-3.6pct;交易2,152→1,030更严格的信号降低频率和收益,体现选择性与机会成本的明确交换。
推荐三天版本的回撤-13.69% vs 买入持有-33.28%回撤约缩小2.4倍,但这部分改善伴随平均投资时间约21%,不能直接视为同暴露下的纯alpha。
胜率与资金占用ETF平均胜率约58.5%;约79%时间不持仓短持有期与高现金比例是策略风险形态的重要来源,不能只展示Sharpe。
波动率目标版本Sharpe 0.95→0.98;最大回撤-25.11%→-17.12%;年化收益8.96%→6.80%风险目标主要改善波动和回撤,收益下降说明它不是免费的风险调整。

怎么理解?

这篇比一般“AI写了一个策略”更值得读,因为它至少做了参数面、五年分段、买入持有和波动率目标等对照;最清楚的经济交换也被报告出来:两天回撤更赚钱但交易更多,三天回撤更慢但回撤更小。 不过,必须把‘AI辅助研究’和‘AI证明了策略有效’分开。正文的结果表和图由Claude/ChatGPT生成,公开页没有给出本看板可直接运行的完整数据与代码;六只ETF、参数扫描和选择规则仍可能包含研究者与模型共同的搜索自由度。约79%时间持有现金,也意味着-13.69%的回撤不能和满仓基准做简单同风险比较。 最合理的读法是把它当成一个研究工作流样本:AI可以快速完成候选规则和敏感性分析,但最终需要锁定ETF池、交易时点、成本、现金收益和样本外窗口后独立重跑。没有这些,0.95 Sharpe是线索,不是可直接上线的结论。

最大限制

公开文章未提供本次实验可复现的完整原始数据、成本明细和独立代码运行日志;参数选择与表格主要由AI生成;六只ETF样本小,不能外推到所有资产。

复现与研究价值

固定资产池和发布日期,先将参数扫描结果锁存,再用后续未见年份做一次样本外;同时加入现金利息、买卖价差、信号日可成交价格和基于同暴露的风险预算对照。只有在这些约束下仍能保留收益/回撤差异,才值得进一步做跨市场验证。

原文与核查

公开正文、表格文字与结果段完整阅读;未独立重跑。

原始文章 ↗

推荐 80/100(暂定) · 问题 27/30 · 证据 21/30 · 方法 24/25 · 复现 8/15

参数与分段对照比单一回测更完整,但实验主要由AI生成且完整数据/代码未随文公开。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法研究

把不同收缩模型的权重再平均,反而不如直接等权:十几种组合的比较再次说明简单基准很难打败

Honey I shrunk the weights (instead of the inputs!)

Rob Carver

一句话先讲结论

一句话先讲结论:在九条交易规则随机组合、1/5/10年样本内和1/5年样本外的比较里,平均不同收缩模型的权重没有带来稳健增益,长样本外甚至是等权明显更好;作者把它列为‘不起作用’的结果,而不是从失败中挑参数。

它到底在问什么?

如果多个收缩方法表现相近,把它们输出的权重平均,能否比平均输入或单一收缩参数更稳?

作者具体怎么做?

  1. 随机选择九条规则和一个工具,改变样本内/外长度。
  2. 对六种收缩组合和单一收缩方法计算Sharpe中位数与配对t统计。
  3. 比较不同样本窗口下等权、最优收缩和权重平均的稳定性。

关键结果

原文结果与口径
核对项结果意味着什么
实验对象九条规则、1/5/10年样本内、1/5年样本外覆盖短样本与长样本。
长样本外等权明显优于组合方法平均权重不能替代稳定的基准。
组合数量六种收缩组合,连同单项共15种比较参数选择空间很容易制造偶然最优。
作者结论权重平均不起作用负结果本身是对复杂组合优化的警示。

怎么理解?

这篇和前面的MVO综述放在一起看,信息增量在于:即便承认不同收缩方法都合理,把它们的权重再平均也不保证更好。对于买方组合,等权不是一个需要被复杂模型随手替换的‘笨基线’,而是一个必须长期、成本后击败的对手。

最大限制

完整表格数字未完全转成文本;随机规则和工具抽样、成本口径需要独立核验,权重平均的负结果不能直接外推。

复现与研究价值

预先锁定收缩候选集,用滚动样本外评价收益、权重变异和换手;若要做模型平均,必须与等权和风险平价基线进行配对比较。

原文与核查

公开正文和结果说明完整阅读;未独立重跑。

原始文章 ↗

推荐 73/100(暂定) · 问题 23/30 · 证据 17/30 · 方法 24/25 · 复现 9/15

失败结论清楚且有多窗口设计,但表格和完整数据未公开。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法研究

Harrell–Davis不是让VaR变准的魔法,而是用多个次序统计量平滑尾部分位数,重点在敏感度和不确定性

Value-at-Risk Estimation: Improved Estimates with the Harrell-Davis Quantile Estimator

Portfolio Optimizer

一句话先讲结论

一句话先讲结论:传统历史VaR用单个或两个次序统计量估计尾部,样本稍短就会跳动;Harrell–Davis用一组次序统计量加权平均,可能改善数值平滑和边际VaR敏感度,但它改变的是估计器,不会凭空创造更多尾部信息,仍需验证覆盖率和回测。

它到底在问什么?

在历史或蒙特卡洛情景下,VaR尾部分位数和对资产权重的敏感度都很不稳定,是否可以用Harrell–Davis估计器减少这种离散跳动?

作者具体怎么做?

  1. 定义不同置信水平与持有期的历史/模拟VaR。
  2. 用Beta权重对多个次序统计量加权,计算分位数及其对组合权重的偏导。
  3. 在实际使用中比较估计稳定性、VaR回测覆盖率和风险贡献排序。

关键结果

原文结果与口径
核对项结果意味着什么
传统问题尾部VaR由很少的次序统计量决定估计方差高,组合敏感度尤其不稳定。
Harrell–Davis加权平均一段次序统计量平滑估计,但不增加样本包含的尾部信息。
适用范围历史与蒙特卡洛情景VaR属于非参数分位数估计器,不等于完整分布建模。
验证要求覆盖率、敏感度、成分VaR回测平滑本身不是准确性的充分条件。

怎么理解?

这篇适合给风控和组合优化同事看:它把‘尾部估计很跳’和‘尾部真的被低估’区分开。Harrell–Davis可能让VaR随新增一个样本变化得更平滑,也让边际风险可微,但如果历史样本根本没有经历过目标危机,任何分位数估计器都无法补出真实尾部。 因此评价它不能只看估计曲线是否好看,必须做VaR exceedance回测和压力情景。

最大限制

文章主要是方法推导和实现说明,未提供统一市场数据上的覆盖率对比;没有把平滑效果等同于更准确。

复现与研究价值

在同一历史窗口和模拟分布上比较三种分位数估计器的覆盖率、Kupiec/Christoffersen检验、边际VaR稳定性及压力期表现。

原文与核查

公开方法正文完整阅读;未独立运行代码。

原始文章 ↗

推荐 74/100(暂定) · 问题 22/30 · 证据 15/30 · 方法 25/25 · 复现 12/15

方法定义清楚、易于实现,但缺乏统一实证效果。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 模拟研究

两百万条纯噪声策略里,最好的Sharpe也能到1.03:样本外和多重检验不是附录,而是研究主体

The Sharpe Ratio of Pure Noise

Quantt

一句话先讲结论

一句话先讲结论:作者用随机数生成2,000,000条真实Sharpe等于0的策略,最佳结果仍能出现Sharpe 1.03;在十年日频、只测一条策略时,纯噪声的95%分位也有0.53,说明从大量回测中挑出一个漂亮Sharpe后,零值不是合适基准,必须按有效试验次数做折价。

它到底在问什么?

一个策略的Sharpe看起来超过0,究竟是信号还是从大量噪声路径中挑出来的极值?参数扫描和完全不同的策略家族是否应被同等计数?

作者具体怎么做?

  1. 用随机数生成不同数量的纯噪声策略,记录每组最大Sharpe。
  2. 与Bailey和Lopez de Prado的期望最大Sharpe/Deflated Sharpe框架对照。
  3. 另比较同一策略族内275个参数变体,检验把所有参数都当独立试验是否过度惩罚。

关键结果

原文结果与口径
核对项结果意味着什么
两百万策略最大Sharpe约1.03纯噪声也能制造足以进入宣传材料的Sharpe。
单策略95%分位约0.53单次回测也不能把Sharpe 0.5自动当成异常。
275个同族变体理论最大约0.92;实际约0.50同族参数高度相关,不能机械地按275个独立试验惩罚。
正确基准从‘大于0’改成‘超过有效试验次数下的噪声最大值’Deflated Sharpe的核心思想。

怎么理解?

这篇的数字直接解释了为什么漂亮回测不可信。比较基准应该随研究过程改变:如果做过多个独立想法,Sharpe=0不再是合理零假设。同族参数变体也不能简单等权计数;有效试验数取决于相关性。 这是自动化AI研究流程最容易忽略的地方:模型不知疲倦地尝试更多规则,会同时增加发现真信号和发现噪声冠军的概率。

最大限制

随机收益分布和试验相关结构是模拟设定;有效试验数需要结合真实研究日志估计,不能固定套用275或200万。

复现与研究价值

为每次研究记录独立想法、参数变体和筛选路径;用Deflated Sharpe或白噪声基准校正最终结果,并报告所有尝试而不是只报冠军。

原文与核查

公开正文完整阅读;未独立运行模拟代码。

原始文章 ↗

推荐 94/100 · 问题 29/30 · 证据 28/30 · 方法 25/25 · 复现 12/15

模拟设计直观、数量级极具警示意义,但真实策略的有效试验数仍需另估。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 策略回测

商品动量的关键不是只追相对强者,而是先用绝对趋势过滤:四ETF基准Sharpe 0.30,双动量把左尾整体截掉

Dual vs. Single Momentum in Commodities: Enhancing Risk-Adjusted Returns

QuantPedia

一句话先讲结论

一句话先讲结论:四只商品ETF等权买入持有的年化收益4.76%、波动15.79%、Sharpe 0.30;相对动量每月底选强者后再加绝对趋势过滤,作者报告整个参数网格的左尾被截断、Sharpe普遍抬升,但表格是0成本回测,不能直接视为净收益。

它到底在问什么?

商品的相对动量是否会在整个资产类别一起下跌时仍然持仓?加入绝对趋势过滤能否减少这种系统性左尾?

作者具体怎么做?

  1. 在X月回看和M个持仓宽度网格上比较相对动量。
  2. 加入绝对趋势过滤,观察整个参数热图而非单一最佳点。
  3. 与等权基准的收益、波动、Sharpe、最大回撤和Calmar比较。

关键结果

原文结果与口径
核对项结果意味着什么
等权基准年化4.76%;波动15.79%;Sharpe 0.30作为简单商品风险暴露的对照。
双动量效果参数网格的左尾被截断,Sharpe整体抬升绝对趋势过滤主要改变下行分布。
交易口径0bps成本、0%无风险利率净收益和现金替代收益尚未计入。

怎么理解?

这篇的机制很清楚:绝对趋势过滤不是让相对排名更准确,而是允许在整个商品篮子都不强时退出风险。评价它时要特别保留0成本设定,否则频繁月度再平衡、ETF价差和现金利息都会改变结果。真正值得复现的是参数热图的稳定区域,而不是作者挑出的最好组合。

最大限制

完整参数表数字未在正文全部复制;0成本、0%无风险利率不符合实盘;未独立重跑,不能把左尾改善直接称为净alpha。

复现与研究价值

固定参数后加入价差、佣金和现金利率,做滚动样本外;比较相对动量、双动量和简单趋势过滤在商品危机窗口的净收益。

原文与核查

公开正文和表格说明完整阅读;未独立重跑。

原始文章 ↗

推荐 83/100(暂定) · 问题 26/30 · 证据 23/30 · 方法 24/25 · 复现 10/15

基准和机制明确,参数网格有信息,但成本后效果未给出。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 策略实现

VIX策略回测年化16.3%、Sharpe约1,但核心是卖SVXY、买VXX的路径依赖,自动下单不等于风险已解决

Automating a Volatility Strategy With Python and Interactive Brokers

Concretum Group

一句话先讲结论

一句话先讲结论:基于SVXY做空波动率、VXX做多波动率的双向策略,在17年回测中年化约16.3%、Sharpe约1、与股票相关性约15%,但这依赖VIX期限结构、杠杆ETN路径和危机时流动性;文章的Python/IBKR自动化解决执行链路,不等于解决尾部损失。

它到底在问什么?

波动率风险溢价是否可以通过两个公开ETN系统化交易?从研究结果到真实经纪商下单,中间有哪些工程与风险断点?

作者具体怎么做?

  1. 以VIX期限结构和实现波动率关系产生策略信号。
  2. 在VXX/SVXY之间调整仓位,加入交易成本和再平衡。
  3. 用Python从数据获取、信号、仓位、订单到IBKR回报完成自动化,并单独检查断连与异常订单。

关键结果

原文结果与口径
核对项结果意味着什么
回测表现年化16.3%;Sharpe约1作者报告的17年结果,不代表未来净收益。
股票相关性约15%策略可能作为组合分散来源,但危机相关性会跳变。
VRP背景VIX约80%时间高于实现波动率卖波动率溢价的经济机制,但不是无风险套利。
工具VXX与SVXYETN滚动和反向杠杆路径风险必须单独模拟。

怎么理解?

这篇适合放在研究到交易链路里:真正有价值的不是又一个VIX回测,而是把信号、仓位、订单和经纪商回报串起来。不过自动化会把错误更快送进市场,不能替代极端行情、流动性和ETN发行人风险测试。年化16.3%最需要谨慎看待,因为VXX/SVXY的路径依赖和危机跳跃会让均值回测严重依赖少数时期。

最大限制

未公开完整逐笔交易、杠杆上限、极端行情滑点和ETN发行人风险处理;回测数字未独立复现,不能视为可直接上线结果。

复现与研究价值

对VXX/SVXY做逐日持仓和危机日压力测试,加入跳空、无法成交、保证金和ETN停牌情景;把自动下单先运行在影子账户。

原文与核查

公开正文与实现说明完整阅读;未独立运行IBKR策略。

原始文章 ↗

推荐 80/100(暂定) · 问题 27/30 · 证据 22/30 · 方法 23/25 · 复现 8/15

机制和实现链路清楚,回测数字具体,但工具路径风险和完整交易细节不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 组合优化实证校准

随机世界的bootstrap/MC到了真实策略收益反而输给强收缩:1年训练1年测试的中位最优是Sharpe收缩0.25、相关收缩0.60;作者最终建议5年以上用0.5/0.75,1年以内干脆等权

FIFA* (*Fitting and Forecasting Actual data) Portfolio Optimisation competition with real returns

Rob Carver

一句话先讲结论

一句话先讲结论:在真实期货规则收益上,Carver重复随机抽单品种的9条规则、比较1/5/10年训练和1/5年测试后发现:随机数据中占优的Monte Carlo/bootstrap在真实数据中往往显著较差,因为它们假设参数分布稳定;一年的训练/一年测试中位最优约为Sharpe收缩0.25、相关收缩0.60,而保守5%点需要Sharpe 1.0、相关0.8。最终操作规则是训练≥5年用0.5/0.75,数据≤1年直接等权。这里最值得用的是“收缩随可预测性而非理论偏好调整”,不是任何一个精确网格点。

它到底在问什么?

在真实、非高斯、会变分布的策略收益上,随机模拟里优秀的bootstrap/Monte Carlo和不同程度的均值/相关收缩,哪一种能提供更稳健的组合权重?

作者具体怎么做?

  1. 用随机规则集合和不同历史长度在真实收益上评估,避免只用一套已知数据选收缩元参数。
  2. 先比较网格中SR/相关双收缩、EPO、等权、MC与bootstrap的样本外Sharpe;以配对t检验评价网格点差异。
  3. 同时看中位数与5%保守点:后者偏好更强的收缩,反映对极端权重失败的厌恶。
  4. 把各训练长度的结论压缩为可实施规则,而非每次在当前样本重新挑最优格点;明确该规则只适合周/月持有期的期货规则组合。

关键结果

原文结果与口径
核对项结果意味着什么
短样本中位最优1年训练/1年测试:SR shrink 0.25、corr shrink 0.60相较随机数据实验的低相关收缩,真实数据需要更大相关收缩,说明相关性非平稳比纯抽样误差更严重。
短样本保守点同一设置5%分位:SR shrink 1.0、corr shrink 0.8若目标是避免最坏优化结果,接近等权的强收缩可优于中位数最优;效用函数决定选择。
重采样方法反转MC/BS在多个真实设置中较差且慢两者在静态随机数据中强,真实数据中因低估参数漂移而失效,是模拟—实证差异的核心发现。
长期实务规则≥5年:0.5/0.75;4—5年:0.6/0.75;1—2年:0.9/0.9;≤1年:1/1等权这是作者针对周/月持有策略的启发式,不是跨所有资产或高频系统的通用公式。
表面噪声多数收缩格点统计上难区分;作者建议不要为精确点位过度优化真正危险是无收缩或太少数据的复杂权重,而不是0.5与0.6的细微差别。

怎么理解?

与随机实验结合看,结论很干净:参数估计问题有两层——有限样本噪声和真实世界的分布漂移。bootstrap/MC只处理第一层,甚至会给第二层一种虚假的精确信心。对组合管理,先通过合理强度收缩、权重上下限和慢更新控制模型风险,再谈是否要以复杂重采样获得额外几个bp Sharpe。

最大限制

规则池集中于作者的期货型周/月信号,非高频、非股票横截面;测试长度短时样本外Sharpe本身极噪,配对检验和多网格比较仍有选择问题。交易成本、容量、权重换手和尾部收益特征未完整披露;收缩规则未在独立新策略库上验证。

复现与研究价值

在自有策略库做嵌套时间序列检验,把相关与预期收益的预测RMSE、权重集中度、turnover和成本和OOS Sharpe一起报告。先固定强收缩基线与等权基线,再允许有限的预注册收缩网格;按持有期和再平衡频率重新标定,避免把此处的年数阈值机械搬到日内/因子组合。

原文与核查

公开全文通过Blogger feed读取;作者实验未独立复跑。

原始文章 ↗

推荐 91/100 · 问题 29/30 · 证据 25/30 · 方法 25/25 · 复现 12/15

真实数据上的随机抽样、多个训练/测试长度、中位与尾部比较直接回答了优化器校准;完整数据和代码缺失且领域外推有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 策略研究

卖波动率不能只看IV高不高:IV/HV比率低于1时反而亏,1.5倍附近才出现约7个波动率点的回归

A Common Sense Guide to Volatility Trading

Quant Galore

一句话先讲结论

一句话先讲结论:单看30日隐含波动率绝对值无法判断卖方优势,真正有信息的是IV/HV比率;比率低于1的便宜波动率卖方反而亏损,约1.5倍的高分位区间才出现约7个波动率点的回归,而不加筛选地卖所有期权几乎没有收益。

它到底在问什么?

如何判断某个期权的隐含波动率真的贵,而不是仅仅因为该股票平时就很波动?卖波动率的收益是否随IV/HV溢价单调变化?

作者具体怎么做?

  1. 计算每只股票的IV/HV ratio和历史分位。
  2. 观察未来波动率回归及短期权收益是否随ratio变宽。
  3. 再按vol-of-vol分组,比较稳定波动与剧烈波动股票的收益均值、胜率和尾部分布。

关键结果

原文结果与口径
核对项结果意味着什么
低溢价区IV/HV<1时卖方亏损绝对IV高并不等于相对实现波动率高。
高溢价区约1.5倍时短方捕获约7个波动率点回归收益集中在真正富裕的IV/HV区间。
无筛选卖出收益接近0、略低于0无条件卖波动率不是稳健策略。
胜率与尾部稳定波动约83%胜率;不稳定波动超过90%但结果更宽高胜率不能替代尾部风险和仓位控制。

怎么理解?

这篇把卖波动率最容易混淆的两个尺度分开:IV的绝对数值和相对HV的溢价。对研究员,ratio>1.25这种筛选门槛比IV超过某个百分比更有经济解释。但胜率超过90%并不等于低风险,vol-of-vol高的样本分布更宽,少数极端亏损可能决定长期净收益。

最大限制

公开文章未提供完整期权逐笔数据、执行价筛选、交易成本和保证金模型;7个波动率点为作者样本结果,未独立重跑。

复现与研究价值

按到期、moneyness和流动性分层,用可成交中间价/买卖价模拟;报告净收益、尾部亏损、保证金占用和ratio阈值的样本外稳定性。

原文与核查

公开正文和结果说明完整阅读;未独立重跑期权策略。

原始文章 ↗

推荐 82/100(暂定) · 问题 27/30 · 证据 23/30 · 方法 24/25 · 复现 8/15

筛选逻辑与数字有经济解释,但期权执行细节和独立样本不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究方法综述

484条股票策略经过多重检验后Sharpe被大幅削弱:34次样本外测试只有年化0.55%、Sharpe 0.33,却把回撤从-23.8%压到-2.76%

Why System Validation Matters More Than Ever

Harbourfronts

一句话先讲结论

一句话先讲结论:文章引用的多重检验框架显示,200条随机策略里Sharpe 0.92经校正后不再显著,484条股票策略的报告Sharpe也会被大幅削弱;另一套34次独立样本外测试的框架只得到年化0.55%、Sharpe 0.33,却把SPY最大回撤从-23.8%压到-2.76%,说明诚实验证往往把收益降下来、把风险形状讲清楚。

它到底在问什么?

AI和高算力让策略生成速度大幅提升后,怎样避免把大量尝试中最好的偶然结果当成alpha?

作者具体怎么做?

  1. 先调整有效试验次数,再判断报告Sharpe是否超出噪声极值。
  2. 把策略按时间切成34个独立样本外测试,只用过去数据训练。
  3. 加入真实交易成本、可解释性和LLM等假设生成工具的审计,报告不显著结果。

关键结果

原文结果与口径
核对项结果意味着什么
随机策略校正Sharpe 0.92经多重检验后不显著漂亮单点结果可能完全来自选择偏差。
股票策略数据库484条策略的Sharpe被大幅削弱历史策略库同样需要考虑挖掘过程。
34次样本外框架年化0.55%;Sharpe 0.33诚实的样本外结果可能很普通,但更可信。
下行风险最大回撤-2.76% vs SPY -23.8%收益不高但防守性强,不能只按收益评价。

怎么理解?

这篇和纯噪声Sharpe文章形成直接呼应:多重检验不是统计学装饰,而是AI研究时代的基本账本。34次样本外测试只得到Sharpe 0.33并不丢人,真正危险的是把所有尝试后挑出的2.0 Sharpe当成没有选择过程的数字。

最大限制

综述未提供引用框架的完整原始代码;多重检验方法对试验相关性、假设族划分很敏感,不能机械套用修正。

复现与研究价值

把策略版本、参数变体、失败结果和样本外日期写入不可覆盖日志;报告原始Sharpe、有效试验数、校正后Sharpe和全测试期回撤。

原文与核查

公开正文完整阅读;引用研究未独立重跑。

原始文章 ↗

推荐 84/100(暂定) · 问题 27/30 · 证据 24/30 · 方法 25/25 · 复现 8/15

数字具体、与研究治理高度相关,但本文是综述而非独立复现。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-summary

Dividend Timing and Global Dividend Premium

Dividend Timing and Global Dividend Premium

Allaudeen Hameed、Jing Xie、Yuxiang Zhong

一句话先讲结论

44个国际股票市场存在显著股息溢价,其中一部分来自除息日前可预测的需求压力,另一部分在非股息月份仍存在并与治理质量相关。

它到底在问什么?

股息支付者相对不支付者的全球超额收益,究竟来自风险/治理特征,还是来自可预测的股息支付时点和投资者需求?

作者具体怎么做?

  1. 计算支付者与非支付者的全球/区域因子调整收益差
  2. 按预期除息月份与非除息月份分解股息溢价,并用日度数据观察公告到除息日的价格压力
  3. 检验除息日聚集度、跨国日历重叠和治理/流动性环境对溢价的影响

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:股息因子不仅是静态高股息或质量暴露,也可能承载投资者围绕现金分配日期的可预测需求冲击;跨国配置会改变股息暴露的时间结构。

最大限制

正文是工作论文的二次解读;1993—2018样本较旧;需进一步核验交易成本、税费、除息日可交易性、跨市场时区和公司股息政策内生性。

复现与研究价值

获取工作论文版本,复刻44市场月度/日度事件研究、日历聚集指标和治理分组;加入税后收益、交易成本、时区和2020年后样本。

原文与核查

public-secondary-summary-read

原始文章 ↗

推荐 86/100 · 问题 27/30 · 证据 26/30 · 方法 23/25 · 复现 10/15

公开正文披露了样本、核心拆分、多个可核验数字和机制;但仍需工作论文与原始国际数据完成独立复现。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-note

A Hidden Trade Around SpaceX IPO?

A Hidden Trade Around SpaceX IPO?

Concretum Research

一句话先讲结论

SpaceX若快速纳入指数可能触发巨额被动买盘,作者发现公告后高再平衡脆弱性股票相对落后、低脆弱性股票表现更强,但因仅一个事件不能确认因果。

它到底在问什么?

当新增成分股吸引被动资金买入时,市场参与者是否会提前交易潜在流量,并在被卖出以腾挪权重的原成分股上留下价格痕迹?

作者具体怎么做?

  1. 梳理指数纳入效应和需求系统资产定价文献
  2. 用无生存偏差的Nasdaq-100成分股计算再平衡脆弱性
  3. 在3月30日公告日形成各10只股票的高/低脆弱性等权篮子并比较至6月10日

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:最有价值的是把传统“买入新增股”思路反向扩展到可能被卖出的原成分股;但当前只是一个IPO/指数事件的研究假说。

最大限制

样本几乎只有一个事件;高低脆弱性篮子可能同时承担规模、行业、流动性或波动率暴露;SpaceX最终纳入规则与实际流量存在不确定性。

复现与研究价值

收集历次指数新增/删除事件,预先定义脆弱性指标,做事件研究、匹配控制组、成本和容量分析;严格区分公告、预期和生效日。

原文与核查

public-original-read

原始文章 ↗

推荐 73/100 · 问题 23/30 · 证据 22/30 · 方法 19/25 · 复现 9/15

公开正文完整且假说与结果清楚,但仅单一事件、无正式统计检验,证据强度有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-summary

The Factor Zoo Has Hundreds of Animals — But Only a Handful of Species

The Factor Zoo Has Hundreds of Animals — But Only a Handful of Species

Larry Swedroe

一句话先讲结论

超过400个候选因子在横截面定价信息上高度冗余,主要归属于少数身份;价值与投资几乎同一身份,宏观长周期身份在潜在统计因子竞争中仍保留。

它到底在问什么?

大量因子是否真的代表不同风险来源,还是不同标签下的同一横截面定价信息?

作者具体怎么做?

  1. 把因子定义为对横截面预期收益提供定价信息的状态变量
  2. 用贝叶斯方法识别风险暴露相近、信息不可区分的因子身份
  3. 将宏观、市场/水平、潜在统计和特征因子放入竞争/horse race比较

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:因子分散化应按身份而不是标签计数;但“潜在统计因子吸收特征因子”不等于价值、规模和动量没有经济含义,而是说明它们可能是有噪声的代理。

最大限制

文章是二次解读;因子身份依赖样本、候选因子集合和贝叶斯设定;1974—2019美国组合不能直接推广到全球或实时投资组合。

复现与研究价值

获取论文,复刻102组合和因子身份分类;做候选因子集合、时间窗口、跨市场和交易成本敏感性;检验身份级组合的真实风险分散。

原文与核查

public-secondary-summary-read

原始文章 ↗

推荐 84/100 · 问题 27/30 · 证据 25/30 · 方法 22/25 · 复现 10/15

正文披露了样本、核心身份和关键数字;但完整贝叶斯设定与原始数据仍需论文核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-blog

The Right Way to Use AI in Trading (This Week)

The Right Way to Use AI in Trading (This Week)

Simon M.

一句话先讲结论

AI适合加速编码、文档和研究流程,却不应被直接要求生成“盈利策略”;必须用人类设定的边界、记忆文件、因果时间约束和严格验证防止过拟合。

它到底在问什么?

生成式AI能快速生成代码和策略,但如何避免把看似漂亮的回测、数据泄漏和目标漂移误当成真实交易优势?

作者具体怎么做?

  1. 先写清研究假设、数据可用时点和禁止改变的目标
  2. 让AI承担编码、测试、文档和重复检查,而不是自行定义目标
  3. 使用由人维护的单一项目记忆/规范文件,并通过样本外、成本和稳健性测试验收

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:这是一篇研究流程治理文章,主要贡献是把AI定位为受约束的工程助手,而不是自主策略发明者;没有作者报告的收益率或Sharpe结果。

最大限制

缺少独立量化实验、收益样本和正式对照组;建议主要来自工程经验,不能直接证明某一AI流程优于其他流程。

复现与研究价值

把建议转成研究模板:假设锁定、点时数据检查、不可变基准、OOS和成本门槛、随机种子和人工审计;对同一任务比较AI辅助与人工流程。

原文与核查

public-original-read

原始文章 ↗

推荐 74/100 · 问题 24/30 · 证据 18/30 · 方法 20/25 · 复现 12/15

正文完整、流程建议清晰且容易实践;但无独立回测证据,研究价值主要在治理与工程纪律。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-audit

I Audited 30 Years of SPY Candlesticks and the Variance Risk Premium

I Audited 30 Years of SPY Candlesticks and the Variance Risk Premium

Peter Olayemi

一句话先讲结论

蜡烛图方向模式即使在高频上统计显著也难以覆盖交易成本;波动率状态更有信息,而错误的Garman-Klass实现会把方差风险溢价Sharpe严重高估。

它到底在问什么?

SPY蜡烛图形态能否预测下一根K线方向?其信号与方差风险溢价在成本和正确实现下是否仍然成立?

作者具体怎么做?

  1. 将K线离散成12状态,使用卡方检验、Wilson区间和每状态方向概率
  2. 以最强方向偏离乘下一根平均绝对收益估算毛边,并扣除2bp往返成本
  3. 比较Garman-Klass与包含隔夜跳空的Yang-Zhang方差估计,再用HMM做因果波动状态门控

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:文章最有价值的是把统计显著、经济显著和实现正确性分开,并公开修正会让Sharpe从6.15降至1.11的估计错误。

最大限制

SPY单一资产;VRP模拟与真实期权交易仍有差距;2bp成本是假设;状态模型、样本切分和多重检验仍需独立审计。

复现与研究价值

下载GitHub代码和数据,逐脚本复现12状态、p值、成本、Garman-Klass/Yang-Zhang及HMM;加入真实期权报价、滑点、期限结构和跨ETF样本。

原文与核查

public-original-read

原始文章 ↗

推荐 90/100 · 问题 27/30 · 证据 26/30 · 方法 24/25 · 复现 13/15

公开正文提供具体样本、统计量、错误修正和代码链接,复现路径最清晰;仍需核验真实期权可交易性和跨资产稳健性。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / quant_methods

Fast Option Pricing using Fourier Transform

Fast Option Pricing using Fourier Transform

VertoxQuant

一句话先讲结论

在Heston等无闭式密度模型中,直接利用特征函数的Fourier方法可将期权批量定价从Monte Carlo的秒级降到微秒级;Carr-Madan、Lewis和COS各有数值权衡。

它到底在问什么?

如何在需要大量重定价或模型校准时,绕过慢速Monte Carlo,稳定地计算一组期权价格?

作者具体怎么做?

  1. 从风险中性特征函数获得分布信息,不必显式求闭式密度
  2. Carr-Madan对call price乘指数dampening,使其平方可积后用FFT批量反演
  3. Lewis用Parseval定理把payoff与密度内积转为复积分,去掉Carr-Madan的阻尼参数
  4. COS在有限区间以余弦级数展开密度,直接从特征函数取系数,再与payoff系数求和
  5. 用Python实现三种方法并与Monte Carlo比较速度/数值稳定性

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

作者报告:Fourier方法适合实时报价和大批量校准。编辑判断:‘30,000倍’依赖硬件、网格、精度、Monte Carlo路径数和实现方式,不能泛化为固定生产优势。

最大限制

文章以Heston和数值公式为主,未给统一硬件、误差容限、网格参数和完整速度表;FFT/COS仍需处理截断区间、aliasing、阻尼和特征函数数值稳定性。

复现与研究价值

下载/重写Python实现,固定硬件和误差容限,比较三种方法与高精度Monte Carlo;做strike/maturity网格、Heston参数、截断区间、N和阻尼敏感性。

原文与核查

public_full_article

原始文章 ↗

推荐 89/100 · 问题 29/30 · 证据 24/30 · 方法 24/25 · 复现 12/15

正文公式和三种方法完整,概念上容易复现;速度结论缺少统一基准配置和误差表,因此证据与复现分略低。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 参数不确定性与组合优化

真实策略PnL里,预测未来一年Sharpe的误差仅比同分布随机数据高6%,但相关性误差高约5.6倍;组合优化最该优先收缩的可能是相关而非均值

Forecasting statistical estimates when data gets real

Rob Carver

一句话先讲结论

一句话先讲结论:Carver将真实交易规则收益的年度参数预测误差与“同样Sharpe/相关、同样长度”的随机数据作基准比较;数千个随机抽取的策略组件中,真实/随机RMSE中位数对Sharpe约1.06、对相关约5.6。也就是说,真实世界预测未来一年Sharpe已经很难,但相对静态抽样模型只略差;真正远超模型误差的是相关性漂移。因此若组合优化只能优先处理一种估计风险,相关矩阵的收缩、权重上限和危机相关压力测试通常比精调单个预期Sharpe更重要。

它到底在问什么?

真实策略收益中,未来Sharpe与未来相关性的预测误差相对i.i.d.随机样本会放大多少;这个差异如何指导组合优化的收缩方向?

作者具体怎么做?

  1. 先在固定分布随机数据中以滚动历史估计Sharpe/相关,使用i.i.d.理论标准误构建95%区间,检查实际未来点落在区间外的比例。
  2. 定义归一化RMSE:未来一年(或五年)估计与此前历史估计的差除以理论采样误差,令不同样本长度可比较。
  3. 对真实US10慢趋势PnL、同品种carry以及不同速度趋势对照,展示真实相关的异常不稳定。
  4. 对数千随机规则/工具抽样,生成匹配同样全样本Sharpe或相关的随机基准,计算真实RMSE/随机RMSE的中位比并据此推导收缩方向。

关键结果

原文结果与口径
核对项结果意味着什么
Sharpe预测误差相对放大真实/随机RMSE中位约1.06(未来一年)真实非平稳会增加Sharpe误差,但在作者规则组件中相对同分布基准只小幅放大;绝对Sharpe预测本身仍然很噪。
相关预测误差相对放大真实/随机RMSE中位约5.6(未来一年;5年/10年量级相近)相关性是主要模型错配来源,静态重采样显著低估它的未来不确定性。
理论基准i.i.d. Sharpe标准误约sqrt[(1+0.5SR²)/N]这个基准只在独立同分布下成立;它不是金融收益的真实置信区间,而是量化偏离程度的尺子。
单例现象US10慢趋势与carry、甚至两种速度趋势的相关RMSE均可极高数学上相近的规则也可能在不同状态下相关性不稳定,不能因信号家族相似就假定协方差稳定。
优化含义随机实验中相关收缩接近零,真实数据应更强相关收缩这为EPO式相关矩阵收缩提供机制解释,但具体力度仍依赖资产、频率和损失函数。

怎么理解?

这篇把“均值难预测、所以收缩均值”的常识拆开了:均值对权重仍很敏感,但相对于它自身的抽样难度,真实相关的额外非平稳更严重。实务上最好同时做两件事:预期收益强收缩以防绝对噪声,相关更强收缩/稳健化以防模型错配。只追求更精确的协方差估计器而不做未来相关压力测试,往往是在拟合过去状态。

最大限制

结果限于作者的期货型策略组件、年度/多年预测窗和所选理论基准;RMSE比会受规则池、样本长度和生成随机数据的方式影响。非线性依赖、尾部共跌、流动性与交易成本不由线性相关捕捉;理论采样误差本身在自相关收益下可能偏小。

复现与研究价值

对现有策略库分开估计Sharpe和相关的预测RMSE,采用重叠/非重叠未来窗并按危机状态分层;将经验放大系数映射为协方差收缩、相关上界或resampled weights。报告正常期与极端期相关、最大权重、turnover、成本后的OOS效用;与等权、固定相关和层级风险平价基准比较,而非只看样本内协方差拟合度。

原文与核查

公开全文通过Blogger feed读取;作者实验未独立复跑。

原始文章 ↗

推荐 93/100 · 问题 30/30 · 证据 26/30 · 方法 25/25 · 复现 12/15

问题直接、理论基准清晰、随机匹配对照与数千抽样给出可行动的数量级;数据和代码未公开,需在其他策略家族独立验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / strategy_operations

Resourcing a Triangulated Stat Arb Operation as a Solo Trader

Resourcing a Triangulated Stat Arb Operation as a Solo Trader

Kris Longmore、Robot Wealth

一句话先讲结论

三角统计套利的主要增益来自上游高质量配对宇宙;随后把配对观点聚合成ticker级信号,再用深度/一致性和业绩事件过滤减少不可逆的基本面重定价。

它到底在问什么?

个人交易者如何在资本和工程资源有限时,把配对套利改造成更资本高效、可维护的三角统计套利运营?

作者具体怎么做?

  1. 以配对回归收益和收敛一致性筛选高质量pairs,加入流动性、行业、退市并购和刷新规则
  2. 把每个pair转为ticker的便宜/昂贵观点与z-score,按pair质量、深度和方向一致性加权聚合
  3. 只交易ticker信号分布尾部,避免中间噪声,并比较pairs组合与mispriced legs组合
  4. 用成交量、新闻和事件区分可逆技术性偏离与新信息造成的基本面重定价
  5. 以earnings surprise过滤形成期内不可逆偏离,按个人账户规模、成本、杠杆和运营能力配置

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

作者报告:三部分按重要性递减为good pairs、triangulation/consistency、volume/news/events,pair selection约贡献80–90%工作效果。编辑判断:这是生产经验与成本前分层结果,不提供完整OOS、成本后绩效或可公开运行代码。

最大限制

精确过滤器、评分权重、阈值和实现不公开;部分数据/API/研究环境属于RW Pro;Sharpe分层为成本前、展示性结果,不能直接推导可交易净收益。

复现与研究价值

用公开股票历史构建不含未来信息的配对质量分数;严格处理退市/并购、流动性和行业约束;比较pair与ticker聚合,加入真实借券、点差、冲击、earnings/news事件和容量测试。

原文与核查

public_full_concept_article

原始文章 ↗

推荐 82/100 · 问题 28/30 · 证据 23/30 · 方法 23/25 · 复现 8/15

正文提供清晰机制、分层Sharpe和生产层级,但核心实现细节与数据接口不公开,完整复现能力受限。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-blog

What Trend Following Actually Adds to a Risk-Premia Core

What Trend Following Actually Adds to a Risk-Premia Core

Beyond Passive Investing

一句话先讲结论

趋势跟踪对RP3核心的主要增量来自核心未持有市场和核心持有市场的危机空头,而不是重复持有股票、债券和黄金的多头暴露。

它到底在问什么?

风险溢价组合与趋势策略都持有股票、债券和金属,组合Sharpe提升究竟来自真实分散化还是重复风险?

作者具体怎么做?

  1. 比较RP3与趋势复制策略的单独及50/50等风险组合表现
  2. 拆分核心持有资产趋势、未持有行业趋势和EBM趋势空头
  3. 用短工业金属/收益率曲线的elastic-net复制补足核心自身空头无法重建的危机暴露

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:趋势的真正价值是结构性危机保险和未持有市场的低相关性;不是把核心已有的长期多头再包装一次。

最大限制

滚动elastic-net复制不构成真正样本外;数据、交易规则和期货历史在1980年前较薄;完全未计佣金、滑点、点差、管理费和容量。

复现与研究价值

取得完整系列和代码,做严格walk-forward;加入真实期货合约、换月、保证金、融资、交易成本和容量,并分解危机/非危机状态。

原文与核查

public-original-read

原始文章 ↗

推荐 82/100 · 问题 26/30 · 证据 24/30 · 方法 22/25 · 复现 10/15

文章公开了组合定义、相关性和回撤等关键数字,结构拆解清晰;但无真正holdout且成本前,实际可交易性需另测。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 组合优化方法论

先用2,000组随机的9资产、35年历史给优化器做“盲测”:bootstrap/Monte Carlo最稳,但慢;1年训练bootstrap约需1,200次迭代才使Sharpe误差降至0.01,等权在作者设定下明显最差

UFC - Ultimate Fitting Championships

Rob Carver

一句话先讲结论

一句话先讲结论:Carver不用一组真实策略收益来挑组合优化器,而是生成2,000条9资产多元正态随机历史、每条35年,再用最长30年训练、固定5年测试比较81种双收缩、EPO、等权、naive mean-variance、bootstrap和Monte Carlo。实验显示bootstrap/Monte Carlo在中位数和保守5%样本外点上通常最优或并列最优,但代价是计算慢;一年的bootstrap约1,200次迭代、Monte Carlo约600次才收敛到约0.01 Sharpe精度。重要保留:这是静态高斯世界的“下界实验”,作者自己说真实非平稳数据需要更强收缩,不能把这里的等权劣势直接外推到真实资产。

它到底在问什么?

如何选择和校准组合优化方法而不在同一组真实资产上“先试后选”;特别是均值/相关收缩、bootstrap和Monte Carlo的稳健性—速度权衡如何被公平比较?

作者具体怎么做?

  1. 构造已知真实Sharpe与相关性的多元正态世界,令实验能区分估计噪声和模型非平稳,避免用单一真实样本挑方法。
  2. 先以权重误差和样本外Sharpe误差确定bootstrap/Monte Carlo迭代数,再在每个模拟历史/训练长度统一比较所有候选。
  3. 对每个优化器记录样本外Sharpe分布的中位数及5%保守分位,而非只看平均值,以惩罚稀疏极端权重的尾部失败。
  4. 从收缩参数网格先选各训练长度的代表,再与随机重采样方法和特殊基准进行速度及稳健性决赛;作者计划以后用真实数据做压力测试。

关键结果

原文结果与口径
核对项结果意味着什么
收敛量级1年训练:bootstrap约1,200次、Monte Carlo约600次;10年训练约600/300次达到约0.01 Sharpe差或相近权重精度所需迭代随历史加长下降;真实数据可能更慢。
30年中位数结果BS1.188、OS1.188、MC1.185、CS1.158、EPO1.122、NMV1.190、EW0.379作者的静态同波动、正权重设定下,等权明显差;NMV中位数高但保守尾部与估计风险需同时看。
30年5%保守点BS0.318、MC0.317、OS0.315、NMV0.315、CS0.292、EPO0.278、EW−0.4bootstrap/MC优势主要是控制糟糕样本的稀疏权重风险;不同效用函数可能选择不同冠军。
收缩含义随机实验中均值Sharpe仍需一定收缩即便数据来自固定高斯分布,估计均值也足够噪;真实策略因非平稳和尾部风险,理论上需要更强而非更弱收缩。
计算代价bootstrap/MC为“gold standard”但显著慢;精细grid search未在合理时间跑通方法选择应包括实际重估频率、资产数和工程预算;理论上最优的概率网格可能不可用。

怎么理解?

这篇的研究设计比“谁的Sharpe高”更重要:把优化器本身当作会过拟合的对象。随机静态实验提供的是鲁棒性下界,不是现实证据;若一个方法在这里就常出极端权重,它不值得上真实策略。相反,随机世界里表现好的NMV或MC并不自动适用于结构断点、拥挤、非高斯收益和交易成本。实务上应把模拟校准、真实历史walk-forward和权重稳定性约束串成三层验证。

最大限制

资产真分布被设定为多元正态、静态、同波动与长仓,真实交易收益的偏度、相关跃迁、成本和容量均缺失;Sharpe/相关候选离散集、九资产和5年测试窗也会影响结论。原网页给出部分汇总而非完整原始模拟输出;无代码无法核对随机种子和统计细节。

复现与研究价值

先对自有策略做同类合成实验:设定已知的收益、相关、偏度与相关跃迁,再检查候选优化器在中位数/5%点、权重Herfindahl、turnover和成本后的表现。随后固定少量候选,在真实数据中做嵌套walk-forward;若采用MC/bootstrap,按资产数和历史长度预先确定迭代预算,并报告权重收敛诊断而非只报告最终Sharpe。

原文与核查

公开全文读取;模拟结果未独立复跑。

原始文章 ↗

推荐 91/100 · 问题 29/30 · 证据 25/30 · 方法 25/25 · 复现 12/15

用随机数据避免meta-overfit、比较中位数与尾部分位并量化收敛,方法论严谨;模拟假设强且无完整代码/真实市场验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-note

When the insiders and the news disagree: a first look at the cross-signal

When the insiders and the news disagree: a first look at the cross-signal

Tommi Johnsen、Svetlana Shasharina

一句话先讲结论

在内部人买入而新闻转悲的冲突单元中,下一日超额收益最高,但仅7个观测;结果暂时支持“知情内部人”假说,不足以形成已验证策略。

它到底在问什么?

当Form 4内部人交易与新闻情绪方向不一致时,冲突本身是否比单一信号更有预测力?

作者具体怎么做?

  1. 将内部人买卖和新闻方向变化映射到同一ticker-day网格
  2. 对新闻用Claude与FinBERT生成正/负/中性标签并识别方向变化
  3. 构建双方看多/看空的四格表,比较前一日、当日和下一日超额收益

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:冲突信号的研究价值在于交互而非简单相加;但作者明确不建议引用+2.46%作为稳定效应,当前只能说模式与知情内部人假说一致。

最大限制

12天不是统计样本,最有趣单元仅7个观测;强势市场环境、新闻模型层级、10%持股人混入、cluster gates和阈值均可能影响结果;无法区分私有信息、新闻过度反应或叙事操纵。

复现与研究价值

扩展至多年、预注册四格定义;区分官员买入与10%持股人交易,加入行业/市场控制、新闻模型替代、交易成本和多重检验。

原文与核查

public-original-read

原始文章 ↗

推荐 76/100 · 问题 24/30 · 证据 20/30 · 方法 21/25 · 复现 11/15

正文公开了管线、样本、单元格数字和限制,复现路径清楚;但样本极短且作者明确仅作描述性推断。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-summary

Reconstructing a Century of U.S. Corporate Bonds

Reconstructing a Century of U.S. Corporate Bonds

Mohammad Ghaderi、Sebastien Plante、Nikolai L. Roussanov、Sang Byung Seo

一句话先讲结论

手工重建的128年美国公司债数据库显示,长期样本能识别出短样本遗漏的信用风险溢价及债券横截面因子定价。

它到底在问什么?

现代TRACE数据覆盖较短,已观察到的公司债风险溢价是否在更长历史中稳健?

作者具体怎么做?

  1. 从三类历史纸质档案收集月度债券报价
  2. 与现代债券数据和CRSP股票数据拼接,形成长期公司债面板
  3. 用Fama-MacBeth回归检验市场、下行风险和信用风险因子定价

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:最大贡献是可公开使用的长期历史数据库,而非单一交易策略;它为信用周期、公司债因子和资本结构联合研究提供基础。

最大限制

QuantPedia为研究摘要,债券报价的选择、清洗、存续偏差、流动性和缺失处理需查论文全文;历史纸质报价与现代交易数据的可比性仍需审计。

复现与研究价值

下载SSRN论文和数据说明,核验债券筛选、报价到收益转换、退市/违约处理;复刻Fama-MacBeth并做时期、评级、流动性和行业分组。

原文与核查

public-summary-and-paper-abstract-read

原始文章 ↗

推荐 85/100 · 问题 28/30 · 证据 25/30 · 方法 23/25 · 复现 9/15

按公开材料与可复现性综合评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 组合层级与聚类

8,100个规则×品种组合不能一次拟合;随机抽5品种×5规则重复数千次后,95.3%更像按品种聚类、仅0.11%更像按规则聚类,因此先在品种内合成预测再跨品种配置

The crossword puzzle of fitting - why across and then down?

Rob Carver

一句话先讲结论

一句话先讲结论:Carver面对40条规则×约204个仍在交易的品种(逾8,100个规则—品种组合),比较一次全拟合、自然聚类、先规则后品种和先品种后规则。用近10年周频相关性随机抽5品种×5规则并重复数千次后,95.3%的样本满足“按品种聚类”判据,仅0.11%满足“按规则聚类”;同品种内不同规则平均相关0.29,而同规则跨品种仅0.05。对系统设计,先在每个品种内汇集预测、再跨品种配权有数据支持;但这不是所有策略和所有频率的通用定理。

它到底在问什么?

当一个系统含大量规则×品种组合时,权重应先在同规则下跨品种拟合,还是先在同品种下跨规则拟合;或者干脆把全部组合一次性优化?

作者具体怎么做?

  1. 定义四种架构:8,100组合一次拟合、按相关性自然聚类、先规则内跨品种后跨规则、先品种内跨规则后跨品种。
  2. 先对近10年周频组合收益做大规模相关聚类并按资产类别/规则类别可视化;该步骤未出现清晰可解释的整体簇。
  3. 以5×5小宇宙反复随机抽样,固定客观簇分类阈值,避免在复杂图形上主观判读。
  4. 同时直接比较平均相关:同品种内规则0.29,对应同规则跨品种0.05;结合数千次分类频率选择“across then down”架构。

关键结果

原文结果与口径
核对项结果意味着什么
系统规模40规则×260工具;约204仍交易品种、逾8,100组合全局协方差估计相对520周观测极度病态,一次性均值—方差拟合会放大噪声和计算负担。
直接相关对照同品种内不同规则平均相关0.29;同规则跨品种0.05在作者系统中,市场归属比规则名称更能解释共同波动,支持先横向整合同品种信号。
随机小宇宙分类品种聚类95.3%,规则聚类0.11%,两者0.81%,皆非3.8%不是单次簇图的视觉结论;在定义的5×5判据下,品种维度压倒性更强。
大簇诊断10年周频、8,100列、最多64簇仍无清晰规则/资产类别色块巨大相关矩阵的“自然聚类”难解释,也可能受估计噪声和多种潜在因子混合影响。
架构结论采用先品种内跨规则、再跨品种的across-then-down这是把预测融合与资产配置分层,而非声称全局聚类或另一顺序必然错误。

怎么理解?

文章的核心不是聚类算法,而是把层级顺序变成可检验假设。对多策略组合,先问“风险主要在规则轴还是品种轴聚集”,再决定何处做收缩和权重合成。这个顺序也利于治理:品种层先限制单市场风险,再把已聚合的品种子系统交给组合层。不要把规则标签当因子标签——同名动量在股票、利率和商品上可能比同一品种的快慢趋势更不相关。

最大限制

相关只看10年周频,未纳入成本、尾部相关、条件相关、容量或不同持有期;5×5和50%/3簇阈值是作者选择。规则与品种并非独立维度,资产类别、交易所、流动性和信号速度可能共同驱动结构;结果仅适用于该作者的规则库。

复现与研究价值

在自有库构造净成本后规则×品种收益面,滚动计算同品种/同规则相关、尾部beta和危机相关;预先比较两种层级架构的冻结样本净Sharpe、turnover、最大品种权重和稳定性。对大矩阵采用层级风险预算/收缩协方差而非直接全局MV;若品种层融合,至少保留规则层的独立归因,避免把失败规则藏在聚合收益中。

原文与核查

公开全文通过Blogger feed读取;作者实验未独立复跑。

原始文章 ↗

推荐 90/100 · 问题 27/30 · 证据 26/30 · 方法 25/25 · 复现 12/15

有清晰问题、直接相关对照、随机重复小宇宙和客观分类规则,方法论价值高;完整规则库与代码不公开,外推需要再检验。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 交易成本与容量研究

交易成本的非线性

The Non-Linear Costs of Trading

Concretum Research

一句话先讲结论

交易规模扩大时,手续费和市场冲击不会按同一比例变化,小单受最低佣金约束、大单则主要受流动性冲击约束,因此策略容量必须和执行模型一起评估。

它到底在问什么?

同一交易策略在不同AUM下为何会出现显著不同的净表现,如何把固定费用与订单簿冲击纳入容量分析?

作者具体怎么做?

  1. 拆分总成本为手续费与市场冲击,并说明订单簿深度和报价撤回使冲击难以仅凭顶层报价估计。
  2. 按IBKR美国股票/ETF每股0.0035美元且最低0.35美元计算固定费用,再用I-Star参数a1=708、a2=0.55、a3=0.71估计滑点。
  3. 比较不同订单规模的美元成本、基点成本及成本构成,并用平方根冲击定律解释规模放大的非线性。

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

机制含义是成本曲线存在规模区间转换:最低佣金主导的小单、费用与冲击并重的中单、流动性冲击主导的大单。对组合管理者而言,回测收益只有在目标AUM和执行方式给定后才有可比性。

最大限制

AMD区间和固定股数是说明性案例,不是完整策略回测;I-Star系数、成交时点、盘口状态和价格路径没有提供足以独立复算的逐笔数据,且文中没有给出净收益或容量置信区间。

复现与研究价值

下载同期AMD逐笔成交与Level-2数据,分别实现最低佣金、分层吃单和平方根冲击模型;按10/100/1000股及不同参与率滚动计算成本分布,再将成本嵌入策略净收益和容量曲线。

原文与核查

public_full_text_verified

原始文章 ↗

推荐 88/100 · 问题 28/30 · 证据 26/30 · 方法 23/25 · 复现 11/15

问题和机制清晰,示例有明确参数与数字;但数据和完整代码不足,复现评分相应下调。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 预测市场微观结构研究

预测市场中的群众有多明智

How Wise is the Crowd in Prediction Markets

Avaneesh Deleep; John Lee; Jenny Bai; Dhruv Suresh; Harsh Dhawan

一句话先讲结论

预测市场的经典favorite-longshot偏差并非普遍存在,部分市场更像是由生命周期和叙事驱动的‘Yes Bias’;大额和高声量并不等于更强信息优势。

它到底在问什么?

谁在预测市场中真正创造信息优势,市场概率中的偏差究竟来自一般性favorite-longshot效应,还是来自参与者、流动性与合约生命周期的微观结构?

作者具体怎么做?

  1. 构建可扩展的多线程数据架构,同步采集并持久化两个平台的tick级订单流、钱包历史和用户评论。
  2. 用连续、多变量样条回归控制合约生命周期和流动性状态,检验favorite-longshot曲线是否仍然存在。
  3. 重建参与者钱包级持仓和盈亏,并以自然语言推断(NLI)测量交易者声量/立场,再与实现结果和小单交易者收益比较。

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

机制上,表面上的概率偏差可能是时间、流动性和合约方向性偏好的混合物;参与者规模还可能代表叙事信念而非信息精度。实务上,与其追逐最响亮的账户,不如做生命周期和流动性条件化的概率校准。

最大限制

Quantpedia与SSRN公开页面给出方法和方向性结果,但没有在本次核验中逐项复算完整样本、回归系数、交易成本或每个平台的分组绩效;钱包身份映射和跨平台数据可得性也可能带来选择偏差。

复现与研究价值

按平台、合约类型和生命周期建立事件级面板,复算原始概率、生命周期/流动性条件概率和去噪概率的校准误差、Brier分数及成本后交易收益;将Mention Markets与其他合约留出做外样本验证。

原文与核查

public_quantpedia_and_ssrn_full_text_entry_verified

原始文章 ↗

推荐 87/100 · 问题 29/30 · 证据 25/30 · 方法 23/25 · 复现 10/15

Quantpedia公开正文和SSRN原文页对样本、方法及核心发现互相印证,但公开页面未提供完整数据和代码,复现分数保守。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 风险管理研究综述

研究综述|2026年6月5日|风险管理

Research Review | 5 June 2026 | Risk Management

James Picerno / The Capital Spectator(综述编辑)

一句话先讲结论

风险管理不能只看长期平均相关性或静态配置:压力期相关性会跃升,行业分化会极端化,估值泡沫和市场状态识别应成为组合构建的条件输入。

它到底在问什么?

如何识别资产泡沫和风险状态,并在系统性压力导致分散化失效、行业相关性翻转或宏观状态变化时改善组合韧性?

作者具体怎么做?

  1. 提取六项研究的样本、识别方法和压力期/状态条件结果,区分无模型泡沫边界、情绪、相关性、行业状态和HMM/RL配置。
  2. 比较危机期间相关性、行业分化和市场状态的变化,并检查主动策略相对被动基准的回撤与Sharpe方向。
  3. 将证据转译为风险管理流程:动态相关性监测、Resilience Portfolio、市场状态相似性轮动、行业分化暴露控制和HMM条件资产配置。

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

机制含义是系统性冲击会让跨行业和跨市场相关性同时上升,削弱经典分散化;另一方面,行业主题在窄窗口内会极端分化,但通用动量或均值回归未必能直接变现。风险预算应显式加入危机条件相关性和状态切换。

最大限制

这是二次综述,六篇论文的定义、样本清洗、交易成本、参数和代码并不统一;综述数字不能替代原论文审计,也不能把不同资产集合和时期拼接成一个未经验证的交易系统。

复现与研究价值

逐篇取得原论文和数据,统一复算泡沫上下界、压力期相关性、状态相似性轮动、行业分化和HMM配置;采用危机留出、滚动外样本和成本后评价,检验组合韧性是否跨时期成立。

原文与核查

public_full_review_verified

原始文章 ↗

推荐 88/100 · 问题 29/30 · 证据 27/30 · 方法 22/25 · 复现 10/15

公开综述提供大量样本定义、统计数字和方法摘要,证据较强;但六项研究异质且原始代码不在综述页,复现分数保守。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 量化研究可复现性与软件工程

复制研究的软件一面

The software side of replication

Luigi Ballabio

一句话先讲结论

复现的瓶颈往往不是数学而是数据许可、依赖环境和发布习惯;应尽早公开可运行代码,锁定环境并给版本打标签。

它到底在问什么?

量化论文即使公式公开,为什么仍难以复现,研究者应如何处理数据许可、依赖漂移和代码可运行性?

作者具体怎么做?

  1. 先核查数据和代码的许可:数据不可再分发时至少公开代码、输入格式和让读者自备数据的说明。
  2. 用Python、QuantLib、NumPy、pandas、Matplotlib、datetime和Jupyter重建曲线引导,并保留市场数据和中间结果。
  3. 用虚拟环境与Pipfile/Pipfile.lock、Poetry或uv锁定依赖,必要时用Docker冻结系统环境,再以Git tag、Zenodo DOI和CITATION.cff发布可引用版本。

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

机制含义是“可复现”是研究产品的供应链属性:数据许可决定能否共享,依赖树决定能否运行,版本标签决定能否精确引用。对于量化研究,工程细节直接影响结论能否被第三方验证和扩展。

最大限制

文章没有新的投资收益或统计显著性结果;示例聚焦QuantLib利率曲线,不代表所有机器学习、另类数据或交易系统的部署问题都已解决。容器冻结也不能替代数据版本与外部API可用性。

复现与研究价值

以一个公开量化策略为样本,建立最小可复现仓库:README、数据字典、输入样例、中间结果、测试、锁文件、Dockerfile、Git release和Zenodo归档;在干净机器上从零运行并记录耗时与差异。

原文与核查

public_full_text_verified

原始文章 ↗

推荐 91/100 · 问题 29/30 · 证据 24/30 · 方法 25/25 · 复现 13/15

工程建议具体、示例和仓库可核验,复现路径最清晰;但它不是新实证研究,因此证据分数反映的是软件实践而非统计推断。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 回归预测与交易系统综述

回归在现代市场中仍然有效吗?

Does Regression Still Work in Modern Markets?

Nam Nguyen(综述作者;文中评述Sanapala等人与Conrad O. Voigt研究)

一句话先讲结论

回归仍可提供可解释的预测信号,但样本外稳定性和市场制度变化更重要;一个在历史期有效的逻辑回归系统在2021—2024年明显落后。

它到底在问什么?

传统线性或逻辑回归是否仍能从价格和宏观变量中提取可交易信息,回报何时会因市场结构变化而衰减?

作者具体怎么做?

  1. 对价格和宏观变量进行清洗、特征选择并拟合OLS,使用RMSE、MAE和R²评价预测;再观察对应交易策略的收益和风险。
  2. 用滚动10年窗口训练逻辑回归,将下月收益是否高于历史中位数作为二分类目标。
  3. 将分类信号转成组合并与S&P500比较年化收益、波动率、Sharpe和分时期表现,重点检查近年失效。

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

机制含义是回归的价值更多在于透明的条件预测和风险控制,而非保证跨制度稳定盈利。滚动训练不能自动解决特征关系变化;模型需要持续做年代分层、漂移监测和成本后检验。

最大限制

这是二次综述,线性回归研究的具体样本、误差和交易规则未在公开文章中完整列出;24.61%、26.11%和0.77来自Voigt研究的转述,尚未独立复算,且未见完整代码与成本敏感性。

复现与研究价值

获取两篇被综述论文的原始数据和代码,严格按时间滚动重建特征;加入生存偏差、交易成本和信号延迟控制,并做1985—2000、2001—2020、2021—2024分段及walk-forward外样本检验。

原文与核查

public_full_review_verified_with_primary-study-caveat

原始文章 ↗

推荐 78/100 · 问题 27/30 · 证据 21/30 · 方法 20/25 · 复现 10/15

综述给出清晰样本定义和若干关键绩效数字,但部分结果来自二次转述、缺少完整误差和代码,故证据与复现保守。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 产品功能说明

一条策略年化14.5%,QQQ贡献3.1个百分点:收益归因比只看净值多回答了什么

New Feature: Return Contribution Analysis

Allocate Smartly

一句话先讲结论

平台用Optimum3演示收益贡献:策略年化14.5%,其中QQQ贡献约3.1个百分点,交易摩擦拖累约0.7个百分点;另一个策略约10%的平均仓位放在美元指数,但年化贡献只有0.07个百分点。这个工具能指出收益从哪里来,却不能仅凭低收益贡献就判定某资产应被删除。

它到底在问什么?

一条多资产策略赚钱,究竟靠哪个资产、哪个年代和哪类风险?如果某个持仓长期占用资金却几乎不贡献收益,它是无效配置,还是承担了保险作用?

作者具体怎么做?

  1. 先将Optimum3的总年化收益分解到各资产和摩擦,观察最大贡献者QQQ,并按年份下钻,发现其在1990年代中后期贡献突出。
  2. 再汇总到美国股票、国际股票等资产类别,避免资产种类太多时漏掉总体贡献;最高层进一步分成风险偏好与防御类别。
  3. 以Defense First为另一个案例检查美元指数UUP:平均配置约10%,但年化贡献仅0.07个百分点;作者据此讨论用现金或短债替代的可能。

关键结果

原文结果与口径
核对项结果意味着什么
总收益与主要来源14.5%;QQQ 3.1 pct作者平台历史结果与贡献口径,不能把QQQ贡献理解成独立资产年化。
交易摩擦约−0.7 pct/年包含手续费与滑点的估算拖累,具体成本模型仍需核验。
UUP贡献0.07 pct/年长期收益贡献很低,但是否值得删去还要看条件风险和替代资产。

怎么理解?

收益归因把策略研究从一条净值曲线推进到可以提问的账本:优势是否集中在某个资产的大牛市,是否依赖一段特定年代,交易成本是否吃掉了微弱的配置贡献。把低贡献位置找出来,有助于减少不必要的复杂度和换手。 但作者对低收益美元仓位的判断仍需反事实支持。保险在平均收益上常常“不划算”,价值却可能出现在其余持仓同时受损时。要删除它,应比较替代后的组合回撤、尾部和融资需求;不能只按每个资产对平均收益的贡献排序。risk-on/risk-off二分也只是方便展示,长债和黄金并非所有危机中都防御。

最大限制

公开文章未说明复合年化贡献的完整链接算法,也未展示UUP替换后的同口径交易成本与条件尾部比较。平台示例是功能演示,不是独立审计后的收益承诺。

复现与研究价值

自有看板应同时显示收益贡献、风险贡献、尾部窗口贡献及持仓时间,允许按年份下钻;对低贡献资产做明确替代组合的回测,而非直接删去。归因总和必须与最终净值及费用账本一致。

原文与核查

公开功能说明与案例完整阅读;未访问会员账户或重算归因。

原始文章 ↗

推荐 70/100 · 问题 24/30 · 证据 18/30 · 方法 20/25 · 复现 8/15

归因维度和示例具体,删除资产的结论仍需反事实与风险贡献验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-blog

Trend following (2/4): Sector-by-sector replication

Trend following (2/4): Sector-by-sector replication

Beyond Passive Investing

一句话先讲结论

把62市场趋势组合按10个行业分别回归,比对全市场一次回归更能保留结构,十合约复制组合Sharpe从0.84提高到1.06并略高于原组合1.03。

它到底在问什么?

为什么全市场回归只用10个合约复制趋势组合时损失约0.2 Sharpe,行业结构是否是缺失来源?

作者具体怎么做?

  1. 将全市场62个期货趋势权重投影为一个目标P&L
  2. 改为对每个行业独立投影并在行业成员内做elastic-net选择
  3. 将每行业代表合约等权、月度重估,并沿用多期限动量和两层波动率目标

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:提升来自把回归限制在真实结构内,避免用跨行业合约解释别的行业;本质是结构化降维,而非增加模型复杂度。

最大限制

滚动拟合非真正holdout;1980年前历史市场稀疏;未计交易成本、换月、容量和合约可交易性;行业标签仍是先验。

复现与研究价值

复刻62市场、10行业和elastic-net窗口;做严格walk-forward、成本/容量测试,并与PCA、聚类和全市场回归比较。

原文与核查

public-original-read

原始文章 ↗

推荐 84/100 · 问题 26/30 · 证据 25/30 · 方法 23/25 · 复现 10/15

公开正文给出清晰算法和多窗口Sharpe/相关性数字;主要扣分来自成本前和滚动拟合非真正OOS。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-blog

When Is a Mispricing Not a Mispricing?

When Is a Mispricing Not a Mispricing?

Kris Longmore

一句话先讲结论

多个价差同时指向同一股票只能提高‘谁相对异常’的定位精度,不能直接证明基本面错价;价格无关的资金流往往比真正重定价更常造成价差发散。

它到底在问什么?

当XOM与多个同行价差同时异常时,XOM是否真的高估,还是同行被价格无关资金流压低?

作者具体怎么做?

  1. 把每个配对价差视为‘A相对B偏贵/便宜’的一条方位线
  2. 寻找多个重叠价差共同指向的股票,形成三角化定位
  3. 定位后继续检查新闻、资金流和基本面,区分真正重定价与价格无关流量

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:该文强调统计套利的诊断顺序——先定位异常,再解释原因,最后才决定交易;三角化降低方向不确定性,但不创造均值回归保证。

最大限制

公开正文未给出完整资产池、样本期、交易成本或OOS收益;案例主要围绕XOM,不能据此量化策略优势。

复现与研究价值

构建多行业配对网络,记录价差方向一致性;加入ETF/指数资金流、新闻和基本面控制,做事件研究与净收益回测。

原文与核查

public-original-read

原始文章 ↗

推荐 70/100 · 问题 23/30 · 证据 18/30 · 方法 20/25 · 复现 9/15

框架和案例公开清楚,但缺少完整数据、统计检验和收益回测,适合作为研究流程启发而非策略证据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究流程评论

AI把策略迭代从一周压缩到二十分钟,也把曲线拟合速度一起加快:真正的防线是预先锁定样本外

AI Overfitting in Trading Systems

Wisdom Trading

一句话先讲结论

一句话先讲结论:这不是一篇给出新交易信号的实证论文,而是一篇关于AI研究治理的警示——作者用示例说明,策略从回测Sharpe 1.2被反复调到2.4后,实盘可能只剩0.4;因此必须在AI开始迭代前锁定样本外、限制迭代次数,并把实盘滑点和成交行为列为最终验收条件。

它到底在问什么?

AI是否降低了量化策略的过拟合风险,还是因为能廉价生成更多变体,反而让研究者更快陷入‘看起来更好’的参数搜索?

作者具体怎么做?

  1. 把样本外区间、失败标准和迭代预算在模型看到数据前写死。
  2. 允许AI在样本内帮助编码、查错和生成候选,但限制最多五轮迭代,不得用样本外结果反向改规则。
  3. 最终只运行一次锁定样本外;若通过,再用小资金走样本,并逐笔比较真实成交、滑点、换月和压力期行为。

关键结果

原文结果与口径
核对项结果意味着什么
示例中的回测—实盘落差Sharpe 1.2 → 2.4 → 0.4说明反复优化可以快速美化历史曲线,但不是作者可独立核验的样本统计。
建议迭代预算五轮后停止把研究者的隐含多重检验限制成事先可审计的规则。
验收顺序锁定样本外一次 → 小资金走样本 → 对照真实成交将模型能力与交易执行误差分开验证。

怎么理解?

文章适合放在看板里做‘研究治理’栏目,不适合当成一篇已经证明某个交易规则有效的论文。它把AI带来的边际风险说得很直白:人类过去需要一周做完的十次参数试验,模型可能在二十分钟内做完;如果评分数据没有隔离,速度提升等于更快地把偶然性写进规则。 最可执行的部分是把研究过程写成门禁:样本外日期、失败标准和最大迭代轮数先锁定;样本外只跑一次;通过后再用小资金观察真实成交。这个流程不能证明策略有alpha,却能显著减少“看完回测才决定哪里是样本外”的事后自由度。 要注意证据等级。文章没有给出可下载数据、交易流水或统一实验,因此不能把Sharpe 1.2、2.4和0.4当作可迁移的经验规律,也不能用它替代正式的概率回测、白噪声检验或多重检验校正。

最大限制

非正式实证论文;没有公开可复现数据或代码,核心数字是示例;作者身份与经纪商观察可能带有选择偏差。

复现与研究价值

在自己的研究平台加入三张强制表:参数迭代日志、样本外锁定记录、样本外后交易流水。每次模型改规则自动增加版本号;超过预设轮数只能新建研究,不允许覆盖原策略。

原文与核查

公开正文完整阅读;未将示例数字当作独立实证结果。

原始文章 ↗

推荐 55/100(暂定) · 问题 23/30 · 证据 8/30 · 方法 21/25 · 复现 3/15

研究治理建议实用,但没有统一实证样本;示例数字只能作为风险提示。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 产品功能说明

提款率7%未必胜过5%:样本越短,最坏退休路径越可能被漏掉

New Feature: Model Portfolio Withdrawal Rates

Allocate Smartly

一句话先讲结论

平台把安全与永久提款率加入自定义组合,并统一采用30年期限和历史通胀;文章特别提醒,1990年起样本得到7%提款率,不一定优于1970年起样本的5%,因为短样本可能恰好漏掉最差退休起点。这里的5%和7%是解释性假设,不是两条真实策略的实测排名。

它到底在问什么?

平均收益相近的组合,在持续提款时可能有完全不同的耗尽风险;能否用历史最坏路径衡量退休资金承受力,又如何防止不同样本长度造成误导?

作者具体怎么做?

  1. 对自定义组合默认使用30年退休期限和历史通胀,逐年调整名义提款额,区分维持生存与维持实际本金两种目标。
  2. 从样本每个可能季度分别开始模拟,取最坏序列对应的提款率;当后续数据不足30年时,把序列绕回样本开头接续,因此包含人工拼接路径。
  3. 比较工具的普通绩效指标使用共同起始日,但提款率例外,继续使用各自全样本,以免截短数据自动抬高最坏路径结果。

关键结果

原文结果与口径
核对项结果意味着什么
默认分析期限30年功能设定,不是所有投资者的统一规划期限。
两个目标不耗尽 vs 保留实际本金相同收益路径下,永久提款目标通常要求更保守的提款。
尾部拼接样本末尾绕回开头补足模拟期限但并非真实连续历史,必须在结果旁披露。

怎么理解?

提款问题最核心的是收益顺序:早期亏损叠加提款会缩小之后参与反弹的本金,因此年化收益和夏普无法独立决定可持续提款。本文把注意力放在最差起点,是对平均指标的有益补充。短样本看起来更安全,很可能只是没有经历过足够坏的路径。 不过,全部使用各自最长样本也不等于可直接公平排名。不同组合的历史长度、资产可投资性和拼接点依然不同;绕回开头还可能创造不自然的利率与通胀跳变。更稳妥的展示是同时给出共同真实历史、各自全样本和压力情景,而不是用单一提款百分比隐去数据结构。

最大限制

本次只审核公开方法说明,未独立验证平台实现。历史最坏结果不是未来安全保证;模拟季度大量重叠,并不代表同样数量的独立退休经验。具体税费与个体现金流未在本文展开。

复现与研究价值

研究看板应在提款率旁展示有效历史长度、真实完整30年路径数和拼接路径占比,并加入固定收益顺序压力测试;把结果作为风险比较工具,不当作个人提款承诺。以上未执行。

原文与核查

公开功能与方法说明全文已读;未使用会员工具计算。

原始文章 ↗

推荐 70/100 · 问题 23/30 · 证据 17/30 · 方法 21/25 · 复现 9/15

样本长度与路径风险解释清晰,拼接模拟和实现透明度需进一步核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / academic-research

Institutions’ return expectations across assets and time

Institutions’ return expectations across assets and time

Magnus Dahlquist、Mats Gärnström、others as listed in JFE article

一句话先讲结论

机构主观风险溢价随实时可得客观风险溢价反周期变化,但机构间横截面差异长期存在,并跨资产同步;差异部分来自对长期估值均值回归的不同信念。

它到底在问什么?

资产管理人、投资顾问、财富顾问、公共养老金和专业预测者如何形成股票、现金和公司债风险溢价预期?这些预期是否可由市场客观风险溢价和估值信念解释?

作者具体怎么做?

  1. 手工收集机构公开报告或请求获得的长期回报预期,并统一名义/实际、算术/几何定义
  2. 按资产类别估计主观风险溢价与客观实时风险溢价的时间关系
  3. 加入机构和年月固定效应,比较机构间异质性及其跨资产相关性,并拆解股票预期的收入、增长、通胀和重估组件

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:研究把‘风险溢价预期’从统一市场共识改写为机构特定信念;资产配置分歧不仅来自宏观预测,也来自对估值长期行为的不同看法。

最大限制

机构报告存在选择和定义差异;不同机构公开程度不一;部分预期为请求获得;跨资产相关性不能单独证明共同宏观信念的因果机制。

复现与研究价值

下载开放数据和Mendeley原始数据,复刻名义/实际与算术/几何转换、机构固定效应和P/E信念分组;检验预期对未来实现收益的样本外预测。

原文与核查

public-open-access-original-read

原始文章 ↗

推荐 93/100 · 问题 28/30 · 证据 28/30 · 方法 24/25 · 复现 13/15

开放获取全文、数据说明和核心结果充分,研究设计与复现路径清晰;主要不确定性来自机构预期采集的非同质性。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

交易程序没报错也可能已经失控:行情新鲜度、账户净额与重启对账才是上线底线

How to Build a Reliable Algo Trading Infrastructure

Concretum Research

一句话先讲结论

这篇列举十类实盘基础设施故障:连接显示正常却使用几小时前行情、两个策略对同一股票提交相反订单、重启后漏掉已成交记录,都可能在回测和纸面测试中完全不出现。对AI写出的交易程序,能运行只是开始;必须证明它知道数据是否新鲜、账户究竟持有什么,以及故障后该停止还是恢复。

它到底在问什么?

策略代码正确,为什么实盘仍会错误交易?信号之外的市场时钟、券商状态和账户共同资源,如何被纳入系统的可验证约束?

作者具体怎么做?

  1. 行情层记录每个标的最近更新时间,重连不等于行情恢复;历史请求需处理限速、空响应和缓存,不能静默使用缺失指标。
  2. 调度层基于正式交易日历、交易所时区和校准时钟处理早收盘与夏令时;订单提交、拒绝和取消都必须有明确状态路径。
  3. 账户层显式路由账户并汇总策略需求;每次重启从券商成交与持仓恢复事实,与内部数据库对账后才恢复决策。

关键结果

原文结果与口径
核对项结果意味着什么
连接状态不等于数据有效健康检查需要核查每条数据年龄,而非只看socket是否连接。
纸面交易不覆盖所有实盘校验模拟环境通过不保证真实券商接受同一组订单。
重启条件先对账再决策内部数据库可能漏掉成交或人工交易,不能把进程恢复当作状态恢复。

怎么理解?

这篇可以直接变成上线验收表,但不要停留在一串提醒。每条提醒应对应一个可测试的不变量:过期行情不能开新仓、未知订单状态不能盲目重发、账户不明确不能提交、持仓不一致必须阻断。这样的要求才能约束人写的代码,也能约束AI自动生成的代码。 文章建议某些被拒收盘单用最后时刻市价单补救,实际应谨慎。若订单状态只是延迟而非确定失败,补单可能造成双倍持仓;接近收盘也会放大网络延迟和成交不确定性。回退逻辑应依据幂等标识、成交查询和明确风险上限,而不只是写一个晚几秒触发的定时器。

最大限制

这是经验性清单,没有故障频率或损失统计;券商行为、交易所规则和时间限制可能改变。本解析不将文中操作细节作为已经核实的最新API规范,也未操作任何交易账户。

复现与研究价值

搭建断网、延迟、重复回报、部分成交、重启、早收盘和时区切换的故障注入测试;每个场景记录预期最终持仓和阻断条件。先验证状态恢复,再讨论自动化交易的收益表现。

原文与核查

公开经验文章完整阅读;未验证当前券商规则或执行账户操作。

原始文章 ↗

推荐 83/100 · 问题 29/30 · 证据 18/30 · 方法 24/25 · 复现 12/15

覆盖真实上线隐患,可转换为测试;具体券商细节仍需官方核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

复制自己的CTA,应复制当前仓位而非过去净值:10合约夏普0.65升至0.84

Trend following (1/4): Replicating your own program

Beyond Passive Investing

一句话先讲结论

把62个期货市场的趋势程序压缩为10个合约,作者将回归目标从过去真实收益改为“当前目标仓位在过去504日会赚多少”的合成路径,夏普由0.65升到0.84、跟踪相关性0.63升到0.68;但仍低于全程序1.03。前提非常明确:你必须知道被复制程序的当前仓位,不能用这招复制一个只公开净值的外部CTA。

它到底在问什么?

完整CTA需要很多合约,个人或小账户能否只交易少数代表品种而保留整体行为?已知自己策略的内部状态,是否还需要从历史净值反推它?

作者具体怎么做?

  1. 基准趋势程序按合约、行业与组合逐层控制风险,周度更新仓位,整体以10%波动为尺度,样本1995年至2026年4月。
  2. 每月把当前62维目标权重应用于此前504日,形成固定当前状态的反事实收益序列;用Elastic Net选择约10个代表合约。
  3. 被选合约继续按自身趋势信号和波动配置,而非直接交易回归系数;对照历史实际收益目标和回归系数配置,分开衡量夏普与跟踪质量。

关键结果

原文结果与口径
核对项结果意味着什么
压缩版夏普0.65 → 0.84作者历史回测,尚未独立核验净成本。
跟踪相关性0.63 → 0.68改善但仍明显偏离完整程序,不能说完全复制。
直接回归权重夏普0.88;相关0.17更高收益指标不代表更好的复制,目标函数需要先讲清。

怎么理解?

这篇的思路很实用:如果你知道要复制的仓位,就不必只用已经压缩成一维的净值去猜。当前状态回溯把问题从“过去这个基金做过什么”变成“现在这组暴露可以用什么代替”,更符合内部组合压缩。 但作者称其为30年样本外仍需谨慎。资产池、信号结构和方法选择是在研究中确定,逐月回归不自动构成完全样本外;加密合约是否纳入也被其历史表现影响。此外,风险归一化、连续价格和合约乘数若处理不当,合成回报可比性会失真。活跃合约选择与历史品种存在时间必须逐日检查。

最大限制

原程序回测未实行生产中每合约5倍净值名义上限;完整成本、整手约束与稀疏选择换手未核验。程序仅适用于当前目标仓位可见的场景,不能泛化为所有CTA产品复制。

复现与研究价值

先冻结目标程序,按实际合约上线时间、乘数、保证金和整手约束压缩;比较相同风险下的跟踪误差、危机行为、成交成本与遗漏行业。单独记录回归用于选品和用于定权的差异。

原文与核查

公开正文完整阅读;未运行62市场程序或压缩回测。

原始文章 ↗

推荐 83/100 · 问题 28/30 · 证据 22/30 · 方法 24/25 · 复现 9/15

目标重构与跟踪/收益分离清楚,仍需交易实现和真正未来验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 独立研究

同一批日内做空候选,改为隔夜做多年化37.1%:省去借券,却接回跳空风险

When Short Sellers Create Overnight Alpha

Concretum Research

一句话先讲结论

作者把上一条日内做空候选改为收盘买入、次日开盘卖出,2012—2026年毛年化37.1%、夏普约1.6、最大回撤约35%;不再需要借券,但每股平均毛利润仅约4.2美分,净收益仍取决于竞价成交和成本。空头回补是解释之一,不是已被识别出的唯一原因。

它到底在问什么?

如果原本的卖空机会因借券昂贵而难执行,能否交易同一股票在另一段时间的风险补偿,用隔夜多头替代日内空头?

作者具体怎么做?

  1. 固定原日内做空候选池,仅改变持有时段与方向,从日内卖空切换为收盘至次日开盘做多。
  2. 用固定10%单股权重控制配置规模,报告毛成本表现,并观察21日平均每日入选数在样本中未低于五只。
  3. 讨论空头回补、隔夜事件风险补偿和高关注股票三种解释;尝试进一步过滤的空间被提出,但尚未提供验证后的新增规则。

关键结果

原文结果与口径
核对项结果意味着什么
毛年化37.1%不含完整交易摩擦,不是实际净盈利。
每股毛利润约4.2美分要按实际双边手续费、竞价冲击与价格分布核算,不能只比较单边佣金。
最大回撤约35%摆脱借券约束后仍有明显隔夜事件风险。

怎么理解?

相邻交易时段的经济结构可能完全不同:日内空头希望回避隔夜不确定性,而愿意接盘的人可能获得补偿。这比把失败策略简单反向更值得研究,因为它真正改变了持有时间和实施约束。不过,同一选股条件的日内跌、隔夜涨,也可能来自关注效应、流动性和Beta,不能只凭叙事归因于空头回补。 尤其需要检查回补究竟发生在什么时候。如果主要买盘在收盘前已经把价格推高,收盘买入未必能赚到这段压力。只有结合竞价订单流、盘后成交和次日开盘才能识别剩余收益;“用MOC/MOO最小化滑点”也不等于可以忽略竞价冲击与订单截止要求。

最大限制

完整筛选表受限,公开作者回顾仍只有概要;未用相关论文冒充私有规则。毛成本回测、因果机制和可成交性未独立审计,固定10%在候选超过十只时的处理也需代码确认。

复现与研究价值

先恢复完整规则与总权重约束,再拆收盘前、竞价、盘后和次日开盘收益;加同Beta、同波动和同流动性对照,报告按价格层的每股净利润及容量,而非只报高年化。

原文与核查

公开方法与结果已读;付费完整筛选表未取得,作者公开回顾未补齐。

原始文章 ↗

推荐 65/100(暂定) · 问题 26/30 · 证据 16/30 · 方法 20/25 · 复现 3/15

交易时段转换有启发,关键选股规则受限且净成本和机制尚未验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 信号处理教程

三阶“零滞后”均线并非提前知道拐点:稳态偏差减少,代价是超调与噪声

Trend-Following Filters – Part 10

Henry Stern

一句话先讲结论

本文比较TMA、TLWMA、TES和TOMR四种三阶滤波器:它们可在稳定线性或二次趋势下消除稳态误差,但遇到真实转折仍会滞后甚至超调;更快反应与更强降噪不能同时免费得到。这里的“零滞后”是特定输入下的数学性质,不是回测收益或拐点预测保证。

它到底在问什么?

简单均线在价格持续上涨时总落后,那么增加滤波阶数,能否既跟上加速趋势又滤掉噪声?

作者具体怎么做?

  1. 分别评价到达阶跃50%和90%的时间、超调、稳定时间及反转响应,不把它们混成一个延迟数字。
  2. 用输出噪声方差与输入噪声方差之比VRR衡量降噪,越小表示噪声越少。
  3. 将不同参数映射到等效数据平均年龄后比较四种三阶滤波器及一、二阶方法;部分复杂规格采用高拟合度回归近似。

关键结果

原文结果与口径
核对项结果意味着什么
稳态适用范围线性与二次趋势不意味着三次趋势或任意金融路径都零误差。
总体取舍反应速度 ↔ 降噪更平滑通常响应更慢,超调也是必须独立衡量的代价。
交易效果未报告控制系统规格不是投资绩效指标。

怎么理解?

对量化研究员,这篇文章的价值在于重写选指标的问题:不要问哪条线最贴价格,而要问在相同平滑约束下,哪种转折错误最能接受。贴得紧可能只是保留了更多噪声;为了追求没有稳态滞后引入负权重,又可能放大局部波动。图上的漂亮响应并不自动转化为更少亏损交易。 等效平均年龄是一种比较口径,不代表风险、带宽或换手已经完全相同。真实市场的噪声并非固定方差独立高斯,且价格常处在过渡状态,恰好是稳态承诺最弱的时候。另需防止术语混淆:这里第三阶指局部过程和滤波构造,不是把任意三条均线叠在一起便得到同样性质。

最大限制

本次读完网页全部实质文字,但公式与附录以图片承载,未逐张核对所有系数及回归拟合式;因此不提供可直接照抄的完整滤波实现。没有独立检验市场效果。

复现与研究价值

先用已核验系数对阶跃、反转及带跳跃模拟序列做单元测试,再在相同VRR或换手约束下比较趋势策略;冻结参数、使用新测试段和真实成本,分别记录错过转折、超调及噪声误触发。

原文与核查

原抓取失败后恢复公开网页,全部实质文字已读;图像附录系数未逐项核验。

原始文章 ↗

推荐 77/100 · 问题 26/30 · 证据 19/30 · 方法 24/25 · 复现 8/15

时域机制与取舍具体,图像系数和交易效果尚未独立复核。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

夏普一样,赚钱节奏可以很不一样:稳定性比率要先修正滚动窗口的重复样本

The Sharpe stability ratio of trading strategies

Eric Brine / Ralph Sueppel

一句话先讲结论

作者把滚动夏普的均值除以经自相关修正的标准误,衡量收益是否只集中在少数幸运时期;示例中同样约0.5的长期夏普,可以对应很不同的稳定性。关键不是新增一个打分名词,而是相邻滚动窗口几乎重复:若直接把每天的夏普当独立观察,显著性会被严重夸大。

它到底在问什么?

两条策略全样本夏普相同,一条持续赚钱、一条靠一次危机大赚,投资者面对的持有体验和模型可信度为什么不同?如何把这种差别纳入评价?

作者具体怎么做?

  1. 先计算固定窗口的超额收益夏普序列,再估计其均值与考虑相关性的长期方差;带宽选择决定纳入多远的依赖。
  2. 通过人工收益路径对照稳定与间歇盈利,再将该指标用于宏观股票、外汇、利率和曲线策略。
  3. 研究区分不利时期持续亏损与不利时期主动缩小信号的两种季节性;后者虽然利润集中,未必同样损害稳定性。

关键结果

原文结果与口径
核对项结果意味着什么
核心计算滚动夏普均值 / HAC标准误衡量估计相对不确定性,结果依赖窗口、样本长度及带宽。
样本重叠相邻共享w−1条若按独立样本计算误差,会制造过强显著性。
收益季节性停手与持续亏损不同同样只在少数时期赚钱,资金承受路径可以明显不同。

怎么理解?

这个指标适合和利润集中度、回撤持续时间一起展示,而不适合单独成为策略淘汰标准。危机保护策略本来就可能长期付保险费,稳定性不高未必意味着对整体组合没有价值;评价应看其在组合最需要时的边际贡献。 还要避免把一个新指标变成新过拟合目标。调整窗口、HAC带宽和基准夏普同样存在选择自由度;根据历史把稳定性调到最高,再用同一指标证明可靠,问题并未消失。比率接近t统计量也不意味着能直接说“有99%概率策略有效”,它需要明确统计假设和检验对象。

最大限制

宏观案例为简化、未计交易成本的PnL,底层JPMaQS数据有访问条件;本次读完公开正文,未执行notebook或审核原论文全部推导。正态近似、平稳性及HAC参数影响推断。

复现与研究价值

在冻结窗口与带宽下同时报告普通夏普、稳定性、最赚钱月份占比和危机贡献;做按时间块重抽样与长度匹配。把保险型策略单独归类,避免用均匀赚钱的要求误删组合保护。

原文与核查

原链接重试后公开正文完整读取;未执行附带notebook。

原始文章 ↗

作者原文与Notebook入口

推荐 84/100 · 问题 28/30 · 证据 22/30 · 方法 24/25 · 复现 10/15

补充时间稳定性且认真处理重叠,统计解释与指标搜索仍需谨慎。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 获奖公告

2026量化研究奖前三名:动量权重、月内周期与LLM假设发现,但奖项不是收益验证

Quantpedia Awards 2026 – Winners Announcement

Quantpedia / Radovan Vojtko

一句话先讲结论

公告前三名分别研究如何学习历史收益权重、月内动量周期,以及LLM引导的资产定价假设发现;第四、五名涉及重启异常与VIX产品交易。它是一张有用的研究地图,但没有公开统一评审回测或净收益证据,获奖名次不能直接变成策略配置排名。

它到底在问什么?

哪些问题获得本届研究评审关注?读者如何利用公告找到下一步应读的原论文,而不把评奖当成已经完成的实证尽调?

作者具体怎么做?

  1. 第一名Wiedemann与Beckmeyer研究学习过去收益的不同权重;第二名Nathan等研究月内动量周期;第三名Liu等研究LLM辅助金融假设发现。
  2. 第四名Beckmeyer等的Reviving Anomalies和第五名Zarattini等的The Volatility Edge扩展到异常复活和VIX产品交易。
  3. 公告列出奖金、培训和订阅等奖励,并说明第一名将有后续采访;未提供逐项评审分数、样本外净收益或可运行代码。

关键结果

原文结果与口径
核对项结果意味着什么
前三名主题动量权重 / 月内周期 / LLM假设发现可据此安排阅读方向,而非确认三类策略已经可交易。
统一绩效比较未报告公告没有可比较的净收益、风险或显著性表。
研究用途原论文导航获奖本身不能替代对泄漏、成本和复现的审核。

怎么理解?

从主题分布看,传统动量研究没有被AI取代,新的工具更多是在改变如何加权历史信息、提出假设和识别条件。这是编辑观察,不是评委公布的学科趋势结论。对研究团队,可按“预测对象—方法创新—验证要求”整理这些论文,避免只按热门程度分配工时。 也要避免把机构背书当统计证据。评奖可能综合创新性、叙事和实用性,未必以同一资产池、成本和样本外区间评分。看板可以保留奖项为元信息,但推荐分中的证据分仍应来自原论文,而不能因为第一名自动给高分。

最大限制

公告未披露统一评分细则及完整评审过程,本次未读这五篇全部原论文,不评价它们具体收益或推断高低。按公告类型完成,不冒充论文解析。

复现与研究价值

将五篇作为待关联的独立研究条目,逐篇追踪原始版本、代码、数据与后续更正;先核验第三名LLM研究的训练时点与假设搜索预算,再谈研究自动化价值。

原文与核查

公开获奖公告完整阅读;未声称读完五篇获奖论文。

原始文章 ↗

推荐 41/100 · 问题 18/30 · 证据 11/30 · 方法 9/25 · 复现 3/15

研究导航有用,但公告几乎不提供方法或复现证据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法访谈解读

别只问最优参数有没有赚钱:先看整张参数成绩表能否迁移到下一段

Martyn Tinsley - Walk Forward Correlation: A New Tool for Robust Strategy Design

Simon M / Martyn Tinsley

一句话先讲结论

Walk Forward Correlation把每组参数的样本内成绩与其样本外成绩配对,检查整张参数网格的相关性,而不是只看最优点能否幸存;但相关性高只说明相对表现稳定,一张从−10%到−1%的亏损成绩表也能高度相关,仍必须另查样本外净收益。

它到底在问什么?

一次滚动测试里最佳参数恰好盈利,是经济机制稳定,还是抽中了幸运点?只展示赢家无法区分二者。

作者具体怎么做?

  1. 先冻结策略、参数网格、时间切分和绩效指标,在训练段评估每个组合。
  2. 把相同组合逐一放入下一段,不用测试段重新挑赢家,计算两段指标的相关性并比较表面形状。
  3. 将相关性与测试段收益分开报告,继续做成本、多重检验和其他滚动验证;不能用一次高相关取代所有审查。

关键结果

原文结果与口径
核对项结果意味着什么
统计对象整张网格的IS/OOS配对不是策略收益与市场收益的相关性,也不是一组参数的滚动收益。
实证数值未报告公开文章没有可核验的相关系数、置信区间或净收益表。
正收益要求仍需单独验证相关性高只能说明排序相对稳定,不能证明测试段净收益为正.

怎么理解?

这是有价值的诊断视角:同一策略如果只有一个尖峰有效,风险确实大于一片合理区域持续有效。但密集网格上的相邻参数通常持仓高度重合,不能把一千个网格点当一千个独立观察,然后照搬普通相关检验的显著性。加权方法本身也需要提前规定,否则可以给漂亮区域更高权重。 更隐蔽的问题是测试集消费。研究员看过WFC后删因子、改网格、换窗口,即使没有直接选择测试段赢家,也已经利用测试段选择模型。最终仍需另一段未参与任何判断的数据。此外,共同市场暴露可能让整张表同步迁移,应该加入去除市场或风险暴露后的成绩,避免把稳定Beta当结构性Alpha。

最大限制

本次完整阅读的是访谈解读,不是其SSRN底层论文;未获得加权公式、检验分布和商业工具实现,因此不对方法新颖性或统计有效性作确认。

复现与研究价值

用预先设定的网格同时测试真实策略和随机信号,在多个不重叠时段比较WFC与最终净收益;按时间块重采样,保留参数之间的依赖,并记录研究者看过测试结果后发生的所有修改。

原文与核查

公开访谈文章完整阅读;所提底层论文与工具未独立核验。

原始文章 ↗

推荐 72/100(暂定) · 问题 27/30 · 证据 13/30 · 方法 23/25 · 复现 9/15

诊断问题准确,但公开文章缺少实证与完整统计实现。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

内幕人买入信号的首要问题是何时能看到:四个集群前一天已涨1.61%

Most of the insider trading alpha is gone by the time you see the filing: poof!

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

这篇五天内部人交易观察最有用的是披露时点和程序性集群过滤,而不是标题中的“Alpha已消失”:作者后续7月审计修正了同一新闻管线的收益数据,并表示Form 4尚需正式时间序列检验。原文四个集群前日+1.61%、六个董事买入当日+3.55%只能保留为当时未复核的探索记录。

它到底在问什么?

长期学术研究中的内部人买入信号,经过公开披露和每日采集后还剩多少信息?同样被数据库标成买入,是否真的代表管理层主动看好公司?

作者具体怎么做?

  1. 先用20日窗口内至少三名不同内部人公开市场买入定义集群,结合身份和交易计划筛选,发现TSM的一组记录高度集中在同日同价。
  2. 人工审查后加入单笔至少1万美元和80%以上交易同日同价则拒绝集群的过滤,防止薪酬或计划性分配被当成独立集体买入。
  3. 分别观察集群、大额单一董事以及10%大股东交易在系统发现前一日、当日、后一日的超额收益;将战略投资交割与管理层自掏现金区分。

关键结果

原文结果与口径
核对项结果意味着什么
集群发现前一日+1.61%历史未复核探索值;同管线后续更正,本篇个案收益未被重新确认,不能作为有效Alpha证据。
董事买入当日+3.55%历史未复核探索值;同管线后续更正,本篇个案收益未被重新确认,不能作为有效Alpha证据。
程序性集群过滤80%同日同价作者据一次异常新增的规则,有用但尚未用独立样本验证假阳性率。

怎么理解?

最有用的部分不是追逐3.55%,而是把数据库里的“买入”拆回经济行为。许多人的小额同价买入可能来自一个公司计划,不能当作许多个独立的信心投票;大股东完成早已公告的投资,也不等于CEO首次用自己的钱下注。去重、身份和事件目的比单纯累计买入金额更重要。 同时要警惕标题过度概括。集群只有四例,无法证明“大部分Alpha已经消失”;每日管线延迟也不等于法律披露延迟。论文报告的交易日至披露日窗口、本文的系统发现前一日,是不同时间区间,不能用一个百分比直接互相验证。评论区声称的大样本复现没有独立材料,不作为本文证据。

最大限制

样本只有五天,集群和大额交易分别约4、6个,且作者没有三年内部人历史来应用完整惯常交易过滤。数据中具体TSM事件的性质还需原始Form 4核对;未提供可交易净收益与显著性。 后续7月审计揭示同管线收益基础缺陷,未重新确认本篇Form 4数值,因此不能将原文收益用于当前策略判断;后续文明确把内部人时间序列列为待检验。

复现与研究价值

建立交易日、SEC接受时间、首次采集时间和可执行时间四个字段,逐项链接原始申报;对同日同价集群做人工盲审。固定清洗规则后累积新样本,按内幕人身份分层,并比较申报后不同延迟的净成本收益。

原文与核查

公开正文完整阅读;未采用评论区未经核验的回测声称,未重查全部SEC申报。

原始文章 ↗

作者7月更正:原有收益结论撤回

推荐 66/100(暂定) · 问题 27/30 · 证据 9/30 · 方法 21/25 · 复现 9/15

时点和分类清洗有用,极小样本且同管线收益修正后未复核这些值。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

不再一对一配股:把价差网络压成个股信号,再在组合层面对冲

The Metamorphosis

Kris Longmore / Robot Wealth

一句话先讲结论

如果XOM相对多个能源股都显得贵,而其他能源股彼此价格正常,逐对交易会反复买入并不便宜的对冲腿;作者建议把每条价差拆成两只股票的相反票数,再聚合为个股信号,直接买便宜股票、空昂贵股票。它改善的是信号利用和组合构造,但多条共享XOM的价差不是多份独立证据。

它到底在问什么?

传统配对交易同时持有两条腿,可能把一半购买力用在只是公平定价的对冲资产上;能否保留风险控制,同时把资本更集中地配置到真正异常的一端?

作者具体怎么做?

  1. 为候选股票构建重叠价差并标准化成z分数,观察某只股票是否相对多个伙伴都偏离。
  2. 把一条XOM–SLB价差的+2.3拆成XOM的+2.3和SLB的−2.3,对每只股票所有连接取平均;正值表示相对贵,负值表示相对便宜。
  3. 按聚合个股信号建立多空篮子,并在组合层控制净市场暴露;可以另研究价差质量、连接数量和信号一致性权重,但本篇未给出最终统一配置。

关键结果

原文结果与口径
核对项结果意味着什么
交易单位改变价差 → 个股多条配对提供信息,但实际订单在个股层净额化。
+2.3价差示例+2.3 / −2.3同一价差拆出的相反信号,不是两条独立预测。
收益改进未报告文章解释预期好处,未提供可审核收益表证明。

怎么理解?

这和把多个因子预测先汇总、再一次性优化组合是同一种设计思想:信号生成不必和交易对冲一一绑定。它能够减少重复持仓和无效对敲,也使风险预算从配对层提升到组合层。但便宜或昂贵仍是相对模型的判断,不是价格必然回归的事实。 最需要修正的是“更多票数就更有信心”。连接都共享同一股票,往往同时受该股票自身新闻或Beta变化驱动;多数票可能只是同一原因被重复计算。连接稀疏与连接密集股票的平均z分数也未必可直接比较。真正的置信度应考虑误差相关性和结构变化,而不能只数伙伴数量。

最大限制

未公开网络筛选、估计窗口、退市与借券处理、净额执行及完整风险约束;未证明个股聚合比原配对在同风险和成本下更好。允许净多净空漂移会增加方向暴露,不能同时声称仍有完全同等的对冲效果。

复现与研究价值

在固定历史股票池上比较逐对交易与个股净额组合,统一总杠杆、行业和市场Beta;按节点度数、信号分歧及公司事件分层检验收益,并记录净额化节省的换手。以上为未执行方案。

原文与核查

公开方法文章完整阅读;未执行网络统计套利。

原始文章 ↗

推荐 74/100 · 问题 27/30 · 证据 15/30 · 方法 22/25 · 复现 10/15

框架转换有用,共享节点依赖和完整回测仍待核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

每周挑3只ETF,10周与25周动量各一半:规则简单,参数选择并未消失

Active Dual Momentum GTAA Strategy

Sona Beluska / Quantpedia

一句话先讲结论

作者在9只ETF里每周选过去表现最好的3只,只持有动量为正的份额,再将10周与25周两个版本各配50%;最终策略报告风险调整指标接近0.9。它展示了多时间尺度配置的可能,但10、25和3都来自同一历史比较,不能因为最后只有几个参数就视为没有过拟合。

它到底在问什么?

跨资产配置如何比慢速战略组合更灵活,又不变成高换手日频交易?相对动量选强者、绝对动量转现金能否同时改善收益与回撤?

作者具体怎么做?

  1. 数据从2007年2月起,先固定选3只,测试1—12周和15—50周不同动量窗口,观察短长信号参数面。
  2. 固定25周回看后,测试选择1至9只ETF,发现过少更集中、过多更接近基准,作者偏向3至6只。
  3. 最终取选3只的10周和25周版本各半;正文部分长窗口结果从2008年起,应在相同起点重新比较,防止样本长度影响排名。

关键结果

原文结果与口径
核对项结果意味着什么
最终配置10周/25周各50%源于同一历史研究后的选择,不是预先冻结的独立验证。
每个子策略前3只且动量>0过滤后可低于满仓,风险下降部分来自现金。
风险调整指标接近0.9作者使用收益/波动的零无风险口径,不应与标准超额夏普混用。

怎么理解?

最好的方法披露是承认资产池也是参数。USO、QQQ与多只股票ETF会让结果受特定风险和时期影响;换一套看似同样合理的ETF,最佳窗口未必不变。比较参数附近表现比单点最优好,但还需检验资产池和调仓日的稳定性。 两个时间尺度平均能表达对速度的不确定性,却不会抹去此前看过的数据。更重要的对照应是相同投资比例和波动的被动组合,否则策略多持现金带来的回撤改善容易被当成选择能力。文章称周频取得平衡,需要用实际换手和成本检验,而不是由频率名字直接推导。

最大限制

公开文字未给完整交易费用、价格调整及同收盘执行细节;精确结果主要在图像表中,本文不臆造。调参、选池和子策略组合均使用同一历史,缺少冻结后的后验样本。

复现与研究价值

固定股票池和规则后,使用后续真实ETF数据前测;同时比较下一可成交价格、其他调仓日、合理交易成本与同风险基准。把所有测试过的窗口和组合记入试验台账,不只保留最后两条。

原文与核查

公开方法与结果讨论全文已读;图中未明确文本化的数值未补写。

原始文章 ↗

推荐 75/100 · 问题 25/30 · 证据 19/30 · 方法 21/25 · 复现 10/15

规则与参数面清楚,成本和真实样本外检验仍不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 独立研究

跳空高开日内做空年化98%,但67%回撤、借券摩擦和2022后失效不能跳过

Identifying Stocks to Fade

Concretum Research

一句话先讲结论

作者筛选异常隔夜跳空股票做日内反向交易,2012年至2026年5月报告毛年化约98%、夏普2.08,却有约67%最大回撤,而且2022年后持续回撤。即使先不谈成本,这也不是一条“高收益所以可靠”的策略;完整筛选表仍在付费区,本条只解析可读实证与实施边界。

它到底在问什么?

大幅隔夜高开是否在开盘后回落?如果这种反转集中在难借、波动高的小盘股,统计可预测性还能有多少变成真实可执行收益?

作者具体怎么做?

  1. 公开部分说明选择异常大隔夜跳空股票,研究随后日内反转;样本2012年1月至2026年5月中旬。
  2. 股票池已剔除Russell3000流动性最差约30%,但剩余仍可能有薄交易、高波动和借券困难。
  3. 作者把毛收益与手续费、市场冲击和locate成本分开讨论,并指出2022年后曲线明显恶化;完整选股规则表在付费区,公开替代检索未恢复。

关键结果

原文结果与口径
核对项结果意味着什么
毛年化与夏普98%;2.08未扣全部实施摩擦,不是可直接外推的净Alpha。
最大回撤约67%很高的历史风险,不因年化更高就可以忽略。
近期稳定性2022年后明显恶化作者提出拥挤解释,但未用资金或借券数据识别因果。

怎么理解?

最值得研究的反差是:极端收益机会常常恰好出现在实施最差的地方。筛选波动最大的跳空股,会同时筛到更昂贵的冲击成本和更难借的空头;这些摩擦不是独立外生常数,而是可能与信号强度正相关。用平均手续费给98%打个折远远不够。 对2022年后的恶化,也不应仅靠“越来越拥挤”讲完。需要分别查看候选数量、跳空幅度、开盘成交质量、幸存者结构和参数选择。真正的结构变化与过去偶然赚钱,在一条事后净值上很难区分。作者承认失效比只展示全样本指标更有价值,但不能据此证明此前收益的机制。

最大限制

完整选股与执行条件无法公开取得,故标部分解析;未绕过付费。原始交易流水、借券可得性和净成本结果均未独立验证,相关论文不能补齐作者私有规则。

复现与研究价值

拿到规则后先做可借券时点交集、跳空分位与流动性分层,使用实际locate报价和成交约束;按2022年前后固定分段审计,先判断原始条件效应是否仍存在,再研究替代交易。

原文与核查

公开实证与限制正文已读;完整筛选表受订阅限制,检索作者公开回顾未恢复。

原始文章 ↗

推荐 62/100(暂定) · 问题 25/30 · 证据 15/30 · 方法 19/25 · 复现 3/15

负面实施与近期失效信息重要,关键方法受限、毛收益不能直接采用。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

三次迭代逼近机器精度还不够:隐波求解器最终卡在浮点边界和定价函数

A Faster Monotone Implied Volatiltty Solver

Fabien Le Floc’h

一句话先讲结论

Thiophene把价格对数上的Euler–Chebyshev迭代与互补价格对数上的Halley迭代拼起来,作者称约三次迭代即可达到机器精度;但真正稳健还需要极小价格修正和高精度重定价抛光,后者约占20%计算时间。数学上的单调收敛,只解决了问题的一半。

它到底在问什么?

能否做出兼有收敛保证、数值稳定性和实际速度的Black–Scholes隐含波动率求解器,而不是依靠常见牛顿法在极端报价下碰运气?

作者具体怎么做?

  1. 把单调收敛思路扩展到归一化价格对数上的Euler–Chebyshev方法,加快靠近解的速度。
  2. 当归一化价格c靠近1,改用互补价格1−c的对数;原迭代此时不再有同样单调性,因此切换为Halley方法。
  3. 对极小价格加入Bachelier基础的细化,再可选使用Jäckel高精度Black–Scholes定价函数做最后抛光,以减少残留误差。

关键结果

原文结果与口径
核对项结果意味着什么
迭代次数约3次作者对组合方法的报告,不是本文对全部输入范围实测的最坏迭代上限。
最终抛光成本约20%追求接近机器精度并非免费,可根据应用需要决定是否开启。
核心风险收敛保证≠浮点稳健公式在精确实数下成立,边界数值运算仍可能丢失有效信息。

怎么理解?

研究员容易只关注求根算法的阶数,却忽略它调用的价格函数是否足够准确。若定价函数本身在尾部存在误差,求解器越努力收敛,可能越精确地求解一个错误方程。把残差计算、变量变换和求根迭代一起审计,比单独比较牛顿与Halley更贴近生产问题。 这篇也展示了性能工程的合理取舍:最后20%的抛光开销可能对严格校准很重要,却不一定对粗粒度行情筛选值得。应先规定最终价格误差、希腊值稳定性与尾部失败率的容忍标准,再决定使用哪种模式,而非把“机器精度”当成所有任务的统一目标。

最大限制

本次完整阅读算法介绍,但未逐页审核论文证明,也未运行Java或Rust代码;公开博客没有完整输入网格和相对耗时表,因此不宣称已独立证明比Jäckel更快。

复现与研究价值

按实际交易所报价范围建立一致测试集,并比较开启、关闭抛光两种模式;对无套利边界附近输入记录返回状态而非静默给数。独立验证重定价误差后,再将新求解器作为可回退的生产候选。

原文与核查

公开博客完整阅读;原论文与代码仅定位,未执行或逐证明核验。

原始文章 ↗

Thiophene原论文

推荐 82/100 · 问题 25/30 · 证据 21/30 · 方法 24/25 · 复现 12/15

工程问题与算法路径清楚,论文证明及完整跨实现基准尚未独立核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-summary

When Everyone Trades the Same Factor Playbook

When Everyone Trades the Same Factor Playbook

Anders Posselt、Mads Kjær

一句话先讲结论

因子投资者同步再平衡形成Anomaly-Driven Demand(ADD),使部分异象收益由自身需求压力机械产生,且价格影响集中在月初并具有持久性。

它到底在问什么?

当数以百万计投资者按相同特征规则同步调仓时,因子组合自身的需求是否会改变股票价格并反过来制造异象收益?

作者具体怎么做?

  1. 追踪股票进入/退出各类异象多空腿的机械再平衡需求
  2. 按ADD分成五组并比较高低ADD超额收益与多空Sharpe
  3. 分解月初六个交易日、日内/隔夜收益、12个月后反转及异象组合ADD失衡

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:因子收益存在自我反馈回路:因子资本越多→同步再平衡压力越大→价格被推动→历史异象看起来越强→吸引更多资本。该机制叠加于风险或错误定价解释之上。

最大限制

文章为二次解读;ADD构造需要完整异象数据库和成分时间点;收益可能受交易成本、借券、指数/基金实际调仓时间和其他拥挤变量影响。

复现与研究价值

获取原论文与异象成分数据,复刻ADD五分组、月初六日内收益、12个月持有和因子控制;加入交易成本、真实基金持仓和跨市场样本。

原文与核查

public-secondary-summary-read

原始文章 ↗

推荐 89/100 · 问题 28/30 · 证据 27/30 · 方法 23/25 · 复现 11/15

公开转载披露了ADD定义、控制变量、多个收益/Sharpe/时间窗口数字;主要扣分来自二次来源和原始异象数据库获取难度。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

VWAP退出的夏普最高,却不是每年赢家:四种出场规则该如何选

How to Manage an Intraday Trend Trade

Concretum Research

一句话先讲结论

同一SOXX日内ATR突破信号,只改变退出规则,2012—2026年VWAP退出夏普1.16、年化18.3%领先;但开盘价退出平均每笔赚6.8bp,高于VWAP的6.1bp,代价是更深的交易内不利波动。不同指标和年份没有同一个赢家,最优出场点不能只靠全样本夏普挑选。

它到底在问什么?

入场不变,退出用开盘价、日内中线、VWAP还是抛物线SAR?细小实现差异会改变交易次数、利润分布和持仓承压,如何避免挑到历史最幸运的版本?

作者具体怎么做?

  1. 比较回到开盘价、触及累计高低中点、回到VWAP及PSAR追踪退出;PSAR首次以开盘初始化,后续交易继承此前止损水平。
  2. 从组合指标进一步下钻交易笔数、平均每笔收益和交易内不利波动,区分赚钱效率与承受路径。
  3. 查看年度夏普排名,发现顺序轮换,作者因此建议给多个有经济逻辑的退出版本分配风险,而不是全押历史第一。

关键结果

原文结果与口径
核对项结果意味着什么
VWAP全样本夏普1.16;年化18.3%样本内最高,不代表未来或净成本后仍最高。
平均每笔收益开盘6.8 vs VWAP6.1 bp毛收益,退出更快可能减少单笔利润并增加成本负担。
交易内不利波动约89 vs 64 bp与单笔平均利润相比不小,持有过程风险不可忽略。

怎么理解?

这篇的优点是把“最佳”拆开:组合夏普、单笔利润、交易次数、承受的反向波动不是同一目标。净成本策略可能更偏好少交易,而风险限额可能更偏好更快退出,只有事前明确目标才能避免事后用最漂亮的指标证明选择正确。 集成体现了参数不确定性,但它不是免费分散。这四条策略共享同一SOXX入场和大部分持仓,危机中可能同时受损;同时运行可能增加实现复杂度和换手。应比较净额后的集成订单与单版本,而不是把四条毛收益曲线平均后就宣称风险完全消失。

最大限制

单一半导体ETF、毛交易统计,公开文章未提供完整ATR参数、分钟数据清洗和执行成本;原文没有给出集成组合的独立数值结果,不能补写其夏普提升。

复现与研究价值

锁定四种退出后,在其他预先指定资产和未来区间测试,统一成交延迟与滑点;比较等风险集成、净额交易与单版本的净收益、最大仓位和尾部滑点。优先验证稳健区域,不继续搜索更多退出规则。

原文与核查

公開正文與结果数字完整阅读;未重新运行SOXX分钟回测。

原始文章 ↗

推荐 79/100 · 问题 27/30 · 证据 21/30 · 方法 23/25 · 复现 8/15

控制变量与多指标比较清楚,单资产、毛成本和集成未实测限制外推。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

把新兴市场历史延到1926年:合成日收益不能当成新增的真实市场经验

A Century Without Data: Reconstructing Emerging Markets Equity History

David Belobrad / Quantpedia

一句话先讲结论

作者用出口额代理盈利、美国估值锚定新兴市场估值,再借美国股市的日内年内波动形状,构造1926年以来的新兴市场指数。它能补齐一条曲线,却没有凭空补出真实交易日:若用它检验股市相关性、危机分散和趋势收益,结果可能很大程度上重现了合成规则自己的假设。

它到底在问什么?

新兴市场可靠日数据很短,而多资产长历史研究需要更早序列;能否用低频宏观与价格资料构造替代历史,并明确替代历史能回答什么、不能回答什么?

作者具体怎么做?

  1. 1926—1989年先估计低频增长路径,把美国股市剥离平滑增长后的波动成分按比例移植,构造年内变化。
  2. 国家层面假设相对美国的长期估值关系较稳定,以出口历史代理盈利,汇总阿根廷、巴西、智利、印度、南非和中国等可构造国家。
  3. 1989—1997年改用Fama–French月度新兴市场组合锚定,1997年后衔接MSCI日指数,2003年后使用EEM代表,并在连接点缩放保证连续。

关键结果

原文结果与口径
核对项结果意味着什么
序列延伸1926年7月起早期是模型生成的代理,不是当时每日成交记录。
盈利代理历史出口额出口与上市公司盈利的对应关系依赖产业、汇率、利润率及所有权假设。
高频形状来源美国股票波动残差人为引入跨市场共同波动,不能再把由此得到的相关性当独立发现。

怎么理解?

这个方法可以用于压力情景生成,但应与实证历史分层存储。研究者需要区分:某个风险结果来自实际观察,还是来自美国股市路径被移植过来。尤其研究分散化时,如果先让新兴市场共享美国冲击,再发现两者危机共跌,这很可能是输入假设的回声。 出口也不是股东收益。国内销售、资本结构、国有化、交易所关闭、外资准入和汇率都会改变投资者实际能拿到的现金流;把企业生产能力平滑映射成价格,会遗漏最重要的制度断点。文章对中国终值归零的处理说明作者意识到这一点,但其他国家也需要同样严格的事件审计。

最大限制

完整代理数据、权重和参数未公开核验;年度/月度插值使用未来期末值,不可直接进入无前视日度回测。来源时期和可投资性差异明显,长序列不等于大量独立真实样本。

复现与研究价值

在数据字段逐日标注真实、插值、代理和人为事件处理;以多组波动锚和出口—盈利假设生成情景区间,而非单一路径。策略检验主要放在真实可投资时期,合成段只做敏感性压力测试。

原文与核查

公开重建方法全文已读;未独立复算合成指数。

原始文章 ↗

推荐 60/100 · 问题 24/30 · 证据 12/30 · 方法 18/25 · 复现 6/15

重建假设公开有价值,但不能把合成高频数据当百年实证。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 独立研究

月末附近十天平均日收益0.072%,其余仅0.011%:日历差异可见,三套策略仍在付费墙后

Market Effect Research: Turn of the Month Effect

TradeQuantiX

一句话先讲结论

1993年2月至2026年4月SPY数据中,月末前后各五个交易日平均收益0.072%,其他日为0.011%,而最后一个交易日反而平均−0.05%。公开部分较充分展示了日历分布差异,但三套交易系统从第一套标题起收费,不能把这组统计当作已读完、可复现的净收益策略。

它到底在问什么?

股票回报是否集中在月末附近?如果最强的一天会随年代移动,应该研究一个宽窗口,而不是回头挑全样本最强日。

作者具体怎么做?

  1. 按交易日而非自然日对齐月末,统计各偏移日均值,并拆成1993—2003、2004—2013和2014—2026三个时期。
  2. 将窗口内3986天与窗口外4373天比较均值、波动、左尾分位和超过特定涨幅的频率。
  3. 公开研究结束后进入三套系统实现,但交易规则、成本、代码和净值结果未开放;本篇解析停在可核验的统计部分。

关键结果

原文结果与口径
核对项结果意味着什么
平均日收益0.072% vs 0.011%条件日均回报,差约6.1bp,不是年化Alpha。
最后交易日−0.05%宽窗口内部并不每天同方向。
交易系统未取得公开数据描述不能替代收费策略的执行结果。

怎么理解?

几张分布图可以帮助判断均值是否只由极端日推动,但这些图都来自同一份SPY数据,不是几次相互独立的验证。把整体日均收益当基线后称超出部分为Alpha,也不等同于控制市场风险、持仓时长和现金收益后的因子Alpha。日历策略减少暴露天数,本来就可能降低总回撤。 养老缴费与再平衡是合理机制假说,却未在本文通过实际资金流识别因果。再平衡还可能因当月股票相对债券表现而改变方向,并非恒定买盘。对研究员更有用的问题是:冻结宽窗口后,优势是否跨市场、跨时段存在,且足以覆盖换手,而不是继续把窗口切成更多漂亮小格子。

最大限制

三套交易系统及完整代码付费未读;未取得样本构建与复权细节、显著性检验及成本结果。搜索不能用其他月末论文代替作者自己的系统。

复现与研究价值

只把公开十日窗口作为待验证假说,使用新留出期及其他股指,按月份分块估计差异不确定性;同时比较持仓日数相同的随机窗口,并计入现金、成本和风险暴露。

原文与核查

公开研究部分完整阅读;三套策略与代码在付费墙后未读。

原始文章 ↗

推荐 70/100(暂定) · 问题 25/30 · 证据 18/30 · 方法 20/25 · 复现 7/15

日历统计具体,但未开放交易实现,不能评估收费系统效果。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

1199条新闻只有106条被判有方向,而FinBERT把其中44条提前判成中性

Nine Pounds of Ore for an Ounce of Gold

Tommi Johnsen

一句话先讲结论

在一天1199条财经新闻里,Claude把106条判为可行动的方向性信息,其余1093条为中性;但FinBERT又把这106条中的44条判成中性,漏掉约41.5%的Claude方向样本。由此更应得出的结论是审计过滤器的漏检,而不是因为大多数新闻无用,就放心永久删除所有小模型中性项。

它到底在问什么?

新闻模型判断的是语言正负面,还是对指定公司的新事件?如果二者不是同一个任务,传统情绪分类结果能否直接成为投资信息入口?

作者具体怎么做?

  1. 日度管线采集九个行业的1199条内容,检查中性池里报价页面、错代码、多公司泛谈、重申评级和旧事件回顾等类型。
  2. 把两个模型的标签交叉列联:Claude中性1093条中,FinBERT也判中性的900条;其余103正面、90负面。
  3. 反向检查Claude有方向106条,其中FinBERT判39正面、23负面、44中性,分析平淡事实性措辞与强烈评论措辞如何造成不对称分歧。

关键结果

原文结果与口径
核对项结果意味着什么
Claude方向标签占比8.8%单日模型定义下的占比,不是所有金融媒体中客观有用信息的固定比例。
方向池漏检44/106 = 41.5%若硬丢弃FinBERT中性项,这部分Claude认为有信息的样本永远不会到下一层。
中性一致率900/1093 = 82.3%条件在Claude中性池上的一致率,不是全模型准确率,也不是正类召回率。

怎么理解?

文章把“情绪语气”和“事件信息”分开,适合用来重新定义新闻工程的目标。真正有价值的改进可能先来自实体匹配、去重、首次事件识别和事实抽取,而不是在正负标签上追求更高小数点精度。反复转述同一消息的十篇文章,不应被当作十份独立证据。 原文建议信任FinBERT中性并只升级非中性项,这与其自己报告的41.5%漏检存在张力。对总体占比低的目标,整体中性一致率很容易看起来不错,正是因为大量无关样本压低了平均错误。生产系统应该随机抽检被过滤部分,直接估计损失的信息价值,而非只展示进入下一关的标签质量。 后续更新:作者7月审计仍观察到小模型对正面催化漏检更强的不对称,但次日收益优势与模型排名并未成立。分类分歧可以保留为工程事实,不能再向上推成已验证Alpha;原混合级联已退出生产。

最大限制

这是单日列联分析,方向标签由Claude定义;文章没有独立人工标注或冻结后的交易检验。原文对“没有新信息就不预测明天”的强断言也未经此表证明,媒体关注量本身可能影响成交或波动。

复现与研究价值

把正类召回、错误实体率、重复事件率和每千条成本并列展示;对中性池分层随机复核,并保留关注量与新闻类型特征。硬过滤、不确定性升级和全量模型需在同一人工标注集及时间截点上比较。

原文与核查

公开正文完整阅读;未独立核验1199条新闻或运行模型。

原始文章 ↗

作者7月更正:原有收益结论撤回

推荐 80/100 · 问题 28/30 · 证据 19/30 · 方法 23/25 · 复现 10/15

列联数字足够揭示过滤器风险,模型标签不是真值且单日样本限制外推。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

散户猜对51.3%却亏钱,机器人猜对49.9%却赚1.33亿美元:入场价比胜率重要

Who Profits from Prediction Markets?

Joshua Della Vedova;Quantpedia导读

一句话先讲结论

在2.22亿笔已结算预测市场交易里,散户方向正确率51.3%却亏损,机器人49.9%却累计赚1.33亿美元;论文把选对方向与支付的价格分开后发现,盈利差别主要在执行。它并不是说随机下注能赚钱,而是买入价格已经隐含概率,判断对了也可能买得太贵。

它到底在问什么?

为什么预测正确率更高的参与者,最终反而亏钱?研究交易技能时,方向判断和执行价格是否被错误压缩成一个指标?

作者具体怎么做?

  1. 利用已结算Polymarket交易,按交易者类型比较方向正确率和损益,再将收益拆成方向与执行组成。
  2. 检查两种能力的依赖性以及执行基准敏感性;作者指出包含自身交易的传统VWAP可能人为制造二者负相关。
  3. 用1410万笔CBOE期权观察检验边界:两维可分性仍存在,但方向准确率与盈利的反转不再出现,因为期权还允许选择执行价、期限等其他维度。

关键结果

原文结果与口径
核对项结果意味着什么
机器人方向与损益49.9%;+$133M样本累计群体损益,不是年化收益,也不能代表任意机器人。
散户方向正确率51.3%高于50%不足以证明信息优势,买入价格决定盈亏平衡概率。
外部市场检验1410万期权观察可分性与胜率利润反转是两条不同结论,后者没有普遍外推。

怎么理解?

对量化研究员,最直接的迁移是把预测质量与经济决策质量分开。新闻模型、LLM事件概率或分类胜率即使改善,若市场在模型出结果前已经调价,就未必有收益;评价必须同时记录决策时价格、等待成本、成交方式与实际可得利润。 但执行与信息也不应被绝对对立。更早进入本身可能需要承担不确定性,挂单收入也可能补偿逆向选择;“执行优势”不是无风险的钱。交易者类型由行为识别,钱包是否同一主体、机器人分类是否准确以及资本规模差异,都影响对群体结果的解释。

最大限制

已读导读及原论文摘要、作者网站资料,未逐页审核112页最新版本或链上重构流程。作者网站持续更新,不能拿最新累计收益替换研究样本;未独立核验费用及钱包分类。

复现与研究价值

自己的预测实验应同时保存概率、报价、订单与成交时点,按价格隐含概率评价校准,再按执行成本评价净收益;避免用自身成交构成的基准给自己打分。先做冻结前测而非从机器人总利润推导可复制策略。

原文与核查

公开导读完整阅读;SSRN摘要及作者研究网站核对,未逐页审计原论文。

原始文章 ↗

原论文SSRN6191618

作者研究主页与数据说明

推荐 83/100(暂定) · 问题 29/30 · 证据 24/30 · 方法 23/25 · 复现 7/15

大样本与边界检验有价值,执行分解及账户识别尚未独立重建。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

VIX现货与期货谁先动并不固定,ETP流量还会改变日内关系

Volatility Derivatives and VIX Market Dynamics

Harbourfront / rvarb

一句话先讲结论

导读汇总两项研究:早期VIX通常领先期货,衍生品市场发展后主导关系交替;另一项发现期货与波动ETP的敏感度随时段和收益分位变化。结论不是拿一个固定领先天数交易,而是对冲映射和价格发现都具有状态依赖。

它到底在问什么?

波动率期货只是跟随VIX指数,还是自身和ETP交易流会反过来影响价格?用一个全样本相关系数或OLS斜率做对冲是否足够?

作者具体怎么做?

  1. 比较VIX衍生市场早期与后期的价格发现关系,检查低交易量时期与期权、ETP推出后是否不同。
  2. 在不同日内窗口和收益分位估计期货—ETP弹性,避免用均值回归掩盖尾部状态差异。
  3. 将结果用于说明流动性与对冲流可能改变关系,而不是在没有成本检验时宣称已发现稳定套利。

关键结果

原文结果与口径
核对项结果意味着什么
领先关系随时期交替不能固定假设VIX永远领先期货。
弹性估计随时段与分位变化平均对冲系数可能无法描述收盘或极端收益状态。
可交易净优势未报告关系存在不代表延迟、价差和冲击后仍有盈利。

怎么理解?

这篇真正有用的是促使研究员把产品链拆开。VIX由期权报价计算,期货反映到期结算预期,ETP又要按自身规则调整期货暴露;不同环节承受不同供需,谁先动不能只靠产品名字推断。 但价格先后和回归弹性不等于因果影响。共同新闻可同时推动多个产品,流量也会响应价格。导读在“ETP对期货”与“期货对ETP”表述之间切换,若未核对回归左右变量就用于对冲,方向可能完全弄反。产品样本还包含已退出或改变结构的工具,现代复现要逐段确认。

最大限制

本次完整阅读导读,未逐表核对两篇原论文;不沿用未经验证的产品杠杆和因果表述。历史ETP样本不能直接代表当前可投资产品,未见净成本交易测试。

复现与研究价值

先按产品历史规则重建期货暴露与再平衡时点,再对同步报价估计分位关系;同时检验成交方向、流动性和共同冲击。对冲模型应按压力情景验证误差,而不是仅追求全样本拟合。

原文与核查

公开导读完整阅读;两篇原研究全文未逐表核验。

原始文章 ↗

VIX与期货领先滞后原论文

推荐 60/100(暂定) · 问题 23/30 · 证据 14/30 · 方法 18/25 · 复现 5/15

状态依赖问题重要,导读细节需回原文核查,不能直接交易。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究流程案例

四个AI角色把研究假说从11个增到38个,但12周仍没有一条策略上线

Agentic Workflows for Alpha Research

Jonathan Kinlay

一句话先讲结论

作者用提案、实现、批判、独立复现四类智能体辅助外汇carry研究,12周假说数从个人历史基准的11个增到38个,候选策略从1个增到2个,但上线数仍为零;人工植入25个缺陷,审计智能体只发现20个。这更像提高研究吞吐和留痕的工程方案,不能解释为AI已经自动发现可交易Alpha。

它到底在问什么?

大模型能很快写回测,但如果提案、调参、解释失败都由同一个上下文完成,怎样避免它为了交付漂亮结果不断改变问题?

作者具体怎么做?

  1. 用时点数据接口和SQLite研究日志保存结构化交接,冻结样本外边界及每次尝试,避免只保留最终胜者。
  2. 批判角色只审计不能修改代码;独立复现角色在晋级阶段仅凭数据契约和说明重新实现特征,不复制原实现。
  3. 晋级要求净样本外IR为正、无严重未解问题、八项扰动至少六项方向稳定、单一状态贡献不超40%,独立实现IR差异在15%内,并由人批准。

关键结果

原文结果与口径
核对项结果意味着什么
研究吞吐11 → 38不同年份个人案例比较,不能把差异全部归因于智能体。
缺陷检出20/25漏掉五个问题;干净样本还出现四个误报。
落地状态2个候选,0部署候选不是已验证实盘收益,也不是部署成功率。

怎么理解?

最值得借鉴的是把研究选择本身纳入审计,而不是角色数量。日志记录试了多少次、为什么改参数、何时决定留出样本,才有机会约束大规模搜索的幸运胜者。作者在目标函数中惩罚搜索次数、有效参数和成本脆弱性,方向合理,但具体惩罚系数也可能成为另一轮选择,需要独立校准。 分离上下文能减少复制同一错误,却不能证明错误独立:同源模型仍可能共享实现习惯和统计盲点。20/25的检测率已经提醒我们,批判智能体不是合规盖章机。要求引用具体单元格会提高可核对性,但引用存在不等于解释正确;应把查错基准、误报率和严重错误漏报持续公布。

最大限制

单人、单工作流、跨年非随机比较,候选仅两个,尚无实盘证据。文末称附带仓库,但本次未取得可核验的完整实现及运行日志;不能独立核对费用和指标。

复现与研究价值

将同一批预注册假说随机分给人工与智能体流程,限定同样算力、时间和搜索预算;用盲化植入缺陷持续测审计能力,最终按冻结测试集的净效果与审计工时共同评价,而不按代码量计功。

原文与核查

公开案例、验证表、失败案例和限制完整阅读;未核验仓库或实际运行。

原始文章 ↗

推荐 78/100(暂定) · 问题 29/30 · 证据 17/30 · 方法 25/25 · 复现 7/15

结构化研究治理很有价值,但自述小样本与未部署限制效果证据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

动态对冲不是免费保险:汇率腿年化1.85%,但近年也落后不对冲约1个百分点

An Active Hedge for the EUR Investor

Beyond Passive Investing

一句话先讲结论

作者用1、3、6、12月欧元美元趋势预测汇率,再让预测收益跨过利差门槛才对冲;1980年以来二元版汇率腿年化约1.85%,半档版0.96%,但2020年代动态对冲反而比不对冲年化低约1个百分点。它是受限的外汇择时策略,不是消除风险且永远更优的保险。

它到底在问什么?

欧元投资者持有美元资产时,能否在美元可能贬值且预期损失超过对冲成本时才提高对冲,避免始终对冲或始终裸露的两种极端?

作者具体怎么做?

  1. 用历史月度汇率构造四个趋势z分数并平均,扩展样本回归次月变动,作者报告样本解释力7.2%。
  2. 将预测与当时可知月度利差比较,二元版直接开关,半个残差标准差的缓冲带允许中间50%仓位。
  3. 七年初始化后从1980年比较,单独拆出汇率腿并检查2020年代的落后,披露特征选择受全样本诊断影响。

关键结果

原文结果与口径
核对项结果意味着什么
汇率腿年化1.85% / 0.96%两种主动规则的历史毛效果,不是整个资产组合年化。
样本R²7.2%不能代表真正未来预测解释力,大部分单月变化仍未知。
近期代价约−1pct/年动态规则会落后恰好适应当期状态的静态政策。

怎么理解?

把利差作为交易门槛而非另一个随意因子,是较清楚的决策设计:对冲必须支付成本,预测优势不够就不行动。不过,未对冲也不是经济意义上的“完全没有成本”,它承担风险与机会成本;真正比较应在同一货币下对现金、资产和远期统一记账。 作者主动披露选趋势特征受全样本影响,这一点必须认真保留。扩展窗口重估只能防止系数直接偷看未来,不能消除研究者在看完整段后选模型的偏差;“严格留出只会略降、不推翻”仍是未验证判断。早期汇率插值还可能增强趋势平滑性,应单独检验真实月度与现代日数据。

最大限制

特征和缓冲选择有样本内成分,早期汇率为代理;作者给的是成本估算而非逐笔实测,完整方向符号和对冲实现未核验。没有保证策略需要或能够持续几十年获得同样优势。

复现与研究价值

冻结四尺度、门槛和缓冲后,在未见过的未来月份及其他本币对上验证;使用真实远期、基差和交易成本,逐项对账自然汇率损益与对冲损益,并报告最差错对冲时期。

原文与核查

公开方法、结果与三项限制完整阅读;未运行对冲策略。

原始文章 ↗

推荐 75/100 · 问题 26/30 · 证据 19/30 · 方法 22/25 · 复现 8/15

成本门槛及近期反例清楚,模型选择和代理历史仍限制结论。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

商品期货155年风险溢价约5.4%:关键不是商品一直涨,而是期货与现货不同

An Index of Commodity Futures Returns Since 1871

Rajkumar Janardanan / Xiao Qiao / K. Geert Rouwenhorst;Quantpedia导读

一句话先讲结论

论文用1871—2025年的历史商品期货资料,摘要报告平均年风险溢价约5.4%,约43%的年份跑赢股票;导读所引表格给出期货夏普0.38、股票0.41、商品现货0.22。这个结果支持期货是一类有独立收益来源的资产,而不是“现货商品长期上涨就能复制”的简单故事。

它到底在问什么?

现代商品指数历史有限,只保留今天还活着的合约也会高估效果;把停交易品种放回历史后,商品期货风险补偿是否仍成立?

作者具体怎么做?

  1. 作者从交易所年鉴和报纸档案手工收集期货价格,纳入现存与已消失合约,减少只看成功品种的幸存者偏差。
  2. 构建长期分散指数并与股票、通胀比较,统计年度和十年区间的相对表现,而不只看155年终点财富。
  3. 把期货超额收益与现货及经利息调整的基差/展期部分区分,检验正回报是否仅由现货上涨解释。

关键结果

原文结果与口径
核对项结果意味着什么
平均风险溢价约5.4%/年摘要口径;不是CAGR,不保证未来同样大小。
股票相对表现约43%年份跑赢分散来源并不要求多数年份获胜,也不等于收益完全不相关。
夏普比较期货0.38 / 股票0.41来自导读引述表格,风险效率相近而非期货全面占优。

怎么理解?

这篇最重要的增量在于数据覆盖,而不是再宣布一次商品可分散。将消失的合约放回去,可以避免只用今日成功市场重写历史;对任何长历史资产研究,这都是比漂亮终点曲线更基础的贡献。研究员应优先看合约进入退出规则、缺失报价和抵押品处理。 但长样本仍可能把许多制度混在一起。交易成本、交割规则、市场参与者和投资限制都变化过,155年平均值不能直接成为今天战略配置的输入。现代可投资指数还可能偏能源,和历史等权篮子不同;需要分阶段、分品种和等风险比较来判断哪些结论可迁移。

最大限制

已读公开导读、SSRN摘要及作者机构资料;未逐页取得并审计原论文数据表。5.4%与5.5%差异保留说明,未复制来源的大段引文;数据库并非已独立下载重算。

复现与研究价值

先以真实可交易合约复核近代子样本,并分别报告现货、超额期货、抵押品利息和净成本;用包含退市合约的历史清单检查幸存者偏差,避免在配置模型里直接填入155年单一均值。

原文与核查

导读完整阅读;SSRN摘要与作者机构说明核对,未逐表审核原论文全文。

原始文章 ↗

原论文SSRN6276738

作者机构研究资料

推荐 79/100(暂定) · 问题 28/30 · 证据 22/30 · 方法 22/25 · 复现 7/15

长历史与退市合约处理贡献大,完整数据和方法尚未独立审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

六周暴涨后一年平均涨18.8%,但“历史最强20次”本身是事后排序

A Historical Look at the Top 20 6-week $SPX Rallies Since 1950

Rob Hanna

一句话先讲结论

作者选出1950年以来不重叠的20次最强30交易日上涨,历史先例随后一年平均涨18.8%,高于基准9.4%;短期一个月却通常进展有限。这支持区分反弹后的短期消化与长期延续,但事后选“最强20次”并不是当时已知的交易阈值。

它到底在问什么?

六周涨得太多,意味着过热即将回撤,还是说明中长期动量很强?上涨从深度熊市开始与从浅回撤开始是否不同?

作者具体怎么做?

  1. 从1950年以来寻找30交易日强涨窗口,排除重叠后保留20个最强事件,包含当前观察。
  2. 用起点回撤20%作状态划分,比较短期与一年后的表现;当前属于相对浅回撤后强涨。
  3. 对八个非熊市案例补充平均后续回撤与上涨幅度,观察路径风险而非仅终点收益。

关键结果

原文结果与口径
核对项结果意味着什么
一年平均收益18.8% vs 9.4%事后极端事件条件均值,不是可执行规则CAGR。
短期与长期一个月弱,一年较强同一事件的不同持有期可能给出不同叙事,必须预先指定目标。
非熊市路径回撤约8.29%八例平均路径风险,未来仍可能更差。

怎么理解?

强上涨之后既可能短期回吐、也可能长期继续上涨,两者并不矛盾。这篇把时间尺度放在一起,比一句“涨多了要跌”更有信息量。研究员应把预测期限固定,再讨论动量或反转,而不是在不同期限之间挑一句支持已有仓位的话。 关键方法问题在于“前20名”的阈值是看完整段历史后才知道。真实使用时只能根据当时历史分位或固定涨幅触发,而且早期和近期事件的市场制度不同。把不重叠处理加入设计有帮助,但一年结果仍可能共享宏观时期,事件数并不等于独立样本数。

最大限制

未独立读取完整事件表;胜率分母与文字描述有待核验。未见固定事前阈值、成本或样本外检验,强涨选择与非熊市细分均可能增加搜索自由度。

复现与研究价值

用固定30日涨幅阈值或仅依赖此前数据的分位数触发,锁定重叠排除规则;比较1、3、12月分布并进行按年代留出检验。先验证能否实时识别,再讨论仓位应用。

原文与核查

公开正文完整阅读;未独立核验原始事件表。

原始文章 ↗

推荐 61/100 · 问题 21/30 · 证据 16/30 · 方法 15/25 · 复现 9/15

期限对比和路径统计有价值,事后排序与小样本限制推断。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法研究

重复测试同一策略不应洗掉其他尝试:用高斯极值定义有效测试次数

The Effective Number of Tested Strategies

Vertox

一句话先讲结论

如果先测两个独立策略,再把其中一个复制很多遍,常见谱参与率会从2趋近1,仿佛原来的第二次独立尝试被抹掉;作者改用最大平方Z分数的期望匹配独立检验数量,避免这个问题。不过,匹配平均极值不保证匹配显著性尾部,也不能直接替代所有多重检验校正。

它到底在问什么?

几十组均线参数彼此相似,把它们当完全独立太保守;但怎样压缩测试数量,才不会因重复试验而人为降低选择偏差?

作者具体怎么做?

  1. 定义M(k)为k个独立标准高斯变量平方的最大值期望,并通过卡方分布积分扩展至实数k。
  2. 按Σ模拟相关高斯向量,估计最大平方Z的均值,再求M的反函数得到有效测试数。
  3. 代码使用20万次模拟及数值积分,展示独立、相同、等相关和潜在因子等场景,没有真实策略收益检验。

关键结果

原文结果与口径
核对项结果意味着什么
核心匹配E[max Z²]相等匹配的是一个期望,不是整个最大值分布。
重复策略反例旧谱指标2 → 1衡量维度集中度不等于累计搜索复杂度。
经验盈利未报告没有证明用该指标筛选后实盘表现提升。

怎么理解?

这个反例抓住了实际研究中的漏洞:在最佳区域加密搜索,不应该使之前的独立尝试消失。但平方统计量隐含双侧检验;若真实流程只允许固定方向做多、只选择最大正收益,把完全负相关策略视为一次尝试就未必适合。度量应跟选择目标一致,不能先用方便的数学定义再宣称所有场景通用。 另一个边界是估计对象。需要的是零假设下检验统计量的联合依赖,不一定等于观察到的策略日收益相关。高斯假设、自相关和自适应搜索都会影响它。原文对其他文献公式的转述未经本次原论文复核,不据此断言原方法错误。实现还有奇异矩阵Cholesky及模拟误差问题,重复策略场景应采用保留半正定结构的分解和置信区间。

最大限制

数值代码未执行,文中部分推导存在平方与绝对值记号混用及反函数定义域表述问题;只匹配均值不足以保证指定显著性水平的错误率,不能直接称严格校正完成。

复现与研究价值

用与实际策略选择相同的单侧或双侧目标,在高斯、厚尾及时间块自助样本下比较真实最大统计量分位数;检验代入DSR后的误报率,并保留所有历史尝试而非仅最终模型相关矩阵。

原文与核查

公开定义、证明和代码完整阅读;被批评的底层文献及代码未独立复核。

原始文章 ↗

推荐 82/100(暂定) · 问题 28/30 · 证据 18/30 · 方法 24/25 · 复现 12/15

反例与实现有启发,通用检验有效性仍需校准。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

翻倍股占比仅为科技泡沫时的四成,但这不是市场还能涨多少的尺子

The 100% Club. 2000 Tech vs 2026 AI

Cesar Alvarez

一句话先讲结论

作者比较纳斯达克100中过去一年翻倍的股票占比:2000年科技泡沫高点约53%,2026年这次观察约20%;当前涨幅前十名的平均表现虽然接近当年,但剔除SNDK这个极端值后便明显下降。它说明两轮行情的上涨广度和集中程度不同,不能据此推出当前市场便宜,更不能把距离53%的差额当作剩余上涨空间。

它到底在问什么?

同样被称为科技泡沫,当前行情究竟是大批股票普遍疯狂,还是少数明星股把整体印象拉高?估值指标之外,价格分布能否提供另一种诊断?

作者具体怎么做?

  1. 作者用AmiBroker及Norgate数据观察纳斯达克100成分股过去一年价格表现,把上涨超过100%的股票归入同一组,计算占比。
  2. 将科技泡沫顶部与当前观察点对照,同时检查历史上超过30%的时段;作者指出这些时段多数出现在市场低点之后,而不只出现在顶部。
  3. 另取过去一年涨幅最大的十只股票,比较平均涨幅;当前SNDK对均值影响很大,于是再使用第二至第十名重算。

关键结果

原文结果与口径
核对项结果意味着什么
翻倍股票广度53% vs 20%两个观察截面的纳指100占比,不是市场见顶概率。
超过30%的历史情形多数在市场低点之后极端上涨既可能来自泡沫,也可能来自低基数反弹,不能只作看空解释。
当前前十名均值受SNDK明显影响剔除第一名后与2000年的差距扩大,提示均值对离群值敏感。

怎么理解?

这篇的价值在于把“市场疯了”拆成两个不同问题:上涨是否足够广,以及上涨是否由极少数股票贡献。对量化研究员,两者应该分别进入市场状态描述,而不是合并为一个笼统泡沫标签。截面分位数、翻倍股比例与集中度能帮助确认目前正在交易哪类风险。 但文末从“还不如2000年疯狂”推到“仍有很大上涨空间”,证据跨越过大。历史上的最高极端值不是市场必须再次达到的目标;更低的翻倍股占比也可能同时伴随更高的估值、更弱的盈利兑现或不同利率。拿一个著名顶部作为标尺,还容易事后挑选最能支撑叙事的参照。

最大限制

公开文章是描述性图表比较,未提供条件未来收益、样本外检验或顶部识别准确率;本文未独立核验历史成分与退市处理,也不把作者的估值背景陈述当作当前市场事实。

复现与研究价值

可把翻倍股比例、收益中位数、前十分位收益和第一大贡献者占比同时做成历史序列,按固定阈值检验后续1—12个月的收益分布,并分别控制此前跌幅和估值。先检验是否增加预测信息,再决定能否进入仓位规则;这是未执行方案。

原文与核查

公开文章正文完整阅读;未重新计算图表或回测。

原始文章 ↗

推荐 58/100 · 问题 20/30 · 证据 15/30 · 方法 14/25 · 复现 9/15

分布视角清晰,但两轮行情类比不构成预测检验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

给策略净值加均线开关:回撤变小,风险调整收益却没有普遍改善

"Surfing the Equity Curve": Using Trend-Following to Switch Strategies On and Off

Allocate Smartly

一句话先讲结论

对100多条TAA策略分别设置净值均线开关,样本从1973年开始:1/2月均线只保留约69%的投资仓位,2/36月约96%;多数设置降低最大回撤,却没有一组在夏普上超过平均策略。唯一在UPI上占优的6/12月组合也缺少周边参数支持——净值看起来更平滑,不等于策略真的更有效。

它到底在问什么?

已经有了一套策略,能否在它最近表现不好时暂停,等净值重新向上再恢复,从而避开失效期?这是对策略本身择时,不是对底层资产再做一次趋势交易。

作者具体怎么做?

  1. 每个月末比较一条策略净值的短期X月均线与长期Y月均线,短线高于长线则下个月保持配置,否则该份额持有现金。
  2. 遍历不同短长均线组合,比较年化收益、夏普、最大回撤,以及兼顾回撤深度和持续时间的UPI,而非只展示最好的一组参数。
  3. 另外测试过去X个月收益大于零的绝对动量开关,并把比较门槛改为同期国库券收益;这些替代规则没有改变总体结论。

关键结果

原文结果与口径
核对项结果意味着什么
平均投资比例69%—96%不同均线设置对应的资产暴露差异,不能把低暴露带来的回撤改善全归功于预测。
夏普改善未见普遍优势作者报告所有组合未超过平均策略,不等于已证明任何净值择时方法都无效。
UPI孤立亮点6/12月单个设置优于对照,周边参数未形成稳定区域,作者判断可能是噪声。

怎么理解?

一个容易忽视的问题是:原策略已经可能包含趋势过滤,再对它的净值做趋势过滤,相当于在一串经过调整的收益上追加延迟。亏损发生后关闭、反弹发生后重新打开,既可能错过恢复,也会削弱原本来自多策略同时运行的分散作用。本文把许多策略放在同一规则下检验,比展示某条策略上漂亮的开关净值更有说服力。 但“没有一组普遍有效”与“任何特定条件都没有作用”仍不同。真正的系统故障、数据失真或交易成本恶化,可能值得停机,却不一定表现为简单均线跌破。收益择时和研究治理应分开:前者需要可重复预测优势,后者可以基于明确的实施失效证据。

最大限制

完整底层收益库并未在公开文章提供;平台当前收录策略向历史延伸可能带有选择偏差。额外切换成本未计,实际表现只会受到进一步拖累。图中未在正文列出的夏普或年化值不臆造。

复现与研究价值

复现时加入等平均仓位的静态降风险对照,分解收益损失来自现金拖累还是错误开关;冻结参数后检验恢复期漏赚和新增换手。若设置停机机制,应让数据质量、成交偏差等诊断与净值信号分别记录。

原文与核查

公开研究正文完整阅读;未独立重跑平台策略库。

原始文章 ↗

推荐 80/100 · 问题 27/30 · 证据 22/30 · 方法 23/25 · 复现 8/15

大范围负面结果和参数面比单例择时展示有用,完整收益库与切换成本仍不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究流程评论

漂亮回测可能回答错问题:先写清策略在组合里的工作,再决定怎么验收

Martyn Tinsley - Beyond the BackTest

Simon M / Martyn Tinsley

一句话先讲结论

这篇访谈没有报告一条新策略的年化收益,核心主张是把“统计检验通过”和“值得部署”分开:一个单独夏普普通、却能缓解现有组合压力的策略,可能比另一个高夏普但重复同样风险的策略更有价值。判断前提是把组合角色写在研究之前,而非看到曲线后补故事。

它到底在问什么?

数据质量、样本外和扰动测试都通过,为什么仍可能建出不适合实际账户的系统?因为这些检验未必检查了正确的经济目标和执行约束。

作者具体怎么做?

  1. 先定义机制、组合用途和失败条件,再用最简单实现检查未经大量过滤的原始信号。
  2. 核查退市样本、公司行动、期货换月及信息时间,围绕该策略真实脆弱点增加成本、延迟和参数扰动。
  3. 在现有组合中评价新增风险贡献及压力期表现,确认容量、监控负担和执行可行,再决定是否部署及如何复核。

关键结果

原文结果与口径
核对项结果意味着什么
可核验收益未报告不能把经验性建议当已证实提高收益的因果结论。
主要产物设计与检验分工研究前设目标,研究后检验,不是用主观判断覆盖失败证据。
外部有效性仍需独立样本验证压力测试与样本外检查不能替代真实交易成本和未见市场的验证。

怎么理解?

对有经验的研究员,本文适合变成项目评审表,而非再添一篇泛泛的“重视风控”。例如,如果目标是降低现有股票组合压力期损失,验收就应同时固定风险预算、压力定义及成本;单独策略CAGR不是主指标。反过来,若低相关只在历史偶然成立,不能因“组合需要它”便忽视期望收益不足。 作者强调经济解释是好的约束,但合理故事同样容易事后拼装,无法取代反事实检验。简单模型也并非天然不会过拟合:研究员试过千个简单规则后挑一个,仍有巨大选择偏差。把复杂度转移到组合层更不是免费午餐,模型数量、分配参数及人工干预都应计入研究自由度。

最大限制

这是公开访谈总结而不是效果评估,私人14步材料未读;部分重排交易次序等建议必须按策略依赖结构选择,不能不加区分当通用稳健性证明。

复现与研究价值

将每个候选策略形成一页事前契约:经济机制、组合工作、风险预算、可证伪条件、可接受成本及停止规则;回顾最终被拒绝和被部署的项目,验证该流程究竟减少了哪类错误,而不是只展示成功案例。

原文与核查

公开访谈总结全文已读;私域14步教程未读。

原始文章 ↗

推荐 69/100 · 问题 26/30 · 证据 11/30 · 方法 22/25 · 复现 10/15

有用的项目治理观点,但缺乏量化效果验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 观点评论

AI让新闻Alpha消失?这是待检验假说,支撑它的早期行业收益后来被更正

A Day Is Now What a Decade Used to Be

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

作者提出:AI压缩机构研究到下单的时间,次日新闻情绪收益可能缩小甚至转为反转。但这篇依据的是早期16天行业观察,而作者7月已承认同管线收益数据和分位排序存在缺陷,行业排名未通过复核。因此“AI正在消灭新闻Alpha”只能保留为假说,不能当作这组数据已经证明的结论。

它到底在问什么?

新闻因子究竟依赖什么?如果优势来自人类处理信息较慢,AI是否会缩短可交易窗口,改变研究者应该测量的时间尺度?

作者具体怎么做?

  1. 将新闻出现、研究解读、投资决策和成交拆成链条,假设AI同时压缩其中多个环节。
  2. 提出行业差异预测:工具采用较快的行业次日情绪信号应更早减弱,并计划用后续季度检验。
  3. 讨论信号可能向更短时间尺度、非公开一手研究或长期判断迁移;这些是作者的方向性推测,没有在本文完成实证验证。

关键结果

原文结果与口径
核对项结果意味着什么
AI导致衰减未被识别需要独立采用时间或信息处理速度数据,不能仅凭新闻收益变弱归因。
早期行业证据后续更正,不再成立不继续使用原16天收益差支持宏大叙事。
仍可研究的对象新闻—交易延迟应直接测时间戳和价格反应,而不是用机构宣传或工时节省替代。

怎么理解?

这个问题重要,但更需要严格的因果设计。市场效率可以因流动性、参与者、新闻构成或采样方法改变;即使次日收益消失,也可能只是错误被修正,而非AI压缩了信息半衰期。把所有变化归于一个热门技术,会让真实诊断失焦。 本系列的更正恰好提供更实用的教训:在讨论新时代之前,先验证收益列完整、周末处理正确、排序对并列值稳定。同日情绪与收益相关也可能是标题已经写了“股价上涨”。这种数据管线问题比宏大机制更基础,且可以立即检验。

最大限制

本文没有AI采用率的可审核面板、交易延迟测量或因果对照;早期数值已被作者后续审计降级。关于哪些信息未来更有优势的推测不构成投资建议,也未核验文中企业产品使用陈述。

复现与研究价值

围绕新闻首次发布时间做分钟级事件研究,区分原始公告与事后评论;若研究AI影响,应利用可辨认的工具采用时点与对照组,固定资产和新闻类型,检查价格反应曲线而非只看日频相关。

原文与核查

5月评论完整阅读,并结合7月更正文核对结论状态。

原始文章 ↗

作者7月更正与撤回说明

推荐 52/100 · 问题 25/30 · 证据 7/30 · 方法 15/25 · 复现 5/15

机制问题值得问,但早期支持证据被更正,因果叙事远超当前设计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

用经理平均仓位替代固定60/40,年化7.9%变9.1%,但股票敞口也多了6个百分点

The NAAIM Exposure Index: Incorporating Active Investment Mgr Sentiment into Asset Alloc

Portfolio Optimizer

一句话先讲结论

每季末把NAAIM过去13周平均读数当股票权重,其余配债,2006—2026年回测年化9.1%,高于60/40的7.9%,周频回撤25%对34%;但平均股票仓位也从60%升到66%。这说明调查驱动配置值得研究,尚不能把1.2个百分点收益差全部称为择时Alpha。

它到底在问什么?

长期股债投资者能否用主动经理实际仓位调查,做低频、透明的配置调整,而不是构建复杂日频信号?

作者具体怎么做?

  1. 先说明NAAIM周度自报仓位可包括空头和杠杆,并同时关注中位数与离散程度,避免把平均数解释为所有经理一致持仓。
  2. 季末计算13周简单均值,将其百分比配置到股票,余额配置债券,持有至下季;用2006年9月至2026年2月数据比较。
  3. 报告收益、波动、夏普与周频最大回撤,同时承认更细频率会显示更大回撤,调查时间与实际后续仓位亦可能不同。

关键结果

原文结果与口径
核对项结果意味着什么
年化差9.1% vs 7.9%历史组合结果,未分离更高股票平均仓位的贡献。
平均股票敞口66% vs 60%公平对照还应包括固定66/34或同风险组合。
周频最大回撤25% vs 34%仅周度观察,不能代表持有期间真实最大损失。

怎么理解?

这类规则的好处是容易解释和执行:用平滑调查代替固定股票比例,降低决策频率。但它也把一群经理的行为当作外部模型,这些经理可能已经在追趋势,因此需要检查调查究竟新增了信息,还是仅把已有价格趋势换一种包装。 还应审计仓位边界。原始调查允许负值与超过100%,若13周平均也越界,公式可能隐含卖空或杠杆;生产实现不能默默截断而又沿用未截断回测。定义、边界和发布时间都应写进规则,而不是只保留一行均线。

最大限制

本次完整阅读作者复现说明,未独立运行API或数据。成本、负/超100读数处理与无风险夏普口径未充分展开;调查样本、分歧及周频风险限制外推。

复现与研究价值

加入固定66/34、价格动量配置和同波动60/40对照,用日价格计算风险并计入费用;严格使用发布时间之后的信号,明确权重截断规则,检查是否仍有风险调整增量。

原文与核查

公开方法与结果表完整阅读;未执行数据API或复现。

原始文章 ↗

推荐 76/100 · 问题 24/30 · 证据 21/30 · 方法 21/25 · 复现 10/15

简单透明且数值完整,更高股权暴露与周频风险尚需拆解。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

同一股债金组合,换欧元计价后回撤23%变45%:样本起点改变了汇率结论

The Currency You Didn’t Choose

Beyond Passive Investing

一句话先讲结论

2009年后样本中,欧元投资者不对冲美元反而受益;但把同一股债金策略延至1970年,作者报告美元计价年化7.08%、回撤23.0%,未对冲欧元计价变为5.58%、回撤44.9%。它说明近期美元强势不能代表全部货币风险,同时更早欧元数据其实由德国马克月度锚点合成,不能当真实日度欧元历史。

它到底在问什么?

研究报告常用美元净值,实际花欧元的人承受什么额外风险?美元在某次危机保护了组合,是否就意味着永远不该对冲?

作者具体怎么做?

  1. 先展示2009年后股票组合和股债金组合的双币种结果,观察美元升值对欧元投资者的帮助。
  2. 延长至1970年并按十年和组合最差月份拆解汇率贡献,区分危机时保护与正常时期方向漂移。
  3. 比较完全不对冲与完全对冲,用利差和期货展期两种方式估计对冲成本,并明确1999年前日路径经过插值。

关键结果

原文结果与口径
核对项结果意味着什么
全样本回撤23.0% → 44.9%计价货币改变投资者体验,早期序列含代理历史。
近期收益方向欧元计价更高同一对冲政策在不同美元阶段可能呈现相反比较。
1999年前数据马克月度锚点插值日度波动人为平滑,不可据此精确校准每日风险。

怎么理解?

研究里最应该保留的是“以负债货币评估风险”。美元资产净值稳定,并不保证欧元购买力稳定;但反过来,汇率有时也会在股债受损时提供缓冲。因此对冲比例应在整体组合和现金流需求中评价,而非只看汇率这一腿长期赚没赚钱。 需要纠正文中的一个金融解释:抛补利率平价约束的是远期与现货、两币利率之间的无套利关系,不是保证未来未对冲汇率收益与对冲成本在期望上相等。两条历史终值接近只是这一条路径的结果。把对冲成本称为完全确定也过强,未来利差、基差、名义金额与展期成本都可能变化。

最大限制

早期股债金及汇率数据含合成和代理,历史欧元计价是假想比较;利率代理、现金币种与对冲名义定义需代码确认。本文未重算,不能将长期单一路径当未来分布。

复现与研究价值

同时提供本币、美元与部分对冲净值,并把实际ETF时期与合成时期分开展示;基于真实远期报价计算利差和基差。对有提款需求的组合增加现金流压力测试,而非直接以最长样本胜者决定对冲。

原文与核查

公开正文及数据注释完整阅读;未独立重算货币换算。

原始文章 ↗

推荐 74/100 · 问题 27/30 · 证据 19/30 · 方法 20/25 · 复现 8/15

计价与样本依赖重要,合成数据及平价解释需谨慎。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

DeepSeek只负责给市场贴标签,EURUSD夏普0.54变0.90:还需排除历史标签泄漏

AI Forex Backtesting with LLM Regime Labels: DeepSeek vs KMeans in Python

José Carlos Gonzáles Tanaka / QuantInsti

一句话先讲结论

在EURUSD的2023年至2026年3月测试中,同一套确定性交易规则把KMeans状态标签换成DeepSeek后,年化2.63%升至5.69%,夏普0.541升至0.898,回撤9.82%降至8.59%。这是一项有用的受限LLM实验,但交易参数滚动样本外,不等于事后调用的新模型生成历史标签也自动无泄漏。

它到底在问什么?

不用LLM直接给买卖建议,只让它根据数字摘要判断趋势、震荡或高波动,能否改善固定规则选择?

作者具体怎么做?

  1. 使用2006年以来日度EURUSD特征,KMeans仅在2023年前拟合并映射为命名状态;DeepSeek读取紧凑数字摘要,返回固定JSON标签并缓存。
  2. 每月用此前默认三年窗口调整少量仓位和震荡阈值参数,下一月执行,仓位滞后一天以避免同根K线交易。
  3. 从2023年1月2日至2026年3月31日拼接测试收益,按1bp固定成本假设比较收益、波动、夏普和回撤。

关键结果

原文结果与口径
核对项结果意味着什么
夏普比较0.541 → 0.898单一货币对和特定历史窗口,未验证跨市场稳定性。
年化与波动5.69%;6.40%收益更高时承担波动也更高,应增加同风险比较。
成本假设1bp简化假设,未代表所有时段可成交价差与融资成本。

怎么理解?

这种实验比让大模型自由买卖更容易审计:输入、输出空间和后续动作都有限,能明确问标签是否增加信息。但KMeans的簇到命名状态映射本身也需要公平设计,同一簇可能同时是最高波动和最强趋势;不同映射可以改变对照强弱。 更重要的是时间边界。数值摘要减少模型直接看到历史事件的机会,却不完全排除日期、特征工程、提示词选择与模型训练知识影响。作者应该保存模型版本、调用时间、是否含日期以及全部失败输出。只说参数在过去三年优化,不能覆盖整个研究链的样本外要求。

最大限制

原文代码展示在提取文本中未完整展开,下载需登录,本次未取得并执行完整脚本;单货币对、短测试和事后模型标签限制证据。交易成本、融资和真实收盘报价未独立验证。

复现与研究价值

先加入无需LLM的固定阈值和简单监督分类对照,统一风险与输入;去日期盲化历史摘要,并冻结模型、提示词后做实时标签前测。测试缓存重跑一致性、API失败空仓逻辑和成本敏感度。

原文与核查

公开文章与结果表完整阅读;完整下载代码未取得或执行。

原始文章 ↗

推荐 75/100(暂定) · 问题 28/30 · 证据 18/30 · 方法 22/25 · 复现 7/15

受限LLM角色与对照明确,历史标签生成和实现尚需审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 强化学习执行教程

PPO比AC省0.7bp?作者承认结果表是参照文献填入,不能当真实测量

Reinforcement Learning for Optimal Execution

Jonathan Kinlay

一句话先讲结论

文章展示PPO执行成本3.6bp、Almgren–Chriss4.3bp、TWAP4.8bp,但紧接着说明这些数字是参照类似文献填入,要求读者运行后替换。因此“节省0.7bp”不是已核验实证;公开代码还存在所谓配对评估实际共用随机生成器等问题,本篇应当作为环境设计审计案例阅读。

它到底在问什么?

执行算法能否依据盘口深度和不平衡动态卖出,比固定时间切片或风险厌恶前置成交更节省成本?问题合理,但答案必须来自有效环境和真实运行。

作者具体怎么做?

  1. 状态包含剩余时间、库存、相对到达价格漂移、价差、不平衡和波动代理,动作仅限可立即成交订单。
  2. 用两层64单元网络训练PPO五万步,最后一步尝试清仓,未成交库存另罚款。
  3. 评估声称使用一千个同场景配对片段,但代码浅拷贝环境并共享rng,依次reset会抽到不同起点;该对照须先修复。

关键结果

原文结果与口径
核对项结果意味着什么
展示成本3.6 / 4.3 / 4.8bp作者标明待运行替换的示意值,不是确认的PPO优势。
真正独立测试未提供同日随机重抽片段可与训练大量重叠,不等于新日期样本外。
模拟市场反馈没有策略消耗当前深度但未来盘口仍按原历史重放,大单优势尤其不可直接相信。

怎么理解?

这篇最重要的阅读结果,是把代码示例和实证发现分开。作者后面反复用“真实、可重复”形容增益,与表格脚注证据状态不一致;规模和波动分组同样不能因为看起来符合机制便成为数据。开头还有口径错误:40亿美元成交额的一基点应是40万美元,不是160万美元,后者对应四基点。 代码也揭示更实质的问题:所谓30秒波动实际rolling(300)按事件条数计算;AC校准写成全日价格波动和固定冲击参数,不是描述的历史30日校准。未成交库存的二次罚款不等于真实清仓成本,所以负累计奖励未必等于标准母单IS。先修好这些,才有资格讨论用PPO还是简单条件规则。

最大限制

没有实际运行结果可供独立核验,且历史重放不包含订单引发的后续市场反应。只支持卖单的示例、单日训练及评估问题限制实现可用性;引用论文未被当作该代码结果。

复现与研究价值

先固定同一到达时间清单独立重置三种策略,按实际时间计算特征,严格隔离训练日期;确保母单全部结算并单独报告未成交率,加入盘口不平衡简单规则基线,再实测成本差和按交易日聚类的不确定性。

原文与核查

全文、结果脚注和全部公开代码已读;确认数字非作者实际测量,未执行。

原始文章 ↗

推荐 55/100(暂定) · 问题 25/30 · 证据 5/30 · 方法 17/25 · 复现 8/15

代码有教育价值,但核心结果是示意且评估存在可见缺陷。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 工程研究

Python日志调用167纳秒,不等于日志已落盘:量化热路径优化的边界在哪里

Designing State-of-the-Art Logging in Python

HangukQuant

一句话先讲结论

作者的文件日志基准中,无参数消息调用中位数从标准库6417纳秒降至167纳秒,但新实现把格式化与I/O移到后台,测的是生产者返回时间,不是可靠落盘时间;异常日志仍需22834纳秒,说明“快30—70倍”不能套到所有负载。

它到底在问什么?

行情处理和下单链路只有微秒级预算时,怎样保留可审计日志,又不在交易线程里不断查栈、分配对象、格式化和写文件?

作者具体怎么做?

  1. 按CPython代码对象和行号缓存调用点,首次注册文件、级别、格式和参数类型,此后只写静态引用、时间戳与动态值。
  2. 每个生产线程使用预分配的字节环形缓冲,减少锁竞争;消费线程汇总时间戳并完成序列化与输出。
  3. 每种负载调用一万次,每次之间设置10微秒暂停,统计p50/p90/p99及最大值,另测异常和被级别过滤消息。

关键结果

原文结果与口径
核对项结果意味着什么
普通文件消息6417 → 167ns调用侧延迟,不是从事件到磁盘持久化的端到端时间。
异常消息37375 → 22834nsPython异常与栈处理仍占主要时间,提升幅度明显更小。
测量间隔每次暂停10μs不代表持续突发流量下的队列拥塞和尾部表现。

怎么理解?

工程思路清楚:不是神奇地让I/O消失,而是缓存静态工作、压缩动态载荷并将重活移出热路径。对交易研究员,这比单看速度倍数更有用,因为它说明何时值得牺牲通用日志API。基准里标准实现同步写入,而新实现异步排队,二者服务语义不同,应加上标准库异步队列或同类异步配置后再比较。 上线时最重要的不是最佳p50,而是消费者卡住会怎样:阻塞下单、丢日志,还是内存膨胀?崩溃前队列里的事件能否恢复?跨线程按时间戳合并是否会因时钟顺序产生歧义?这些都是审计可靠性,不是额外装饰。文章没有给出完整答案,因此不能仅凭纳秒图就替换生产日志系统。

最大限制

本次未运行基准或审计原生队列实现,硬件与完整环境未独立核验;缓存热身、异步语义、输出格式及后台排空均影响公平比较,作者最快实现的市场范围声明未验证。

复现与研究价值

增加同语义异步基线,测突发负载、队列饱和、强制终止和异常风暴;同时报告生产者p99.9、端到端落盘延迟、丢失率、CPU及退出排空时间,先在影子环境验收。

原文与核查

公开设计、全部基准表和基准代码完整阅读;未独立运行或审计底层实现。

原始文章 ↗

推荐 83/100(暂定) · 问题 28/30 · 证据 21/30 · 方法 24/25 · 复现 10/15

设计与基准代码具体,异步可靠性和同语义对照仍需补充。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-summary

Why Momentum Investing Has Been Struggling—And What Volatility Has to Do With It

Why Momentum Investing Has Been Struggling—And What Volatility Has to Do With It

Haim Mozes

一句话先讲结论

2014—2024年VIX尖峰更频繁、反转更快,造成动量在急跌后快速反弹中频繁反向;动量信号若与波动率尖峰重合应降权。

它到底在问什么?

波动率尖峰如何影响动量收益?近期动量疲弱是否与尖峰频率和反转速度的结构变化有关?

作者具体怎么做?

  1. 以不同倍数阈值识别VIX尖峰并统计频率/反转天数
  2. 比较尖峰前、尖峰期间和反转期S&P 500收益
  3. 比较尖峰月/次月与其他月份的动量因子收益,并检验移动均值窗口

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:机制是急跌触发动量做空或减仓,快速反弹又迫使其反向调整;波动率尖峰兼具反转交易信号和动量风险过滤器属性。

最大限制

二次解读;尖峰阈值、移动平均和动量定义敏感;2008、2020等持续上升的尖峰会造成严重损失;未提供完整交易成本和可交易策略回测。

复现与研究价值

获取原论文,复刻各阈值和窗口;对动量信号加入VIX门控,做严格OOS、成本、不同市场和不同动量定义检验。

原文与核查

public-secondary-summary-read

原始文章 ↗

推荐 83/100 · 问题 26/30 · 证据 25/30 · 方法 22/25 · 复现 10/15

公开全文披露样本、阈值和多组数字;主要扣分来自二次来源与策略实现细节不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

追最近高夏普的TAA策略:12个月窗口有亮点,却在2011年后失去优势

Selecting TAA Strategies Based on Recent Performance, Part 2: Recent Sharpe Ratio

Allocate Smartly

一句话先讲结论

从100多条TAA策略里每月挑最近夏普最高的几条,12个月回看、选3条的组合给出UPI 3.59,高于平均策略3.05;但作者指出这种优势在2011年后已无效,短于12个月的回看尤其差,而且尚未扣除策略切换的额外摩擦。因此它不是一条已经得到稳健支持的“追高夏普”规则。

它到底在问什么?

直接追最近收益最高的策略容易追到高风险策略,改成追风险调整后的夏普,能否更可靠地选择下一阶段的赢家?

作者具体怎么做?

  1. 以平台100多条TAA策略为候选,从1973年起进行月度筛选,分别改变回看长度和最终持有策略数,检查参数面而不是只展示最优组合。
  2. 比较年化收益、夏普、最大回撤和UPI;特别观察小于12个月与至少12个月窗口的区别。
  3. 再去掉无风险收益门槛,用收益/波动替代夏普排名。策略选择因此更偏向收益路径平稳的资产,但没有改变缺少稳定优势的结论。

关键结果

原文结果与口径
核对项结果意味着什么
最好看的公开例子UPI 3.59 vs 3.0512个月回看、选3条;这是参数格中的结果,不能当作预先指定规则的样本外证据。
较短回看小于12个月更差四类指标均有明显差异,短样本夏普估计噪声可能抵消轮动价值。
分段稳定性2011年后无效作者文字披露,未展示分段完整数列,故不进一步推算损失幅度。

怎么理解?

追夏普比追总收益更合理,但并不会消除选择误差。候选策略的短期波动、共同持仓和危机暴露都可能暂时改变排名;选出的是“最近看起来顺”的路径,不一定是未来预期收益真正提高。候选高度相关时,三个不同名字也可能代表同一种风险。 作者对孤立UPI亮点保持谨慎是这篇最有价值的部分。真正可信的轮动改进应该同时有机制、邻近参数稳定性和时间稳定性;从完整参数表挑出一个胜者,再用全样本指标给它背书,恰好又回到了策略筛选原本要避免的问题。

最大限制

没有公开完整候选收益库、策略首次可投资时间与分段统计。基础策略成本已计,策略间切换成本未计;两者不能混为“已经净成本”。去掉无风险门槛改变排名偏好,但不宜据此普遍断言夏普必然偏爱高风险。

复现与研究价值

在自有策略库上先做按首次上线时间的滚动候选池,再把夏普排名与收益排名、等权、风险平价比较;以相关簇为单位限制重复风险,并单独报告换手成本和危机后恢复期表现。固定检验方案后再观察未来月份。

原文与核查

公开正文完整阅读;未重新计算平台策略收益。

原始文章 ↗

推荐 77/100 · 问题 26/30 · 证据 21/30 · 方法 22/25 · 复现 8/15

负面结果与时间失稳披露有用,数据和分段结果开放度有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

黄金与比特币轮动年化64.7%,降风险后只剩12.0%:暴露调整才是故事关键

Dual Momentum Allocation Between Physical Gold and Bitcoin (Digital Gold)

Cyril Dujava / Quantpedia

一句话先讲结论

2018年底至2026年4月,黄金/比特币/现金的4、8、12周动量等权组合报告年化64.73%、最大回撤49.40%;加上基于12周波动估计的降仓后,年化降至12.01%,回撤收窄到12.27%,夏普反而由1.47小降至1.37。风险确实下降,但不能把降杠杆后的低回撤等同于新增Alpha。

它到底在问什么?

黄金与比特币常被放进同一个保值叙事,但波动和危机表现很不一样。能否用相对强弱择一,再用绝对动量转现金,让配置更可控?

作者具体怎么做?

  1. 将Bitfinex小时比特币价格对齐GLD的纽约交易收盘时点,使用2018年底至2026年4月样本,并讨论后期BITO、IBIT实现载体。早期历史并不是当时已经存在的IBIT交易记录。
  2. 遍历1、2、3、4、6、8、12、20、24、28周动量;原文8周表现最好,再构建4、8、12周等权复合版本以分散单参数选择。
  3. 选择资产后用12周滚动波动年化,按示例可理解为min(1,20%/估计波动)配置,剩余现金;原文公式排版不完整,复制前需要核对代码。

关键结果

原文结果与口径
核对项结果意味着什么
复合年化64.73% → 12.01%降风险大幅降低收益和暴露,不是保持收益免费削去回撤。
最大回撤−49.40% → −12.27%历史改善,仍不保证未来回撤受同一界限约束。
夏普1.47 → 1.37使用零无风险利率口径,降风险后的全样本风险效率略降。

怎么理解?

最应该拆开的,是资产选择与仓位选择的贡献。原策略在比特币大波动期承担很高风险,复合参数也没有避免接近50%的回撤;风险调整后的结果更适合稳健预算,却不能称为动量选择能力被进一步证明。需要一个相同平均波动或相同平均仓位的被动组合,才能看清择时有没有独立贡献。 另一个关键是资产代理的可交易历史。现货比特币、期货ETF和现货ETF涉及不同费用、展期和交易时段,把它们串成一条方便的序列并不能消除这些差别。周三收盘既用于判断又用于执行,也必须明确是否有滞后;只有当天已知数据才能决定后续真实成交。

最大限制

参数最优区间及复合选择均在同一历史上观察,未见冻结后的独立样本。公开正文对ETF代理、同收盘成交、现金利息和交易成本披露不足;风险权重公式有排版问题,不能直接无核对复制。

复现与研究价值

先用现货数据与真实ETF成立后数据分别复现,明确下一可成交价格、手续费及价差;加入同波动被动混合对照,并把参数选择放入内层窗口。按周审计预测波动与实现波动偏差,不把20%视为硬保证。

原文与核查

公开正文及文字结果表完整阅读;未下载原始行情或执行回测。

原始文章 ↗

推荐 74/100 · 问题 26/30 · 证据 19/30 · 方法 20/25 · 复现 9/15

收益风险对照充分,但代理历史、成本和参数选择限制策略结论。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

回撤优化了17%,却只是绕开两笔亏损:一次策略修改的过拟合审计

Bad Month for Your Strategy? Should You Change It?

Cesar Alvarez

一句话先讲结论

某策略遭遇最差回撤后,增加规则让CAR相对提高约5%、最大回撤相对缩小17%、夏普提高15%;看起来全面改善,但作者进一步发现,主要收益来自绕开引发修改念头的两笔交易,其他大回撤几乎未改善。文章最终不接受这次修改:改好了历史伤口,不等于学到了可迁移规律。

它到底在问什么?

真实交易亏损后发现一个看似合理的新过滤条件,究竟是在修复策略,还是在为刚发生的亏损寻找事后借口?

作者具体怎么做?

  1. 先观察年化复合收益、最大回撤、年度收益及夏普,确认修改是否带来足够大、而非微小的高层指标改善。
  2. 进一步检查逐年收益和前五大回撤:大多数年份不变,显著变化集中在少数年份,尤其是触发修改的2026年;前五大回撤主要只改善最差那一次。
  3. 返回原策略,单独排除触发重估的两笔交易,发现几乎复制了新规则的主要改善,因此把它视为事后拟合。对于通过上述检查的修改,作者仍等待两三个月再重新判断。

关键结果

原文结果与口径
核对项结果意味着什么
表面改善CAR +5%;夏普 +15%相对改善幅度,不是年化增加5个百分点或夏普增加0.15。
最大回撤变化相对缩小17%改善集中在最差一次,不代表所有尾部风险均下降。
收益来源审计两笔交易解释大部分改善排除个案即可重现效果,是新规则可能缺少一般性的警报。

怎么理解?

这是一种非常实用的“删除个案对照”。研究员往往只展示新规则比旧规则多赚多少,却没有问:如果只删掉让我难受的那两笔,它还能多贡献多少?把这部分先扣出来,能够识别一条规则到底改变了广泛的交易分布,还是只给已知亏损穿上经济逻辑的外衣。 不过,集中在少数事件也不能自动判定规则错误。真正的灾难风控本来就只在少数极端事件上起作用。区别在于是否有事前可辨认、跨事件成立的机制,以及它在未见过的相似事件中是否仍有效。等待两三个月有助于情绪冷却,但若该状态几年才出现一次,等待本身并不构成统计验证。

最大限制

文章是匿名策略案例,未公开全部规则、交易明细和绝对指标,因此不能独立复现17%的回撤改善。作者的等待步骤属于决策治理经验,不是对有效样本量的正式要求。

复现与研究价值

每次修改都记录提出日期、触发交易、原始理由及所有尝试过的替代条件;剔除触发事件后再评价增量效果,并做留一危机事件检验。交易前锁定接受标准,不允许只因最近净值恢复就接受规则。

原文与核查

公开方法与案例正文完整阅读;未取得真实交易流水。

原始文章 ↗

推荐 78/100 · 问题 27/30 · 证据 18/30 · 方法 23/25 · 复现 10/15

个案剔除对照可立即加入研究审核,但匿名策略限制独立复现。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

问卷择时只投资19%的时间,周频回撤不到10%,日频却达到25%

Modeling with the NAAIM Exposure Index

Rob Hanna

一句话先讲结论

作者仅用NAAIM仓位调查设置三种做多条件,触发时持有150%标普敞口,历史只投资约19%的时间;最醒目的不是收益,而是最大回撤用周收盘看不到10%,换成日数据却因2020年3月达到25%。低频估值会藏住持有期内风险,不能据周频表给杠杆策略定风险预算。

它到底在问什么?

主动经理仓位极低可能意味着反弹机会,极高却也可能意味着强势延续;如何把两种不同逻辑写成明确规则,并正确衡量风险?

作者具体怎么做?

  1. 条件一:读数处于过去52周底部10%,但不再低于上周,用于极端悲观后的止跌。
  2. 条件二:读数至少80且四周上升至少15点;条件三:读数至少100,分别表达热度上升和高仓位延续。
  3. 使用周度结果后再用Realtest日价格重算回撤,发现持有期内波动远大于每周抽样所显示的风险。

关键结果

原文结果与口径
核对项结果意味着什么
触发仓位150% SPX不是普通满仓;需要融资、工具与风险约束。
投入时间约19%现金持有减少总体暴露,应与同平均风险基准比较。
回撤频率差<10% → 25%周收盘漏掉周中损失,不能当成两个不同策略的改善。

怎么理解?

这篇最适合做风险报告的反例:同一策略不改交易,只改净值采样频率,就能让最大回撤看起来小很多。持仓和融资面对的是连续市场而不是每周一张截图,日内保证金与滑点甚至可能比日数据还糟。展示周度策略也必须用足够细的价格评估风险。 调查极低和极高都可能对应正收益,提醒我们不能把所有情绪指标机械逆向。可是这三条阈值是否事后选择、是否只是价格趋势的代理,仍需检验。经理仓位往往响应此前市场,加入价格动量后是否还有增量信息,比单独净值漂亮更重要。

最大限制

无佣金、滑点或融资成本;作者明确表示不会仅凭调查持有一整周。未见阈值搜索台账和独立未来样本,问卷平均值也不等于市场总体资金仓位。

复现与研究价值

先重建公开时间戳与日度风险,再加入融资成本;与价格趋势、同平均暴露和简单阈值策略比较。固定三条规则后观察未来,不用新样本继续微调80、100和15。

原文与核查

公开规则与风险说明完整阅读;未下载会员代码或重跑。

原始文章 ↗

推荐 76/100 · 问题 25/30 · 证据 20/30 · 方法 21/25 · 复现 10/15

规则清楚且揭示低频回撤偏差,但无摩擦和阈值选择限制有效性。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

新闻情绪不是一个因子:拆成数字、事件、分析师后,行业方向甚至相反

Sentiment is not one signal

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

先看后续更正:作者7月审计发现次日收益缺失、周末虚假零收益和分位排序并列处理问题,早期行业收益排名不再成立。5月这篇仍值得读的,是把22261条新闻拆成数字结果、公司事件、分析师动作等渠道,而不是交易当时仅16天估出的巨大收益差。

它到底在问什么?

财报超预期、收购公告、评级上调和泛泛评论为何要放进同一个情绪平均值?如果它们通过不同机制影响价格,汇总标签是否反而抹掉了重要结构?

作者具体怎么做?

  1. 对2026年4月16天、九个行业22261条文章返回类型、material、方向与一句理由,类型占比约71%其他、14%事件、10%数字、5%分析师。
  2. 检查输出约束及同公司同日的跨渠道冲突;22260条满足逻辑约束,发现222个方向冲突案例。逻辑一致并不等于标签事实正确。
  3. 按行业与信息类型计算正负标签日的次日超额收益差,并看分布而非仅均值;各组中位数普遍接近零、分布重叠,少量尾部观察推动平均差。

关键结果

原文结果与口径
核对项结果意味着什么
信息分类样本22261条 / 16天早期提示词与语料的工程记录,不代表收益检验有效。
历史行业收益表后续更正,不再成立不得用原文−2.4或+2.4个百分点等数值给行业择时。
更正后的次日信号未显著区别于零作者7月修正数据与无并列歧义指标后,未确立稳定模型排名。

怎么理解?

这种拆法的研究价值在于让假设有明确经济对象:数字结果可围绕预期差,事件可围绕金额和业务影响,分析师动作可围绕首次调整与目标变化,而不只是一个通用正负分数。行业之间确实可能通过不同渠道吸收信息,但需要更长的未来验证来决定哪些差异稳定。 最需要刹车的是把九行业乘三渠道的结果表直接变成选股规则。单元格越多、样本越短,越容易找到几个很大的均值;同一公司多条新闻、同一交易日宏观冲击也让观察不独立。文章把某些行业现象解释为分析师更有价值或信息已定价,这些是合理假说,不是当前设计识别出的因果关系。 后续核验改变了本篇的结论等级:作者7月不只说样本不足,而是发现原始测量有缺陷,行业排名未通过复核。因此这里保留分类思路作为研究设计,不保留早期收益表作为有效经济证据。

最大限制

重要后续更正:次日收益列只覆盖约一半日期,周末填充产生虚假零,分位排序受大量并列值影响;作者已撤回稳定次日收益和行业排名声称。本篇旧数据只用于解释研究演变,不能作为当前策略证据。

复现与研究价值

冻结类型定义后,新增事件金额/市值、预期差和首次发布时间;按公司与日期聚类评价,设置真正后续季度样本。先报告渠道标签一致性和条件分布,再决定是否需要行业专属参数。

原文与核查

公开正文、提示词和分布解释完整阅读;未重跑原始新闻模型。 已阅读7月更正正文,旧收益结论已降级并标注。

原始文章 ↗

作者7月更正:原有收益结论撤回

推荐 68/100 · 问题 28/30 · 证据 10/30 · 方法 21/25 · 复现 9/15

信息类型拆分仍有工程价值,但收益与行业排名已被作者后续审计推翻。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

没持有比特币,也可能持有同一批投机者:关注因子是在找隐藏共振

The Attention Factor: The Link That Connects Crypto and Public Equity Markets

Harin de Silva;Quantpedia导读

一句话先讲结论

论文导读称,在投机活跃时期,比特币约四分之一短期收益变化与全球股票共同变化;扣除市场和风险偏好后,剩余联系集中在Coinbase、Robinhood、DraftKings及情绪型ETF,而纳指100等基准大幅减弱。要问的不是组合有没有币,而是是否反复暴露于同一类投机参与者。

它到底在问什么?

没有共同现金流的市场为何同步波动?普通市场Beta能否解释全部联系,还是跨平台交易的同一群边际投资者带来额外共同风险?

作者具体怎么做?

  1. 观察比特币与全球股市连通性的时间变化,重点比较投机参与高低阶段,而不把一个全样本相关系数当常数。
  2. 剔除共同市场与风险偏好通道后,比较不同股票和ETF的剩余联系,检查其是否与投资者构成及商业模式对应。
  3. 用情绪ETF和去趋势0DTE交易量作补充验证;导读引用相关系数0.30、p<0.001,但这仍是共同变化证据,不自动识别同一群投资者的因果传导。

关键结果

原文结果与口径
核对项结果意味着什么
高投机期共同变化约25%文中连通性口径,不宜直接替换成所有时期固定回归R²。
剩余联系股票之间明显不同商业暴露与参与者结构可能重要,并非所有热门科技股都同样敏感。
0DTE佐证r=0.30相关性支持进一步研究,但不证明同一资金群体造成了全部联系。

怎么理解?

这篇对组合风险的提醒比对收益预测更成熟。跨资产分类常按证券形式划分,但真正的风险源可能是共同融资约束、投资者情绪或参与热度。一个组合同时买交易平台、博彩平台和高关注股票,形式上跨行业,行为风险却可能高度集中。 不过,剔除几个市场因子后留下相关性,不等于找到了唯一遗漏因子。共同政策、融资条件、风险偏好代理误差和商业收入渠道,都可能产生残差。尤其交易平台公司本身的收入确实与市场活跃度相关,不能把所有关联都视为纯粹没有基本面的注意力传染。

最大限制

本次完整阅读导读与其引述摘要,原论文全文未独立取得;不采用无法核对的表格描述和缩写解释。显著相关不等于因果,尚未提供可复制的实时因子、净收益或稳定对冲结果。

复现与研究价值

在现有组合中先做残差暴露与压力归因,再分别控制交易量敏感收入、融资条件和传统风格;使用时间外检验确认负载是否持续,避免把新的残差名字直接加入风险模型并给予因果含义。

原文与核查

公开导读完整解析;原论文全文未逐页核验。

原始文章 ↗

原论文SSRN6277718

推荐 71/100(暂定) · 问题 28/30 · 证据 17/30 · 方法 21/25 · 复现 5/15

隐藏风险问题重要,全文、因子构造及识别仍待核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 合成数据实验

CNN修补波动率曲面输给线性插值:学到的平滑先验在新曲面上反成负担

Deep Learning for Volatility Surface Repair

Jonathan Kinlay

一句话先讲结论

在合成SSVI曲面常规缺失测试中,CNN补点波动率RMSE为0.0184,线性插值0.0131;换成未训练过的SABR风格事件曲面后,CNN为0.0671,插值0.0248。复杂模型没有自动胜过简单基线,而其名义95%区间在最困难场景仅覆盖41%;这些都是合成实验,不是市场报价效果。

它到底在问什么?

期权报价缺档或整片缺失时,模型学过的曲面结构能否帮助补点?必须区分缺数据和学到错误先验这两种困难。

作者具体怎么做?

  1. 以总方差为目标,输入观测值、缺失掩码和两个坐标通道,对缺失格子的重构误差给五倍权重。
  2. 交叉比较SSVI参数偏移与SABR风格生成器、约50%和18%观测密度,CNN训练60轮。
  3. 除缺失点RMSE外检查期限单调、蝶式诊断、置信区间覆盖和陈旧报价识别,再对补完曲面做下游SVI拟合。

关键结果

原文结果与口径
核对项结果意味着什么
SSVI常规缺失0.0184 vs 0.0131CNN与插值的隐含波动率RMSE,单位不是收益百分比。
SABR常规缺失0.0671 vs 0.0248换生成器后CNN误差显著放大,反映先验迁移失败。
95%区间最低覆盖41%知道哪里难,不等于不确定性大小校准准确。

怎么理解?

值得肯定的是作者没有把深度学习包装成赢家,而且同时看缺失误差和经济约束。不过,期限方向累积最大值只保证网格上的单调性,不是通常最小二乘意义的等距投影,更不是完整无套利修复。文中仍有约5%—11%的蝶式诊断违规;离散网格没违规也不能保证格间和翼部完全安全。 实现口径还应比叙述更优先:SVI只测试前十张而其他方法测试两百张,排名不是真正相同样本的配对比较;按一倍标准误称“统计打平”也不是正式等价检验。SSVI生成代码虽令ATM期限项单调,但移位事件凸起加入后未对全曲面重新累积最大,和文字对目标全面保证的说法有落差,需重新核验目标自身约束。

最大限制

未运行代码,本文结果未独立复现;SABR-style是人为构造的风格生成器,不是校准真实SABR行情。文中0.0671/0.0189的比值约3.55,不能照其文字称2.5倍。

复现与研究价值

先统一所有方法的200张配对样本及目标无套利检查,报告差值自助置信区间;随后用按日期留出的真实报价和实际缺失机制测试,对比完整无套利拟合,并评估价格、Vega和对冲损益误差而不仅补点RMSE。

原文与核查

全文与全部公开实现已读,识别SVI样本数等口径差异;未执行或核验市场数据。

原始文章 ↗

推荐 81/100(暂定) · 问题 28/30 · 证据 18/30 · 方法 24/25 · 复现 11/15

失败结果和多维诊断有研究价值,但合成设置及代码口径不一致限制证据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法教程

同样幅度的涨跌,为什么跌后波动更大?EGARCH解释这个机制,不保证期权套利

New Contributor: Modeling Asymmetric Volatility With EGARCH

Krzysztof Ozimek

一句话先讲结论

EGARCH把上一期冲击的大小与方向分别放进对数方差:同样一个标准差的涨跌,可以产生不同的下一期波动预测;本文展示的是这一机制和单步预测脚本,没有证明预测波动与隐含波动的差能够在交易成本后赚钱,更不是无风险套利。

它到底在问什么?

普通对称GARCH主要关心冲击平方,同样幅度的上涨和下跌反应相同;如何刻画权益市场常见的下跌后波动更强?

作者具体怎么做?

  1. 先指定收益均值方程,用残差除以条件标准差得到标准化冲击。
  2. 将冲击绝对值和带符号项放入对数方差递推,再指数化得到严格正的方差。
  3. 文章用交互图固定常数部分0.5与α=1改变φ,另提供R和Python脚本入口估计模型并做一步预测。

关键结果

原文结果与口径
核对项结果意味着什么
方差非负指数化后为正不需要用普通GARCH的非负系数约束保证这一性质。
方向效应负冲击与正冲击相差−2αφa这里比较对数方差增量,前提是两次冲击绝对值相同。
交易证据未报告文中谈交易应用,但未回测期权策略。

怎么理解?

教程的清晰之处是把大小效应和方向效应拆开。不过,“不需要特殊参数约束”只能用于强调方差正性,不能理解为任意参数都给出稳定、可估计、预测良好的过程;持续性、创新分布和矩存在仍要检查。不同软件还可能将绝对冲击中心化,截距与符号系数不能只按名字对照。 应用段需要明显降温:历史信息下的预测方差属于真实世界分布,期权隐含波动含风险溢价,两者不相等不是市场犯错。即使方向判断正确,期限错配、波动曲面、跳跃和对冲费用都能吃掉利润。研究员应先检验预测损失,再讨论具体期权组合的净收益,而不是看一条波动差就开仓。

最大限制

作者有意采用简化表达,未提供模型间样本外预测比较;本次未运行链接脚本或读取引用教材全书。示意参数不是市场估计值。

复现与研究价值

在同一收益与实现波动数据上滚动比较EWMA、GARCH、GJR和EGARCH的QLIKE与尾部覆盖,统一创新分布及预测期限;只有预测改进稳定后,再独立测试考虑风险溢价和成本的交易规则。

原文与核查

公开教程、公式及应用讨论完整阅读;链接代码未执行。

原始文章 ↗

推荐 70/100 · 问题 23/30 · 证据 16/30 · 方法 21/25 · 复现 10/15

适合理解非对称机制,但教程不是盈利证据且应用论述需严格区分测度。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

五月首日上涨后,25次中17次四日后下跌:季节性线索还不是交易策略

A Strong Start to May Has Often Been Followed by a Short-Term Dip

Rob Hanna

一句话先讲结论

自1987年以来,五月第一个交易日上涨的25次样本中,17次在四天后收低,约占68%;但其中一次包含2010年闪崩,作者本人也不把它作为独立交易理由。频率倾向可以提示短期风险,却不能替代平均收益、尾部损失与成本检验。

它到底在问什么?

月份开头的强势是否一定延续,还是五月这一日历位置存在短期回吐倾向?当多个季节性和价格信号相互矛盾时,应给这个条件多少权重?

作者具体怎么做?

  1. 作者回看1987年以来五月首日上涨的历史实例,统计四天后相对起点是否走低。
  2. 检查累计结果路径,指出一笔巨大下行发生在2010年闪崩附近,提醒单事件可能影响总收益观感。
  3. 同时考虑当时其他多空研究信号,因此把该现象定位为背景倾向,而非单独开仓依据。

关键结果

原文结果与口径
核对项结果意味着什么
方向计数17/25历史条件频率,样本稀少且未调整日历规则搜索。
重大尾部事件2010年闪崩收益强度可能被极端观察影响,需要同时报告剔除前后与稳健统计。
净收益结果未报告公开文字不足以计算可执行空头策略的净收益和风险。

怎么理解?

最有用的审阅问题不是68%够不够高,而是这条规则为什么被拿出来。日历日期、首日方向和四天持有期都可能来自大量尝试;若没有试验台账,25个观察里偏离50%的频率很难自动构成新的效应。置信区间和未参与选择的未来年份比漂亮历史胜率更关键。 同时,方向胜率不会告诉你盈亏比。少数上涨日可能幅度更大,卖空还要承担成本与跳空;去掉2010年后仍“看起来偏弱”不等于已经有稳健净收益。作者没有夸大为独立策略,这种边界应在看板上保留。

最大限制

短篇公开研究没有完整收益表和交易规则;仅25个条件实例,未独立核验原图或逐日行情,也未给多重比较调整。

复现与研究价值

把规则原样登记后观察后续年份;在历史审计中同时报告均值、中位数、最差反向行情及删除单事件敏感性,并与其他月份同定义规则比较,不再继续挑最佳日期。

原文与核查

公开短文完整阅读;未独立转录图表或回测。

原始文章 ↗

推荐 53/100 · 问题 17/30 · 证据 14/30 · 方法 13/25 · 复现 9/15

短线背景线索清楚,但小样本和规则搜索限制交易意义。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

参数平台比尖峰更可信,但搜索平台本身仍会过拟合

Overfitting and Parameter Selection in Trading Strategies

Harbourfront / rvarb

一句话先讲结论

这篇把两类脆弱性放在一起:线性预测模型用太多弱信号会高估样本内夏普,而只挑某个最佳参数点也容易失效;第二项研究改为搜索邻近参数表现稳定的平台。值得采用的是对复杂度和局部稳定性的审计,不是把“粒子群找到的平台”当作已经通过样本外验证的保证。

它到底在问什么?

回测失败来自模型本身维度太高,还是来自参数恰好选中历史尖峰?能否分别诊断,而不是只用一句“做交叉验证”概括?

作者具体怎么做?

  1. 第一项研究从线性模型PnL均值和方差推导样本内外夏普关系,考察信号强度、资产/模型维度及训练样本量。
  2. 第二项用平台评分衡量邻近参数的稳定表现,再用粒子群提高高维搜索效率,避免只取单点最高收益。
  3. 导读同时提醒简单模型和更多有效数据有益,但对“必须更少信号、追更高夏普”的机械结论持保留态度。

关键结果

原文结果与口径
核对项结果意味着什么
复杂度风险弱信号 × 高维度样本内收益更易乐观,真实强度不能由训练夏普直接得知。
参数选择目标邻域稳定而非尖峰可以降低对单点误差敏感性,但仍属于待验证选择规则。
量化改善幅度未报告公开导读未给完整表格,不能宣称某个固定百分比改善。

怎么理解?

研究员可以把这两项合成一套审计:先看模型自由度与样本信息是否匹配,再看参数周围是否稳定。但要记住,彼此相关的多个信号可能提供有效分散,而“少信号”不自动更好;真正需要控制的是可估计的独立自由度和经济信息,而不是列数。 粒子群只是更快找到候选,不会让候选的证据更强。搜索算法越有效,越可能探索更多历史偶然性。平台评分本身也有半径、尺度和权重参数,必须连同优化预算一起锁定,并把最终评估留给从未参与选择的数据。

最大限制

本次完整阅读导读,未逐页审计两篇原论文和代码。未提供可比交易成本、数据与统一基准;方法研究不能直接替代具体策略的复现。

复现与研究价值

把参数平台作为预先定义的选择目标,外层按时间留出评估;报告所有尝试次数、平台半径与跨时期稳定性。控制搜索预算后比较平台选择、单点选择及简单固定参数,避免给更昂贵搜索不公平优势。

原文与核查

公开导读全文已读;原论文仅定位,未审核全部推导。

原始文章 ↗

线性模型样本内外夏普原论文

推荐 72/100(暂定) · 问题 26/30 · 证据 17/30 · 方法 22/25 · 复现 7/15

问题拆分清晰,缺少原文数值和独立复现实验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

22条加密策略纸面前测16条亏损,但“累计−2081%”并不是账户收益

I paper-traded 22 popular crypto strategies on real fees for 10 days. Here's the data.

StratProof / Patrick Mortenson;文章注明由Claude撰写

一句话先讲结论

平台报告22条策略十天纸面前测26765笔交易,16条净亏,平均每笔−0.078%;但标题式“累计−2081%”只是逐笔百分比加总,不能当成账户跌幅,文中另列1000美元变662.90美元。它最值得读的是成本与信号家族集中风险,同时也必须审计文章自己的统计口径。

它到底在问什么?

常见技术指标在加入交易费和盘口价差后是否还能盈利?看似不同的六条胜者,是多种独立策略,还是同一个均值回归信号的参数变体?

作者具体怎么做?

  1. 从2026年4月19日开始十天前测,将22条技术策略的结果按策略、周期与币种分解,并加入平台自述的手续费和L2价差模型。
  2. 发现六条盈利策略均属于RSI均值回归家族,而不是六种独立优势;作者进一步给候选池加家族分类和容量上限。
  3. 比较回测与前测差异,报告胜率偏差、止损穿透与滑点校准,同时公布方法规范;核心回测引擎仍未开源。

关键结果

原文结果与口径
核对项结果意味着什么
总体平均每笔−0.078%跨策略交易样本平均,交易并不独立,也不是每日组合收益。
模拟账户余额1000 → 662.90美元与加总收益指标不同;具体资本分配和净值对账仍需公开流水核验。
盈利家族六条均属RSI类参数数量不等于风险分散度,六个名字可能同涨同跌。

怎么理解?

这是一个适合训练研究审计的案例:作者愿意讨论成本与失败,但“使用真实费用”并不会自动让模拟变成真实可成交业绩。被动单排队、成交概率、盘口更新延迟、资金占用与市场冲击仍可能遗漏。纸面模型需要用真实成交验证,而不只是用自己的另一组假设校准。 文章本身还有值得警惕的口径问题:宣称十个币种却列出更多名称;不同段落的单边价差与往返成本不完全吻合;低周期交易数更多也不意味着大数定律自动带来优势。这些不推翻成本重要性,却意味着不能照抄它的胜者排名或“长周期更差”的解释。研究员应把可验证账本与营销性概括严格分开。

最大限制

仅十天、多个相关策略和重叠交易,无法支持长期有效性。核心引擎未公开,费用表、滑点及账户净值未独立核验;文章由AI撰写并由运营者事后审核,不能视为独立第三方测试。

复现与研究价值

先对逐笔名义本金、手续费、价差、已实现损益和账户权益做恒等对账,再冻结规则延长前测。按信号家族报告收益相关性和有效多样性,并将真实成交、纸面成交与回测成交逐笔匹配。

原文与核查

公开文章、方法脚注与作者披露完整阅读;未独立验证平台账本或访问账户。

原始文章 ↗

推荐 58/100(暂定) · 问题 24/30 · 证据 10/30 · 方法 17/25 · 复现 7/15

失败披露与家族风险值得看,但统计口径和模拟实现问题明显。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

风险平价最痛的月份不是普通坏日子的简单累加:股债共跌占比明显上升

Where Risk Parity Hurts: A 58-Year Audit of Tails and Drawdowns

Beyond Passive Investing

一句话先讲结论

把股、长债、黄金逆波动组合延长到1968年后,作者找到721个最差5%交易日,平均跌1.04%;换成月频,35个尾部月份平均跌4.40%。其中股债共同下跌的类型从日尾部的14%升到月尾部的23%,说明组合的长期伤害不只是一次闪崩,而可能来自持续的共同宏观暴露。

它到底在问什么?

同样约20%的回撤,究竟由什么资产、以什么速度造成?如果不先拆清楚失败模式,就很难知道新增策略是在填补风险缺口,还是仅提高全样本平均收益。

作者具体怎么做?

  1. 在约14,400个交易日里选择最差5%的721日,计算平均尾部损失并根据股、债、金当天涨跌分组。
  2. 对694个月同样选最差5%的35个月,比较资产共跌类型和历史聚集区间,区分急性冲击与持续状态变化。
  3. 另外列出六个最大峰谷回撤期间的资产表现,观察1968—70、1972—74、1983—84、1987、2008、2022等时期的差异,再讨论潜在补充策略的目标。

关键结果

原文结果与口径
核对项结果意味着什么
日尾部平均损失−1.04%最差5%日期的平均值,不是每天预计亏损,也不是最大单日跌幅。
月尾部平均损失−4.40%35个历史尾部月份平均,样本之间可能属于同一危机、并非独立观察。
股债共跌类型占比14% → 23%日尾部与月尾部分类占比的变化,显示持续风险结构与单日冲击不同。

怎么理解?

这篇值得研究员借鉴的是“新增策略对着缺口设计”的顺序。一个与核心组合全样本低相关的策略,未必在核心最痛的时候赚钱;先列出不同失败状态,再检查候选在这些状态的实际贡献,更接近风险预算的目标。特别是长债和黄金的利率敏感性,在某些宏观变化中可能同时暴露,资产名字不同不代表风险源独立。 但分类本身用了已经发生的资产收益,只能做事后诊断,不能直接用作当时可交易的状态标签。把历史最差窗口选出来,再反复寻找恰好赚钱的补充策略,会产生新的尾部过拟合。尾部样本少而且聚集,六段危机并不能支持精细到许多状态的最优配置。

最大限制

1968年以来序列含合成历史,黄金早期可投资性尤其重要;最大回撤发生在黄金尚不可按现代方式持有的阶段。文中尾部归因是观察性分析,未验证预测规则或新增策略的样本外收益。

复现与研究价值

先锁定日尾部、月尾部的审计定义,再用留一危机时期检验候选补充策略,报告成本、资金占用和非危机拖累;保留合成历史与真实ETF时期两套结果,不让前者掩盖实际可交易区间。

原文与核查

公开正文完整阅读;未取得或重算底层合成日序列。

原始文章 ↗

推荐 81/100 · 问题 28/30 · 证据 21/30 · 方法 23/25 · 复现 9/15

尾部归因细致、设计顺序有用,合成历史及事后状态限制可交易推断。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

隐含波动率“几乎显式”公式并不等于更快:尾部测试慢了一个数量级

Almost Explicit Implied Volatility

Fabien Le Floc’h

一句话先讲结论

利用逆高斯分布分位数求Black–Scholes隐含波动率,公式看起来简洁,数值精度也接近机器精度;但作者的变行权价测试里,Julia默认实现用时1704微秒,Jäckel算法只需154微秒。把求根藏进一个分位数函数,不会自动消除迭代成本,“显式”不是速度保证。

它到底在问什么?

新的隐含波动率表达式能否在实际定价管线里取代成熟算法?比较重点不只是公式是否简短,而是深度虚值等困难区域的精度、耗时和稳定性。

作者具体怎么做?

  1. 先通过看涨看跌平价与归一化把输入价格转成统一形式;近似平值时使用正态分位数,其他情况调用逆高斯互补分位数得到波动率。
  2. 第一组固定远期100、行权价200、期限1年,让波动率从0.02到4.0,形成399个样本,比较波动率和重定价误差。
  3. 第二组固定波动率10%,把行权价从100改到500,专门观察更深虚值区域;同时比较两种逆高斯分位数实现,以区分数学表达与底层库的性能。

关键结果

原文结果与口径
核对项结果意味着什么
固定行权价批次104 vs 246 μsJäckel与默认逆高斯实现;精度相近,但后者约慢一倍以上。
变行权价批次154 vs 1704 μs默认逆高斯实现约慢11倍,说明尾部路径可能触发昂贵计算。
替换分位数实现288 μsstatsmod移植版改善很多,瓶颈不应简单归咎于数学变换本身。

怎么理解?

这篇提醒我们把数学简洁性和计算复杂度分开。调用一个特殊函数并不意味着它的成本为常数,实际库可能在困难参数区间反复迭代。量化系统里更应该看分布尾部延迟和失败率,而非只在平值、正常波动率附近跑平均速度。 另一个值得借鉴的设计是双层归因:同一数学方法换底层实现后,性能明显改变。这能避免把库实现缺陷误写成算法本身不行,也避免因某一次漂亮基准便替换成熟求解器。机器精度级波动率误差已远小于常见报价粒度,是否值得进一步追求精度,需要结合下游希腊值和校准需求判断。

最大限制

只是两组特定网格的Julia测试,不覆盖全部到期时间、负利率、极端贴现因子、边界价格和所有硬件;原文提到新论文与旧实现的历史渊源,但本文未独立审核其全部学术优先权。

复现与研究价值

在真实报价清洗后的输入分布上加入极小价格、接近上界、超短期限等压力集,记录最大重定价误差、分位耗时和失败案例;与成熟实现交叉验证,再决定是否进入生产。

原文与核查

博客全文、代码及两张数值表已读;未运行Julia基准。

原始文章 ↗

推荐 83/100 · 问题 24/30 · 证据 24/30 · 方法 23/25 · 复现 12/15

明确网格、代码和误差口径,直接揭示特殊函数实现的性能陷阱。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / academic-research

Rethinking Trend Following: Optimal Regime-Dependent Allocation

Rethinking Trend Following: Optimal Regime-Dependent Allocation

Valeriy Zakamulin

一句话先讲结论

与固定多空暴露的趋势规则不同,按已识别市场状态直接做Sharpe最优配置,18个多元组合数据集的平均样本外Sharpe由两状态TSM的0.208提高至0.506,四状态DSM的0.496提高至0.628。

它到底在问什么?

趋势信号识别后,牛市、熊市、修正和反弹状态下的仓位是否应由数据驱动,而不是机械设为+1或−1?

作者具体怎么做?

  1. 以两状态或四状态趋势分类作为条件信息
  2. 从各状态的条件收益和风险最大化Sharpe推导状态权重
  3. 在扩展训练窗口估计权重,并与固定TSM/DSM做样本外比较

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:主要创新在定位而非信号——同一个状态识别器,通过更合理的仓位映射就可能改善风险调整收益;但低熊市暴露也意味着策略更像风险管理而非纯趋势做空。

最大限制

状态识别被视为给定;权重估计仍可能受样本和状态数量影响;公开文章披露的完整公式/代码有限;成本、杠杆和实际换仓影响需单独验证。

复现与研究价值

下载SSRN PDF,复刻状态定义、条件Sharpe权重、扩展窗口和18数据集表;加入成本、杠杆、权重上限及状态识别误差敏感性。

原文与核查

public-original-and-ssrn-read

原始文章 ↗

推荐 95/100 · 问题 29/30 · 证据 28/30 · 方法 25/25 · 复现 13/15

全文、SSRN PDF和表格均公开,样本外划分和数字完整;仍需代码级复现状态识别与权重估计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

宏观做曲线夏普0.7—0.9,删掉金融危机仍有0.5—0.6:但不是无成本中性套利

Curve trades with macroeconomic signals

Fabio Saia-Cereda / Ralph Sueppel

一句话先讲结论

作者用当时可知的增长、通胀等指标交易10个发达市场2年—10年互换曲线,2000—2026年简化回测夏普约0.7—0.9;去掉全球金融危机后降为0.5—0.6,说明收益并非全部来自一次危机。但结果未计交易成本,DV01平衡也只对平行利率变动近似中性,不能称为无风险套利。

它到底在问什么?

经济过热推动短端政策利率上升,而长期预期较锚定,能否用宏观变化预测曲线变平?零利率与量化宽松是否破坏这种关系?

作者具体怎么做?

  1. 使用时点宏观数据,按截至上月可知信息标准化并限制极值,构造增长、通胀、金融条件及实际收益差等经济信号。
  2. 比较等概念权重与实际收益差平衡权重、本地与本地加美欧信息四种信号,不按回测好坏删除经济上合理的弱因子。
  3. 月末信号决定次月仓位,延迟一个交易日,按10国面板评估;另外删除金融危机区间检查结果对单次事件的依赖。

关键结果

原文结果与口径
核对项结果意味着什么
全样本夏普0.7—0.9简化PnL,不含完整成交、风险管理与成本。
剔除金融危机0.5—0.6优势减弱但未全部消失,危机仍贡献明显。
方向准确率约53%—54%小幅概率优势需要仓位、成本与依赖调整才能转化为经济价值。

怎么理解?

这篇比泛泛用宏观择时更好之处,是预测对象足够具体:不是简单押债涨跌,而是政策敏感短端相对长端如何变化。经济机制、交易表达和时点数据之间有明确连接,便于逐环节检查。 不过,央行信誉、零利率与期限溢价变化意味着机制不是永久定律。十个国家也并非十次独立实验,全球周期可能同时驱动所有仓位;原文承认跨国分散贡献有限,这是重要约束。经济合理因子全部保留能减少事后筛选,但因子定义与组合权重本身仍需要未来检验。

最大限制

回报用通用互换代理计算,未纳入真实报价、抵押融资、双边成本和市场冲击;JPMaQS需数据权限。本次完整阅读公开正文,未运行notebook或核验每日交易。

复现与研究价值

先做DV01与现金流对账,加入实际互换买卖价差和融资;按零利率、通胀与政策框架分层,并对全球共同冲击做块检验。跨市场迁移要重审当地政策机制,不能机械照搬方向。

原文与核查

失效缓存经原站重试恢复,公开正文完整阅读;未运行研究代码。

原始文章 ↗

原研究与Notebook

推荐 85/100 · 问题 28/30 · 证据 24/30 · 方法 24/25 · 复现 9/15

机制、时点数据和危机敏感性清楚,成本与真实工具实施仍待验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

追最近最赚钱的策略:绝对收益更高,但风险调整后没有增加价值

Selecting TAA Strategies Based on Recent Performance (Part 1)

Allocate Smartly

一句话先讲结论

从 100 多个战术配置策略中,每月选最近收益最高的几个,1973 年以来的测试显示绝对收益普遍超过平均策略;但夏普和回撤调整指标没有显著优势,选前 1—2 名的回撤尤其差。更关键的是,结果还没扣在策略之间换仓的额外成本:看起来是在选赢家,实际上很可能主要选中了风险更高的策略。

它到底在问什么?

既然不同配置策略轮流占优,能否在策略之上再套一层动量,持续买近期最好的那几个?这里选的不是股票,而是完整策略的历史收益曲线。

作者具体怎么做?

  1. 每个月末计算平台 100 多个 TAA 策略过去 X 个月收益,选前 Y 个,等权持有下一月。比较不同回看长度与入选数量。
  2. 先看年化收益,再看夏普、最大回撤,以及同时考虑回撤深度和持续时间的 UPI。不同指标用来区分收益增加与风险增加。
  3. 单个策略历史已计入自身交易摩擦,但本层从策略 A 切换到 B 造成的额外买卖没有加入。这是第二层组合成本,不会因为底层已经算过成本就自动消失。

关键结果

原文结果与口径
核对项结果意味着什么
候选策略池100+今天平台跟踪的策略集合;并不等于 1973 年投资者已知道所有这些策略。
尤其脆弱的选择前 1—2 名集中追近期赢家失去策略分散,正文指出回撤不佳。
风险调整后增量未显示显著优势这是本文收益排序设置的结论,不能外推到所有策略选择方法。

怎么理解?

它和股票动量一个重要区别,是策略池里的风险尺度并不一致。股票收益排名也有波动偏差,但这里从保守配置到激进集中策略,风险差距更大。近期收益领先可能只是某段行情奖励了更高 Beta,不是经理能力突然增强。 另一个值得用于实际组合管理的教训是成本分层。底层策略各自回测净收益正确,不代表把它们轮动起来后的净收益正确;真正要交易的是合并后的证券头寸。换两个高度重合策略可能成本较低,换完全不同资产配置则可能很高,必须在净头寸层计算,不能统一忽略或重复收费。

最大限制

本次只核对公开文字,图中完整网格数字未转录。当前策略库回溯到 1973 年有策略发现时间与筛选偏差,作者没有在本文证明这是历史真实可选策略池。结论是未发现增量,不是数学上证明所有业绩选择都无效。

复现与研究价值

做自有策略看板时同时显示原始收益排名和统一波动后的排名;以全部策略等额风险组合为基准,补上策略发布后才可入池的验证。若二层择时在计入净头寸成本后仍不能胜过简单平均,应保留分散,而不是再优化更多回看窗口。

原文与核查

已读公开正文与指标解释,未逐图转录全部网格、未执行平台回测。

原始文章 ↗

推荐 82/100 · 问题 28/30 · 证据 22/30 · 方法 23/25 · 复现 9/15

负面结果与二层成本提醒直接影响策略组合决策;历史可用策略池和完整网格仍需审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 观点评论

让 AI 多跑一千次回测,并不会自动增加对市场的理解

For The Love of The Game

Kris Longmore

一句话先讲结论

作者把“自己试到一条好曲线”和“让 AI 替自己试到一条好曲线”视为同一个问题:提高搜索速度,却没有回答收益为什么持续。这篇值得读的不是反对 AI,而是提醒研究员:多重检验修正只能约束统计假阳性,不能单独证明策略背后存在会继续运转的经济机制。

它到底在问什么?

自动生成代码和回测后,量化研究最稀缺的能力变成什么?作者认为是理解市场参与者的约束,而不是继续增加模型和试验数量。

作者具体怎么做?

  1. 先寻找可能反复出现的约束性交易,例如配置组合再平衡、永续合约杠杆需求,而不是直接枚举价格规则。
  2. 把机制写成可观察的预期,再检查交易流、时间窗口与收益变化。回测用于验证如何把机会转成可执行组合,不应替代机制本身的研究。
  3. 区分统计证据和持续性解释:记录所有试验并校正显著性有用,但不能由此跳到未来仍然赚钱。研究应积累对市场行为的理解,而不只积累回测数量。

关键结果

原文结果与口径
核对项结果意味着什么
材料性质观点与方法评论没有新收益或因果识别结果,不能把语气强烈当证据充分。
多重检验能够帮助控制假阳性需要有效的检验假设;不保证经济机制持续。
AI 的流程价值取决于研究目标速度既能帮助检验,也能加快过拟合,本文没有量化两者的净效应。

怎么理解?

我赞同把回测当作压缩后的结果,而不是所有研究信息。一个信号即使最终组合没赚钱,原始预测关系也可能存在,只是被交易成本或仓位规则抵消;反过来,组合赚钱也可能只是承担了更多风险。保留逐事件证据和交易账本,会比只存一张净值图更有帮助。 但原文“每一笔利润都来自对手方亏损”的表述不能覆盖所有投资收益。风险补偿、企业现金流和不同参与者的对冲效用,使双方都可能从交易获得价值。因此更准确的问题是“我提供了什么风险承担、流动性或信息服务”,而不是必须找出一个长期输钱的人。机制解释和统计纪律应相互补充,不能拿故事替代数据。

最大限制

没有受控证据证明机制驱动流程一定优于所有数据驱动研究。作者既表达个人经验也推广课程,读者应分开评价。来源网页日期晚于目录收录日,保留原值并注明,不把日期差异改造成确定的首次发表日。

复现与研究价值

把 LLM 的下一步任务从“继续提高夏普”改成“列出当前结果的三种替代解释,并设计最便宜的区分实验”。数据库同时保存失败试验、条件收益和仓位归因,策略失效时才有依据判断是机制消失还是正常噪声。

原文与核查

公开正文已读;观点评论,无新增回测可核验。

原始文章 ↗

推荐 68/100 · 问题 25/30 · 证据 11/30 · 方法 23/25 · 复现 9/15

流程反思有帮助,但缺少新实证且有绝对化表述;适合作为团队讨论材料,不是策略背书。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

做空标普尾部成分失败;反过来做赚了钱,却还不能证明是指数资金效应

When Big Gets Small: Trading the Lower Tier of Large Caps and Upper Mid Caps

David Belobrad / Quantpedia

一句话先讲结论

作者原本想做空标普 500 最小的成分股,赚它们可能被剔除后的卖盘压力;分别做空 5、20、50 只都没有找到稳健优势。反过来买最小的指数内公司、卖最大的指数外公司后,20 对 20 的设置报告年化约 11.23%,但夏普仍只有约 0.4。这个结果更像值得继续拆解的相对收益现象,尚不是已经识别清楚的“被动资金 Alpha”。

它到底在问什么?

被动资金越来越大,能否提前利用指数资格带来的买卖盘?如果不知道未来谁被剔除,用指数内部市值最小的公司作为候选,是否足够接近真正的资金事件?

作者具体怎么做?

  1. 在 QuantConnect 框架中按季度末市值排序,先做空指数内最小的 20 家,再把数量改成 50 和 5;这些设置都没有支持稳定的剔除压力收益。
  2. 加入相对价值对照:买入最大的非标普公司、做空最小的标普公司,比较每边 50、20、10 家。作者仍未发现令人信服的改善。
  3. 将方向倒转,买指数内最小公司、空指数外最大公司;再测试两边数量相等和不相等的组合,观察股票数量与分散程度的影响。
  4. 原文报告 20 对 20 配置年化约 11.23%,风险调整后夏普约 0.4,其余相关配置多在 0.3—0.4。作者承认逐步调数量已经包含参数选择,并查看附近设置是否有相近表现。

关键结果

原文结果与口径
核对项结果意味着什么
最初的剔除风险交易未获稳健支持不能凭接近指数尾部,就视作拥有确定的剔除时间和卖盘信息。
反向 20 对 20 组合约 11.23%/年作者回测年化,公开文字未充分披露净成本、融资与借券口径。
风险调整效果夏普约 0.4原始收益看起来较高,但并未明显超过附近构造的风险效率。

怎么理解?

我认为最值得注意的并不是把失败信号反过来交易,而是代理变量到底代理了什么。标普资格不是一条纯市值门槛:如果指数内外公司在盈利、流动性、行业和上市历史上不同,多空收益可能来自这些差异,而不是被动资金持续推高成分股。要讲“指数会员溢价”,先得把这些替代解释压下去。 另一个警示是研究路径本身:从做空、换数量、加多头,到反转方向再改配比,试验空间一直扩张。附近参数表现接近比孤立尖峰好,但所有变体仍来自同一段历史;这不能替代冻结规则后的样本外检验。正反策略也可能因现金、融资和敞口设定不同而不是严格镜像,必须核对交易账本。

最大限制

公开文字未给出完整回测日期、时点成分实现、证券筛选与借券费用,本文未从图中臆造缺失数值。原文有一处对原始多空方向的文字表述不一致,本文按相邻图注与方法段理解;复制前仍须以代码为准。没有因子中性化或准实验设计,不能宣称已证明被动资金因果机制。

复现与研究价值

优先做市值、行业、盈利和流动性匹配,再分别研究指数公告日、生效日以及平时持有期;把市场 Beta、借券不可得和总杠杆统一。A 股迁移应使用各指数当时的准入与调整规则,不直接照搬标普排序;先检验匹配后的条件收益,再谈交易组合。

原文与核查

公开方法和结果文字已读;未逐图转录或执行 QuantConnect 回测。

原始文章 ↗

推荐 70/100 · 问题 26/30 · 证据 17/30 · 方法 19/25 · 复现 8/15

负面结果和方向反转有启发,但资金机制尚未识别,成本与历史成分口径不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

事实没变,FinBERT 却改口:97.2% 的分类准确率经改写攻击降至 71.0%

How to Break a Financial Sentiment Model Without Changing What It Means

Tommi Johnsen;原论文 Aysun Can Turetken / Markus Leippold

一句话先讲结论

保持财务事实和情绪含义不变,只用 GPT-4o 改写句子,导读报告 FinBERT 在 Financial PhraseBank 上的准确率由 97.2% 降到 71.0%,FinGPT 由 99.2% 降到 78.5%。但这不是说日常新闻有三成必然被误判:作者是在每句多个候选改写里挑选更容易攻击目标模型的版本,测到的是抗攻击能力,而非自然分布下的平均错误率。

它到底在问什么?

金融情绪模型到底学会了经济含义,还是依赖“增长、下降、损失”一类词语线索?同一事实换一种正常说法就改变交易方向,会让新闻因子的稳定性和安全性同时出问题。

作者具体怎么做?

  1. 导读介绍的攻击先用 GPT-4o 为每个输入生成 25 个候选改写,要求保留信息和情绪方向,不直接修改公司财务事实。
  2. 候选按参考语义空间与目标模型空间的相似度差异筛选,再对靠前候选检查语义是否保留。这个选择步骤有意寻找“人看着一样、目标模型表示却变了”的句子,不能把它当随机同义改写实验。
  3. 在 Financial PhraseBank、TFNS、SEntFiN 三类金融情绪数据上攻击 FinBERT、FinGPT,比较预测标签改变率和准确率下降。期刊摘要确认跨设置预测改变约 20%—54%,准确率下降约 10—26 个百分点。
  4. 导读归纳数值比较缺少方向词、双重否定、触发词多义等错误类型。它们有助于设计压力测试,但不能由少量案例推导所有新模型都能正确理解金融语义。

关键结果

原文结果与口径
核对项结果意味着什么
FinBERT:FPB 准确率97.2% → 71.0%下降 26.2 个百分点;详细数字来自本篇导读,未逐表核对期刊全文。
FinGPT:FPB 准确率99.2% → 78.5%下降 20.7 个百分点;不能把相对较小下降解释为交易系统已经安全。
原论文摘要范围20%—54% 标签改变不同模型和数据集的攻击结果范围,不是日常新闻误判概率。

怎么理解?

对量化研究员,这比“换一个更大的模型”更具体:如果因子建立在经济含义上,那么句子不改意思,信号就不该大幅漂移。可以把原句及其多种表达视作同一经济事件,研究标签、置信度和最终仓位的一致性,把语言不稳定造成的换手单独记账。 但攻击成功也不等于策略必然亏损。标签从正变中性和从正变负,对仓位的影响不同;错误是否集中在真正有信息的新闻,比总体翻转比例更重要。评估应延伸到事件层和组合层,而不能把分类误差直接乘上资产规模宣称金融损失。

最大限制

本次读完公开导读,并查到期刊摘要及 SSRN 地址;出版社全文访问返回 403,尚未逐表核对攻击参数、人工等价性验证与代码。文中细项明确按导读报告,不冒充原论文全文审计;数据集微调重合和对抗性挑选也限制了对真实新闻的外推。

复现与研究价值

给现有新闻因子加入冻结的语义一致性测试集:保留金额、比较期与公司主体,分别测试数字重排、否定句、转折和多公司标题;独立人工检查语义未变,再统计信号翻转与交易换手。训练增强与测试改写必须分开,防止把同一批攻击样本反复调到高分。

原文与核查

公开导读完整解析;原论文摘要与书目信息核对,期刊全文未取得。

原始文章 ↗

原论文:Journal of Banking & Finance

作者工作论文:SSRN 4977483

推荐 82/100(暂定) · 问题 29/30 · 证据 21/30 · 方法 23/25 · 复现 9/15

压力测试问题直接相关,期刊摘要可核实总结果;详细表格和完整攻击实现仍需核验。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

Lazy Prices 的 22% 是旧论文结果,不是把年报接入大模型后的新 Alpha

Lazy Prices, Lazy Investors - and the 22% Alpha Hidden in 10-Ks That Nobody Reads

Quantt;原论文 Lauren Cohen / Christopher Malloy / Quoc Nguyen

一句话先讲结论

这篇标题中的“22% Alpha”来自 Lazy Prices 原论文的特定组合结果:买年报变化少的公司、卖变化多的公司,月度 Alpha 最高约 188 bp;不是作者用 Snowflake 和大模型重新回测得到的 2026 年收益。文章真正的新内容是工程流程提案,而把词频相似度换成语义向量,已经改变了信号,不能视为原策略的无损复现。

它到底在问什么?

公开年报里新增和修改的风险信息是否被市场慢慢消化?如果过去难在清洗、配对、比较大量申报文件,现在数据平台与 LLM 降低工程成本后,还剩哪些真正困难?

作者具体怎么做?

  1. 原研究方向是配对年度或同季文件,以余弦、Jaccard、编辑距离及词语差异等方法衡量改动,再按相似度排序比较后续收益。期刊摘要确认最高月度 Alpha 188 bp;这一上限不等于所有定义和加权方式都达到同一收益。
  2. Quantt 提议在数据平台读取已经按 Item 拆分的 SEC 文件,生成向量,并将同一公司、同一章节、相邻财年的记录连接起来,计算向量余弦相似度。
  3. 再把相似度、收益和财务变量组织成语义视图,让分析员用自然语言查询组合表现。文中 SQL 包含省略号与示意定义,是架构草图,不是已验证可运行的完整研究系统。
  4. 作者也承认嵌入与原始词频指标不等价,建议并行保留传统度量。本文没有提供这套新流程的完整回测、模型版本冻结、样本外收益或成本验证。

关键结果

原文结果与口径
核对项结果意味着什么
原论文最高月度 Alpha188 bp/月约 22.56% 的线性年化口径;不是本篇 2026 年新测得的可投资净收益。
新语义向量流程收益未报告本文展示提案,未报告完整复现结果,不能把旧数字移植过来。
发表年份纠正2020 年出版页首次发表为 2020-01-28;博客使用的 2019 年说法不能替代正式出版信息。

怎么理解?

对研究员最有价值的实验,恰好在两个相似度不一致的地方。把“字面变化大但意思不变”和“字面变化少但风险含义改变”分开,才能回答收益究竟来自阅读成本、真实基本面变化,还是报告模板更新。直接换成更先进的表示并沿用旧 Alpha,反而跳过了最重要的测量验证。 工程上也不能把两段 SQL 当成完成数据治理。示例只按财年配对 10-K/10-Q,未完整约束报告类型、同季度和修订版本,可能产生一对多连接;按 filing_date 分组也不天然等于月度可交易横截面。财年结束、申报公布和数据库入库是三个不同时间,任何一个用错,都足以让自然语言查询流畅地给出错误答案。

最大限制

已读本文并核对原论文出版摘要,未在此完成 45 页原论文及代码审计。本文对 Alpha 长期存活和一天搭完基础设施的判断没有相应实证;还包含平台和培训推广。向量模型的发布日期、截断长度与成本也没有被纳入其历史实验,因为本文并未执行该实验。

复现与研究价值

先建立逐文件时点审计,再用同一股票池、同一交易时点比较词频、字符改动、章节语义变化三组信号;保留原论文发表后的独立测试期。A 股可以研究风险提示、MD&A 和前后版本差异,但先清除模板修订和格式变化,并与首次业绩预告信息去重。

原文与核查

公开文章完整解析;原论文摘要及出版信息核对,未重跑原论文。

原始文章 ↗

原论文 Lazy Prices(Journal of Finance,2020)

推荐 77/100 · 问题 28/30 · 证据 17/30 · 方法 22/25 · 复现 10/15

研究问题和测量差异值得读,代码草图有教学价值;没有新 Alpha 验证,不能按标题分数背书。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

58 年股债金配置:波动可预测,不代表逆波动权重就是风险平价

Revisiting Beyond 60/40: Five Decades of Risk-Weighted Allocation

Beyond Passive Investing

一句话先讲结论

作者把股票、长债和黄金的回测向前拼接到 1968 年:股债 120 日滚动相关性的均值只有 +0.06,但约 61% 的时间仍为正,说明不能把过去二十年的股债负相关当永久保险。其组合用 63 日波动率定月度权重,组合波动超过 8.5% 时缩仓到 8% 目标;防御效果值得研究,却不能把“加黄金、重新配权、降低仓位”三种贡献混成一个 Alpha。

它到底在问什么?

传统 60/40 的分散效果是否依赖特定宏观时期?如果股债可能一起跌,加入黄金并根据波动调整仓位,能否让承担风险的路径更稳定?

作者具体怎么做?

  1. 2005 年之前用黄金定盘价、股票总回报重建序列和由 FRED 收益率构造的长债序列,按比例衔接到现代 ETF;2005 年之后主要用 ETF 价格。整体覆盖约 58 年,但可交易工具和历史构造方式并不相同。
  2. 每月末用过去 63 个交易日的实现波动率计算逆波动权重:波动越高,资金权重越低。全期目标权重均值大致为股票 34%、长债 35%、黄金 31%。
  3. 每日检查组合过去 63 日波动:超过 8.5% 时缩减风险资产敞口,使估计波动回到 8%;否则保持全额投资,不加杠杆。现金按当时联邦基金利率计息,不能假设减仓现金收益为零。
  4. 作者检查过去 63 日波动对未来 21 日波动的解释力,报告整体约 40%,不同年代大致 0.2—0.5;另以单资产 5% 目标波动比较资产,那个演示允许杠杆,与主组合规则不同。

关键结果

原文结果与口径
核对项结果意味着什么
股债滚动相关性+0.06;61% 为正历史 120 日滚动统计;接近零的均值掩盖了长期正负相关状态切换。
波动覆盖层规则8.5% 触发 → 8% 目标阈值是作者选择的风险预算,不是检验所得的唯一最优值。
黄金累计收益金额贡献约 38%不是平均权重、年化收益贡献,也不能拿它直接证明未来边际分散收益。

怎么理解?

文章里需要修正的一个概念是“逆波动等于风险贡献平衡”。逆波动只让各资产的单独波动预算接近,实际组合边际风险还取决于相关性;当股债共同上涨下跌、黄金较独立时,资金按 1/波动率分配并不自动形成风险平价。恰恰因为本文强调相关性不稳定,这个区别不能略过。 波动有持续性确实能支持风险管理,但波动预测的 R² 不是收益预测力。缩仓也可能在冲击发生后兑现损失、错过反弹;目标 8% 不是实现波动的保证。真正有说服力的归因应分别加入黄金、改逆波动权重、加现金覆盖层,再把各版本调整到同一实现风险进行比较。

最大限制

合成长债涉及久期、票息与滚动假设,乘法衔接只统一价格尺度,不保证历史收益和真实可投资组合相同。完整主表数值位于图中,本次未逐图转录,故不编造精确 CAGR 或最大回撤。原文对未来现金利率及季节性叠加低相关的判断不是已证明事实。

复现与研究价值

复现时先分“真实 ETF 期”和“合成长历史期”报告,公开每条拼接规则;再做四层消融:60/40、等权股债金、逆波动股债金、逆波动加覆盖层。固定一组合理波动参数做敏感性检查,记录冲击后减仓与反弹缺席成本,避免只用全期净值评价风控。

原文与核查

公开正文、规则与文字统计已读;图内完整绩效表和合成代码未独立核验。

原始文章 ↗

推荐 77/100 · 问题 27/30 · 证据 20/30 · 方法 21/25 · 复现 9/15

长期状态对照和清晰仓位规则有用;合成历史、风险平价表述及归因对照仍有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

动量跳过最近一个月:行业组合中,它放大了状态差异,而非稳定改善收益

The Skip-Month Mystery: What Last Month’s Returns Are Really Telling You

Larry Swedroe;原论文 Dibyam Dikhit

一句话先讲结论

在1975—2024年48个美国行业中,每月买入过去表现最好的5个行业:跳过最近月的12–1策略,在稳定趋势状态月均赚2.32%,压力状态只有0.94%;不跳月的12–0对应1.86%和1.35%。但两策略的“稳定”月份分别只有156和208个,并非同一组市场日期。这篇揭示最近月有诊断价值,却还没有证明按这张表切换策略就能获得样本外优势。

它到底在问什么?

为了避开短期反转而删去最近月,是否也删掉了识别行业趋势已经变化的重要信息?

作者具体怎么做?

  1. 用French的48个价值加权行业日收益,复合成月收益,每月开始重新排名;基准为48行业等权。原始数据从1974年起,为1975年持仓提供形成窗口。
  2. 对所选行业组合比较最近月收益与之前11个月月均收益,划分偏强/偏弱;比较最近月日收益标准差与之前形成期标准差,划分高/低波动。
  3. 两个维度交叉为稳定趋势、过热、缓慢恶化、压力四状态。各策略按自己的所选行业计算状态,所以相同名称不保证相同月份。
  4. 全样本两策略月均1.57%和1.66%,基准1.16%;作者再展示状态条件收益,而未给出冻结切换规则后的独立样本外策略。

关键结果

原文结果与口径
核对项结果意味着什么
12–1:稳定 / 压力月2.32% / 0.94%状态条件月均收益,不是连续持有一年的可实现CAGR。
12–0:稳定 / 压力月1.86% / 1.35%状态日期与12–1不同,不能直接解释为同月替换收益。
最大回撤:12–1 / 12–0−60.47% / −53.65%纯多行业策略仍有很深回撤,状态均值为正不意味着规避危机。

怎么理解?

最值得做的下一步,是将两策略放到同一条件下比较。若12–0因为包含最近月而换入另一批行业,它既改变仓位,又改变用于分状态的组合;表中更平稳的条件均值可能部分来自状态样本变化。先用一个事前固定的市场状态或同一行业篮子标记所有月份,才更接近检验“跳月”本身的增量。 还要警惕把稳定状态的条件CAGR当成可投资收益。它相当于只拼接那些月份,实际投资者不能删除其余月份;剩余时间持有现金还是另一策略,会改变完整净值、成本和风险。

最大限制

没有成本与严格的未见样本切换检验;只做多的选择本身有观察短边表现后的判断。行业组合不是个股,不能据此废除A股个股动量的跳月惯例。原文对条件关系用词偏强,但未提供机制因果识别。

复现与研究价值

用当前可得个股样本另起实验:先固定股票池、复权和可交易过滤,再比较相同月份的12–1与12–0,并分开报告排序变化与状态过滤的收益。只使用当时已知数据,避免10年、20年滚动要求;本条未运行回测。

原文与核查

导读及20页作者公开论文全文已读;未执行代码。

原始文章 ↗

作者原论文(Zenodo)

作者代码与数据说明

推荐 84/100 · 问题 28/30 · 证据 21/30 · 方法 22/25 · 复现 13/15

公开论文、代码与清晰参数很适合复核;条件日期不一致和缺成本限制策略结论。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 技术教程

PCA 保留九成方差,不等于保留九成 Alpha:无监督学习教程该怎样用

Unsupervised Learning for Trading: K-Means, PCA & Python Examples

Ashutosh Dave / QuantInsti

一句话先讲结论

教程用 12 只股票的 ROE 与 Beta 做聚类,再把 7 只股票的收益输入从 7 维压到 4 维,保留约 90.3% 的样本方差;但没有证明预测准确率或策略收益因此改善。对量化研究员,最重要的区别是:PCA 保留的是输入变化最大的方向,不是未来收益最有用的方向,低方差部分也可能藏着真正的相对价值信号。

它到底在问什么?

没有未来收益标签时,机器能从股票特征中找到哪些结构?这些结构可以帮助压缩数据、寻找候选配对,但怎样避免把“看起来分得很清楚”当成已经找到交易优势?

作者具体怎么做?

  1. 聚类演示取 12 家公司的 ROE 与 Beta,对两个特征标准化后做 K-means;先任意设两组,再观察不同组数下的簇内离差拐点,认为三组值得考虑。
  2. PCA 演示使用 272 行、7 列股票收益,先拟合全部主成分,再按累计方差选择前四个。其解释方差比例约 50.7%、21.4%、12.2%、6.0%,合计约 90.3%。
  3. 把原收益矩阵投影为 272×4 的新特征,留给后续监督学习。文章没有继续报告完整预测模型、外样本检验、组合回测或净交易成本。
  4. 标准化与中心化需区分:PCA 默认中心化不等于每列除以标准差。实际输入尺度决定哪个方向更容易成为第一主成分,不能忽略预处理选择。

关键结果

原文结果与口径
核对项结果意味着什么
PCA 特征维度7 → 4减少三个输入方向,但是否提高后续预测尚未测量。
前四成分解释方差约 90.3%样本内输入方差,不是模型准确率、收益解释力或保留 Alpha 比例。
交易效果未报告教程结束在特征构造阶段,不能补成已成功配对交易。

怎么理解?

用于量化研究时,我更看重标签稳定性和时间稳定性。K-means 的“第 0 类”不带固定经济含义,重训后编号可以交换;如果直接把编号作为择时信号,会制造并不存在的状态变化。应匹配簇中心,再看证券分组是否真正改变。 PCA 也有类似问题:主成分符号可翻转,接近的特征值对应方向会旋转;全样本拟合再切训练测试,还会把未来协方差结构提前告诉过去。正确流程是在每个训练窗口拟合标准化和分解,只把已冻结变换应用到随后数据,同时保留不用 PCA 的基线,检查降维究竟减少噪声还是丢失预测信息。

最大限制

例子规模小、选择的股票并非随机全市场,仍含历史旧代码与行业称呼不严谨之处;不能当作当前证券分类。网页没有可靠明确的首次发表日期,本年度收录不等于今年原创。未执行示例代码或验证其当前依赖兼容性。

复现与研究价值

对现有信号库比较原特征、标准化 PCA、风险分组聚类三条冻结管道;相同训练窗口、模型预算和交易成本下,分别报告预测、换手和风险暴露。配对交易候选还需要独立价差稳定性与执行验证,不能只用“在同一簇”作为下单条件。

原文与核查

公开教程及结果数组完整阅读;未运行代码,无策略收益可核验。

原始文章 ↗

推荐 68/100 · 问题 22/30 · 证据 14/30 · 方法 20/25 · 复现 12/15

适合工程入门和预处理审查;无交易实证,不能按 Alpha 研究评价。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究综述

预测市场研究综述把三种问题放在一起:概率校准、交易收益与信息优势不是一回事

Research Review | 24 April 2026 | Prediction Markets

James Picerno / The Capital Spectator

一句话先讲结论

这篇综述列了7篇预测市场研究,但最重要的不是“预测市场有效还是无效”:Polymarket价格与期权风险中性分布的差异,不能直接叫错价;赢家集中、做市收益、EPS反向交易和疑似信息交易也分别对应不同对象。把概率校准、交易PnL和信息优势混成一个“市场智慧”指标,会得到错误结论。

它到底在问什么?

预测市场既可以被当作事件概率、交易场所,也可以被当作信息聚合器;这些评价标准能否互相替代?

作者具体怎么做?

  1. 第一类比较Polymarket的BTC/ETH概率与期权隐含风险中性分布,关注尾部、波动和摩擦;不能直接将差异转成交易Alpha。
  2. 第二类研究钱包、订单流和期限,讨论favorite-longshot/Yes bias及大户是否真正更有信息;需要控制到期时间和极端价格路径。
  3. 第三类研究Kalshi宏观预测、338个EPS市场的反向交易以及150百万笔交易中的做市/吃单角色,将概率预测与事件后收益分开。
  4. 最后一篇用210,000个钱包—市场组合筛出异常盈利;异常分数是审查线索,不是法律上已证明的内幕交易。

关键结果

原文结果与口径
核对项结果意味着什么
Akey等最新版本588百万笔 / $67bn;前1%拿76.5%利润最新摘要口径,旧版本数字不应同时使用。
EPS事件市场338个已结算市场综述转述的短期反向交易样本,不是全部预测市场。
异常钱包筛选210,000对;胜率69.9%复合筛选统计,不能单独证明违法或非公开信息。

怎么理解?

读这类综述时,先把问题分成三张表:概率是否校准、谁在交易中赚钱、价格是否含有可识别的新信息。三张表的分母、成本和时间尺度都不同。对量化研究最有用的是研究设计:用风险中性分布做外部基准,用事件结算做真实标签,再用钱包行为解释谁承担了错误定价。 综述本身也暴露了版本管理风险:同一Akey论文在不同月份的样本和利润集中度不同。引用前必须锁定版本日期,不能为了让数字更漂亮而拼接旧摘要。

最大限制

未逐篇取得7篇论文全文;原文链接有SSRN访问限制。综述的“显著”“异常”“技能”均不能替代作者完整的标准误、交易成本和样本选择检查。涉及疑似内幕交易时仅作研究描述,不作法律判断。

复现与研究价值

建立预测市场研究台账,分列Brier/校准、结算后PnL、做市角色、流动性和信息时点;每条结论记录论文版本与原始样本。先复现一类可公开取得的BTC合约,再决定是否扩展到钱包层。未执行。

原文与核查

公开综述全文已读;7篇底层论文未全部取得全文。

原始文章 ↗

推荐 69/100(暂定) · 问题 26/30 · 证据 17/30 · 方法 19/25 · 复现 7/15

综述能搭出研究地图且提醒版本差异;底层论文未逐篇审计,不能直接据此交易。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 论文导读

先让整套研究流程在无信号数据上失败,再相信它在真实市场的成功

Backtests Lie: Building a Stress-Test Framework for ML Trading Signals

Vertox;底层论文 Sotirios D. Nikolopoulos

一句话先讲结论

在底层公开论文的无信号模拟中,只试一个模型,样本内“显著”的概率约 5.3%;试 100 个再挑最好,升到 99.9%,但赢家到独立前推样本的统计量仍接近无信号水平。最值得借鉴的不是再加一个回测评分,而是把清洗、调参、选模型、择时阈值整条管道放进已知没有 Alpha 的环境,看看它是否仍能制造漂亮结果。

它到底在问什么?

回测很好看,究竟是发现市场规律,还是研究管道擅长从噪声中挑赢家?只对最终策略做显著性检验,会遗漏前面失败的试验和隐含调参。

作者具体怎么做?

  1. 第一阶段测试整条研究流程,而不只测试最终模型。构造严格无条件方向优势的参考过程,以及专门带有微观结构假象的安慰剂过程,观察前推检验是否异常拒绝零收益。
  2. 第二阶段才在真实历史上冻结样本内选择,并在不参与选择的未来块上评估。论文用样本内与前推绝对统计量的差来描述膨胀,比例型 BIF 只是补充诊断,不是校正后 p 值。
  3. 作者比较搜索数量和候选相关性,并做已知存在弱信号的正控制。没有发现信号既可能说明确实不存在,也可能是事件太少、检验没有足够统计功效。
  4. 实际案例检查 SPY 方向预测、FF25 横截面模型和波动预测;结果并非一律判错。FF3 调整后仍显著的横截面结果就没有被认定为纯 Beta,说明审计应服从证据而不是预设结论。

关键结果

原文结果与口径
核对项结果意味着什么
无信号下挑选样本内赢家5.3% → 99.9%1 与 100 个候选的模拟比较,不是市场上所有研究的错误率。
SPY 案例毛 Alpha0.39%/年;p=0.931这一个方向预测管道没有显著样本外优势,不能推导所有深度模型无效。
博客新增加密资产结果未报告付费正文受限,不能从底层论文推断作者改进后赚了多少。

怎么理解?

我最赞同“检验生产结果的机器,而非只检验结果”。如果缺失值处理、全样本标准化或信号阈值已经用到了未来,即使最后一层写着 walk-forward,仍然不是时点正确的评估。把这些步骤整体封装后送入负控制,往往比盯着策略曲线更容易定位错误来源。 但这套框架不是防过拟合认证。参考环境只能覆盖你想到的错误;如果反复根据同一批安慰剂调管道,它也会成为训练集。论文中的 99.9% 是特定模拟值,在独立且单次误拒率恰为 5% 的理想化情形,100 次至少一次误拒约为 99.4%;因此重点是搜索放大假象,不是把一个百分比当普遍常数。

最大限制

已读原论文相关方法与主要结果,但没有独立验证代码和全部数学论证。有限样本、序列相关与稀疏交易影响检验校准;样本内/外统计量的比值不能替代收益归因和正式多重检验。收录博客的付费新增内容仍未取得,因此保持部分材料状态。

复现与研究价值

给量化研究流水线增加三套冻结测试:纯方向无信号、保留波动聚集的无信号、可报价但不可无成本捕获的价差跳动;再加入一套明确微弱信号的正控制,防止过严审计把所有策略都拒绝。所有选择步骤只在训练段执行,研究全集和失败尝试一起留存。

原文与核查

付费博客只读公开预览;已追读底层 arXiv 论文方法与主要实验,本篇按底层研究解析。

原始文章 ↗

底层原论文:Spurious Predictability in Financial Machine Learning

原论文公开 HTML v1

推荐 87/100(暂定) · 问题 30/30 · 证据 23/30 · 方法 24/25 · 复现 10/15

管道级证伪设计对研究纪律很有价值;博客新增实验受限,底层模拟仍需代码审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 产品介绍

TradeLock 锁定的是事前信号记录,不是证明实盘成交和可实现收益

TradeLock: New site from ex-Quantocracy contributor Sanzprophet - build independently verified track record

TradeLock

一句话先讲结论

TradeLock 的价值是给提交的交易或信号加时间戳,减少事后改写历史的空间;它自己也明确说,不证明真实成交、滑点、冲击、账户归属或实际投入资金。因此它可以把回测向前推进成可检查的纸面记录,但不能把这条记录升级成经审计的实盘业绩。

它到底在问什么?

研究员如何证明今天展示的交易想法真的是当时提出的,而不是看到行情以后补写?这是“时间先后是否可信”的问题,与“订单是否能成交”是两道不同的审核。

作者具体怎么做?

  1. 官网介绍可通过手工、webhook、API 或 MCP 提交交易和组合更新,平台按到达时点记录。本文只说明公开产品机制,没有替用户提交任何信号。
  2. 记录默认私有,用户可选择公开 factsheet 或直接分享;官网声称提交后不能静悄悄改写过去,但本站未进行管理员权限与存储机制的安全审计。
  3. 官网定位偏流动性较好、较低频策略,并明确排除对实盘成交、滑点、市场冲击和资本投入的认证。其公开示例仍是产品展示,不应当成独立验证样本。

关键结果

原文结果与口径
核对项结果意味着什么
能够提供的证据提交时间与历史留痕有助检查信号是否事前存在,具体防篡改能力未被本站审计。
不能证明成交与容量官网主动承认的边界,而非本文已经发现其成交错误。
独立收益实验不存在这是产品介绍,不应填入年化收益、夏普或论文样本量。

怎么理解?

量化研究最容易遗漏的是另一种选择偏差:即使每条已发布记录都无法改写,研究者仍可同时创建很多策略,只挑后来表现好的公开。单策略防篡改不等于研究全集透明。团队治理还需要在实验开始时登记策略全集、版本号与停运记录,而不是只锁住最终赢家。 这类工具最合适的位置是证据链中间:代码版本和输入快照说明怎么算,外部时间戳说明何时算,券商订单和资金记录说明实际做了什么。把三层放在一起,才能区分预测能力、执行质量和事后筛选。不能只看到一个 verification 标记就跳过后两层。

最大限制

本次仅阅读公开产品页,没有注册、调用写入接口或审计服务可用性与安全性。价格、隐私与保存政策可能变化,部署前应重新核查正式条款。首页无明确文章发表日,因此来源日期保留未知,仍按原目录收录月份呈现。

复现与研究价值

自有研究平台可先做最小留痕设计:信号生成时间、数据版本、代码提交号、预期下单时间和每次修订原因全部追加保存;同时登记失败和停止的策略。如果选用第三方,再检查完整导出、时间精度和更正记录,不把用户数据默认公开。

原文与核查

公开产品页已解析;不是论文,也未验证实盘收益。

原始文章 ↗

推荐 63/100 · 问题 24/30 · 证据 10/30 · 方法 20/25 · 复现 9/15

事前留痕对研究治理有用,但这里只核对产品陈述,未做功能或安全审计。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

日内买波动、隔夜卖波动?先看互换损益口径,再谈能否交易

Volatility Risk Premium and Clustering: Intraday vs Overnight Dynamics

Harbourfront / Relative Value Arbitrage

一句话先讲结论

把方差互换损益拆成隔夜与日内后,原论文在 14 个标的中发现 10 个日内平均损益为正,隔夜则全部为负;但日内正值并非都显著,更不是直接买 VIX 就能赚。文中量度是做多假想方差互换的逐日盯市损益,既含实现方差,也含剩余期限隐含方差重估,不能简化成一条“白天买期权、晚上卖期权”的已验证净收益策略。

它到底在问什么?

同样承担波动风险,交易时段与休市时段是否获得相同补偿?把两者合并成一个日度波动率,会不会丢掉风险价格和波动持续性的差别?

作者具体怎么做?

  1. 第一项研究使用欧美亚股指及个股对应的 30 日期限隐含波动指数,计算假想方差互换从前收盘到开盘、再到收盘的损益,比较时段差异。
  2. 本站追到正式期刊,核对共同样本为 2012-01-30 至 2022-09-30;方法需要对剩余期限方差价格近似,并按日历时间处理周末,而不是所有间隔都算一天。
  3. 导读还比较这些时段指标对后续股票收益的预测期限:日内偏较短期,隔夜偏较长期。这里是回归预测关系,不是已经完成期权执行测试。
  4. 第二项研究考察 15 个股票市场,导读报告两类收益都有波动聚集,隔夜通常更强、时段间交叉聚集相对弱。本次未取得该篇完整正文,不据摘要进一步推导模型参数。

关键结果

原文结果与口径
核对项结果意味着什么
隔夜互换损益方向14 个标的均为负买方损益符号;若把溢价定义为隐含减实现,符号会相反,必须先说明定义。
日内平均为正10 / 14正值不等于全部统计显著;不同市场的周内效应也不完全一样。
可交易净收益尚未验证表格为假想互换口径,不能直接替代期权组合、保证金与成交成本。

怎么理解?

我会把这篇用来改风险分账,而不是直接发交易指令。若风险主要在无法连续对冲的时段发生,全天一个限额会掩盖隔夜跳空与日内可调整仓位的本质差别。对同一证券分别保存隔夜、日内收益和隐含波动变化,能帮助判断策略到底在卖哪种保险。 尤其要避免三个偷换:方差不是波动率,VIX 点位不是可直接买入的资产,互换盯市利润也不是资本回报率。一个显著的均值如果要靠每天跨买卖价差反转头寸才能获得,净收益可能消失;隔夜卖方承担的尾部跳跃则可能恰恰是这份补偿存在的原因。

最大限制

没有执行互换复制或期权回测,未核对第二篇全文;第一篇的期限结构近似和开盘价格可实现性需要进一步审计。公开导读对“多数日内买波动盈利、周五除外”的概括不能推广到所有市场,正式表格存在市场间差异。

复现与研究价值

在自有波动研究里先统一买方/卖方符号,并把日内和隔夜风险分开预测;再用真实期权链、同步报价与交易时点复制可行组合,计入对冲、点差、跳跃及保证金。用同等尾部风险而不只同等波动比较收益。

原文与核查

公开导读完整解析;第一篇正式论文方法和关键表格核对,第二篇全文未取得。

原始文章 ↗

方差风险溢价原论文(正式发表版)

波动聚集原论文

推荐 83/100 · 问题 28/30 · 证据 23/30 · 方法 23/25 · 复现 9/15

时间分解与符号澄清很有价值;两篇证据层级不同,交易实现尚未验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法研究

美股占全球组合71%,能反推出投资者预期美股多赚多少吗?

Mean-Variance Optimization in Practice: Reverse Optimization and Implied Expected Returns

Portfolio Optimizer

一句话先讲结论

把全球股票组合中71.27%的美股权重代入均值—方差逆向优化,文章得到美股隐含收益7.48%、非美5.82%,相差约1.7个百分点;但换一个收益锚点,两者就变成9.09%和7.07%。这些不是市场对未来的客观预测,而是给定协方差、风险厌恶和最优性假设后,让当前权重合理化的一组答案。

它到底在问什么?

正向优化输入预期收益、输出权重;反过来,能否从一个已经持有的组合,知道它隐含了什么收益判断?

作者具体怎么做?

  1. 先选择被假定为有效组合的参考权重,可以是市值组合,也可以是风险平价等自选组合。选择后者不等于证明市场遵循风险平价。
  2. 估计资产收益协方差Σ,再指定λ;文章讨论用组合风险溢价除以方差、夏普除以波动率或某资产收益锚点来确定尺度。
  3. 若要求权重加总为1,解变为 μ=λΣw+γ1;一般线性约束还会引入对应乘子,非负约束在零权重资产上可能只给出不等式边界。
  4. 实证示例采用截至2026年3月的美股/非美权重,配合1979年以来月收益估计的年化协方差。λ约3.015时得7.48%与5.82%;锚定美股9.09%时则得9.09%与7.07%。

关键结果

原文结果与口径
核对项结果意味着什么
参考美股权重71.27%输入的市场权重,不是优化后建议仓位。
第一组隐含收益7.48% vs 5.82%依赖作者的历史Σ与λ,差约1.66个百分点。
改用美股收益锚点9.09% vs 7.07%同样权重可以对应不同收益尺度,不能唯一读出投资者信念。

怎么理解?

最有价值的用途不是预测,而是检查组合与观点是否相容:如果团队声称不看好美股,却在自己认可的风险模型下持有很高的美股权重,就需要解释风险预算、约束或判断是否不一致。反推结果是一次诊断,不是让持仓自动获得理论背书。 这里还有一个应当修正的小公式错误:按 μ=λΣw,若用第i个资产的目标收益定λ,应为 μ目标/(Σw)i,网页相应一处写成了倒数。另一个常见误解是预算约束的共同常数γ能随意改变两资产收益差;λ和Σ不变时,共同加数在作差后会消失。

最大限制

把市值权重视为均值—方差有效,隐含了强最优性假设;长期协方差可能不代表当前环境,市场价格也包含约束、负债匹配和非均值—方差偏好。文中没有给出据此预测下一期收益或交易获利的样本外证据。

复现与研究价值

对实际股票组合固定同一权重,分别用短期、长期及收缩协方差反推,并报告不同λ锚点下的区间。若结论主要来自协方差选择,就将它列为模型风险,而不是投资信念;这是研究提案,未运行。

原文与核查

公开全文、推导及案例已读;未独立下载历史收益或执行优化。

原始文章 ↗

推荐 84/100 · 问题 27/30 · 证据 22/30 · 方法 23/25 · 复现 12/15

推导与数值可核对,适合组合诊断;不能当预测模型,网页公式有一处倒置。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

同一个动量策略,只改调仓日,年化就能差 3.48 个百分点

The Tranching Dilemma

Quantpedia;原论文 Carlo Zarattini / Alberto Pagani

一句话先讲结论

在 1991—2024 年同一套美国个股动量规则下,只把每月调仓日挪动,最佳与最差配置的 CAGR 就差 3.48 个百分点,1 美元期末分别变成约 272 和 99 美元。分成 5 批错峰调仓后,时点差异降至 0.63 个百分点,但平均毛 CAGR 只从 16.73% 变为 16.84%;它主要分散调仓运气,不是创造新 Alpha,小账户还可能被更多笔最低佣金反噬。

它到底在问什么?

两个基金选股方法相同,业绩为什么仍可能明显分叉?月底附近涨跌、信号排名变动和持有期不同,会不会让看起来属于研究能力的优势,其实只是执行日期幸运?

作者具体怎么做?

  1. 作者原文从历史 Russell 3000 选最活跃的 1,000 家,按跳过最近一月的年度动量选 100 家,再按日收益涨跌分布筛出动量较连续的 20 家,等权持有;信号在 t 日收盘计算,t+1 日收盘执行。
  2. 先测试月内 20 种调仓日,再测试 1、2、4、5、10、20 批均匀错开的日程。RTL 在这里定义为同一批数下最佳与最差日程的 CAGR 极差,不是收益标准差。
  3. 成本前比较平均收益、日程间差异、交易笔数与换手;随后加入每股佣金、最低单笔佣金和冲击模型,在固定参考账户规模下归一化成本。
  4. 选择批数的目标是平均净 CAGR 减去 RTL。原文得到 2.5 万美元约 2 批、10 万美元约 5 批,更大账户更受益;这是该成本模型与目标函数的结果,不是通用最优日程。

关键结果

原文结果与口径
核对项结果意味着什么
调仓日期的年化极差3.48 pct → 0.63 pct1 批与 5 批比较;不是把波动率降低到原来的某一固定比例。
平均毛 CAGR16.73% → 16.84%几乎不变,说明主要减少日程差异,不能包装为收益提升策略。
原文最优批数$25K:2;$100K:5依赖账户规模、成本参数及 CAGR−RTL 目标;不是直接给用户的交易参数建议。

怎么理解?

最容易误读的是“多做几批会增加换手”。本文增加的是交易笔数,每笔更小,累计交易金额与本金之比却几乎没变。因此纯比例收费未必增加很多,最低单笔收费会变差,非线性的市场冲击反而可能改善。讨论分批成本必须先分清这三种费用。 我还会把“20 批时 RTL 为零”读得更谨慎:在作者定义的均匀日程里,20 批只剩唯一安排,当然没有其他日程可以比较;这不意味着组合没有执行误差、没有市场风险,也不意味着未来收益确定。目标函数把一个百分点的日程极差与一个百分点的平均收益等权相减,同样是决策偏好,不是金融定律。

最大限制

这是集中动量案例,不能外推全部因子;正文关于个别 Alpha 临界显著的措辞还需与表内 p 值一起看,不能据此说整体 Alpha 稳健。碎股、历史调整价和参考规模归一化都是模型假设。未加入仓位容忍带与合并子组合净订单等常见实盘优化,也未独立执行回测。

复现与研究价值

对现有个股策略做一个低成本补充:冻结选股规则,遍历可行调仓日,先报告平均、最好、最差,而不挑最优日上线;然后在组合净订单层比较 1、2、4 批与仓位容忍带。使用本账户实际最低费用、成交量和约束,明确愿意付出多少收益来降低日程不确定性。

原文与核查

导读与作者官网论文方法、主要表格和成本框架已读;未独立复现。

原始文章 ↗

作者官网原论文 PDF

SSRN 原始登记

推荐 90/100 · 问题 29/30 · 证据 25/30 · 方法 24/25 · 复现 12/15

直接揭示易被忽视的实现风险,成本与目标函数可核验;不构成策略 Alpha 背书。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

把 TLT 补到 1962 年:可以扩展压力场景,不能把高相关当成无误差历史

Sixty-four years of TLT: reconstructing the bond ETF everyone owns

Beyond Passive Investing

一句话先讲结论

作者用国债收益率重建长债总回报,把只有二十多年实价的 TLT 向前延到 1962 年;月度版本与真实 TLT 回报相关约 99%、跟踪误差约 1.9%,日度误差却约 4.7%。这能帮助检验组合在高通胀年代的脆弱性,但不是找到了 64 年真实 ETF 净值;尤其 1977 年前的收益率来自全重叠期回归外推,不能直接当历史时点可用数据。

它到底在问什么?

仅从 ETF 成立日起回测,会不会错过长债在其他利率状态下的损失?要扩展历史,应模拟一只固定债券持有到期,还是模拟不断换入长久期债券的投资组合?

作者具体怎么做?

  1. 按固定现金流折现计算债券价格。每个持有期用上期收益率设平价票息,本期按新收益率及缩短后的剩余期限重新估值,再加应计票息,形成总回报序列。
  2. 比较月度、日度和期限梯形三种构造,在 2002—2014 年校准期限参数,2015—2026 年验证。尽管基础定价公式不需要统计拟合,具体 TLT 近似仍有校准步骤。
  3. 30 年收益率早期不足时,以 1977—2026 年的 30 年对 20 年收益率回归向前外推,并用 60 日线性过渡处理衔接。作者报告回归样本内 R² 0.997,但它不直接检验更早年代的误差。
  4. 用真实 TLT 重叠期检查收益相关、跟踪误差、误差自相关及长期漂移,再将合成历史的重大损失与其他公开长债记录对照。不同基准期限并不完全相同,不能要求逐年数值完全重合。

关键结果

原文结果与口径
核对项结果意味着什么
月度验证约 99% 相关;1.9% TE作者报告的模型跟踪指标,不是预测收益准确率。
日度验证约 4.7% TE对短持有期和日内阈值可能重要;不能因月度接近就忽略。
日度误差一阶相关−0.41与时点错位相容,但单凭负自相关无法排除所有模型误设。

怎么理解?

这篇对组合研究的价值在于补充利率状态,而不是把历史长度当成数据质量。用更晚年代校准出来的期限和期限间关系重建 1960 年代,是事后模型化的压力场景;它可以回答“这种利率路径大概会怎样”,却不能直接回答“当年可实时执行的择时策略赚了多少”。 我也不会接受“日度误差完全是三十分钟时间差、对周度以上无关紧要”的强判断。现券估值、ETF 收盘、久期漂移、曲线非平行移动和费用都可能贡献误差。最直接的区分实验是使用同步时点比较,观察误差还剩多少。另需注意,低起始收益率使利率上升时更脆弱,是条件风险关系;它不意味着当时已经能确定未来利率必然上行。

最大限制

原文未提供本文可独立执行的完整重建环境。全文一些基础表述过强,例如把低起点后的亏损称为机械必然;价格变化仍取决于之后利率路径。IEF 也不应与 20 年以上 ETF 混为相同期限产品。日度误差、平价债近似和历史外推必须随数据一起交付。

复现与研究价值

给研究数据库同时保存真实 ETF、合成历史和来源标记,任何回测自动按两段出报告。宏观压力测试可用长历史;短期择时优先真实可交易期,并对同步时间戳、平行曲线假设及参数校准期做敏感性分析。不要把平滑拼接引入的未来信息混入信号。

原文与核查

公开正文和验证口径已读;未重建或审计完整债券历史。

原始文章 ↗

原方法:Treasury Bond Return Data Starting in 1962

推荐 82/100 · 问题 28/30 · 证据 21/30 · 方法 23/25 · 复现 10/15

历史构造与误差讨论有研究价值;模型化数据不等于真实时点记录,因果解释需收敛。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

预测市场低位买入:有的年化22%,有的只加10bp成本就由赚转亏

Exploiting Mean-Reversion in Decentralized Prediction Markets: Evidence from Polymarket

Cyril Dujava / Quantpedia

一句话先讲结论

在三个最终都结算为NO的预测合约上,作者测试滚动低位买入。最平稳的“耶稣回归”合约,5日低点买入、持有1日,零成本年化7.95%,每边加入10bp后变成−7.83%;而外星人合约某组参数扣费后年化22.09%。这说明价差和换手足以决定结果,并不能证明三个事后选出的事件构成稳定套利。

它到底在问什么?

当极端事件被情绪反复推高概率时,反向合约的短暂下跌能否提供可以成交、覆盖成本的均值回归机会?

作者具体怎么做?

  1. 用约一年10分钟价格,三个合约分别约4.1万、4.9万、5.3万个观测;这是报价频率,不是同等数量的独立事件。
  2. 以5、10、20日滚动最低价为入场阈值,持有1、2、3、5日,共12组参数;不叠加持仓,使用全额可用资金。
  3. 比较零成本和每次买卖各10bp两档,分别报告年化收益、夏普和最大回撤。零成本限价成交是一种情景,不是被订单记录证实的事实。
  4. 作者对部分2025年11月异常价格作前值填充;这种清理应回查真实成交,不能仅因尖峰不美观就删除可能恰是策略损失的行情。

关键结果

原文结果与口径
核对项结果意味着什么
耶稣合约:成本冲击7.95% → −7.83%5日回看/1日持有,从零成本改为每边10bp的CAGR变化。
中国合约:20日/5日18.91% vs 12.57%扣费策略与持有的年化收益;单一事件期间结果。
外星人合约:10日/5日22.09% vs 8.52%扣费策略与持有CAGR,不是跨事件样本外收益。

怎么理解?

这篇真正值得读的是执行敏感性,而不是挑最高夏普。NO价格接近结算面值时,涨幅空间天然变小,小幅回撤反弹收益很容易被双边摩擦吃掉。不同事件的消息冲击和盘口厚度又不同,同一成本常数并不能代表真实成交。 作者以四小时最高最低价差辅助估计摩擦,但区间振幅不是买卖报价差:前者含真实价格变化,后者还要考虑时点、排队和逆向选择。用被动单也可能只成交后续继续下跌的订单。要验证这条策略,首要问题是哪些低价真的买得到,而非再扫更多回看天数。

最大限制

样本仅三个最终NO事件,存在事件选择和幸存条件偏差;约一年数据不足以估计罕见大损失。12组参数内选优、异常值人工处理和不清楚的入场窗口端点都应复核。这里也不把预测市场称为无风险资产。

复现与研究价值

事前冻结全部符合条件的事件池,同时纳入最终YES和NO;保存订单簿、撤单及部分成交,按事件留出而非随机抽10分钟行。先比较合理成交下的毛收益与总费用,再决定是否值得做参数研究。未执行该复现。

原文与核查

公开文章方法与结果表已读;未取得订单级成交数据。

原始文章 ↗

推荐 73/100 · 问题 27/30 · 证据 17/30 · 方法 20/25 · 复现 9/15

成本反转很有启发,但三事件选择、成交假设与调参使可交易证据较弱。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

一套通胀信息做六类交易:组合夏普1.3,但不是六个独立Alpha

Inflation as a trading signal

Elena Sueppel / Ralph Sueppel

一句话先讲结论

Macrosynergy把当时可见的通胀超标程度和近期通胀意外,分别用于国债、利率互换、股指与外汇六类交易,合成组合报告夏普1.3、Sortino 2.0。但这是一组未扣交易成本、不计复利的信号损益实验,而且不少单策略盈利集中于2010—2024年;它更能说明通胀信息可跨市场使用,不能直接视为随时稳定获利的六个独立策略。

它到底在问什么?

同一条CPI信息,除了预测利率,还能否通过不同市场的政策反应和风险补偿产生可分散的交易信号?

作者具体怎么做?

  1. 分别计算总体和核心CPI的同比、6个月及3个月年化动态,减去兼顾官方目标与历史兑现情况的有效目标;再以目标与2%中的较大者缩放,顺序标准化并截断到±3倍标准差。
  2. 意外项采用发布日前信息建立ARMA(1,1)预测,不是经济学家调查预期;首发与修订都在公开时进入。标准化使用36个月半衰期,随后以21个工作日半衰期累计近期意外。
  3. 超额通胀与意外趋势合成压力指标;高压力对应偏空久期/股票,国家间相对通胀差用于外汇,具体方向由不同定价渠道决定。
  4. 月末信号用于后续持仓并留一天执行延迟,六类账簿采用风险缩放后合成;没有进一步择优权重,但纳入哪些账簿仍带有研究者选择。

关键结果

原文结果与口径
核对项结果意味着什么
六策略合成Sharpe 1.3作者未扣成本的naïve PnL,不是可购买产品业绩。
国债超额核心通胀Sharpe 0.92000年至2026年3月,盈利时间分布并不均匀。
股票信号强度仅G2达到所述显著性不能把每个国家本地通胀都称为显著的股指预测器。

怎么理解?

最值得拿走的是数据定义,而不是1.3这个数字。有效目标、首发意外和修订意外把“市场当时知道什么”变成了可计算变量,减少了用终值数据解释过去的错误。研究员应先重建信息时点,再考虑复杂模型。 分散渠道仍不等于分散信息源。六本账都受到同一通胀周期影响,危机中可能同时放大久期或汇率敞口;低全样本相关不能替代压力期风险检查。作者认为未展示失败策略造成的事后偏差较小,但没有完整研究日志就无法量化这个判断。

最大限制

宏观数据及部分可交易收益序列需DataQuery/JPMaQS权限。无交易成本、冲击与完整融资预算,波动率目标也不保证危机期实际风险。ARMA意外与市场预期意外并非同义,跨国制度差异可能改变方向。

复现与研究价值

先在有真实发布时间的少量市场实现超额通胀与意外两条独立信号,再比较水平、意外和合成版本。记录每类账簿成本、总久期、美元敞口与压力期共振,避免一开始扩到几十国却无法核对数据。未执行。

原文与核查

公开完整研究文章已读;未调用付费数据或运行notebook。

原始文章 ↗

推荐 86/100 · 问题 29/30 · 证据 24/30 · 方法 24/25 · 复现 9/15

时点数据与跨市场机制清楚,信号工程价值高;商业数据和无成本实验降低直接复现便利性。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法说明

AutoTune 自适应周期:滚动测试仍报约 25% CAGR,但还没证明周期识别真的有用

The AutoTune filter

Petra Volkova / The Financial Hacker

一句话先讲结论

作者把 Ehlers 的自适应周期滤波器移植到 Zorro,在 ES 日线、2010—2025 年、10 个 walk-forward 周期下,报告 CAGR 约 25%,低于原先样本内优化的漂亮曲线。但它没有把“识别出的周期”与固定周期、随机周期做同规则比较,所以目前只能说整套交易系统表现不错,不能单独证明自动识别主导周期贡献了收益。

它到底在问什么?

行情的有效周期会变,固定长度的滤波器容易错过节奏。那么,动态估计周期再调整滤波器,是否真的比固定参数更好?需要区别数学上能分解频率与交易上能预测下一段周期。

作者具体怎么做?

  1. 对价格先做高通滤波,再计算不同滞后的相关性;取相关性最低的滞后并乘二作为周期估计。代码把本次周期变化限制在上次估计的 ±2 根 K 线内,以避免跳变。
  2. 把估计周期送入带通滤波器,以滤波结果相隔两根 K 线的差值作为 ROC;向上穿零做多,向下穿零做空,并用最小相关阈值筛掉不明显的周期状态。
  3. 公开代码的多空规则并不对称:做空还要求高通滤波值大于零。优化窗口 10—30、带宽 0.10—0.30 和相关阈值,对 ES 日线实施 10 个 walk-forward 周期,并加入资金管理。

关键结果

原文结果与口径
核对项结果意味着什么
作者报告 CAGR约 25%整套 ES 期货系统的结果,不是无杠杆指标收益;成本细节未充分列示。
滚动训练测试10 个周期优于单次样本内优化,但作者对模型结构的历史选择仍可能影响结果。
自适应模块独立增量未报告缺少相同交易规则下固定周期/随机周期消融对照。

怎么理解?

这篇的代码透明度比单纯展示净值高,读者能看出收益并不只来自周期估计:它还包含状态过滤、方向不对称与头寸管理。若这些模块贡献主要利润,滤波器自动调频可能并不是核心优势。 我的首要检验不是扩大参数网格,而是保持其他代码完全相同,只替换周期输入。如果固定周期也差不多,复杂估计没有必要;如果随机周期也一样好,就更需要怀疑“发现了市场节奏”的解释。还应把收益序列中的可预测性与波动序列的周期性分开,日内活动规律未必能预测价格方向。

最大限制

本站只读代码,未在 Zorro 执行;不能确认所有参数选择、费用、合约换月与资金管理实现。CAGR 受期货杠杆影响,原文没有提供同风险买入持有对照。页面评论者的反驳是另一套实验,本解析不把它当对当前 ES 策略的直接证伪。

复现与研究价值

优先四组同代码消融:固定周期、实时估计、滞后一个窗口的估计、保留周期分布但打乱顺序。统一仓位和成本,比较样本外 Sharpe、换手及每组训练期贡献,再决定是否把滤波器加入个股或指数信号。

原文与核查

已读正文与公开代码;未运行回测,未读取 TASC 付费原文的完整研究。

原始文章 ↗

推荐 81/100 · 问题 26/30 · 证据 20/30 · 方法 23/25 · 复现 12/15

公开代码且采用滚动测试,便于定位机制;缺少自适应模块消融、同风险和完整成本对照。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 方法教程

SHAP能解释模型为什么买入,却不能证明这个买入有Alpha

Looking Inside The Black Box

Vertox

一句话先讲结论

文章用2010—2026年的SPY数据训练XGBoost,再用SHAP、ICE、ALE和特征删除解释预测;但作者明确没有切训练集和测试集。那些漂亮的“低波动时均值回归、高波动时动量”曲线,只描述这个拟合模型学到了什么,不能据此确认市场规律或构建盈利策略。

它到底在问什么?

预测模型表现异常时,研究员怎样区分真正有用的特征、数据泄漏和模型在错误区域里的想象?

作者具体怎么做?

  1. 示例目标是下一日SPY收益,输入包含5/20/60日动量、波动率、RSI、成交量及缺口,XGBoost用300棵深度4的树,整段数据同时拟合和演示。
  2. CP逐一改变某特征;ICE画多条个体曲线,PDP取平均。对相关特征,这种单独改值可能离开真实数据支持区域。
  3. LIME用邻域简单模型逼近复杂模型;SHAP把相对背景预测的差分配到特征。背景样本、相关特征处理和邻域选择都会影响解释。
  4. ALE在局部区间累积预测变化,置换重要性破坏某列信息,LOFO删列后重新训练。后两者回答依赖程度和可替代性,不是同一个问题。

关键结果

原文结果与口径
核对项结果意味着什么
样本外预测检验未进行作者主动声明示例省略训练/测试切分。
解释对象模型预测,而非实现收益特征推动预测上升,不意味着推动市场价格上升。
相关特征处理需要另外审查多个解释工具仍依赖如何构造缺失/扰动特征。

怎么理解?

用于量化最有价值的做法,是把解释当作反证工具:模型若依赖无法在下单时获得的特征,应立即停下来核对时点;若特征贡献突然跨期翻转,应检查行情分布和模型版本。解释不能替代预测有效性,但能帮助定位有效性为什么消失。 教程代码也不宜直接当生产实现。LIME的原始系数单位不同,不能仅凭大小比较重要性;H统计的中心化与联合PDP构造需要测试,尤其全局实现没有完整处理基准均值。置换段落关于相关特征获得“高重要性”的一句与其论述方向不一致:可替代特征常会互相遮蔽,导致单列重要性偏低。

最大限制

这是教学用的样本内模型,没有策略收益、成本或稳定性证据。SHAP的分摊公平性基于所定义的博弈,不等于经济因果识别;ALE也不能自动消除所有相关与稀疏区域问题。

复现与研究价值

在已有滚动样本外预测上,按行情状态抽取解释样本;共同报告实际IC/净收益、分组置换重要性和解释稳定度,并给每张图标明解释数据、模型训练截止日与背景集。先写已知加法模型的单元测试,验证解释代码再用于黑箱。未执行。

原文与核查

完整教程和示例代码已读,未安装依赖或运行示例。

原始文章 ↗

推荐 81/100 · 问题 28/30 · 证据 19/30 · 方法 22/25 · 复现 12/15

工具地图与代码适合研究排错,但示例不是策略证据且实现细节需修正。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

FinBERT 先过滤新闻:省下调用费,也可能提前删掉最有用的信号

We Trusted FinBERT to Filter the Noise. It Was Also Filtering the Signal

Tommi Johnsen / Svetlana Shasharina

一句话先讲结论

先用 FinBERT 过滤新闻、再交给 Claude,4 月文章曾报告混合流程改善收益;但作者 7 月审计发现次日收益缺失、周末补零和分位排序错误,已经撤回收益改善与收益反转两项结论。修正后混合、Claude、FinBERT 的次日正负组收益差约为 +0.26%、+0.20%、+0.05%,彼此差异和各自收益均不显著。留下的可信发现是:前置过滤确实漏掉了信息,而不是已经证明哪种模型能赚钱。

它到底在问什么?

金融新闻系统应该先用便宜模型筛一遍,再把少数难题交给贵模型吗?如果第一关的错误不是随机噪声,而是把重要事件误判为中性,后面的模型再强也无法补救。

作者具体怎么做?

  1. 作者收集 536 个股票代码、9 个 GICS 行业的 64,608 篇新闻;输入主要是 Google News RSS 的标题和摘要,不是完整报道。检索使用公司名称、代码及同义词,随后判断新闻对目标公司的方向。
  2. 混合流程先让 FinBERT 分类,把中性项直接丢弃,只把其余约 37% 送给 Claude Sonnet;Claude 进一步区分新催化事件与泛泛推荐、旧闻和情绪措辞。在升级处理的新闻里,Claude 又改写了约 65% 的初步标签。
  3. 作者用 991 条 NVDA、AMD 标题比较分类一致率,再把不同模型的标签与当日、次日、后两日收益关联。跨行业汇总的次日正负组收益差约 0.28 个百分点,后两日关系接近消失;当日关系不能直接当作可交易预测。
  4. 最后按短时间窗口拆分,观察模型排名是否稳定,并回头审查 FinBERT 的中性池。该池包含大量财报、指引和带有保留措辞的新闻,说明“中性语气”与“没有增量信息”并不是同一件事。

关键结果

原文结果与口径
核对项结果意味着什么
更正后的次日组间收益差+0.26% / +0.20% / +0.05%依次混合、Claude、FinBERT;全部与零及彼此统计不可区分,不是可交易 Alpha。
中性池中正/负催化标签数之比1.74 / 1.95更正后的两个窗口仍存在漏检不对称;参考标签仍来自 Claude,不是全部经人工核实的事件真值。
所谓分类准确率83.4% vs 58.5%以 Claude 标签为参照的一致率,不是独立人工标注的准确率。

怎么理解?

这篇最值得带回研究流程的,是对“门卫模型”的审查。常见的工程指标只问送给大模型的多少条最后被确认有用,却不问被挡在门外的新闻里漏掉了多少真实事件。前者看起来很省钱,后者才决定信号上限。不能只用升级样本评价整个级联系统。 不过,本文还不能证明全量 Claude 就能创造稳定 Alpha。用 Claude 自己当参考答案,会天然偏好与 Claude 接近的流程;标题里出现“股价上涨”也可能是在报道已经发生的收益。研究员应把目标公司的真实事件标签、新闻首次时间戳和交易收益分开核验,避免把语言判断的一致性误当成投资有效性。

最大限制

版本更正是本篇最重要的限制:上方流程中的4月统计属于原始实验记录,其收益结论被7月审计撤回。新闻与股价同日变化也可能是报道追随行情;作者更正后的样本仍短,不能由未显著推出所有新闻模型永远无效。没有扣费、风险中性的可交易组合证据。

复现与研究价值

实用复现不是立刻换模型,而是对中性池持续随机抽样,由盲审人工标注“是否包含公司新信息”;同时比较全量大模型、小模型硬过滤、随机抽样升级和不确定性升级。统一新闻截点、重复稿处理、行业敞口和成本,再报告漏检率、每千条成本及净组合收益。以上是未执行的研究方案。

原文与核查

4月公开正文已读,并核对7月审计的数据缺陷、撤回声明与修正统计;未独立重跑。

原始文章 ↗

后续更正:The Mechanism Survives, the Magnitude Doesn’t(7月16日)

推荐 79/100 · 问题 29/30 · 证据 16/30 · 方法 24/25 · 复现 10/15

过滤偏差和后续自我纠错很有研究价值;原始收益结论已撤回,因此证据分下调。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 工具评测

RayforceDB“快几千倍”是特定工作负载经验,不是通用数据库排名

Time Series Database Review: RayforceDB

Anton Vorobets

一句话先讲结论

作者称某些 SQL 工作负载迁移到 RayforceDB 后快了几千倍,另有原先跑不完的计算在 30 秒内结束;但没有公开同口径数据、机器配置和完整基准,不能据此认定它全面胜过 SQL、Pandas 或 Polars。对量化团队更有用的是其按日分区、列式向量存储和低开销 Python 接口,是否贴合自己的行情查询与计算路径。

它到底在问什么?

高频行情分析慢,是数据库执行引擎慢,还是数据布局、跨进程搬运和逐行 Python 调用慢?换一个适合列式计算的工具可能很有效,但先得识别自己真正的瓶颈。

作者具体怎么做?

  1. 文章介绍一个以 C 实现、受 kdb+ 启发的列式数据库,可管理内存表和磁盘数据,并提供 Python 绑定。本站补查其官方仓库,确认项目及 Python 包有公开源码。
  2. 作者描述按日期组织分区,复用证券字符串对应的枚举及 symfiles,以减少日间重复标识和连接操作;时间戳可辅助形成日期字段进行范围查询。
  3. 与关系型工作流相比,文中强调没有传统外键和级联删除,数据一致性责任更多落在应用与数据管道;以文件保存和迁移也不自动解决并发写入或备份一致性。
  4. 作者报告 beta 使用体验及与开发者反馈 bug 的过程,但没有提供该案例的公开测试脚本。现在官方另有基准仓库,可作为自测起点,不等于本站已验证它的所有性能主张。

关键结果

原文结果与口径
核对项结果意味着什么
作者报告的速度提升特定任务数量级改善缺少完整配置与对照脚本,不能视为可重复的普遍倍数。
部分重任务少于 30 秒对照任务被提前停止,未测得完整耗时,因此不存在精确加速比。
独立基准验收尚未执行已有公开代码入口,不等于本团队生产环境验证通过。

怎么理解?

我会把它放在“研究基础设施候选”,而非“发现 Alpha”的位置。真正的比较应是相同数据、相同查询语义、相同线程与缓存状态;若旧实现每条记录来回穿过 Python 和数据库,新实现一次向量化,巨幅改善可能主要来自工作流改变,而非某个引擎独有能力。 金融时序应用的验收还必须越过速度:乱序到达、更正行情、跨日证券映射、时区与夏令时、缺失值和 as-of join 都可能静悄悄改变结果。尤其不能为了去掉外键而失去证券主数据的版本约束。一个很快但把更正后行情当成实时可见的数据系统,会高效制造未来函数。

最大限制

本文评价反映 2026 年 4 月作者当时经历,不把 beta 版本号当成当前最新版。作者声明无经济利益,但仍是积极使用者而非独立测试机构;未公开全部生产负载、容错、恢复与并发基准。本站没有安装、迁移或运行用户数据。

复现与研究价值

选三类真实只读负载做小规模对照:按证券滚动统计、跨表时点连接、跨日全市场聚合。先逐结果核对,再比较冷/热缓存耗时、峰值内存和恢复成本;通过后才评估迁移,不因营销倍数直接替换生产库。

原文与核查

公开评测完整解析;官方源码与基准入口核对,未运行性能测试。

原始文章 ↗

官方 Rayforce 源码

官方 Python 绑定

官方基准测试项目

推荐 69/100 · 问题 24/30 · 证据 13/30 · 方法 20/25 · 复现 12/15

开源入口和数据布局启发实用;经验性速度主张缺乏独立对照。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 实盘复盘

Carver年度期货赚23.7%,为什么风险调整后仍落后CTA基准?

Annual performance update- year 12

Rob Carver

一句话先讲结论

Carver报告本年度期货账户净收益23.7%,但这不是家庭总资产收益:总体只有6.4%,非期货部分约0.2%。期货盈利还包含约2.9个百分点现金/保证金收益;统一风险后,当年他的25.9%又低于两项CTA参照约30%的表现。漂亮的账户收益,需要先拆账户边界、资金收益和风险,才能判断策略是否出色。

它到底在问什么?

个人系统化交易者一年赚了多少,究竟应看期货策略、整个账户,还是承担同等波动后的相对表现?

作者具体怎么做?

  1. 主要个人年度采用英国税年4月6日至次年4月5日;部分基准表另用3月底区间,比较时必须检查日期是否一致。
  2. 期货价格盯市收益约21.7%,扣管理相关费用0.04%、佣金0.33%、滑点0.55%,得约20.7%;再计约2.9%资金收益后约23.7%,存在显示舍入。
  3. 分资产归因,股票和金属各贡献约5.49个百分点,农业约3.89,债券拖累约2.84;这些是对组合收益的贡献,而非各资产自身回报。
  4. 作者同时展示原始收益与波动率调整后的对照,长期均值/标准差与复合增长率分列,不能把算术平均收益直接当CAGR。

关键结果

原文结果与口径
核对项结果意味着什么
总体 / 期货账户6.4% / 23.7%不同资产范围,不是同一组合的两种算法。
滑点估计0.55%作者相对市场单约1.34%的对照,未独立核验成交日志。
当年风险调整收益25.9% vs 30.3% / 29.9%作者与AHL/SG参照;原始高收益不等于同风险领先。

怎么理解?

这类实盘复盘的研究价值,在于它把平时容易被省略的资金收益与执行成本单独列出。研究员可以据此检查自己的回测是否也包含现金利息、换汇和保证金管理,而不是只比较净值曲线。 不过,风险缩放不是完全公平的胜负判决:同波动仍可能有不同偏度、资产机会集和风险上限。一年的股票、金属贡献较高,也不能据此确定下一年加配这些市场。应追问收益来自稳定规则还是恰好遇到有利行情,并在持仓和交易层核对归因。

最大限制

数据由作者披露,未见独立审计;税年与日历日期不同,一处表头还出现晚于文章日期的4月底标签,不能解释为当时已实现的未来收益。滑点反事实依赖市场单价格模型,节省金额不等于任何交易者都能复制。

复现与研究价值

建立一张月度对账表,逐项连接盯市、佣金、滑点、现金利息、汇兑和资金进出;另列统一日期、统一波动的基准,不让风险或现金处理代替策略能力。这是建议,未重建作者账户。

原文与核查

公开年度复盘和数值表已读;未核验私人交易记录。

原始文章 ↗

推荐 81/100 · 问题 26/30 · 证据 23/30 · 方法 23/25 · 复现 9/15

真实账户边界与费用拆解有价值,独立核验和基准可比性有限。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 组合研究

最优叠加组合年化多2个百分点,但跟踪误差7.8%可能先逼投资者退出

What's the Optimal Stack?

Return Stacked Portfolio Solutions

一句话先讲结论

文章用一万条重抽样历史优化股票、债券、黄金、CTA和并购套利,得到约195%名义敞口的组合,模拟中位年化7.3%,高于60/40的5.3%;但相对基准跟踪误差约7.8%,不少一年区间显著落后。核心不是照抄最优仓位,而是把能承受多久跑输基准,写进组合目标和约束。

它到底在问什么?

当分散资产需要额外杠杆叠加时,研究员应追求最高模拟收益,还是在融资、跟踪误差与持有耐心之间选择可持续组合?

作者具体怎么做?

  1. 正文重抽12个月区块,生成一万条25年历史,保留区块内时序与同月跨资产关系,但不能生成历史从未出现的制度冲击。
  2. 各模拟内选择在60/40风险水平附近最大化几何收益的多头组合,超过100%的敞口按国库券收益加50bp融资,再平均最优权重。
  3. 另固定60/40基础组合和20%叠加,比较黄金、CTA、并购套利单项与等权/逆波动混合;后者用此前36个月波动率,每月更新。
  4. 进一步按稳定超额收益或危机保护优化,目标不同得到不同权重;页面互动工具采用2000次、26年及不同重抽样说明,不能与正文实验不加区分地混用。

关键结果

原文结果与口径
核对项结果意味着什么
模拟中位年化7.3% vs 5.3%不同组合在作者收益假设下的模拟统计,不是未来收益承诺。
20%逆波动混合叠加TE 1.23%,IR 0.47相对基准统计,IR不是整个组合夏普。
最差12个月相对收益平均约−1.9%每条模拟最差值再取平均,不是损失下限或95%风险分位。

怎么理解?

最有用的转变,是把“我相信分散化”改成可检验的约束:最多接受多少持续跑输、追加保证金和融资压力。跟踪误差可以帮助预算偏离程度,但并不能代表最坏尾部或持有期限。也不能把客户一般能忍受2%—3%的经验判断,当普适的统计结论。 一万次模拟主要减少对历史顺序的依赖,并不减少对预期收益假设的依赖。若并购套利被赋予更高前瞻夏普,优化器多配它有一部分是输入假设的结果。研究员应先看假设改变时权重是否剧烈变化,再看单一最优数值。

最大限制

指数无法直接交易,融资和额外产品费可能与假设不同;危机相关性与保证金需求也未被简单月度重抽样充分捕捉。发布方经营相关产品,属于有商业背景的研究。标题权重为舍入数,合计不应据此精算实施订单。

复现与研究价值

以自己的基础组合和真实融资条件,将收益均值、融资利差和危机相关性作为压力情景;报告持有期间跑输长度、追加保证金和最差分位,而不仅是均值TE。最后与简单等权叠加比较,未执行该实验。

原文与核查

公开正文、结果表及模拟说明已读;未运行网页工具或独立复算。

原始文章 ↗

推荐 81/100 · 问题 28/30 · 证据 21/30 · 方法 23/25 · 复现 9/15

目标约束和融资分解有实用价值,模拟对主观均值及指数历史依赖较大。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 季节性研究

税日季节性曾经很强:45笔交易净赚11,851美元,但近年优势已明显变弱

A Historical Look At $SPX on Tax Day

Rob Hanna / Quantifiable Edges

一句话先讲结论

1981—2025年在税日附近做多SPX,作者图表中的45笔交易胜率64.44%、利润因子2.26、累计净利11,850.74美元;但这是每年一次的季节性小样本,作者也明确说近年表现已不如过去。IRA缴款形成资金流是合理假说,不是这45笔交易已识别的因果机制。

它到底在问什么?

美国报税截止日前后的IRA缴款和资金入市,是否形成可以提前交易的SPX短期偏差?

作者具体怎么做?

  1. 样本覆盖1981—2025,每年一次,共45笔;图中以每笔100,000美元为单位绘制权益曲线。
  2. 统计报告总净利、毛利、毛损、利润因子、胜率和平均盈亏,假定的进出时点和费用仍需读取作者完整规则。
  3. 作者将IRA缴款和基金经理立即配置资金作为可能机制,同时展示曲线近年趋弱;他明确说这不再是过去那样的‘layup’。
  4. 这更像季节性提醒而不是完整策略论文,图表本身不能区分税日效应、星期效应和长期牛市漂移。

关键结果

原文结果与口径
核对项结果意味着什么
交易笔数 / 胜率45 / 64.44%跨45年每年一次,统计独立性与稳定性有限。
利润因子 / 净利2.26 / $11,850.74图表回测值,不等于扣除所有可执行成本后的投资收益。
最大单笔盈亏+$3,322 / −$2,262集中度较高,平均值受少数年份影响。

怎么理解?

这篇的正确用途是把“季节性还剩多少”列入事件前检查,而不是自动在4月15日买入。尤其当资金流机制没有账户级数据时,价格优势可能是长期趋势、节日效应或历史制度环境的合成。作者主动承认近期变弱,反而比只展示累计曲线更值得重视。 小样本季节性最容易被复合收益图说服。研究员应列出逐年收益、事件日期是否顺延、交易时点与成本,再做滚动年代检验;45次不足以放心估计尾部。

最大限制

正文很短,未给出逐笔交易时间、完整费率和样本外冻结规则;IRA税法和缴款行为也可能变化。图表资金规模是示意,不把$11,850当可按任意本金线性复制的承诺。

复现与研究价值

将税日与相邻非税日、星期几及市场趋势做匹配事件研究,按年代留出近十年;报告净收益、最大回撤和成本敏感性。若效应只在早期存在,应把结论写成历史事实而不是现行信号。未执行。

原文与核查

公开正文、图表和统计摘要已读;未取得逐笔交易数据。

原始文章 ↗

推荐 65/100 · 问题 23/30 · 证据 19/30 · 方法 15/25 · 复现 8/15

数据口径直观且作者承认衰减;样本小、规则细节和机制验证不足。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 论文导读

把过去12个月拆成财报日与非财报日:动量收益中约一半来自公司特定信息窗口

The Many Facets of Stock Momentum: Distinguishing Factor and Stock Components

Elisabetta Basilico;原论文 Gerard / Jehl

一句话先讲结论

论文把个股过去12个月收益拆成财报公告前后±2日的收益与其余收益:美国大型股中,财报事件部分的动量策略年化平均收益约3.51%(近15年4.90%),低于传统动量的波动,却保留预测力;短期最新财报策略近15年仅1.15%、t值0.67。动量里有公司特定信息成分,但不能因此把3.51%当成已扣成本的PEAD。

它到底在问什么?

传统个股动量到底是行业/市场共同走势,还是公司在财报信息窗口的特异反应逐步被消化?

作者具体怎么做?

  1. 样本来自IBES财报日期、Worldscope财务数据和Datastream价格;美国、欧洲、日本分别取最大1000/400/200家公司,收益换算美元。
  2. 每月底用过去一年所有年度与中期财报公告日期,在每个公告前后两日累计市场/行业调整收益;信号按横截面去均值和绝对值缩放为100%多空。
  3. 将策略暴露分解为财报窗口、非窗口及市场均值,并用行业、市场beta、规模、价值、盈利和投资因子做动态横截面归因。
  4. 美国全样本1992—2024,欧日因数据从2003/1998等时点起;同时报告最近15年和不同地区结果。

关键结果

原文结果与口径
核对项结果意味着什么
美国12M EAR:全样本 / 近15年3.51% / 4.90%年化平均收益,不是CAGR;一向换手约430%。
最新财报策略近15年1.15%,t=0.67最新事件信号在大盘股中没有显著预测力。
EAR波动 / 换手7.91% / 430%单边波动看似低,但交易成本和借券费用仍需计入。

怎么理解?

论文把“动量”从一个总分拆成事件窗口和剩余路径,这是比再换一个动量回看期更有解释力的设计。财报窗口收益更像公司特异信息的可观测代理,因此行业中性和动态因子归因后仍有收益,才更接近个股信息滞后。 但事件窗口不是纯粹的公司信息:市场开盘跳空、行业公告和事件日期披露误差都会进入±2日。近15年传统最新财报策略已消失,也提醒不能用旧PEAD文献替代当前交易成本和容量审查。

最大限制

原始I/B/E/S、Worldscope、Datastream需权限,未逐行重建;财报日期分布和地区数据覆盖存在断点。文章提供的是大盘股多空研究,不直接代表A股个股,且15年结果仍非未来保证。

复现与研究价值

在A股用公告首次披露时间而非财报期末,构造±1/±2/±3日事件窗口,分离行业与市场收益并计算换手、涨跌停和融券可得性;先复现EAR分解,再比较传统动量。未执行。

原文与核查

Alpha Architect导读及公开FAJ论文关键方法、表1—2已读;未取得原始数据。

原始文章 ↗

论文PDF

推荐 86/100 · 问题 29/30 · 证据 25/30 · 方法 24/25 · 复现 8/15

事件分解和跨市场比较扎实,数据权限与交易成本限制直接部署。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究博客

战术收益率:久期补偿不够就持现金,50% 是历史分位而不是收益率阈值

Meb Faber's "Tactical Yield", Simple and Intuitive

Allocate Smartly;策略提出者 Meb Faber

一句话先讲结论

每个月分别判断“10 年国债收益率−3 月国库券收益率”和“投资级公司债收益率−3 月国库券收益率”是否高于各自当时历史中位数;超过就给对应债券 50% 仓位,否则把那一半留在现金。作者把分位门槛从 30% 测到 70%,发现更严格并非更好:风险下降,但收益和夏普也会变差。它是在选择风险补偿,不是在精准预测下月利率。

它到底在问什么?

既然短期国库券也有收益,什么时候值得承担长久期和信用风险?策略试图用相对现金的收益率补偿约束持仓,而不是只追随债券价格趋势。

作者具体怎么做?

  1. 月末计算两个收益率差,分别与截至当时已观察到的自身历史分布比较。基准规则采用扩展历史中位数,不是拿今天的全样本中位数回填过去。
  2. 国债利差超过门槛就配置 50% IEF 代表的国债风险,公司债利差超过门槛就配置 50% LQD 代表的公司债风险;因此总债券仓位可以是 0%、50% 或 100%,剩余为现金。次月末重新判断并再平衡。
  3. 平台从 1930 年开始测试,正文称计入交易成本;再比较历史长度和 30%、40%、50%、60%、70% 分位门槛。早期不是 ETF 实际交易记录,作者承认历史数据来源差异会影响结果。

关键结果

原文结果与口径
核对项结果意味着什么
开仓门槛历史 50% 分位利差的历史相对位置;不是利差达到 50 bp,也不是债券收益率 50%。
每条风险腿仓位50%两项判断独立,未配置部分持现金。
门槛敏感性30%—70%更严格减少风险,也会牺牲收益和风险调整表现;没有报告处处更优。

怎么理解?

“只有补偿足够才承担风险”是一个容易解释给组合经理听的规则。但这里的期限溢价只是长短收益率差,不是剔除了未来短率预期的学术期限溢价;公司债减国库券也同时含期限和信用成分。因此不能把两条信号当作已干净分离的久期与信用预测因子。 读它还要避免一个跨期限跳跃:起始收益率与长周期债券回报相关,不自动推出历史分位能预测下个月。本文月度开关的依据需要依靠策略对照,而不是用长期收益可预测性代替。最需要补的是相同平均债券仓位、相同久期预算下的比较,才能区分择时价值和单纯减风险。

最大限制

1930 年以来数据包含 ETF 成立前的重建历史,不能看成九十多年可直接买卖的产品记录。本次未逐图核验收益统计和全部成本参数。美国利率制度跨度很大,跨时代历史分位并不保证适合短样本市场。

复现与研究价值

迁移当前国内样本时,不照搬几十年回看。先在实际可用样本内固定合理的扩展或有限窗口,设最短训练期;与相同平均久期的固定组合、价格趋势规则对照,再做 40%/50%/60% 门槛敏感性。这里是研究建议,未实施回测。

原文与核查

已核对公开文字中的规则、阈值敏感性和历史数据说明;未逐图或重跑全部绩效。

原始文章 ↗

推荐 79/100 · 问题 26/30 · 证据 20/30 · 方法 22/25 · 复现 11/15

规则简单、参数解释清楚,适合检验风险补偿择时;长期重建数据与久期混合口径需要谨慎。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / research-tutorial

Data transformations: Data shape and predictive features

Data transformations: Data shape and predictive features

QuantBeckman

一句话先讲结论

数据转换是模型结构选择而非清洗细节;应按交易持有期与经济机制选择转换,否则差分、缩放和全样本参数会切断趋势、泄漏未来或扭曲距离结构。

它到底在问什么?

如何将原始价格路径转换成与交易机制匹配、避免因果泄漏且保留有效信息的预测特征?

作者具体怎么做?

  1. 先将转换视为选择要保留/抑制的路径变化,并匹配目标持有期
  2. 用局部线性趋势模型提取一步预测误差、用滚动回归残差中和动态基准Beta
  3. 用协整去除共同随机趋势,用Haar小波隔离频段,并用滚动min-max压缩状态范围

关键结果

原文结果与口径
核对项结果意味着什么

怎么理解?

编辑判断:文章把特征工程重新定义为经济假设;关键不是转换越多越好,而是转换后的信息形状必须对应持有期和策略机制。

最大限制

教程型文章缺少统一资产、样本期和策略OOS绩效;不同转换的参数选择可能引入隐性前视;小波、协整和min-max在非平稳/断裂市场中可能失效。

复现与研究价值

下载文章代码和PDF,对每类转换建立严格点时管线;在趋势、均值回归和相对价值任务上做同一模型的消融与OOS成本比较。

原文与核查

public-original-read

原始文章 ↗

推荐 80/100 · 问题 25/30 · 证据 19/30 · 方法 24/25 · 复现 12/15

公开正文清楚列出转换机制并有代码入口;但不是完整实证论文,缺少统一量化绩效和样本外比较。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

稀疏策略怎么配仓:先问给底仓增加了什么,不要把零重叠误认成零风险

When Correlations Fail: A Bayesian Approach to Sizing Sparse Overlays

Beyond Passive Investing

一句话先讲结论

在 SPY、TLT、GLD 逆波动底仓上,把 8 个季节性策略各按 10% 叠加,报告夏普从 1.01 升至 1.31;但 FOMC 策略在自己的活跃日与底仓回归,R² 高达 0.903,几乎没有独立截距。进一步按增量收益与尾部表现调权能改善组合,不过所谓“贝叶斯”主要是人工先验与置信门控,不是完整后验推断。

它到底在问什么?

一年只交易几天的策略,彼此几乎没有同时持仓的样本,怎么判断它值得配多少?作者把问题改成:在它实际交易的那些日子,它给每天都在运行的底仓增加了什么。

作者具体怎么做?

  1. 在每个卫星策略的活跃日,用它的收益对底仓收益回归,得到截距 Alpha、斜率 Beta 和剩余波动;非活跃日不用于这个条件回归。
  2. 以 Alpha/剩余波动衡量增量收益质量,用扩展历史更新估计。每条策略初始权重 10%,belief=0.25,回归调整强度 0.70;截距 t 值从 0 增至 2 时,置信门逐渐打开。
  3. 再检查底仓最差 5% 日子的卫星表现,给有防御贡献的策略正向加权;尾部样本达到 30 个才充分信任,调整强度设 0.10。作者声明参数凭判断设定、并非拟合,但未提供前瞻登记证据。
  4. 报告计入每股佣金及最低佣金、闲置现金利息、杠杆部分按联邦基金利率加 1.5% 融资。这个口径不能自动覆盖滑点、特殊借券和冲击等所有成本。

关键结果

原文结果与口径
核对项结果意味着什么
先做简单等额叠加Sharpe 1.01 → 1.31先拿到大部分直观分散收益,再讨论复杂权重的增量。
FOMC 对底仓的解释比例R² = 0.903条件线性相关很高;不是证明所有时点择时价值为零。
尾部加权的边际改善Sharpe +0.05回撤 −16.1% → −15.0%;效果需对照新增参数与权重集中。

怎么理解?

这篇最好的问题是“它给现有组合增加什么”。高独立夏普的策略,可能只是在特定日子加了一倍底仓;低相关策略,也可能仅仅因为大部分时间收益记为零。条件回归把这两件事区分得更清楚。 但原文把 Alpha/残差波动叫 IC,和选股研究里常用的预测值—未来收益相关系数不是同一指标;其调权也不再等同于经典 Treynor–Black 的 Alpha/残差方差。分母从方差变成波动,排序与风险缩放都会改变,不能仅靠常数吸收。 我也不会接受“协方差矩阵不适用”的绝对说法:按全日历把空仓收益记零,仍能估计实际组合 P&L 的协方差;困难是样本误差、条件依赖与未来是否继续不重叠。相对底仓回归是有用的补充,不是免除共同尾部风险检查。

最大限制

季节性策略本身有样本选择,活跃日回归不能消除它。只正向奖励尾部贡献、不惩罚额外非线性下行的规则并不对称。尾部均值和 t 值都需要尊重重叠窗口与时间依赖,本站未重跑。

复现与研究价值

对于当前较短的 A 股策略样本,别为了凑尾部样本硬上十几年窗口。先采用保守等额风险预算或强收缩权重,把残差收益、活跃占比、共同亏损日期一并报告;复杂尾部加权只有在独立样本确实增加价值时才保留。

原文与核查

公开正文、图注统计和调权说明已核对;公式图片未完整转录,代码与底层数据未独立验证。

原始文章 ↗

推荐 81/100 · 问题 28/30 · 证据 21/30 · 方法 24/25 · 复现 8/15

对稀疏策略的条件增量评价很实用;指标命名和方法等价性需要纠正,复杂权重仍待独立验证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 观点评论

趋势还是反转不是关键,关键是收益由谁的行为提供

To Trend or Not To Trend? (Wrong question)

Kris Longmore

一句话先讲结论

这不是一篇证明趋势优于反转的实证论文。作者的判断是:同样的跌后反弹,可能来自强制平仓、杠杆产品再平衡或机构配置调整;只有把具体交易行为与可检验预期对应起来,模式才有研究意义。先看见漂亮回测、再补一个永远不会错的故事,并不会增加证据。

它到底在问什么?

“做趋势”与“做均值回归”描述价格怎么走,却没解释为什么有机会。研究员更应问谁需要交易、为什么不完全在意价格,以及自己为什么还能参与。

作者具体怎么做?

  1. 把相似的价格形态拆成不同成因:保证金压力导致的卖出、杠杆产品为恢复目标杠杆而交易、机构偏离目标权重后的再平衡。它们的可观察时点、流量和持有期应不同。
  2. 对趋势,作者讨论信息反应不足和估值锚不清晰等解释,但承认其机制比已知的机械流量更模糊;这是作者的研究偏好,不是本文实证排名。
  3. 立项前用三个问题约束假说:什么造成机会、为什么没有被更快交易者完全吃掉、具体如何交易;再检查预期是否在数据中出现,并考虑机制消失的条件。

关键结果

原文结果与口径
核对项结果意味着什么
材料性质研究方法评论读它是为了改善立项与验证,不是获取现成收益参数。
关键区分价格模式 ≠ 经济机制同样的统计形态可能包含完全不同的交易机会。
新增实证收益未报告原文没有提供,不编造结果。

怎么理解?

它对研究员的直接价值,是迫使机制产出可以被推翻的预测。如果认为收益来自再平衡,效果就应随预计调仓规模、窗口和流动性变化;如果这些地方都不变化,故事的解释力就值得怀疑。 但我不会把“先有故事”当成研究合格证。一个先写好的故事也可能错,发现数据模式后再提出机制也并非天然无效。真正的分界是发现后的验证是否独立、是否记录搜索过程、是否允许结果否定自己。原文强调机制是合理的,读者仍需要把它落实成对照实验。

最大限制

这是一位从业者的研究观,不提供机制的因果识别或策略强弱证据。价格不敏感对手方的存在也不保证可获利:时点、容量、拥挤和成本仍可能吃掉全部优势。网页当前日期晚于目录收录日,保留两者差异,不自行修正来源。

复现与研究价值

每个研究立项增加四行:预期收益来自谁;哪项数据能观察其行为;哪组对照不应出现收益;出现什么结果就否决。让 LLM 帮忙列反证,不只生成支持性解释。

原文与核查

公开正文已读;性质为观点评论,没有可复现收益实验。

原始文章 ↗

推荐 70/100 · 问题 26/30 · 证据 12/30 · 方法 23/25 · 复现 9/15

研究约束清晰、可立即用于团队流程;但观点文章没有新增实证,不能当作策略有效性的证据。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 工作论文导读

因子过去一个月出现最大单日上涨,之后高MAX组每月多0.32%;但这是因子择时,不是个股信号

Factor MAX: A New Signal for Predicting Factor Returns

Liyao Wang / Ming Zeng

一句话先讲结论

1963—2023年172个因子中,按上月最大单日因子收益分五组,最高组下月0.41%、最低组0.09%,H−L为0.32%/月(t=5.89);控制五因子、因子动量和个股彩票特征后,Alpha仍为0.24%—0.37%。它检验的是“买高MAX因子、卖低MAX因子”,不是把个股最大涨幅直接当买入信号。

它到底在问什么?

一个因子在月内突然大涨,是已经过度反应,还是因子层面信息尚未被充分吸收?

作者具体怎么做?

  1. 数据来自Open Source Asset Pricing的连续因子,剔除7个彩票类因子,保留172个因子,1963—2023连续覆盖。
  2. 每月按过去一个月最大日收益排序五分位,买P5卖P1;下月因子收益等权,报告均值、夏普及CAPM/FF5/FF5+MOM/HXZ/DHS Alpha。
  3. 通过跨度回归控制时间序列和横截面因子动量,并控制个股MAX、偏度、特异波动等异常。
  4. 按注意力、极端宏观新闻及财报月双重分组;低注意力MAX约0.42%/月且显著,高注意力不显著;因子MAX在事件后至少30日延续,个股MAX则回撤。

关键结果

原文结果与口径
核对项结果意味着什么
P5−P1月均收益0.32%,t=5.89因子层级多空收益,非个股组合年化Alpha。
五模型Alpha0.24%—0.37%/月控制模型不同但仍显著;样本期长且因子库定义仍重要。
低注意力组0.42%/月,t=2.93注意力机制的条件支持,不是实时注意力可直接交易的证明。

怎么理解?

它最有意思的地方是把“极端收益后的反转/延续”从个股提升到因子层面:同样的显著日收益,聚合到因子可能代表系统性信息,投资者反而低估其持续性。因而不能把个股MAX文献机械套到因子组合。 不过172个因子不是172个独立经济风险,因子之间高度相关,等权P5可能集中在少数共同主题。研究还在已知因子库上选规则,不能把随机抽样的显著性当作完全免疫数据挖掘。实际交易还需把因子收益映射到可交易股票权重和容量。

最大限制

原始因子构造与可交易成本未在本站复现;会议稿和SSRN版本存在更新。研究只到2023年,注意力代理、极端事件日和因子可得性可能产生后视或样本选择。

复现与研究价值

在本地因子库先固定发布日期和可交易权重,按因子相关性聚类后做MAX信号;将P5−P1拆成行业、规模和成交成本贡献,并留出近十年滚动样本外。未执行。

原文与核查

导读及公开会议论文关键方法、表格和附录图已读;未下载完整研究数据。

原始文章 ↗

会议论文PDF

作者研究页面

推荐 87/100 · 问题 29/30 · 证据 25/30 · 方法 24/25 · 复现 9/15

主结果、控制和机制检验丰富,且明确区分因子与个股;落地成本与因子相关性仍需实证。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

新兴市场与美国轮动:均线组合年化 7.13%,但别把价差择时当成风险中性 Alpha

Systematic Tactical Allocation in Emerging Markets vs. U.S.: A Momentum-Based Approach

Cyril Dujava / Quantpedia

一句话先讲结论

1997—2026 年新兴市场相对美国的价差长期走弱,但按均线信号双向切换后,多窗口组合报告年化 7.13%、文中夏普 0.564、最大回撤 −20.31%。看起来比一直做多新兴市场价差好很多;不过这不是同风险的持有美国股票基准,而且“等金额多空”也不等于 Beta 中性,尚不能把全部收益称为 Alpha。

它到底在问什么?

何时应该超配新兴市场、低配美国,而不是永远押注某一个市场?作者测试相对表现本身是否具有中期趋势,不依靠人工判断美元或地缘政治拐点。

作者具体怎么做?

  1. 使用 1997 年 2 月至 2026 年 2 月月度数据,新兴市场为 MSCI EM,美国为 S&P 500/SPY。以两者相对表现构造多空价差,测试 ROC 动量和 SMA 均线方向。
  2. 分别统计只做价差多头、只做价差空头和双向切换;ROC 测试 1、2、3、6、9、12、24 月,SMA 测试 2、3、4、5、6、9、12、24 月。每个窗口需要先积累信号历史,因此起始日期会不同。
  3. 把多个回看窗口的策略平均成组合,排除最长窗口。原文公开表格列出各变体收益、波动和回撤,但完整信号公式在网页中的数学图形未由本站还原,交易账本和执行成本未取得。

关键结果

原文结果与口径
核对项结果意味着什么
SMA 多窗口双向组合7.13% / 0.564年化复合收益/文中夏普;成本与资金口径未完整说明。
ROC 多窗口双向组合5.69% / 0.497与 SMA 相比收益较低,但回撤略小,不是每个指标都落后。
SMA 24 月双向变体回撤−78.33%最长窗口表现显著恶化;组合排除它是否事先决定,是重要审计项。

怎么理解?

最有价值的是多参数组合相对单一最优点的比较:它没有拿到最高收益,却降低了波动。但排除最差的最长窗口会带来新的选择问题——参数平均只有在参数集合也事先冻结时,才能真正减少回看择优。 表格还有一个值得注意的口径:7.13% 除以 12.64% 正好约等于 0.564,显示文中“夏普”至少数值上采用 CAR/波动,而非常见的平均超额收益/波动。比较其他论文之前需统一公式。另有正文称 ROC 空头 9 月夏普最好,但表 1 的 1 月 0.407 高于 9 月 0.332;这里以表中数字为准,不照搬正文概括。

最大限制

没有独立样本外结果和完整成本说明。不同参数起始日期变化、价差净值定义、融资与卖空成本、汇率暴露和两腿 Beta 不同都影响比较;不能把两腿收益差直接当作普通 ETF 净值。

复现与研究价值

复现时先明确交易工具与资金占用,再同起点比较:固定美国超配、静态两市场配置、单窗口、包含全部候选窗口的平均组合。冻结 6/9/12 等少量可解释窗口后检验,而不是根据全样本表现删掉 24 月。A 股研究可借鉴相对指数轮动设计,但不是个股动量边界论文的替代复现。

原文与核查

已核对正文和 HTML 结果表;指出表文差异,未执行回测或恢复全部公式图形。

原始文章 ↗

推荐 76/100 · 问题 25/30 · 证据 20/30 · 方法 21/25 · 复现 10/15

参数表充分且易发现反例;夏普公式、基准、成本与窗口排除尚不清楚,降低证据评价。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究博客

增长×通胀行业轮动:年内涨 39%,但不是全天候,更可能夹带市场 Beta

David Varadi's "Growth and Inflation Sector Timing", a Wildcard Strategy

Allocate Smartly;策略提出者 David Varadi

一句话先讲结论

这套增长×通胀轮动策略在文章写作时报告 2026 年内上涨 39%,却在 2025 年出现过约 24% 的月末口径回撤,且自 2008 年起没有跑赢大盘。原因不难理解:它任何时候都只持有一个股票行业;更关键的是,用周期行业相对防御行业构造的“通胀预期”还混入了市场 Beta,并非纯粹的通胀信号。

它到底在问什么?

不用滞后的 CPI,能否直接从行业价格判断增长和通胀状态,再轮动到最受益的行业?文章的价值在于提出可交易的价格代理,也暴露了代理变量究竟测到什么的问题。

作者具体怎么做?

  1. 用 S&P 500 的当前趋势代理前瞻增长;把能源、工业、金融、材料放入正通胀敏感组,把公用事业、医疗、必选消费放入负敏感组,以两组组合价格之比构造行业隐含通胀指标。
  2. 按增长与通胀指标的升降切成四种状态,并持有对应的一个行业 ETF。网页文字明确增长上升/通胀下降对应科技 XLK,二者上升对应能源 XLE;其他映射与精确趋势规则未在本次读取的文字中完整披露,不能据此宣称已取得可复现规则。
  3. 平台测试的是降低换手后的改版,日末判断状态并假定日末成交,平均每年不到 6 次持仓切换。单边摩擦假设 0.1%,往返 0.2%;历史测试从 1991 年起。

关键结果

原文结果与口径
核对项结果意味着什么
写作时的年内收益+39%截至 2026-04-06 文章口径,既不是全年收益,也不是截至今天。
2025 年回撤约 −24%月末采样口径;不能当作逐日最大回撤上限。
与 S&P 500 月收益相关性0.60可能有分散价值,但不代表低风险或市场中性。

怎么理解?

真正值得研究的是价格能否及时反映宏观,而不是“四象限”这个名字。周期行业相对防御行业既含通胀信息,也含风险偏好、市场 Beta 和行业特有冲击。平台自己发现正通胀组的市场 Beta 更高,这使所谓通胀择时有一部分可能只是股票风格择时。 因此,年内上涨 39% 不能压过长期相对收益和回撤证据。作为小比例股票替代项,它可能带来不一样的持仓路径;作为完整资产配置方案,它缺少分散风险资产的机制。文章关于 Beta 调整后表现改善的说法值得跟进,但没有在正文给出改善幅度,本解析不把它写成已验证的新策略。

最大限制

未取得完整映射和趋势参数,1991 年以来行业数据的拼接也未独立审计。用日末信息又按当日收盘成交需要验证可执行性。策略选择和平台改版可能有回看选择,相关性和近期收益都不是未来稳定性的保证。

复现与研究价值

优先比较原始行业比值、滚动 Beta 调整后的比值、直接通胀预期代理三种信号;控制相同风险和换手后,再检验行业收益增量。A 股应重新估计行业敏感度,不能照抄美国能源与科技的状态映射。

原文与核查

已核对公开正文及文字统计;完整图表映射、参数和原始回测未审计。

原始文章 ↗

推荐 74/100 · 问题 25/30 · 证据 20/30 · 方法 21/25 · 复现 8/15

行业价格代理与 Beta 污染问题有研究价值;规则披露有限,集中风险与长期相对收益削弱策略直接采用价值。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 论文导读

LLM 会按角色下单,不等于会赚钱:模拟市场也纠正不了所有高估

Large Language Models in Trading: Models and Market Dynamics

Harbourfront / rvarb;相关研究 Alejandro Lopez-Lira 等

一句话先讲结论

这篇导读把两件事放在一起:用 RAG 辅助交易、让 LLM 在模拟市场互相交易。后者的原论文更值得细看:8 个 GPT-4o 代理面对价值 28 的资产,从价格 14 出发会向价值靠近,但从 56 出发,15 轮后仍明显高估。会遵循投资者角色,不等于能够自动纠正错价,更不是实盘盈利证明。

它到底在问什么?

LLM 是作为外部研究助手提供信号,还是自己进入订单簿成为交易对手?前者要检验预测增量,后者要研究行为与市场反馈。把两者统一写成“AI 交易有效”,会漏掉最重要的证据边界。

作者具体怎么做?

  1. RAG 书章提出把价格等数值与新闻等文本结合,通过检索相关材料辅助模型。出版社公开页没有可核对的样本、基准和收益表,不能由“显著改善”的摘要描述补出数字。
  2. 市场模拟论文使用带限价单、市价单与部分成交的订单簿,让不同角色的 GPT-4o 代理提交结构化决策;设置明确的股息与资产价值,观察价格发现,而不是直接回测真实股票。
  3. 无限期情景保持价值 28 不变,分别从价格 56 与 14 启动,观察 15 轮。论文报告低估得到纠正、高估持续;交易成本设为零,结果用于理解模拟行为。

关键结果

原文结果与口径
核对项结果意味着什么
低估情景14 → 向 28 收敛定性结果来自论文正文;没有转录未核对的图中终值。
高估情景56 → 15 轮后仍高估同一模型群体不保证对称地消除错价。
RAG 交易绩效未报告书章全文受限,不能把摘要主张当已核验收益。

怎么理解?

我认为这组材料最大的提醒是:角色服从、估值计算、交易获利和市场稳定,是四个不同的目标。代理忠实扮演乐观投资者,即使持续高估,也可能是提示词执行成功、经济决策失败。用“像投资者”评价系统,和用“收益与风险”评价系统,得到的答案可能相反。 同样,市场产生泡沫不自动证明 LLM 特有的系统性风险。还要在相同规则下比较传统规则代理、不同底座模型,以及相同模型但不同真实信息的代理。真正需要分离的是:角色差异、信息差异和模型差异各自带来多少行为多样性,而不是把角色数当独立意见数。

最大限制

模拟是小规模、人工设定的市场,不能用来量化真实市场未来波动。论文正文核查不等于代码重跑;本篇引用的另一项 RAG 书章仍只有摘要。上述模拟阅读采用当前可访问文本,不保证与 4 月导读当时所见版本完全相同。

复现与研究价值

适合构建 LLM 投研系统的行为测试:固定信息,仅改变措辞,测仓位是否发生不合理跳变;固定角色,改变一条基本面证据,测决策是否响应;再跨底座模型比较相关性。先检验信息响应与风险约束,不把自然语言推理写得通顺当作交易能力。

原文与核查

已读导读;核对 arXiv 当前可读正文的实验设定与结论;RAG 书章仅摘要,故整条仍列材料受限。

原始文章 ↗

市场模拟论文原文(arXiv)

RAG 书章原址(Springer,仅摘要可读)

推荐 76/100(暂定) · 问题 27/30 · 证据 18/30 · 方法 23/25 · 复现 8/15

模拟可帮助检验多代理行为,但 RAG 书章未获全文;暂定分只基于已核查部分。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 研究博客

稀释、de-SPAC 与违约做空:事件时点可定义,收益却还不能从公开预览确认

A Junior Quant's Guide to Event-Driven Trading

Quant Galore、Alphanume Research

一句话先讲结论

公开部分提出:收集增发稀释、de-SPAC 和违约事件,事件记录后延迟一个完整日再做空,持有一个月。它明确改善了“知道事件就假设立即成交”的回测口径,但收益统计出现在付费墙之后;目前只能评价设计,不能说这三类事件已经提供了可实现 Alpha。

它到底在问什么?

价格模型容易被公司事件打断,那是否可以直接把事件当信号?作者选的是供给增加、上市转换和偿付困难这些可能持续施压的情形,而不是泛泛做公告情绪。

作者具体怎么做?

  1. 定义三类事件:增发稀释、SPAC 完成并购转换为经营实体、违约/破产等困境事件。它们的经济机制不同,不能只按共同下跌标签混为一个样本。
  2. 按事件日期与时间构建历史记录。作者强调事件可获知时点与策略可成交时点并不相同,提出留出一整日执行延迟。
  3. 公开部分计划做空并持有一个月;后续模拟结果不可见,样本范围、组合构建、重叠事件处理、借券成本和回测收益都未取得。

关键结果

原文结果与口径
核对项结果意味着什么
事件类型3 类不同经济机制需要分组验证,不是三条已证实盈利策略。
执行延迟一个完整日能降低过度乐观成交假设,但不能修复错误的事件数据库时间戳。
收益与风险结果未报告付费墙之后,不能依据文章语气推测。

怎么理解?

对研究员最有用的是事件账本的思路:不仅记录发生了什么,还要记录市场什么时候能够知道、策略什么时候可以买卖。延迟成交是保守处理,但不是防未来信息的万能补丁。如果供应商后来回填了早期事件标签,延迟一天依然可能用了当时不存在的数据。 另一个重要区分是“事件后继续下跌”和“事件后可以赚钱地做空”。困境股票可能没有券、被召回或暂停交易,尾部损益也不能简单按最后价格退出。上市公司增发还会同时带来现金;稀释比例本身不是等量价格损失,更不能单凭机械稀释叙事预测收益。

最大限制

完整付费研究未读取,不能核验样本、显著性、费用或卖空可得性。预览中的机制解释只是假说,不是实证结果。

复现与研究价值

取得正文前,不把本文作为立项收益依据。若做 A 股研究,先从可实现的多头规避或风险过滤评估事件增量,而不是假设能普遍融券做空;用首次公告时点、行业市值匹配对照和退市后收益处理构建事件研究。

原文与核查

仅公开预览已读;模拟结果位于付费墙后,未获取,不计新版完整文章解析。

原始文章 ↗

推荐 51/100(暂定) · 问题 22/30 · 证据 7/30 · 方法 18/25 · 复现 4/15

仅评价公开方案的启发,付费结果尚不可核查;不是对完整文章质量的最终评分。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 独立研究

月末交易:先分清债券季节性和股债反转,再剔除没跑赢随机窗口的腿

Two Calendar Effects at the Month Boundary

Beyond Passive Investing

一句话先讲结论

作者把股债月界交易拆成四条候选腿,发现“股强债弱后,下月初买股票”虽有正收益,但在 10,000 次随机 5 日窗口比较中,p 值为 0.068,没过 5% 门槛,因此删掉。剩余三条组成的低仓位叠加策略报告年收益约 2.2%—2.8%;不过样本内筛选、信号与持有窗口可能重叠,以及未计滑点,仍需要补查。

它到底在问什么?

月末债券上涨,是无需条件的季节性,还是机构把上涨资产卖掉、补回落后资产的再平衡?如果两者混在一起,既可能误读收益来源,也可能把股票自身的正漂移当成择时能力。

作者具体怎么做?

  1. 使用 2002 年 8 月至 2025 年 6 月 VTI、TLT 实际 ETF 数据,共 273 个月。先按月初和月末分别排列交易日,扫描 1—7 日持有窗口,最后统一采用 5 日。
  2. 以前 15 个交易日 VTI−TLT 收益差的正负区分股强或债强。候选是:月末无条件买 TLT;债强时月末买 VTI;股强时下月初买 VTI或做空 TLT。
  3. 对每条候选,从同一标的随机抽取等量 5 日收益窗口,重复 10,000 次比较几何平均收益。月初买 VTI 没过 5% 门槛,被排除;其余三条进入组合。
  4. 版本 A 每条腿用组合资金的 20%,债强时月末两条多头重叠,总名义敞口最高 40%。版本 B 将重叠两腿各降至 10%,最高敞口 20%。二者约 62% 交易日空仓。

关键结果

原文结果与口径
核对项结果意味着什么
被删除的股票腿p = 0.068有正收益,但不足以证明优于 VTI 自带漂移的随机 5 日窗口。
叠加组合年收益2.2%—2.8%低名义仓位的独立叠加收益,不等于加入任何底仓后都能原样增加这些收益。
最高名义敞口20% / 40%两个版本仓位口径不同;小回撤必须与小仓位一起阅读。

怎么理解?

最好的对照是被作者否定的那条腿:相同 ETF 的随机窗口比零收益基准更难战胜,也更贴近“择时有没有增量”的问题。月末买债本来就有收益,则股债强弱条件可能只是改变收益大小,不能据此认定所有利润都来自再平衡。 但这里还有一个比显著性更优先的时序检查:若某月不足 20 个交易日,前 15 日的信号窗口与最后 5 日的持有窗口可能重叠。要逐月核对最早下单时刻是否已经知道完整信号;原文没有展示这份账本。其次,机构流量只是解释假说,文章没有直接观测强制再平衡资金,相关性不能把机制坐实。

最大限制

持有长度和交易腿经过样本内筛选,单腿随机检验未消除整个搜索过程的多重比较。随机重采样还应保留时间依赖并处理窗口重叠。收盘市价单仍有成本;用减少底仓替代借券,会改变底仓收益,不能继续套用独立做空的无成本损益。

复现与研究价值

先复核每个月信号截止与成交时刻,再冻结三条规则做后续样本测试;补上月度区块重采样、全搜索族校正和收盘滑点。A 股借鉴的是“标的原生漂移基准”的检验思路,不能默认美国股债月末现金流结构适用于国内市场。

原文与核查

已读网页正文及图注中的统计;未取得逐笔交易账本,未独立回测。

原始文章 ↗

推荐 81/100 · 问题 27/30 · 证据 20/30 · 方法 23/25 · 复现 11/15

随机窗口对照与拆分收益来源有启发;时间窗重叠、样本内挑选和成本口径尚需复核。

返回全年目录 ↑

Quantocracy / Word 标准 · 材料受限,不计完整解析 / 独立研究

深度动量:别只选最可能上涨的股票,还要看所有结果的概率与回报

Uncertainty

Quantitativo;相关论文 Chulwoo Han、Chang Qin

一句话先讲结论

这篇的独立实现报告年化 18.5%、夏普 1.78,而基准夏普为 0.51;但作者明确省略了不少实现细节,不能据此复刻结果。真正值得研究的是排序方法:不只看股票最可能落入哪个收益档,而是把各档概率与对应回报一起计算;“最可能赢家”未必是“期望收益最高的股票”。

它到底在问什么?

一个股票大概率上涨,却有不小概率大跌,分类器仍可能把它判成赢家。只取最高概率那一档,会不会丢掉对投资最重要的下行信息?文章借两篇 Deep Momentum 研究讨论这个问题,再给出自己的实现结果。

作者具体怎么做?

  1. 先根据历史动量等特征预测股票落入不同收益档位的概率,而不是只保留一个最可能标签。国际扩展研究用跨国数据考察这种收益分布特征,SSRN 摘要确认覆盖 45 个国家。
  2. 再把概率转成用于投资排序的分数。关键差别是保留概率分布,而不是用硬分类标签排序;收益档位代表值也只能来自当时可用的训练数据,不能用未来全样本档位均值。
  3. 博主给出自己的策略表现,但公开文没有披露足以重建实现的训练切分、全部工程调整、选股与执行细节。因此下面统计只作为博主报告,不等于本站核验了完整模型或原论文结果。

关键结果

原文结果与口径
核对项结果意味着什么
博主实现夏普1.78 vs 0.51自己的实现与自己的基准;不是国际论文的全球组合结果。
博主实现年化收益18.5%公开文未完整说明模型与成本,不能写作已核验净收益。
博主实现最大回撤−32.8%高夏普并不意味着小回撤;基准为 −56.8%。

怎么理解?

这条思路的核心不是“神经网络比传统动量更聪明”,而是训练目标与交易决策有没有对齐。硬分类准确率关心标签是否猜对,投资收益还关心猜错时损失多大。即使模型和特征完全不变,仅改变概率到持仓的映射,也可能改变策略表现。 但完整概率向量不等于可靠概率。若模型对尾部风险过度自信,用它计算期望回报反而可能放大错误。因此我会把概率校准和排序规则分别检验:分类准确率相同的两个模型,可能具有完全不同的收益校准和尾部损失。也不能从有限回测没有遇到某次崩盘,推断策略消除了动量崩盘风险。

最大限制

原论文完整正文和博主实现尚未核验,本文不转述异常高的全球夏普作为可靠策略结论。论文写作日、SSRN 上传日和本篇博客日期也不同。多国数据必须按日历切分,不能随机拆国家—日期行;交易成本、微盘股、卖空和退市处理均需单独审查。

复现与研究价值

A 股个股可做三路同条件对照:传统动量排序、最大概率标签排序、概率加权收益排序。保持股票池、特征、训练窗、调仓日和成本一致,再看提升来自概率映射还是其他改动;补看校准曲线、换手、分市值结果以及不同市场状态的尾部回报。此处是提案,未执行。

原文与核查

已读博主正文并核对其报告数字;已查 SSRN 摘要与版本信息,尚未取得完整论文逐表核查。

原始文章 ↗

国际研究:原文引用的 SSRN 版本

国际研究:2026 年 7 月版本

早期美国研究:Management Science DOI

推荐 75/100(暂定) · 问题 29/30 · 证据 15/30 · 方法 24/25 · 复现 7/15

问题和方法价值高,但独立实现细节不充分,原论文逐表核查未完成;暂定阅读分,不评价策略可交易性。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究博客

缺一个宏观因子就删整行?补缺让回测多出九年,也改变了比较口径

How imputation helps statistical learning for macro trading signals

Rushil Gholkar、Ralph Sueppel、Stefan Swandel / Macrosynergy

一句话先讲结论

用 11 个宏观因子预测 8 种发达市场货币时,丢掉所有不完整观测的版本只能从 2005 年生成信号;放宽因子准入并补缺后,最早可从 1996 年开始,报告夏普也由约 0.4 升至 0.6。但三种版本的回测区间并不相同,所以这首先说明“删整行会浪费大量信息”,还不能把 0.2 的夏普差都解释成补缺带来的 Alpha。

它到底在问什么?

一个国家有十项宏观数据,只因第十一项缺失就把整个月删掉,会不会让模型既学不到东西,又迟迟凑不齐可回测样本?作者研究的是信息保留与人为填值之间的取舍,而不是创造缺失的真实数据。

作者具体怎么做?

  1. 使用 JPMaQS 历史时点宏观信息,构造增长、消费、信心、就业、通胀、实际利率、国际投资头寸和贸易条件等 11 个因子。交易 AUD、CAD、JPY、NZD、CHF、NOK、SEK、GBP 相对各自基准货币的 1 个月远期。
  2. 面板线性模型在普通/时间加权最小二乘、是否非负约束、是否截距之间选择;时间权重半衰期为 5 年。按序扩展可用历史,以面板交叉验证的策略 Sortino 选模型,不是一次性用全样本估计后回填。
  3. 比较不补缺、限制性补缺和积极补缺。限制版要求至少 4 个同期国家才能补一个因子、至少 5 个因子才能出信号;积极版降低国家及因子准入门槛,允许更稀疏的早期数据参与。补缺候选是同组国家均值和中性零值,也进入模型选择。
  4. 月末把预测转成经过标准化和截尾的下月持仓,执行延迟一天。展示的净值统一缩放到年化 10% 波动,但不计交易成本、风险管理或复利。

关键结果

原文结果与口径
核对项结果意味着什么
可生成信号的起点2005 → 1996积极补缺延长约 9 年历史,但早期实际使用的因子比当前少。
报告夏普0.4 → 0.6各自完整可用区间的比较;未计成本,不是共同区间净 Alpha。
限制性补缺 Sortino0.9不补缺为 0.7。收益来源还应结合共同样本与实际填值比例判断。

怎么理解?

这篇有价值的地方,是把缺失值从清洗细节提升为研究设计:一项新增因子可能增加信息,也可能因为历史太短,反而使其他十项因子的训练数据大量消失。只看最终模型有多少因子,看不出这个代价。 但“能回测更早”不等于“同一套策略经历了更多历史”。积极版 1996 年最初只用了 3 个因子,之后才逐渐增加。更长曲线混合了不同信息集,因此应把证据拆为两部分:共同期间是否改善;新增早期样本是否仍与今天要交易的模型有足够相似性。作者报告的早期权重不稳定正好说明这种区分的必要性。

最大限制

数据依赖 JPMaQS 授权;本站未运行所附 notebook。跨国均值会弱化本国特有信息,且回退均值必须只在当期训练集估计。原文图示的不同历史长度不足以单独识别补缺的因果贡献;未计成本净值也不能当可实现收益。

复现与研究价值

迁移 A 股多因子或宏观择时时,先输出三张对照:每期真实观测/填值比例、相同日期与股票池的收益比较、按缺失程度分组的 IC。补缺器必须放进每折训练流程;另外保留“减少因子但不补缺”的基准,以区分信息增量与样本保留效应。

原文与核查

已读正文、参数设定、收益口径和因子附录;未独立执行 notebook 或核验授权数据。

原始文章 ↗

推荐 82/100 · 问题 28/30 · 证据 23/30 · 方法 23/25 · 复现 8/15

把缺失值与历史可用信息联系起来,方法能迁移;不同样本起点和授权数据降低了直接验证便利性。

返回全年目录 ↑

Quantocracy / Word 标准 · 文章解析 / 研究博客

ChatGPT 做量化:能加快试验,但也会把稳健性检验做成过拟合

One Year Later: Is ChatGPT Finally Worth Using for Quantitative Analysis?

Quantpedia

一句话先讲结论

让 ChatGPT 只用给定 ETF 数据研究 EEM 短期交易,人工改造后的两类候选策略,在原文计入 5 bp 成本的口径下,最佳变体夏普约为 0.524 和 0.483;但模型不断建议加参数、加过滤器,新增美元信号的优势又主要表现为降低波动。文章真正支持的是“LLM 能提高有人监督的研究效率”,不是“LLM 已经能自主找到可靠 Alpha”。

它到底在问什么?

量化研究员把数据、想法筛选和回测交给 ChatGPT,究竟是在节省时间,还是在用更快的速度筛选历史噪声?作者重做一年前的体验测试,关注代码生成、结果整理和研究方向控制。

作者具体怎么做?

  1. 上传 EEM、SPY、IEF、GLD 的价格/净值数据,明确只能用这些数据、只交易 EEM、持仓几天,先让模型提出 10 个思路并汇总初步回测。
  2. 人工选择并改变其中两个思路:一是把风险偏好上升触发器反过来,测试风险规避期间的 EEM 反转;二是把相对一篮子资产的均值回归,简化为 EEM 相对 SPY 的弱势反转。
  3. 第二类最佳变体使用 5 日 EEM−SPY 收益差、20 日 z-score、−1.25 入场阈值和最多 5 日持有。后续又主动去掉标准化窗口等参数,只保留相对收益回看长度和 1—3 日持有期,检查是否依赖狭窄最优点。
  4. 加入美元 ETF UUP,比较原始风险规避信号(SPY 过去 X 日下跌、IEF 同期上涨)与美元替代/附加版本;再更换交易资产为 SPY,并比较不同参数区域的平均净值。作者索取 Python 代码,检查模型报告的执行错位问题。

关键结果

原文结果与口径
核对项结果意味着什么
风险规避后反转候选Sharpe ≈ 0.5243 日风险规避窗口、不额外要求 EEM 下跌;是该组最佳变体,不是平均结果。
EEM 相对 SPY 反转候选Sharpe ≈ 0.483复杂参数版本的最佳结果,不能直接转用于后续简化模型。
新增美元条件的主要优势降低波动更少交易可以同时降低风险和机会,不等于增加预测信息。

怎么理解?

最值得带走的不是这两条 EEM 策略,而是作者对“下一步建议”的警惕:LLM 很擅长继续给出可做的试验,却不天然区分验证原假设与寻找更漂亮的回测。一次次加入看似合理的条件,仍然是在使用同一段历史选模型。 因此,降低参数数量只是第一步;研究员还要事先写下什么结果会否定策略。新增美元条件后,应比较同一时段、同一风险预算下的收益和交易机会,而不是只看波动下降。更换相关资产也有参考价值,但 EEM 与 SPY 的共同市场冲击使它弱于真正独立的样本外检验。

最大限制

正文没有给出足以重建全部实验的固定模型版本、完整机器可读数据及预先冻结的样本外方案;部分统计只在图片中,本解析不补造。代码自查发现一个问题,不代表所有执行时序已无误;作者关于效率提升的判断也不是计时对照实验。

复现与研究价值

适合拿来改造研究流程:把“提想法”和“验证”拆开。先冻结最多两三个核心参数、可用信息时点和否决条件,再让 LLM 批量生成对照;最终用独立实现核验持仓和交易账本。迁移 A 股时先处理涨跌停、停牌与 T+1,不照搬 ETF 的短持有成交假设。

原文与核查

已读原网页正文并核对文内参数与统计;图片中的其他数字未转录,代码未独立执行。

原始文章 ↗

推荐 78/100 · 问题 27/30 · 证据 18/30 · 方法 23/25 · 复现 10/15

研究流程警示实用,给出真实参数和失败方向;但不是受控模型评测,也没有冻结样本外的自主 Alpha 证据。

返回全年目录 ↑

Quantocracy / 导读完成

AI 能加速写回测,但谁来说明这个收益为什么会存在?

More of the Disease, Faster (What happens when you ask an LLM to find you an edge)

Kris Longmore

这是一篇研究流程评论,不是证明大模型无效的实验论文。它提醒我们:写出了验证代码,不等于已经验证了投资逻辑。

2 分钟看懂

一个回测很好看,但你说不清它为什么赚钱,遇到回撤时靠什么决定继续还是停止?

增加过滤器通常能改善旧曲线,却不一定增加对市场的理解。

编辑自设例子,非作者实验

自设例子:假设某种被动调仓带来暂时冲击。可检验的问题应是调仓规模、价格影响及回补速度,而不只是哪个均线窗口最好。机制若消失,模型也应允许宣布假设失败。

  1. 写出可被反驳的机制
  2. 推导应观察到的市场现象
  3. 用未参与设计的数据检验
  4. 失败后更新理解,而非只换参数
关键结果与解释边界
核对项结果意味着什么
文章类型观点评论不是受控模型对比实验。
模型胜率NOT_FOUND未提供,不能凭观点补出一个数字。
统一回测结果NOT_FOUND没有同设置策略表,适合讨论研究纪律而非评估收益。

不能推出什么

作者对 LLM 能力的强判断属于观点。机制叙事也可能事后编造,不能因为故事合理就跳过数据检验。

研究用途

让代理明确写出“什么结果会推翻这个假设”,比要求它给出更自信的投资故事更有用。

详细讲解

编辑理解

一个回测很好看,但你说不清它为什么赚钱,遇到回撤时靠什么决定继续还是停止?

增加过滤器通常能改善旧曲线,却不一定增加对市场的理解。

自设例子:假设某种被动调仓带来暂时冲击。可检验的问题应是调仓规模、价格影响及回补速度,而不只是哪个均线窗口最好。机制若消失,模型也应允许宣布假设失败。

原文证据

原文实际报告了什么

作者认为研究需要经济机制和数据证据,反对让 LLM 不断生成规则、调参、回测,却不理解交易机会为何存在。文章以读者使用代理的经历展开,没有提供可供比较的模型胜率或统一回测实验。

原文位置:正文关于交易对手与 mechanism / evidence 的讨论
编辑理解

为什么值得讨论,哪里不能外推

我不会把“先有经济故事”设为所有有效研究的必要条件:数据驱动发现也可能有价值。但研究者必须知道证据如何变化才会改变判断。一个不能失败的故事和一个被无限调参救回的回测有同样的问题。更合理的分工是人负责限定问题与决策标准,工具负责可追溯执行;二者都要接受反例。

作者对 LLM 能力的强判断属于观点。机制叙事也可能事后编造,不能因为故事合理就跳过数据检验。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-03-192026-03-19待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
文章类型观点评论不是受控模型对比实验。
模型胜率NOT_FOUND未提供,不能凭观点补出一个数字。
统一回测结果NOT_FOUND没有同设置策略表,适合讨论研究纪律而非评估收益。

原文位置:正文关于交易对手与 mechanism / evidence 的讨论

推荐 64/100 · 问题 26/30 · 证据 12/30 · 方法 21/25 · 复现 5/15

很适合团队讨论研究纪律,但属于评论而非受控证据;没有可独立复现的主实验,因此证据与复现分低。

尚未执行的实验思路

让代理明确写出“什么结果会推翻这个假设”,比要求它给出更自信的投资故事更有用。

返回全年目录 ↑

Quantocracy / 导读完成

宏观信号不缺复杂模型,缺的是约束模型的理由

Macro trading signals with regression-based machine learning

Rushil Gholkar、Ralph Sueppel

宏观事件稀少,增加模型自由度的代价很高。比较回归方法时,经济约束和样本外选择流程往往比模型名称更重要。

2 分钟看懂

增长、通胀和利率能组合成信号,但回归模型越多,选出来的赢家就越可靠吗?

宏观数据行数很多,不代表独立经济周期很多。复杂模型可能反复学习同一个时期的偶然关系。

编辑自设例子,非作者实验

自设例子:同一轮通胀冲击同时影响许多国家,把每个国家每一天都当独立的新样本,会夸大信息量。模型需要跨市场数据,也需要理解共同冲击。

  1. 构建当时可知的宏观信息
  2. 限定模型候选与方向约束
  3. 历史内选择并重估
  4. 只用于下一期信号
关键结果与解释边界
核对项结果意味着什么
作者 Sharpe 范围低于 0.7 至 1.3各回归方案的模拟结果区间,并非扣费后实盘业绩。
比较风险口径年化波动 10%经过风险缩放后比较,不同原始杠杆不能忽略。
交易成本未计入高换手方法尤其需要另做成本敏感性测试。

不能推出什么

数据有访问门槛,结果没有计入成本;本文长历史是作者实验,不是替用户指定滚动窗口。

研究用途

在当前样本下先固定少量基线,再判断更灵活模型是否给出稳定的增量。

详细讲解

编辑理解

增长、通胀和利率能组合成信号,但回归模型越多,选出来的赢家就越可靠吗?

宏观数据行数很多,不代表独立经济周期很多。复杂模型可能反复学习同一个时期的偶然关系。

自设例子:同一轮通胀冲击同时影响许多国家,把每个国家每一天都当独立的新样本,会夸大信息量。模型需要跨市场数据,也需要理解共同冲击。

原文证据

原文实际报告了什么

作者以逐时点面板学习比较回归信号,三类策略 Sharpe 约从低于 0.7 到 1.3。模拟月末定信号、一天执行、下月再平衡,忽略交易成本与复利,波动缩放至年化 10%。数据复核需要 DataQuery / JPMaQS 访问。

原文位置:Overview of regression methods and PnL results;文章开头数据说明
编辑理解

为什么值得讨论,哪里不能外推

判断模型是否更好,应比较它在同样信息、同样成本假设和同样调参预算下的增量。若一个方法试了几十种变体,另一个只用默认值,最终的排名同时混入了研究投入。宏观信号还应看收益是否集中在少数重大事件;平均绩效漂亮但只靠一次周期,和跨环境持续有效不是一回事。

数据有访问门槛,结果没有计入成本;本文长历史是作者实验,不是替用户指定滚动窗口。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-03-072026-03-07待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
作者 Sharpe 范围低于 0.7 至 1.3各回归方案的模拟结果区间,并非扣费后实盘业绩。
比较风险口径年化波动 10%经过风险缩放后比较,不同原始杠杆不能忽略。
交易成本未计入高换手方法尤其需要另做成本敏感性测试。

原文位置:Overview of regression methods and PnL results;文章开头数据说明

推荐 80/100 · 问题 27/30 · 证据 23/30 · 方法 23/25 · 复现 7/15

顺序学习与模型约束讨论实用,成本遗漏与数据访问限制需要扣分;未运行 notebook。

尚未执行的实验思路

在当前样本下先固定少量基线,再判断更灵活模型是否给出稳定的增量。

返回全年目录 ↑

Quantocracy / 导读完成

宏观数据修订不仅会制造假信号,也会把真信号藏起来

Point-in-time economics and financial market forecasting

Fabio Cereda、Ralph Sueppel

市场交易的是当时公开的信息,不是多年以后修订好的历史。用错数据版本,可能高估,也可能低估信号。

2 分钟看懂

今天下载的一列“2010 年 GDP”,真的是 2010 年研究员当时看到的数字吗?

简单把最终值向后平移发布滞后,只修了发布日期,没有修正后来多次改写的数值。

编辑自设例子,非作者实验

自设例子:某月先报告增长放缓,后修订为加速。市场当时下跌未必是没有看懂增长;它可能只是面对了与我们今天回测不同的信息。

  1. 记录数据所属期
  2. 记录真正公开时间
  3. 保留当时版本
  4. 按交易时点拼接信息集
关键结果与解释边界
核对项结果意味着什么
外汇对照样本15 个市场工业增长案例的范围,不是全球所有资产。
修订数据显著性超过 90%作者采用的检验口径,不是预测正确率。
逐时点相关性约减半在该案例中原有关系不再显著,不能泛化为所有宏观因子减半。

不能推出什么

这不是“把信号滞后一个月”就能解决的问题。数据库必须能表达历史版本;完整复核还受数据许可限制。

研究用途

任何宏观回测先验收数据版本与可用时间,再解释策略好坏。

详细讲解

编辑理解

今天下载的一列“2010 年 GDP”,真的是 2010 年研究员当时看到的数字吗?

简单把最终值向后平移发布滞后,只修了发布日期,没有修正后来多次改写的数值。

自设例子:某月先报告增长放缓,后修订为加速。市场当时下跌未必是没有看懂增长;它可能只是面对了与我们今天回测不同的信息。

原文证据

原文实际报告了什么

作者比较历史信息状态与修订数据。工业增长预测外汇的 15 个新兴市场样本中,修订数据通过 90% 显著性口径,逐时点数据的相关性约减半且不显著。另讨论进口与信贷指标,说明修订误差会累积。

原文位置:Examples of hindsight errors:Overestimating the quality of short-term industry growth
编辑理解

为什么值得讨论,哪里不能外推

对数据工程最有用的是把一个“日期”拆成不同字段。观测所属期、首次发布日期、修订发布日期、我们实际获得的时间,回答四个不同问题。漏掉其中一个,简单的数据库 join 就可能把未来版本接回过去。我的验收会抽查极端修订月份,逐条重放当时的信息集,而不是只看回测代码有没有 shift。

这不是“把信号滞后一个月”就能解决的问题。数据库必须能表达历史版本;完整复核还受数据许可限制。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-02-132026-02-07待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
外汇对照样本15 个市场工业增长案例的范围,不是全球所有资产。
修订数据显著性超过 90%作者采用的检验口径,不是预测正确率。
逐时点相关性约减半在该案例中原有关系不再显著,不能泛化为所有宏观因子减半。

原文位置:Examples of hindsight errors:Overestimating the quality of short-term industry growth

推荐 84/100 · 问题 29/30 · 证据 24/30 · 方法 24/25 · 复现 7/15

直接展示修订数据与实时信息差异,方法价值高;商业数据访问和未独立运行限制复现分。

尚未执行的实验思路

任何宏观回测先验收数据版本与可用时间,再解释策略好坏。

返回全年目录 ↑

Quantocracy / 待获取全文

系统平均很快,却在最需要交易时读到了旧行情

Data: Data structures as lifecycle engineering

Quant Beckman

低延迟工程首先要保证读到的是同一个有效市场状态。可见部分的问题诊断有价值,但示例代码不是生产级保证,后半文仍受付费墙限制。

2 分钟看懂

平均处理一条行情只需很短时间,为什么实盘仍会交易到不存在的价差?

平均耗时没有反映信息年龄,也没有保证买价与卖价来自同一次更新。模型输入如果混合了两个状态,再精确的计算也可能是在计算一个从未出现过的市场。

编辑自设例子,非作者实验

编辑自设:盘口先为 100/101,随后为 102/103;读线程若混读成买价 102、卖价 101,就会看到虚假的倒挂。正确目标不是把计算再快一点,而是让策略拒绝使用混合快照。

  1. 标记行情序列和数据年龄
  2. 给队列设容量与溢出处理
  3. 验证快照来自一致更新
  4. 发生缺口后停用依赖连续状态的计算
关键结果与解释边界
核对项结果意味着什么
已读范围公开部分至 Point 4Point 5 起及附录未读,不算全文完成。
分位数示例update 为 pass正文是骨架,不能复制后就声称监控已实现。
延迟目标尾部与数据年龄不是只看平均循环耗时。

不能推出什么

没有执行代码,也没有可核对的端到端基准。后半文付费受限;公开 P² 估计器只是占位实现,不能当成已验证高频基础设施。

研究用途

可以把数据年龄、序号缺口与一致性检查列入工程检查表;不可将文中代码片段直接当生产实现。

详细讲解

编辑理解

平均处理一条行情只需很短时间,为什么实盘仍会交易到不存在的价差?

平均耗时没有反映信息年龄,也没有保证买价与卖价来自同一次更新。模型输入如果混合了两个状态,再精确的计算也可能是在计算一个从未出现过的市场。

编辑自设:盘口先为 100/101,随后为 102/103;读线程若混读成买价 102、卖价 101,就会看到虚假的倒挂。正确目标不是把计算再快一点,而是让策略拒绝使用混合快照。

原文证据

原文实际报告了什么

公开段落讨论行情突发时的队列积压、尾部延迟、读写一致性和数据布局校验,展示固定容量队列、分位数估计器骨架及快照读取片段。页面在 Deterministic replay 一节开始处出现付费墙,后续恢复机制与附录未取得。

原文位置:公开 Introduction 至 Point 4;Point 2 的 update 函数;Point 5 付费墙
编辑理解

为什么值得讨论,哪里不能外推

独立代码审阅意见:文章称某些 Python 片段“零分配”或用一致性协议保证安全,这些说法不能仅靠片段注释成立;实际实现还依赖运行时、内存模型与线程/进程同步。尤其要区分丢弃完整快照和丢弃增量盘口消息,后者可能让整本订单簿失真。覆盖掉旧消息之前,必须知道自己丢掉的是可替代状态还是不可缺失的状态变化。

没有执行代码,也没有可核对的端到端基准。后半文付费受限;公开 P² 估计器只是占位实现,不能当成已验证高频基础设施。

核查记录

有限材料导读:公开正文读至 Point 4;Point 5 起及付费附录未取得。代码片段仅静态阅读,未执行。

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-272026-01-27待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
已读范围公开部分至 Point 4Point 5 起及附录未读,不算全文完成。
分位数示例update 为 pass正文是骨架,不能复制后就声称监控已实现。
延迟目标尾部与数据年龄不是只看平均循环耗时。

原文位置:公开 Introduction 至 Point 4;Point 2 的 update 函数;Point 5 付费墙

推荐 61/100 · 问题 27/30 · 证据 10/30 · 方法 19/25 · 复现 5/15

切中实盘输入失真;部分示例未实现、性能保证未验证且全文受限,评分仅针对公开部分。

尚未执行的实验思路

可以把数据年龄、序号缺口与一致性检查列入工程检查表;不可将文中代码片段直接当生产实现。

返回全年目录 ↑

Quantocracy / 导读完成

大家都在卖的时候谁接盘?日内与隔夜的答案可能不同

Who Is the Counterparty to the Pro-Cyclical Investors

Johannes Beutel、Maik Schmeling、Willy Scherrieble;Quantpedia 导读

不要把长期机构自然想成逆向买家。导读中的逐笔交易研究显示,吸收资管净流量的关键角色是交易商银行,而且结论取决于观察频率。

2 分钟看懂

一个群体集中卖出时,为什么不能只靠“每笔交易都有买家”解释市场会不会失去流动性?

成交恒等式只保证买卖数量相等,不保证买家愿意以原价接单。研究要问的是谁承担库存、承担多久,以及当这个群体收缩风险预算时,价格要让步多少。

编辑自设例子,非作者实验

编辑自设:高频交易者上午买入、下午卖回,日内看像重要接盘者,日终净持仓却接近零。交易商若把库存留到次日,日频数据会显示它承担更多净风险。这两个观察并不矛盾,不能拿日内成交额推断隔夜风险吸收。

  1. 识别逐笔交易双方的部门
  2. 按统一频率聚合净买卖
  3. 比较与资管净流量的同向或反向关系
  4. 区分短时中转与持续库存吸收
关键结果与解释边界
核对项结果意味着什么
观察频率15 分钟至 1 个月改变频率会改变谁像流动性提供者。
日频量级PTF 约 10% / 对冲约 5%相对于资管净流量的吸收估计,不是成交量市场份额。
长期投资者并非天然逆向本研究样本中的部门行为,不能外推到每家机构。

不能推出什么

本条核对的是导读和引用片段,未审底层交易数据库、部门分类误差及完整回归。欧洲市场结构不能直接套入 A 股。

研究用途

在流动性研究中明确时间尺度和谁承担库存,避免将交易量、净流量与承接能力混为一谈。

详细讲解

编辑理解

一个群体集中卖出时,为什么不能只靠“每笔交易都有买家”解释市场会不会失去流动性?

成交恒等式只保证买卖数量相等,不保证买家愿意以原价接单。研究要问的是谁承担库存、承担多久,以及当这个群体收缩风险预算时,价格要让步多少。

编辑自设:高频交易者上午买入、下午卖回,日内看像重要接盘者,日终净持仓却接近零。交易商若把库存留到次日,日频数据会显示它承担更多净风险。这两个观察并不矛盾,不能拿日内成交额推断隔夜风险吸收。

原文证据

原文实际报告了什么

研究按投资者部门分组欧洲股票和利率市场交易,在 15 分钟至一个月频率考察资管净流量的对应方。导读报告日频下交易商银行占主导,自营交易公司和对冲基金吸收比例约 10% 和 5%;长期投资者反而表现为同向交易。

原文位置:Quantpedia 开篇;所引 Figures 1–3;频率与投资者部门结果段
编辑理解

为什么值得讨论,哪里不能外推

研究员能带走的是流动性压力分析的结构,而不是某个买卖点。我的建议是把成交活跃度与承接能力分开:很多账户互相倒手能形成大成交,却不一定有人愿意持有新增风险。部门回归的比例也不宜做成简单饼图,因为还有同向放大流量、不同市场以及估计误差,不一定按你选取的几项恰好加到 100%。

本条核对的是导读和引用片段,未审底层交易数据库、部门分类误差及完整回归。欧洲市场结构不能直接套入 A 股。

核查记录

已核 Quantpedia 网页及研究引用;未取得底层论文全表和逐笔交易数据。

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-272026-01-26待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
观察频率15 分钟至 1 个月改变频率会改变谁像流动性提供者。
日频量级PTF 约 10% / 对冲约 5%相对于资管净流量的吸收估计,不是成交量市场份额。
长期投资者并非天然逆向本研究样本中的部门行为,不能外推到每家机构。

原文位置:Quantpedia 开篇;所引 Figures 1–3;频率与投资者部门结果段

推荐 71/100 · 问题 28/30 · 证据 17/30 · 方法 22/25 · 复现 4/15

交易对手识别与频率区分很有价值;当前导读层证据,监管级逐笔身份数据难以复现。

尚未执行的实验思路

在流动性研究中明确时间尺度和谁承担库存,避免将交易量、净流量与承接能力混为一谈。

返回全年目录 ↑

Quantocracy / 导读完成

比特币最优权重为负?关键在预期收益假设,不是优化器投票看空

Is The Optimal Long-term Portfolio Share of Bitcoin Negative?

Alistair Milne;Quantpedia 导读

负权重是特定收益假设与协方差输入的条件结果。它提醒我们审查优化器的输入,不能据此推断比特币未来一定下跌。

2 分钟看懂

为什么相同的历史涨幅,在不同资产配置研究里会导出正负相反的 BTC 权重?

均值方差优化器不判断资产的投资叙事。它接受预期收益、波动、协方差和约束,再计算组合。如果不同研究先给 BTC 填入不同的长期收益,权重方向不同并不奇怪。

编辑自设例子,非作者实验

编辑自设:一种资产与股票同涨同跌、波动很大,预期超额收益又设为零,它在最优组合中很难因“曾经大涨”获配。若提高它的预期收益,答案可能改变。这不是证明任何一个预期正确,而是说明权重本身不能反过来验证输入。

  1. 分开历史实现收益与未来收益假设
  2. 估计与股票的协方差
  3. 明确允许做空还是只做多
  4. 检验最优权重对假设的敏感性
关键结果与解释边界
核对项结果意味着什么
全样本风险估计-1.6%作者设定下风险组合中的 BTC 比例,不是所有投资者总资产比例。
较近风险估计-7.3%协方差改变可显著改变结果。
关键输入长期预期收益假设不是只凭历史协方差就能决定符号。

不能推出什么

本条只核对导读,底层论文假设推导未完整审计。没有把厚尾、动态配置和现实做空摩擦都纳入一个可直接执行的结论。

研究用途

阅读任何“最优配置”论文时,先找预期收益这一行;用假设敏感性解释权重,而不是直接抄小数点后的比例。

详细讲解

编辑理解

为什么相同的历史涨幅,在不同资产配置研究里会导出正负相反的 BTC 权重?

均值方差优化器不判断资产的投资叙事。它接受预期收益、波动、协方差和约束,再计算组合。如果不同研究先给 BTC 填入不同的长期收益,权重方向不同并不奇怪。

编辑自设:一种资产与股票同涨同跌、波动很大,预期超额收益又设为零,它在最优组合中很难因“曾经大涨”获配。若提高它的预期收益,答案可能改变。这不是证明任何一个预期正确,而是说明权重本身不能反过来验证输入。

原文证据

原文实际报告了什么

导读介绍 Milne 的均值方差研究:在股票与 BTC 的风险资产组合中,用 2014–2025 风险估计得到 BTC 权重 -1.6%,用较近样本为 -7.3%。长期预期收益不是简单沿用 BTC 的历史涨幅,而依赖作者的资产定价假设。

原文位置:Quantpedia 摘要与 Figure 2 引述;SSRN 5176989 原地址
编辑理解

为什么值得讨论,哪里不能外推

我的判断是,真正值得讨论的不是 -1.6% 是否精确,而是资产的边际预期回报够不够补偿它给现有组合增加的风险。做多约束、融资和做空成本都会改变可实施答案。风险厌恶程度影响总体风险仓位;风险资产内部的相对比例与总资产仓位也不能混淆。

本条只核对导读,底层论文假设推导未完整审计。没有把厚尾、动态配置和现实做空摩擦都纳入一个可直接执行的结论。

核查记录

导读完成:核对 Quantpedia;底层 SSRN 全文和参数推导未完整审计。

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-252026-01-22待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
全样本风险估计-1.6%作者设定下风险组合中的 BTC 比例,不是所有投资者总资产比例。
较近风险估计-7.3%协方差改变可显著改变结果。
关键输入长期预期收益假设不是只凭历史协方差就能决定符号。

原文位置:Quantpedia 摘要与 Figure 2 引述;SSRN 5176989 原地址

推荐 66/100 · 问题 26/30 · 证据 14/30 · 方法 20/25 · 复现 6/15

有助于理解配置结论的条件性;当前只有导读层核验,关键预期与实现假设仍待审计。

尚未执行的实验思路

阅读任何“最优配置”论文时,先找预期收益这一行;用假设敏感性解释权重,而不是直接抄小数点后的比例。

返回全年目录 ↑

Quantocracy / 导读完成

AI 越一致,市场就越脆弱?这是可检验的假说,不是已证实的规律

The Age of AI Attractor Markets: One Possible Trajectory

Tommi Johnsen、Svetlana Shasharina

多套模型可能因为同样的数据和约束而同时退出。文章的用途是提出压力测试问题,而不是预测下一次崩盘。

2 分钟看懂

十套看起来不同的 AI 策略,是否真的提供了十份独立风险?

算法名称不同不等于交易行为不同。若都使用相同信息、相同风险上限,在波动升高时都要卖出,平常不高的收益相关性也可能掩盖压力下的共同动作。

编辑自设例子,非作者实验

编辑自设:三套选股模型持仓不同,却都把组合波动控制在同一个水平。市场突然跳跌后,三个模型可能同时减仓。此时交易同步来自风控约束,不一定来自 LLM 权重。仅观察同步卖出,无法辨别这两种原因。

  1. 把共同数据与共同约束分开
  2. 观察压力下订单而非只看平常收益
  3. 加入非 AI 策略对照
  4. 寻找能够否定拥挤假说的证据
关键结果与解释边界
核对项结果意味着什么
证据性质情景推演没有识别 AI 普及的因果效应。
关键观测压力下行为相关性不只计算全样本收益相关。
反例条件AI 增加而同步性不增控制共同市场冲击后,才更接近检验假说。

不能推出什么

没有给出可交易的拐点、阈值或成本后对冲结果。担心尾部风险也不能直接推出长期买期权必然合算。

研究用途

做模型组合评审时同时列出信息来源、风险约束和压力下减仓规则,避免仅凭模型名称认定分散化。

详细讲解

编辑理解

十套看起来不同的 AI 策略,是否真的提供了十份独立风险?

算法名称不同不等于交易行为不同。若都使用相同信息、相同风险上限,在波动升高时都要卖出,平常不高的收益相关性也可能掩盖压力下的共同动作。

编辑自设:三套选股模型持仓不同,却都把组合波动控制在同一个水平。市场突然跳跌后,三个模型可能同时减仓。此时交易同步来自风控约束,不一定来自 LLM 权重。仅观察同步卖出,无法辨别这两种原因。

原文证据

原文实际报告了什么

作者明确把文章定位为一种推测情景:相似的数据表示、目标与反馈可能使行为收敛,平时看似稳定,遇到共同无法处理的冲击时同步失效。文末列出反驳条件,例如 AI 使用增加但控制宏观因素后的策略相关性不升反降。

原文位置:开篇情景声明;Counterarguments and boundary conditions;What would falsify this?
编辑理解

为什么值得讨论,哪里不能外推

我认为“AI 吸引子”作为比喻容易读起来宏大,却也容易无法证伪。把它转成研究问题,需要明确采用率、订单同步性与流动性指标,找到合适对照,并排除共有风险因子的影响。另一个反方向同样合理:AI 降低研发成本,也可能增加细分策略的多样性。应该让数据区分两条路径,而不是把所有市场现象都解释成收敛。

没有给出可交易的拐点、阈值或成本后对冲结果。担心尾部风险也不能直接推出长期买期权必然合算。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-252026-01-24待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
证据性质情景推演没有识别 AI 普及的因果效应。
关键观测压力下行为相关性不只计算全样本收益相关。
反例条件AI 增加而同步性不增控制共同市场冲击后,才更接近检验假说。

原文位置:开篇情景声明;Counterarguments and boundary conditions;What would falsify this?

推荐 55/100 · 问题 25/30 · 证据 8/30 · 方法 18/25 · 复现 4/15

压力测试思路有启发且列出证伪条件;没有实证识别、执行规则或收益验证。

尚未执行的实验思路

做模型组合评审时同时列出信息来源、风险约束和压力下减仓规则,避免仅凭模型名称认定分散化。

返回全年目录 ↑

Quantocracy / 导读完成

宏观如何落到个股:先学不同公司的敏感度,而不是预测整个指数

Stock selection with macro factors: the case for simple neural networks

Eric Brine、Rushil Gholkar、Ralph Sueppel

同一轮经济变化对公司影响不同。这篇用一个小网络做个股相对信号,但小股票池和幸存者筛选限制了结论。

2 分钟看懂

利率上升对银行、地产和消费公司影响不同,能不能把宏观判断转成个股之间的排序?

对所有股票统一加一个宏观择时仓位,无法利用公司敏感度的差异;逐只回归又可能浪费共同信息。

编辑自设例子,非作者实验

自设例子:如果两家公司面对同一轮利率变化,甲的融资成本上升、乙的利息收入改善,那么“买哪个”可能比“整个市场涨不涨”更值得建模。具体方向仍须由信息和数据共同验证。

  1. 准备逐时点宏观因子
  2. 小网络共享学习公司敏感度
  3. 历史内验证并控制训练
  4. 产生下一期个股相对信号
关键结果与解释边界
核对项结果意味着什么
网络输入 / 股票28 / 22有限因子与小股票池的实验,不是全市场测试。
季度方向准确率约 51%弱信号也值得研究,但不是高命中率选股器。
相对策略 Sharpe0.4—0.6作者未计成本的结果,不是净收益保证。

不能推出什么

长期连续交易与当前市值筛样,不能代表一个真正逐时点变化的全股票池。

研究用途

若迁移到 A 股,首先重建动态股票池与信息时点,再讨论网络结构。

详细讲解

编辑理解

利率上升对银行、地产和消费公司影响不同,能不能把宏观判断转成个股之间的排序?

对所有股票统一加一个宏观择时仓位,无法利用公司敏感度的差异;逐只回归又可能浪费共同信息。

自设例子:如果两家公司面对同一轮利率变化,甲的融资成本上升、乙的利息收入改善,那么“买哪个”可能比“整个市场涨不涨”更值得建模。具体方向仍须由信息和数据共同验证。

原文证据

原文实际报告了什么

作者用 28 个宏观因子、32 个隐藏单元,为 22 只美股同时生成信号。季度方向准确率约 51%,相对价值策略 Sharpe 0.4—0.6,未计交易成本。股票需自 1992 年持续交易,且按当前市值筛选,需注意幸存者与事后选样。

原文位置:A recap of macro factors and stock selection;Sequential signal generation;Predictive power and value generation
编辑理解

为什么值得讨论,哪里不能外推

对量化研究员而言,这篇最好的切入点不是增加网络层数,而是检验共享学习是否优于简单基线。可先比较行业暴露模型、线性个股敏感度和小网络;三者使用同一股票池和相同交易时点。只有当非线性模型在未参与选择的阶段贡献增量,才有理由支付额外复杂度。

长期连续交易与当前市值筛样,不能代表一个真正逐时点变化的全股票池。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-252026-01-24待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
网络输入 / 股票28 / 22有限因子与小股票池的实验,不是全市场测试。
季度方向准确率约 51%弱信号也值得研究,但不是高命中率选股器。
相对策略 Sharpe0.4—0.6作者未计成本的结果,不是净收益保证。

原文位置:A recap of macro factors and stock selection;Sequential signal generation;Predictive power and value generation

推荐 77/100 · 问题 27/30 · 证据 20/30 · 方法 23/25 · 复现 7/15

从宏观到个股的建模启发明确;22 只股票与事后筛样、未计成本削弱外推证据,商业数据限制复现。

尚未执行的实验思路

若迁移到 A 股,首先重建动态股票池与信息时点,再讨论网络结构。

返回全年目录 ↑

Quantocracy / 导读完成

价值投资失灵了吗?先分清估值贵、公司好与股价还能涨

Is Value Investing Dead?

Jose Ordonez;访谈对象 Tobias Carlisle

这篇为价值投资辩护,但没有给出价值风格何时反转的可检验时点。适合校正概念,不应直接转成加仓信号。

2 分钟看懂

一家公司的业务持续增长,为什么买入其股票仍可能赚不到钱?

股票价格已经包含了市场对增长的预期。财务增长快只说明公司做得好;要取得超额收益,还要比买入价格隐含的预期更好。价值风格讨论的是价格相对基本面的关系,不是简单购买差公司。

编辑自设例子,非作者实验

编辑自设:一家公司利润从 10 增长到 15,但估值从 40 倍降到 20 倍。忽略分红,市值从 400 降到 300,利润增长 50%,投资者却亏 25%。这只是算术示例,不是原文个股案例。

  1. 把基本面增长和估值变动拆开
  2. 检验价值组合是否混入小盘暴露
  3. 区分长期解释与短期入场条件
关键结果与解释边界
核对项结果意味着什么
文章性质访谈观点不能当作新发表的价值因子实证。
核心区分好公司 ≠ 好买价是分析框架,不是反转预测。
交易阈值NOT_FOUND没有由本文验证的估值差买入阈值或持有期限。

不能推出什么

历史类比没有识别技术革命的独立因果作用。估值便宜可能持续很久,本文没有证明一个可以交易的反转时钟。

研究用途

把现有价值策略的收益分成市场、规模、行业、盈利质量与估值暴露贡献;优先解释组合究竟押了什么。

详细讲解

编辑理解

一家公司的业务持续增长,为什么买入其股票仍可能赚不到钱?

股票价格已经包含了市场对增长的预期。财务增长快只说明公司做得好;要取得超额收益,还要比买入价格隐含的预期更好。价值风格讨论的是价格相对基本面的关系,不是简单购买差公司。

编辑自设:一家公司利润从 10 增长到 15,但估值从 40 倍降到 20 倍。忽略分红,市值从 400 降到 300,利润增长 50%,投资者却亏 25%。这只是算术示例,不是原文个股案例。

原文证据

原文实际报告了什么

文章整理 Carlisle 的观点:价值表现受估值差、大小盘环境及技术革命影响;企业经营成功与股票投资回报并非同一件事。它以估值变化和历史案例支持讨论,不是新增一项有完整交易规则的回测。

原文位置:正文关于估值差、技术革命与企业成功/投资回报的三个讨论段
编辑理解

为什么值得讨论,哪里不能外推

对量化研究最有用的追问是:价值因子的弱势究竟来自价值本身,还是同时持有了小盘、低盈利或行业偏离?我的建议是先看暴露分解,再讨论“时代变了”。另一个容易忽略的问题是估值均值可能改变:盈利质量、无形资产计量和行业构成都可能影响历史可比性,不能只看到价差大就断言一定收敛。

历史类比没有识别技术革命的独立因果作用。估值便宜可能持续很久,本文没有证明一个可以交易的反转时钟。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-252026-01-23待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
文章性质访谈观点不能当作新发表的价值因子实证。
核心区分好公司 ≠ 好买价是分析框架,不是反转预测。
交易阈值NOT_FOUND没有由本文验证的估值差买入阈值或持有期限。

原文位置:正文关于估值差、技术革命与企业成功/投资回报的三个讨论段

推荐 63/100 · 问题 24/30 · 证据 13/30 · 方法 20/25 · 复现 6/15

概念澄清有价值;访谈证据有限,没有新样本外检验或完整实现规则。

尚未执行的实验思路

把现有价值策略的收益分成市场、规模、行业、盈利质量与估值暴露贡献;优先解释组合究竟押了什么。

返回全年目录 ↑

Quantocracy / 导读完成

黄金上涨还不够:为什么再看一眼美债动量?

Gold Cross-Asset Momentum

Allocate Smartly

额外的美债条件会删掉一部分黄金多头月份。重点不是规则更复杂,而是这些被删掉的月份是否真的不值得持有。

2 分钟看懂

黄金本身已经在上涨,再增加美债上涨条件,究竟增加了什么信息?

单资产规则只问黄金有没有趋势;双资产规则还问这个趋势是否处于与债券上涨相容的环境。但债券总收益不是实际利率本身,不能把一个便于计算的价格变量当成宏观原因的直接测量。

编辑自设例子,非作者实验

编辑自设:月末黄金过去一年涨 8%,美债跌 2%。只看黄金的规则下月继续持有,双信号规则转为现金。如果后来黄金继续涨,过滤器就丢掉收益;如果黄金回撤,过滤器才发挥保护作用。每多一道条件,都同时增加避错与错过的机会。

  1. 月末计算两项 12 个月总收益
  2. 两项均严格为正才配置黄金
  3. 否则持有现金
  4. 单独检验被排除月份的机会成本
关键结果与解释边界
核对项结果意味着什么
信号窗口12 个月每月更新,不是每 12 个月才调仓。
额外剔除77 / 405 个月约 19%;分母是黄金单信号允许持有的月份。
较近时期优势减弱长期统计不能直接代表最近环境。

不能推出什么

长期历史使用 ETF 出现前的替代数据。网站称结果扣除交易成本,但本站未逐笔复核其实现;月末信号与成交同一时点的可执行性也须另验。

研究用途

先与原研究对照规则和现金口径;若开展后续复现,将黄金单信号、双信号和等平均风险基准并列,不只比较买入持有。

详细讲解

编辑理解

黄金本身已经在上涨,再增加美债上涨条件,究竟增加了什么信息?

单资产规则只问黄金有没有趋势;双资产规则还问这个趋势是否处于与债券上涨相容的环境。但债券总收益不是实际利率本身,不能把一个便于计算的价格变量当成宏观原因的直接测量。

编辑自设:月末黄金过去一年涨 8%,美债跌 2%。只看黄金的规则下月继续持有,双信号规则转为现金。如果后来黄金继续涨,过滤器就丢掉收益;如果黄金回撤,过滤器才发挥保护作用。每多一道条件,都同时增加避错与错过的机会。

原文证据

原文实际报告了什么

Allocate Smartly 复核 Quantpedia 的黄金跨资产动量:月末观察 GLD 与 IEF 的过去 12 个月总收益,两者都大于零才持有 GLD,否则持有现金。文中称美债条件剔除了黄金自身动量为正时的 405 个月中的 77 个月,长期比较的优势在较近时期减弱。

原文位置:Trading rules;黄金单信号对照;2002 年前后讨论
编辑理解

为什么值得讨论,哪里不能外推

我的阅读重点是三个不同收益口径:持有黄金月份的收益、包含现金月份的组合收益,以及相同平均黄金风险暴露的对照。只看第一项,很容易夸大选时效果。现金收益较高时,空仓策略可能仅靠现金利息改善表现。对组合已有黄金配置的团队,真正的问题是替换后能否增加整体分散化,而非这条曲线单独是否漂亮。

长期历史使用 ETF 出现前的替代数据。网站称结果扣除交易成本,但本站未逐笔复核其实现;月末信号与成交同一时点的可执行性也须另验。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-202026-01-20待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
信号窗口12 个月每月更新,不是每 12 个月才调仓。
额外剔除77 / 405 个月约 19%;分母是黄金单信号允许持有的月份。
较近时期优势减弱长期统计不能直接代表最近环境。

原文位置:Trading rules;黄金单信号对照;2002 年前后讨论

推荐 81/100 · 问题 25/30 · 证据 22/30 · 方法 22/25 · 复现 12/15

规则清楚且讨论效果衰减;历史数据和成本尚未独立核对,不能据此确认实盘优势。

尚未执行的实验思路

先与原研究对照规则和现金口径;若开展后续复现,将黄金单信号、双信号和等平均风险基准并列,不只比较买入持有。

返回全年目录 ↑

Quantocracy / 导读完成

组合年化从 19.1% 到 23.1%:增益来自优化,还是先找到了互补策略?

Portfolio Optimization

Quantitativo

本文优化的是美、加、澳三个策略的权重,不是让模型直接挑个股。分散化已经贡献了大部分改善,优化带来的 Sharpe 增量相对有限。

2 分钟看懂

手里已经有三个赚钱方式相近、但收益相关性不高的策略,要平均分资金还是估计最优权重?

等权只要求相信三种策略都有长期价值;均值方差优化还要求历史收益、波动与相关性能预测下一年的相对表现。它不是免费升级,而是加入估计误差。

编辑自设例子,非作者实验

编辑自设:甲乙预期收益都为 10%,但过去一段时间甲偶然多赚了 3%。优化器若把这当永久优势,就可能把甲加到上限。权重看似精确,依据却可能只是噪声。0–60% 的约束作用是防止估计误差把资金推到单一策略。

  1. 各市场分别运行股票均值回归策略
  2. 取得三条策略日收益
  3. 年末用过去四年估计参数
  4. 在权重约束内优化并持有下一年
  5. 对照同样年度再平衡的等权组合
关键结果与解释边界
核对项结果意味着什么
CAGR19.1% → 23.1%作者的策略组合比较,不是本站个股回测。
Sharpe1.66 → 1.76收益提升同时伴随波动变化,风险调整改善仅 0.10。
最大回撤-21.4% → -20.7%回撤改善很小,不能概括为全面降风险。

不能推出什么

2010 起点和三个市场/策略的选择都有研究自由度。本文引言提到的生成式模型论文不是后续这个均值方差实验;成本及完整股票池时点信息仍需核对。

研究用途

后续研究先比较等权、等风险和受约束均值方差;保存每年的事前权重及估计误差,不将多个策略的结果误写成个股优化效果。

详细讲解

编辑理解

手里已经有三个赚钱方式相近、但收益相关性不高的策略,要平均分资金还是估计最优权重?

等权只要求相信三种策略都有长期价值;均值方差优化还要求历史收益、波动与相关性能预测下一年的相对表现。它不是免费升级,而是加入估计误差。

编辑自设:甲乙预期收益都为 10%,但过去一段时间甲偶然多赚了 3%。优化器若把这当永久优势,就可能把甲加到上限。权重看似精确,依据却可能只是噪声。0–60% 的约束作用是防止估计误差把资金推到单一策略。

原文证据

原文实际报告了什么

作者对三个市场的股票均值回归策略做组合。2010–2026 的等权组合报告 CAGR 19.1%、Sharpe 1.66、最大回撤 -21.4%;每年用此前四年日收益估计均值方差、单策略权重限制为 0–60% 的版本,分别为 23.1%、1.76、-20.7%。

原文位置:The portfolio;Mean-variance optimization;两组组合绩效图和比较段落
编辑理解

为什么值得讨论,哪里不能外推

这篇最值得学的是先找低相关收益来源,再谈权重。我的理解是,研究员常把精力放在最后一层优化器,却没有问输入的策略是否足够不同。还要警惕收益均值的误差通常比协方差更难处理:如果稍微移动起始日期,最优权重就剧烈变化,漂亮的历史组合未必可持有。作者采用四年估计窗只是本文设定,不是本站建议的通用参数。

2010 起点和三个市场/策略的选择都有研究自由度。本文引言提到的生成式模型论文不是后续这个均值方差实验;成本及完整股票池时点信息仍需核对。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-202026-01-20待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
CAGR19.1% → 23.1%作者的策略组合比较,不是本站个股回测。
Sharpe1.66 → 1.76收益提升同时伴随波动变化,风险调整改善仅 0.10。
最大回撤-21.4% → -20.7%回撤改善很小,不能概括为全面降风险。

原文位置:The portfolio;Mean-variance optimization;两组组合绩效图和比较段落

推荐 80/100 · 问题 27/30 · 证据 20/30 · 方法 22/25 · 复现 11/15

有清楚对照和实施约束;选样、成本及数据时点未完整独立验证,优化增量需稳健性检验。

尚未执行的实验思路

后续研究先比较等权、等风险和受约束均值方差;保存每年的事前权重及估计误差,不将多个策略的结果误写成个股优化效果。

返回全年目录 ↑

Quantocracy / 导读完成

LLM 把新闻读快了,但更快读懂不等于净收益更高

AI is no longer an experimental “tool” in finance

Tommi Johnsen、Svetlana Shasharina

文章适合建立 AI 文本研究的地图,不适合用来背书一个高收益策略。信息处理、预测能力与可成交利润是三个不同环节。

2 分钟看懂

如果所有团队都能低成本读完新闻,优势会留在模型里,还是转移到别处?

从文章到收益至少经过:拿到数据、辨别信息增量、形成预测、成交、承担风险。模型改进只作用于其中一部分。准确抽取公开消息,也可能在价格已经反映消息后才完成。

编辑自设例子,非作者实验

编辑自设:两套模型识别同一利好,甲用 1 秒,乙用 30 秒。如果价格在前 2 秒已经跳涨,乙的分类完全正确也未必有交易价值。反过来,低频基本面研究未必需要秒级速度,它更关心这条信息是否改变数月的盈利判断。

  1. 确定新闻首次可得时间
  2. 区分信息抽取与收益预测
  3. 计入处理和成交延迟
  4. 比较成本后收益
  5. 检查不同模型是否拥挤于相同标的
关键结果与解释边界
核对项结果意味着什么
本文材料综述性评论引用别人的回测不构成作者的新验证。
关键区分更快 ≠ 更正确微观报价效率与长期基本面定价不能混为一谈。
可复现持仓NOT_FOUND本篇未提供完整交易记录,不据二手收益数字评高分。

不能推出什么

引用研究未在本条逐篇核验,因此不沿用其中醒目的年化收益作为推荐依据。AI 是否必然增强市场脆弱性仍需独立证据。

研究用途

给新闻模型写清楚任务边界:检索、归因、预测还是执行辅助,并为不同任务设置不同验收指标。

详细讲解

编辑理解

如果所有团队都能低成本读完新闻,优势会留在模型里,还是转移到别处?

从文章到收益至少经过:拿到数据、辨别信息增量、形成预测、成交、承担风险。模型改进只作用于其中一部分。准确抽取公开消息,也可能在价格已经反映消息后才完成。

编辑自设:两套模型识别同一利好,甲用 1 秒,乙用 30 秒。如果价格在前 2 秒已经跳涨,乙的分类完全正确也未必有交易价值。反过来,低频基本面研究未必需要秒级速度,它更关心这条信息是否改变数月的盈利判断。

原文证据

原文实际报告了什么

作者讨论 LLM 对公司新闻、市场信息处理速度及策略拥挤的影响,并引用其他研究的收益和短暂预测效果。本文不是自己新增的完整实验,没有给出可直接复核的新闻时间戳、组合持仓与成交数据。

原文位置:Stock-by-stock sentiment;The main issues AI raises for market efficiency;结尾
编辑理解

为什么值得讨论,哪里不能外推

我更愿意把它读成研究流程的提醒:先定义模型究竟替代哪项人工工作,再选择指标。如果替代新闻初筛,衡量漏报、错报与人工节省时间;如果要直接交易,就必须看延迟后的收益衰减和可成交规模。把这两种目标放在同一张“AI 有效”图里,很容易把生产力收益误认成投资 alpha。

引用研究未在本条逐篇核验,因此不沿用其中醒目的年化收益作为推荐依据。AI 是否必然增强市场脆弱性仍需独立证据。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-202026-01-20待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
本文材料综述性评论引用别人的回测不构成作者的新验证。
关键区分更快 ≠ 更正确微观报价效率与长期基本面定价不能混为一谈。
可复现持仓NOT_FOUND本篇未提供完整交易记录,不据二手收益数字评高分。

原文位置:Stock-by-stock sentiment;The main issues AI raises for market efficiency;结尾

推荐 53/100 · 问题 23/30 · 证据 10/30 · 方法 16/25 · 复现 4/15

问题框架有启发;主要是二手综述,没有本篇可审计的实验与交易实施。

尚未执行的实验思路

给新闻模型写清楚任务边界:检索、归因、预测还是执行辅助,并为不同任务设置不同验收指标。

返回全年目录 ↑

Quantocracy / 导读完成

新闻语气为负,不等于这家公司遇到了坏消息

What Investors Should Know About Common Sentiment Models: Tone Isn’t Attribution

Tommi Johnsen、Svetlana Shasharina

做股票情绪因子,先确认情绪指向哪家公司,再判断正负。本文的小实验揭示一个接口错配,但没有证明哪种模型能赚取超额收益。

2 分钟看懂

一篇文章整体悲观,为什么给其中提到的股票打负分可能是错的?

普通情绪分类回答“这段文字语气如何”。投资者需要回答“哪条信息改变了哪家公司的经营预期”。这多了一步归因:对象、事件、影响方向,不能把全文平均情绪直接贴到每个 ticker。

编辑自设例子,非作者实验

编辑自设:报道说原材料价格大跌,上游企业承压,下游企业利润改善。若全文打一个负分,再同时分给两家公司,就会把相反的经济影响揉成同一个信号。目标感知不是加一句“请专业分析”,而是要求每个判断对应公司和证据句。

  1. 给定目标公司
  2. 找出与该公司有关的事件和证据句
  3. 隔离无关内容
  4. 判定影响方向
  5. 再评估新闻信号与收益的关系
关键结果与解释边界
核对项结果意味着什么
测试规模9 篇合成文本是诊断案例,不能估计全市场错误率。
模型数量4 个模型任务和标签体系不同,横向排名需谨慎。
可交易收益未测试识别归因错误不等于证明 LLM 修正后有 alpha。

不能推出什么

样本小且刻意构造;没有真实新闻样本外测试、收益检验或目标感知 LLM 的直接对照。作者对全部情绪模型的概括比这个实验能支持的范围更大。

研究用途

先做小型人工标注的公司—证据句—影响方向测试集,比较全文分类、相关句分类、目标感知 LLM;分类误差与策略收益分开评估。

详细讲解

编辑理解

一篇文章整体悲观,为什么给其中提到的股票打负分可能是错的?

普通情绪分类回答“这段文字语气如何”。投资者需要回答“哪条信息改变了哪家公司的经营预期”。这多了一步归因:对象、事件、影响方向,不能把全文平均情绪直接贴到每个 ticker。

编辑自设:报道说原材料价格大跌,上游企业承压,下游企业利润改善。若全文打一个负分,再同时分给两家公司,就会把相反的经济影响揉成同一个信号。目标感知不是加一句“请专业分析”,而是要求每个判断对应公司和证据句。

原文证据

原文实际报告了什么

作者构造 9 篇合成文本,把 NVIDIA 的正/中/负财务信息与不相关的正/中/负情绪段落组合,测试 FinBERT、Twitter-RoBERTa、SieBERT 和 NLPTown。作者报告:无关情绪会干扰目标公司的分类,尤其在财务信息中性时。样本是人工压力测试,不是真实新闻收益回测。

原文位置:Experiment Setup;Models Tested;Conclusions(结果表未逐格审计)
编辑理解

为什么值得讨论,哪里不能外推

我的判断是这篇的问题价值高于实验强度。它能说明现有流水线可能把任务交错了,却不足以证明通用模型都不会归因,更不能证明必须使用大模型。更便宜的实体识别加相关句筛选,应当是必要基线。测试还应加入一条信息同时影响竞争者的真实情境,因为“无关旅游段落”容易暴露极端问题,却不代表日常新闻分布。

样本小且刻意构造;没有真实新闻样本外测试、收益检验或目标感知 LLM 的直接对照。作者对全部情绪模型的概括比这个实验能支持的范围更大。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-192026-01-14待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
测试规模9 篇合成文本是诊断案例,不能估计全市场错误率。
模型数量4 个模型任务和标签体系不同,横向排名需谨慎。
可交易收益未测试识别归因错误不等于证明 LLM 修正后有 alpha。

原文位置:Experiment Setup;Models Tested;Conclusions(结果表未逐格审计)

推荐 74/100 · 问题 29/30 · 证据 14/30 · 方法 20/25 · 复现 11/15

直接击中新闻因子的归因风险;仅 9 个合成案例、没有策略对照,证据分受限。

尚未执行的实验思路

先做小型人工标注的公司—证据句—影响方向测试集,比较全文分类、相关句分类、目标感知 LLM;分类误差与策略收益分开评估。

返回全年目录 ↑

Quantocracy / 导读完成

指数头部权重很高,为什么仍不构成减仓信号?

The Fallacy of Concentration Risk

Mark Kritzman、David Turkington;Quantpedia 导读

集中度描述今天持仓长什么样,不自动告诉你明天收益如何。本文导读挑战的是用集中度择时,不是说集中持仓没有风险。

2 分钟看懂

头部公司占指数一大半,是风险测量问题,还是一个能赚钱的择时信号?

要把状态指标变成交易信号,需要证明它对未来有增量预测作用。即使一个组合更依赖少数公司,也不意味着当前价格没有补偿这种风险,或者你能判断风险何时兑现。

编辑自设例子,非作者实验

编辑自设:10 只等权股票的有效数量为 1/Σw²=10;若一只占 50%,另外九只均分剩余,有效数量约 3.6。它直观反映权重不均,但没有用到股票之间的相关性:十只同产业股票也可能同时受一个冲击影响。

  1. 计算权重集中程度
  2. 明确预测的是未来收益还是未来风险
  3. 与相同风险暴露基准比较
  4. 再决定是否有交易价值
关键结果与解释边界
核对项结果意味着什么
集中指标有效股票数量权重分散程度,不等于独立风险源数量。
择时对照相同事后平均股票暴露用于区分减仓本身与择时的效果;不是可事前知道的配置。
本站证据层级已读导读,未审论文全文原论文链接保留,不把转述升级为独立全文核查。

不能推出什么

本条仅核对 Quantpedia 正文及其研究引用,未获得并审计底层回归和原始数据。理论均衡论证不能替代实证的统计功效。

研究用途

在风险报告中分开写“集中度状态”和“预期收益判断”;没有独立预测证据时,不让前者自动触发整体减仓。

详细讲解

编辑理解

头部公司占指数一大半,是风险测量问题,还是一个能赚钱的择时信号?

要把状态指标变成交易信号,需要证明它对未来有增量预测作用。即使一个组合更依赖少数公司,也不意味着当前价格没有补偿这种风险,或者你能判断风险何时兑现。

编辑自设:10 只等权股票的有效数量为 1/Σw²=10;若一只占 50%,另外九只均分剩余,有效数量约 3.6。它直观反映权重不均,但没有用到股票之间的相关性:十只同产业股票也可能同时受一个冲击影响。

原文证据

原文实际报告了什么

Quantpedia 介绍 The Fallacy of Concentration:研究用有效股票数量衡量集中程度,并检验未来收益和风险。导读称集中度的预测贡献很小;按集中度减持股票的规则,弱于具有相同事后平均股票暴露的买入持有对照。

原文位置:Quantpedia 开头的结果综述;所引研究 Exhibits 4–6;SSRN 原地址
编辑理解

为什么值得讨论,哪里不能外推

我的判断是不要把“未发现预测力”读成“风险不存在”。组合经理仍然可以为了单名风险预算而限制权重,这与预测指数要跌是不同目标。还需要问集中于谁:同样的集中指标可能对应不同盈利质量、业务相关性与估值水平。一个单变量没有预测力,不能排除条件关系,也不能支持当前市场必然安全。

本条仅核对 Quantpedia 正文及其研究引用,未获得并审计底层回归和原始数据。理论均衡论证不能替代实证的统计功效。

核查记录

导读完成:已核 Quantpedia 网页;底层 SSRN 论文全文及回归尚未审计。

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-192026-01-19待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
集中指标有效股票数量权重分散程度,不等于独立风险源数量。
择时对照相同事后平均股票暴露用于区分减仓本身与择时的效果;不是可事前知道的配置。
本站证据层级已读导读,未审论文全文原论文链接保留,不把转述升级为独立全文核查。

原文位置:Quantpedia 开头的结果综述;所引研究 Exhibits 4–6;SSRN 原地址

推荐 69/100 · 问题 27/30 · 证据 15/30 · 方法 21/25 · 复现 6/15

问题和对照有价值;当前只完成导读层核验,原论文表格与数据尚待审读。

尚未执行的实验思路

在风险报告中分开写“集中度状态”和“预期收益判断”;没有独立预测证据时,不让前者自动触发整体减仓。

返回全年目录 ↑

Quantocracy / 导读完成

让 LLM 给动量候选股做新闻复核:有改善,但还不是稳固的 alpha 证据

Can AI Read the News Better Than You? How ChatGPT Could Transform Momentum Investing

Nikolas Anic、Andrea Barbon、Ralf Seiz、Carlo Zarattini

LLM 在这里不是从零选股,而是在动量候选中重排和调整权重。测试期改善值得关注,但短样本、参数筛选和模型时点仍限制结论。

2 分钟看懂

两只股票过去都涨得很好,能否用最新公司新闻判断哪一只更值得继续持有?

基线是 S&P 500 范围内的做多动量,不是市场指数择时。新闻模型只在强势股票里做第二轮判断。因此超越这个基准,最多说明新闻层可能有增量,不能说明 LLM 可以独立替代整个选股系统。

编辑自设例子,非作者实验

编辑自设:甲乙基础权重相同,LLM 原始分为 0.8 和 0.6;若线性转成 -1 到 1,则分别为 0.6 和 0.2。用论文的指数倾斜形式、倍率 5,未归一化权重比为 5^(0.6−0.2)≈1.90。不是给甲配 80%、乙配 60%;最后还需归一化与约束。这里只演示两股算术,不是论文持仓。

  1. 过去 12 个月收益跳过最近月,取前两成候选
  2. 读截至调仓前的公司新闻标题与摘要
  3. LLM 评分并重排候选
  4. 选择 50 只,以市值权重乘以 5 的标准化分数次方
  5. 归一化、约束并按月再平衡
关键结果与解释边界
核对项结果意味着什么
测试期15 个月 / 312 日来自 Table 1;不能把 312 日看成 312 个独立市场环境。
样本外 Sharpe0.79 → 1.06Table 3,含论文假设的 2bp 成本,未计本站实际执行。
相对基准 alpha3.26% / 10% 显著水平§3.3:正向但统计证据较弱,不是确定的超额收益。

不能推出什么

正文写周/月调仓,Table 2 的候选却写 Day/Month;方法新闻截止时间与提示示例也不完全相同,复现前须澄清。原文没有足够细节让本站确认数据与 API 的全部时点一致;不得把模型分数视为校准概率。独立数据和代码未运行。

研究用途

复现设计应增加同样持股数/权重约束的无 LLM 对照、打乱新闻对照,以及仅新闻数量或简单情绪基线;记录所有提示和模型版本。本文推荐的是研究设计,不是直接交易。

详细讲解

编辑理解

两只股票过去都涨得很好,能否用最新公司新闻判断哪一只更值得继续持有?

基线是 S&P 500 范围内的做多动量,不是市场指数择时。新闻模型只在强势股票里做第二轮判断。因此超越这个基准,最多说明新闻层可能有增量,不能说明 LLM 可以独立替代整个选股系统。

编辑自设:甲乙基础权重相同,LLM 原始分为 0.8 和 0.6;若线性转成 -1 到 1,则分别为 0.6 和 0.2。用论文的指数倾斜形式、倍率 5,未归一化权重比为 5^(0.6−0.2)≈1.90。不是给甲配 80%、乙配 60%;最后还需归一化与约束。这里只演示两股算术,不是论文持仓。

原文证据

原文实际报告了什么

原论文 v1 的 Table 3 报告,2024-01 至 2025-03 测试期 Sharpe 为 0.79→1.06、年化收益 24%→30%、最大回撤 -19%→-17%,假设每笔交易成本 2bp。正文另报相对基准年化 alpha 3.26%,仅在 10% 水平显著。参数由 2019-10 至 2023-12 期间的 512 组候选选出。

原文位置:原论文 §2.1–2.4;Table 1–3;§3.3 的 alpha 段;§4 限制
编辑理解

为什么值得讨论,哪里不能外推

值得肯定的是它有明确的传统信号基线,也没有把模型吐出的概率直接当持仓比例。但我会优先做三个区分。第一,改善来自删除股票还是改变权重?两步需要单独对照,否则难以知道哪一步有效。第二,LLM 分数是否只是新闻多、规模大或科技行业的代理?需要控制这些暴露。第三,测试期是事后用固定模型处理历史文本,不等于当时已真实运行。原文以训练截止日宣称完全无泄漏过强;仍须核对准确模型快照、调用日期、新闻修订与成分股时点。

正文写周/月调仓,Table 2 的候选却写 Day/Month;方法新闻截止时间与提示示例也不完全相同,复现前须澄清。原文没有足够细节让本站确认数据与 API 的全部时点一致;不得把模型分数视为校准概率。独立数据和代码未运行。

核查记录

已读 arXiv v1 方法、结果表及限制;保持导读完成,未逐图审计、取得原始数据或独立运行。

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-192026-01-162025-10-30待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
测试期15 个月 / 312 日来自 Table 1;不能把 312 日看成 312 个独立市场环境。
样本外 Sharpe0.79 → 1.06Table 3,含论文假设的 2bp 成本,未计本站实际执行。
相对基准 alpha3.26% / 10% 显著水平§3.3:正向但统计证据较弱,不是确定的超额收益。

原文位置:原论文 §2.1–2.4;Table 1–3;§3.3 的 alpha 段;§4 限制

推荐 81/100 · 问题 29/30 · 证据 20/30 · 方法 23/25 · 复现 9/15

有原论文、明确对照和独立时间段;短测试期、弱显著 alpha、内部数据和实现歧义限制了证据与复现分。

尚未执行的实验思路

复现设计应增加同样持股数/权重约束的无 LLM 对照、打乱新闻对照,以及仅新闻数量或简单情绪基线;记录所有提示和模型版本。本文推荐的是研究设计,不是直接交易。

返回全年目录 ↑

Quantocracy / 导读完成

策略该上观察名单了吗?这里的阈值是 Q1 − 1.5 × IQR

New Feature: The Underperformer Watchlist

Allocate Smartly

这不是挑近期最差策略,而是找出明显偏离自身历史预期的策略。进入名单代表需要调查,不等于策略死亡,也不是抄底信号。

2 分钟看懂

两个策略最近都亏 10%,为什么只有其中一个需要报警?

波动很大的策略亏 10% 可能正常,平时很平稳的策略同样亏损却可能异常。比较对象应当是它自己事前的合理范围,而不是只按近期收益排倒数。

编辑自设例子,非作者实验

编辑自设:若历史相同口径收益的 Q1 为 2%、Q3 为 10%,IQR=8 个百分点,则进入阈值为 2%−1.5×8%=-10%。当前收益 -12% 会报警,恢复到 -5% 仍未达到 2% 的退出门槛。这种进出门槛不同的设计,减少边缘附近反复切换;数字不是原文某策略数据。

  1. 分别计算多个 n 月收益
  2. 用 n 个月前的信息形成历史分布门槛
  3. 低于 Q1−1.5×IQR 进入观察
  4. 检查数据、暴露与过拟合原因
  5. 超过 Q1 才解除对应警报
关键结果与解释边界
核对项结果意味着什么
进入门槛Q1 − 1.5 × IQRIQR=Q3−Q1;不是亏损达到固定百分比。
窗口12 / 18 / 24 / 30 / 36 月是原作者监控窗口,不是本站重新优化出来的值。
退出门槛Q1与进入不同;报警不等于自动清仓。

不能推出什么

公开说明没有给出这套名单改善未来净收益的充分对照,也未完整公开历史分布估计的全部实现细节。有限样本下分位数本身也不稳定。

研究用途

将报警、调查结论与后续表现留档;在当前样本足够的窗口上做监控,不为了照搬所有窗口而拼接不可靠的历史。

详细讲解

编辑理解

两个策略最近都亏 10%,为什么只有其中一个需要报警?

波动很大的策略亏 10% 可能正常,平时很平稳的策略同样亏损却可能异常。比较对象应当是它自己事前的合理范围,而不是只按近期收益排倒数。

编辑自设:若历史相同口径收益的 Q1 为 2%、Q3 为 10%,IQR=8 个百分点,则进入阈值为 2%−1.5×8%=-10%。当前收益 -12% 会报警,恢复到 -5% 仍未达到 2% 的退出门槛。这种进出门槛不同的设计,减少边缘附近反复切换;数字不是原文某策略数据。

原文证据

原文实际报告了什么

网站使用 12、18、24、30、36 个月滚动收益,分别考察绝对收益及相对策略专属基准的收益。当前 n 月收益低于 n 个月前测得的 Q1−1.5×IQR 时标记,恢复超过当时对应的 Q1 门槛才移出;基准按截至当时的平均资产配置构建。

原文位置:The math for the nerds;How we would use the Underperformer Watchlist
编辑理解

为什么值得讨论,哪里不能外推

这篇的实用价值在于把“看起来不对”变成可记录的规则,但 1.5 倍四分位距是异常值经验门槛,不是失效概率 95% 的同义词。同时监控多个窗口和多个策略,会增加报警机会;滚动收益还高度重叠。我的建议是把名单当人工调查队列,另行验证整套监控政策的误报、漏报和交易代价,而不是把统计警报直接接到清仓按钮。

公开说明没有给出这套名单改善未来净收益的充分对照,也未完整公开历史分布估计的全部实现细节。有限样本下分位数本身也不稳定。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-162026-01-15待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
进入门槛Q1 − 1.5 × IQRIQR=Q3−Q1;不是亏损达到固定百分比。
窗口12 / 18 / 24 / 30 / 36 月是原作者监控窗口,不是本站重新优化出来的值。
退出门槛Q1与进入不同;报警不等于自动清仓。

原文位置:The math for the nerds;How we would use the Underperformer Watchlist

推荐 80/100 · 问题 28/30 · 证据 19/30 · 方法 23/25 · 复现 10/15

阈值和进出规则清楚;监控政策的样本外经济价值、误报率与实现细节仍待验证。

尚未执行的实验思路

将报警、调查结论与后续表现留档;在当前样本足够的窗口上做监控,不为了照搬所有窗口而拼接不可靠的历史。

返回全年目录 ↑

Quantocracy / 导读完成

Delta 对冲用隐波还是历史波动?先别把“已知未来波动”偷换成历史估计

Implied vs. Realized Volatility in Delta Hedging Strategies

Relative Value Arbitrage / Harbourfront

理论上已知未来实际波动,和实盘用过去波动去预测,是两个不同问题。对冲输入的优劣取决于评价到期收益、期间净值还是成本后误差。

2 分钟看懂

用市场隐含波动计算 Delta,和用自己预测的波动计算 Delta,分别在对冲什么风险?

Delta 是价格对标的变化的一阶敏感度,它取决于定价输入。实际交易还面临离散调仓、跳跃、价差和波动曲面变化,所以“模型中的对冲”不等于“实盘消除了风险”。

编辑自设例子,非作者实验

编辑自设:你预测未来波动 15%,市场隐波 25%,于是想赚取波动差。若未来跳跃导致实际波动 35%,历史估计并没有任何保证。即使最终实际波动较低,有限频率对冲和交易成本也可能吃掉价差;预测方向正确不等于每条路径都赚钱。

  1. 区分隐波、历史估计与未来实际波动
  2. 明确关注到期还是期间损益
  3. 固定对冲频率与成交成本
  4. 在相同持仓上比较误差与尾部风险
关键结果与解释边界
核对项结果意味着什么
理论输入未来实际波动已知这是理想化前提,不能用历史样本估计冒充。
实证对象QQQ 期权导读中的短样本,不是所有期权市场。
通用最优频率未由本文给出波动输入与对冲频率需要分开检验。

不能推出什么

本条仅核读导读,未完整审读其两篇底层论文;没有复核短样本期权报价、成本与对冲计算。不延伸至本项目排除的转债。

研究用途

后续若研究对冲,采用同样初始期权头寸和调仓时点,只替换波动输入,并分别报告成本、均方误差与尾部损失。

详细讲解

编辑理解

用市场隐含波动计算 Delta,和用自己预测的波动计算 Delta,分别在对冲什么风险?

Delta 是价格对标的变化的一阶敏感度,它取决于定价输入。实际交易还面临离散调仓、跳跃、价差和波动曲面变化,所以“模型中的对冲”不等于“实盘消除了风险”。

编辑自设:你预测未来波动 15%,市场隐波 25%,于是想赚取波动差。若未来跳跃导致实际波动 35%,历史估计并没有任何保证。即使最终实际波动较低,有限频率对冲和交易成本也可能吃掉价差;预测方向正确不等于每条路径都赚钱。

原文证据

原文实际报告了什么

文章并列介绍 Ahmad 与 Wilmott 的 2005 年理论讨论,以及 Zhao 的 QQQ 期权短样本研究。前者在理想条件下比较已知实际波动与隐含波动对冲,后者比较历史估计与市场隐波;导读称后者的隐波对冲较平稳,但样本只有数月。

原文位置:Which Free Lunch Would You Like Today Sir?;Delta Hedging with Implied vs. Historical Volatility;References
编辑理解

为什么值得讨论,哪里不能外推

我的核心意见是别把这两篇研究合成一句“隐波永远更好”。理论结果依赖连续模型的假设;实证比较还取决于历史估计器、样本行情和交易口径。导读中的平滑或零方差措辞,不能延伸为真实市场无风险。对研究员最有用的是先定义损失函数:平均对冲误差小与极端误差小,也不是同一个目标。

本条仅核读导读,未完整审读其两篇底层论文;没有复核短样本期权报价、成本与对冲计算。不延伸至本项目排除的转债。

核查记录

导读完成:已读 Harbourfront;两篇底层论文与原始数据未完整核查。

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-162026-01-15待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
理论输入未来实际波动已知这是理想化前提,不能用历史样本估计冒充。
实证对象QQQ 期权导读中的短样本,不是所有期权市场。
通用最优频率未由本文给出波动输入与对冲频率需要分开检验。

原文位置:Which Free Lunch Would You Like Today Sir?;Delta Hedging with Implied vs. Historical Volatility;References

推荐 61/100 · 问题 25/30 · 证据 12/30 · 方法 19/25 · 复现 5/15

揭示重要输入差异;当前只有导读、理论与实证假设不可混用,数据与实现尚未核验。

尚未执行的实验思路

后续若研究对冲,采用同样初始期权头寸和调仓时点,只替换波动输入,并分别报告成本、均方误差与尾部损失。

返回全年目录 ↑

Quantocracy / 导读完成

策略亏了两年就该关掉吗?一个事后反弹不能给出答案

Much Ado About Variance

Kris Longmore

亏损可能只是噪声,但“只是噪声”也不能成为永不下线的借口。真正可复用的是事前制定监控规则,而不是在反弹后总结纪律。

2 分钟看懂

观察到亏损以后,怎么区分正常低谷和真实失效?

单看最近盈亏无法回答。还要知道策略原本有多吵、暴露是否变化、数据或执行是否出错,以及停止交易的代价。证明亏损不罕见,不等于证明策略仍有正期望。

编辑自设例子,非作者实验

编辑自设:在年度收益正态、均值和波动均为 10% 的简化模型下,负收益概率约 16%。但这是假设真实参数已知;实际研究中 Sharpe 本身要估计,收益还有相关性和厚尾。因此不能把 16% 直接当作自己策略的失效报警概率。

  1. 交易前写下可接受波动范围
  2. 亏损时先核对数据与执行
  3. 区分市场暴露变化与异常残差
  4. 用预先规定的规则决定降风险或继续
关键结果与解释边界
核对项结果意味着什么
历史量级Sharpe 约 1作者报告,不是已知不变的真实参数。
2025 假设继续交易约 15% / 1.8收益 / Sharpe;是作者的事后反事实,不是其实际持有收益。
停用阈值未给出通用值不能据此得出亏两年都应该坚持。

不能推出什么

单个策略的事后反弹不能证明坚持优于停用。因果机制没有被直接观测,本文也没有检验一套统一下线政策。

研究用途

建立异常处理表,分别记录数据质量、执行偏差、风险暴露和收益异常;每项对应事前处理规则。

详细讲解

编辑理解

观察到亏损以后,怎么区分正常低谷和真实失效?

单看最近盈亏无法回答。还要知道策略原本有多吵、暴露是否变化、数据或执行是否出错,以及停止交易的代价。证明亏损不罕见,不等于证明策略仍有正期望。

编辑自设:在年度收益正态、均值和波动均为 10% 的简化模型下,负收益概率约 16%。但这是假设真实参数已知;实际研究中 Sharpe 本身要估计,收益还有相关性和厚尾。因此不能把 16% 直接当作自己策略的失效报警概率。

原文证据

原文实际报告了什么

作者回顾暂停月末债券策略的决定,称该策略历史 Sharpe 约 1,2023 年后经历弱势;若 2025 年继续执行,扣成本收益约 15%、Sharpe 1.8。他以此提醒:为亏损寻找合理故事,可能导致把波动误判成失效。

原文位置:One Glaring Lesson;The Psychology of Abandoning a Sharpe 1 Strategy;预设期望段
编辑理解

为什么值得讨论,哪里不能外推

这篇有价值,因为作者承认叙事会随净值变化。但证据也有幸存者问题:我们听到的是后来反弹的策略,没看到同样坚持后继续亏损的全部案例。我的建议是把监控分为两类。数据错、信号错、成交错属于明确故障,可以立即处理;纯收益低于期望属于统计问题,需要结合不确定性和资金承受能力。不要把两类都归入“市场变了”。

单个策略的事后反弹不能证明坚持优于停用。因果机制没有被直接观测,本文也没有检验一套统一下线政策。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-112026-01-11待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
历史量级Sharpe 约 1作者报告,不是已知不变的真实参数。
2025 假设继续交易约 15% / 1.8收益 / Sharpe;是作者的事后反事实,不是其实际持有收益。
停用阈值未给出通用值不能据此得出亏两年都应该坚持。

原文位置:One Glaring Lesson;The Psychology of Abandoning a Sharpe 1 Strategy;预设期望段

推荐 71/100 · 问题 27/30 · 证据 16/30 · 方法 21/25 · 复现 7/15

对策略治理有用且坦诚;单案例、事后反事实与缺少统一策略对照限制了证据强度。

尚未执行的实验思路

建立异常处理表,分别记录数据质量、执行偏差、风险暴露和收益异常;每项对应事前处理规则。

返回全年目录 ↑

Quantocracy / 导读完成

相关矩阵有空白,为什么不能直接填零?

Completing a Correlation Matrix: Another Problem from Finance

Portfolio Optimizer

填零不是中立处理,而是额外假设。矩阵补全首先保证整体合法,再在可能的解中做选择;数学合法仍不等于未来预测正确。

2 分钟看懂

几个研究团队分别交来局部相关性,拼成一个大矩阵后为什么风险系统可能算不下去?

每个相关系数在 -1 到 1 之间还不够。整个矩阵必须半正定,意思是任何权重组合算出的方差都不能为负。各小块单独合理,合起来也可能不相容。

编辑自设例子,非作者实验

编辑自设:已知 Corr(A,B)=0.9,Corr(A,C)=0.9,未知 Corr(B,C)=x。三变量矩阵的非负行列式要求 x 在 0.62 到 1 之间。若填零,得到不合法矩阵;最大行列式选择 x=0.81。这是自设三变量算例,不是原文机构预测,也不说明未来相关性就等于 0.81。

  1. 统一资产、币种、期限与数据口径
  2. 标记已知值与缺失值
  3. 检验能否保留已知值并合法补全
  4. 必要时记录对原值的修正
  5. 对不同补全假设做风险敏感性比较
关键结果与解释边界
核对项结果意味着什么
基本约束对称、对角为 1、半正定单个系数不越界并不足够。
求解状态可能无解或多解不能强迫系统悄悄返回一个看似精确的结果。
补全含义条件性假设不是凭数学恢复从未观测到的真实市场数据。

不能推出什么

专有实现不是完整开源复现。最大行列式的统计解释依赖模型假设;财务尾部共同风险不能由相关矩阵完整表达。本站未调用 API 或运行作者算法。

研究用途

建立风险输入检查:缺失位置、最小特征值、原值改变量、下游权重敏感性。补全失败必须显式报告。

详细讲解

编辑理解

几个研究团队分别交来局部相关性,拼成一个大矩阵后为什么风险系统可能算不下去?

每个相关系数在 -1 到 1 之间还不够。整个矩阵必须半正定,意思是任何权重组合算出的方差都不能为负。各小块单独合理,合起来也可能不相容。

编辑自设:已知 Corr(A,B)=0.9,Corr(A,C)=0.9,未知 Corr(B,C)=x。三变量矩阵的非负行列式要求 x 在 0.62 到 1 之间。若填零,得到不合法矩阵;最大行列式选择 x=0.81。这是自设三变量算例,不是原文机构预测,也不说明未来相关性就等于 0.81。

原文证据

原文实际报告了什么

文章讨论保留已知相关系数、补全缺失值的问题,强调解不一定存在,也不一定唯一。最大行列式方法在适当可行条件下选出一个解;已知输入相互矛盾时,还要调整原值。网页以机构资本市场假设的缺失矩阵展示应用。

原文位置:Existence / Unicity;Maximum determinant;Infeasible problem;Example of usage
编辑理解

为什么值得讨论,哪里不能外推

值得提醒一处原文表述:C2 例子包含非对角相关系数 1,对应二阶主块奇异,不能据此声称严格正定补全;半正定与正定要区分。我的使用建议是保留输入改动账本。若算法为了可行性大幅改动已知值,应该首先复查口径,而不是把修正结果直接送进优化器。可行性修复、统计估计和投资预测是三项不同工作。

专有实现不是完整开源复现。最大行列式的统计解释依赖模型假设;财务尾部共同风险不能由相关矩阵完整表达。本站未调用 API 或运行作者算法。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-06待核待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
基本约束对称、对角为 1、半正定单个系数不越界并不足够。
求解状态可能无解或多解不能强迫系统悄悄返回一个看似精确的结果。
补全含义条件性假设不是凭数学恢复从未观测到的真实市场数据。

原文位置:Existence / Unicity;Maximum determinant;Infeasible problem;Example of usage

推荐 83/100 · 问题 28/30 · 证据 22/30 · 方法 24/25 · 复现 9/15

数学定义和反例清楚,能防止实际风险管线错误;个别正定措辞需纠正,专有实现限制复现。

尚未执行的实验思路

建立风险输入检查:缺失位置、最小特征值、原值改变量、下游权重敏感性。补全失败必须显式报告。

返回全年目录 ↑

Quantocracy / 导读完成

黄金与美债双动量:简单规则值得试,宏观解释还没有被证明

Cross-Asset Price-Based Regimes for Gold

Cyril Dujava / Quantpedia

可读之处是把两个价格信号拆成四种状态;应保留的怀疑是:挑出最好状态与窗口后,不能直接称为独立样本外证明。

2 分钟看懂

美债上涨是否提供了黄金自身趋势以外的信息?

必须先与黄金单动量比较,才能知道第二个信号的增量。再与相同平均黄金暴露的基准比较,才能区分预测改善和仅仅少持有黄金的效果。

编辑自设例子,非作者实验

编辑自设:黄金和债券的动量各有正负两种状态,组合成四格。如果在同一段历史里找出表现最好的一格,再只展示那格的收益,就有挑选赢家的偏差。状态解释再合理,也不能让这次选择自动变成事前选择。

  1. 分别计算两类资产过去收益
  2. 划分四种正负组合
  3. 比较黄金持有与单信号基准
  4. 明确窗口和状态的选择过程
  5. 在未参与选择的数据上再评价
关键结果与解释边界
核对项结果意味着什么
候选窗口1 / 3 / 6 / 12 月最后采用 12 月,是考察多个候选后的选择。
交易规则双正才持有黄金债券是输入信号,不是同时持有的资产。
早期数据内部重建序列不是 1969 年就存在 GLD、IEF ETF。

不能推出什么

原文虽使用样本外措辞,但可见方法未明确给出独立的选择/验证切分;图中绩效数值本条未逐格审计。成本、拼接规则和现金代理均需另核。

研究用途

结合 Allocate Smartly 的独立讨论阅读。后续若复现,冻结规则与候选集合,分别报告真实 ETF 样本、合成历史和净成本结果。

详细讲解

编辑理解

美债上涨是否提供了黄金自身趋势以外的信息?

必须先与黄金单动量比较,才能知道第二个信号的增量。再与相同平均黄金暴露的基准比较,才能区分预测改善和仅仅少持有黄金的效果。

编辑自设:黄金和债券的动量各有正负两种状态,组合成四格。如果在同一段历史里找出表现最好的一格,再只展示那格的收益,就有挑选赢家的偏差。状态解释再合理,也不能让这次选择自动变成事前选择。

原文证据

原文实际报告了什么

研究比较黄金与 IEF 的正负动量组合及 1、3、6、12 个月窗口,最终采用月度更新的 12 个月双正信号:两者总收益均大于零时 100% 配置黄金,否则为零或现金。历史范围为 1969-12-31 至 2025-09-30,ETF 出现前用内部重建数据。

原文位置:Data;Joint Momentum States;Annual Joint-Momentum Allocation Rule;Discussion & Conclusion
编辑理解

为什么值得讨论,哪里不能外推

我认为有两个必须拆开的命题:双信号是否预测黄金,以及它是否识别真实利率下降。第一项可以用价格序列检验;第二项还需直接对照真实利率、通胀预期等变量。名义债券总收益包含票息、久期和名义利率变化,不是实际利率的无误差代理。另一个问题是现金利息:持有更长时间现金,本身就会改变结果,不能把全部改善都归于预测能力。

原文虽使用样本外措辞,但可见方法未明确给出独立的选择/验证切分;图中绩效数值本条未逐格审计。成本、拼接规则和现金代理均需另核。

核查记录

导读完成:核对网页相关方法、结果与限制段落;未逐图及逐行代码审计,未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
2026-01-042026-01-04待核 / 不适用待核
网页导读核对记录(不是本站回测)
核对项原文 / 状态解读边界
候选窗口1 / 3 / 6 / 12 月最后采用 12 月,是考察多个候选后的选择。
交易规则双正才持有黄金债券是输入信号,不是同时持有的资产。
早期数据内部重建序列不是 1969 年就存在 GLD、IEF ETF。

原文位置:Data;Joint Momentum States;Annual Joint-Momentum Allocation Rule;Discussion & Conclusion

推荐 74/100 · 问题 26/30 · 证据 17/30 · 方法 21/25 · 复现 10/15

可执行规则和基线明确;候选选择、内部历史数据和独立验证边界限制了可信度。

尚未执行的实验思路

结合 Allocate Smartly 的独立讨论阅读。后续若复现,冻结规则与候选集合,分别报告真实 ETF 样本、合成历史和净成本结果。

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

Engram:把“记住知识”和“动脑推理”分开,为什么反而更聪明?

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

Xin Cheng、Wangding Zeng、Damai Dai 等

不只是给模型加一个更大的记忆库。真正有价值的实验是:总参数和计算预算相同,把部分专家参数换成查表,推理分数仍然上升。

2 分钟看懂

模型每遇到一个熟悉术语,是否都值得重新花算力处理?

传统模型把记忆常见搭配和处理新关系都交给网络计算;Engram 尝试让一部分重复模式直接查表。

编辑自设例子,非作者实验

可以把它想成研究员手边的术语表:查表省下力气,但“这个解释在本句是否适用”仍需判断。这是帮助理解的类比,不是作者做了一个财务知识库。

  1. 读取局部词元组合
  2. 哈希查出记忆向量
  3. 结合上下文判断是否采用
  4. 把结果交给后续网络推理
关键结果与解释边界
核对项结果意味着什么
同预算 BBH50.9 → 55.9在总参数和激活参数对齐时,推理测试仍改善,不只是模型变大。
代码测试 HumanEval37.8 → 40.8改善也出现在代码任务;不能直接换算成生产代码可用率。
参数对照26.7B / 3.8B两组总参数 26.7B、激活参数 3.8B,训练量同为 262B tokens。

不能推出什么

训练内部记忆不等于实时、可审计的金融数据库。等计算量也不必然等实际时延。

研究用途

对应用研究员更有用的启发是区分可查表的确定性操作与真正需要推理的工作。

详细讲解

编辑理解

模型每次读到一个熟悉名称,都有必要重新推导一遍吗?

让一个研究员每天重新查清“EBITDA”是什么意思,再开始做估值,显然是在浪费他的注意力。模型也可能存在类似的资源错配:大量高频名称和局部搭配具有重复性,却仍占用网络的计算深度。

Engram 最值得读的地方,是把这个直觉变成了可以比较的架构问题:有限的模型预算,究竟应该给动态计算,还是给静态模式存储?注意,这不是在应用外面加 RAG,也不是把聊天记录存进向量数据库;它讨论的是模型内部的参数如何分工。

原文证据

方法的关键:查出来的东西,仍要让上下文决定能不能用

Engram 用局部 N-gram 生成确定性地址,经过词元压缩、多头哈希取得记忆向量,再通过当前隐藏状态参与的门控把它融入主干网络。查表提供候选表示,而不是无条件把同一条知识塞给所有上下文。

确定性寻址还有系统意义:地址能预先计算,CPU 内存中的表项可以提前搬运,与 GPU 计算重叠。但查表是 O(1),不代表端到端推理没有带宽、传输或缓存成本。

原文位置:§2.1–2.5
原文证据

最有说服力的对照,不是 40B 赢了 27B

Table 1 中更干净的比较是 MoE-27B 对 Engram-27B:两者总参数都是 26.7B,激活参数都是 3.8B,训练量都是 262B tokens。Engram 把部分 routed experts 换成 5.7B 的记忆参数。

这组对照下,BBH 从 50.9 到 55.9,HumanEval 从 37.8 到 40.8,MATH 从 28.3 到 30.7。它不只是知识题变好,推理、代码也改善。另一个更大记忆版本 Engram-40B 并非全指标更好:HumanEval 为 38.4,反而低于 Engram-27B 的 40.8。

同预算架构对照:分数变化均为百分点
指标MoE-27BEngram-27B变化
BBH EM50.955.9+5.0
HumanEval Pass@137.840.8+3.0
MATH EM28.330.7+2.4
MMLU Accuracy57.460.4+3.0
原文位置:Table 1
原文证据

20%–25% 不是通用配方,而是所测规模里的最优区间

固定稀疏参数预算的实验呈现 U 形损失曲线:几乎全给 MoE,静态模式仍需计算;过多给记忆,又挤掉处理动态关系的能力。在两档测试规模上,约 20%–25% 稀疏参数分给 Engram 最好。作者用中间层表征分析支持“减轻早期静态重建负担”的解释。

原文位置:§3.1;§5
编辑理解

为什么这对量化研究员有启发,但不是一个新 alpha

核心迁移不是“我们也训练一个 Engram”,而是重新划分系统中哪些工作需要判断。证券代码映射、单位换算、公告版本、字段定义应由可追溯的结构化层处理;对证据冲突的判断、跨文档关系的推理才交给模型。这只是受论文启发的工程原则,不能说作者已验证这种投研系统。

也不要把内部记忆当实时金融数据库。模型训练得到的表项没有天然的 point-in-time 语义;更新知识、撤销错误和审计来源,仍是应用层必须解决的事情。

对照最值得追问的是资源口径:等 FLOPs 不等于等墙钟时间,CPU 内存带宽和批大小可能改变经济性。离线批量研究与低延迟事件处理,应分别测吞吐和尾部延迟,不能用一个平均加速数字代表两者。

编辑理解

带走一个判断

这篇论文值得高分,不是因为它宣布记忆能替代推理,而是因为它展示了两者可能互补,并认真问了“钱花在什么地方”。读完以后,应更警惕只有总参数增长、没有同预算对照的架构宣传。

核查记录

已核查正文方法、主要结果与限制;未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-01-12待核
同预算架构对照:分数变化均为百分点
指标MoE-27BEngram-27B变化
BBH EM50.955.9+5.0
HumanEval Pass@137.840.8+3.0
MATH EM28.330.7+2.4
MMLU Accuracy57.460.4+3.0

原文位置:Table 1

推荐 87/100 · 问题 28/30 · 证据 26/30 · 方法 25/25 · 复现 8/15

同预算比较和架构消融具有较强方法价值;结论限于所测训练规模,完整预训练成本高,因此复现分保守。

原文 CC BY 4.0;本站为中文改写与独立评析

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

金融 LLM 的第一道门槛:你的回测,究竟在测谁知道未来?

Evaluating LLMs in Finance Requires Explicit Bias Consideration

Yaxuan Kong、Hoyoung Lee、Yoontae Hwang、Alejandro Lopez-Lira 等

把“数字好不好”与“这个数字是否回答了正确的问题”分开。它不是再列一次回测常识,而是指出模型权重、搜索排名和解释文字也会污染金融实验。

2 分钟看懂

用今天的大模型回测过去,收益究竟来自方法,还是模型已经见过后来发生的事?

只把行情切成训练集和测试集还不够:模型权重、检索材料、股票池也可能携带未来信息。

编辑自设例子,非作者实验

自设例子:用当前模型读 2020 年财报。输入里没有 2021 年数据,不代表模型不认识这家公司后来的成败。时间隔离要覆盖工具和知识,而不只是 CSV。

  1. 明确当时的可用信息
  2. 检查模型与检索的时间边界
  3. 检查股票池与样本筛选
  4. 记录搜索和评估过程
关键结果与解释边界
核对项结果意味着什么
文献样本164 篇作者回顾的研究样本,不是 164 个已证实失效的策略。
提及前视偏差26.8%衡量文献是否讨论问题,不是其余论文一定存在泄漏。
提及幸存者偏差1.2%提醒报告缺口;不能据此计算真实违规发生率。

不能推出什么

文献审查和调查能够揭示盲点,不能替代逐个策略的实证诊断。

研究用途

把模型版本、资料日期和股票池时点一起写进实验日志。

详细讲解

编辑理解

先问这个数字有没有资格被叫作回测

一个语言模型用 2019 年财报预测公司后来的表现,样本文件可能完全合规,但模型权重可能已经读过这家公司的结局。对传统因子来说,封住数据时间通常是核心关卡;对 LLM 来说,这只封住了一扇门。

这篇论文的价值,在于把评估对象从“输入文件是否早于交易日”扩展到整个信息系统。模型、检索器、网页版本、股票池、输出解释和执行时延,每一层都可能改变实验到底在估计什么。

原文证据

作者究竟发现了多大的问题?先别把“未讨论”读成“已犯错”

作者回顾 2023–2025 年的 164 篇金融 LLM 会议论文:26.8% 提到前视偏差,1.2% 提到幸存者偏差;没有单一偏差被超过 28% 的论文讨论。论文将常见问题分为前视、幸存者、叙事、目标和成本五类,并提出结构有效性清单。

这是报告与评估惯例的调查,不是逐篇复现后测出的虚假 alpha 比例。问卷接触 112 人,但完成全部必答题的是 50 人;其中 74% 认为现成评估工具稀缺或不存在。不能把不同分母混用。

原文位置:§1,Figure 2,§4,Appendix A
原文证据

最容易漏掉的一条:旧网页不等于旧信息集

论文把前视信息拆成模型权重与外部上下文两条通道。标注知识截止日并不能保证之后的信息绝无进入;闭源模型后训练与系统配置也不透明。

外部检索同样不能只按发布日期过滤:网页可能事后改写但保留原日期,搜索排名也可能借用了后来形成的链接和关注度。作者要求使用可核查的历史快照,并记录提示、检索文档、工具输出与决策时间。

原文位置:§2.1,§3.1
编辑理解

把有效性清单改成研究评审真正能问的五个问题

第一,做出预测时有哪些可用信息?不仅要有数据日期,还要能重建文档版本和模型调用版本。把今天的搜索结果限制到旧日期,不能自动复原当时的信息发现过程。

第二,当时可以买哪些证券?使用当前股票池重放历史,会把未来的存活条件带进去。即使任务只是财报问答,也可能因样本只来自知名幸存公司而低估风险信息处理难度。

第三,解释真的由证据约束吗?交换公司名称、删去关键段落、加入矛盾证据之后,如果结论几乎不动,漂亮文字可能只是事后配文。

第四,不知道时会不会停止?覆盖率与条件准确率必须一起报;拒答一半问题得到的高准确率,不等于全自动系统同样可靠。

第五,信息变成仓位需要多久?一次离线调用的美元成本可以很小,但几十分钟的证据链可能让短期信号失效。成本不只是佣金,还包括从可见信息到可执行决策之间的时间。

编辑理解

清单能排除什么,又不能替你证明什么

它最适合当“拒绝不合格证据”的门槛,不适合当满分认证。通过时间、股票池和成本检查,仍可能有多重检验、标签重叠、暴露遗漏和参数选择偏差。反过来,一篇无法证明可交易 alpha 的论文,仍可能对抽取、检索或系统设计有价值,只是必须换一个更窄的主张。

因此推荐阅读分也不能等同于部署分:一篇严谨揭示失败机制的文章,往往比一条收益极高却无法核查的曲线更值得研究员花时间。

核查记录

已核查正文方法、主要结果与限制;未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-02-15待核
推荐 90/100 · 问题 30/30 · 证据 24/30 · 方法 22/25 · 复现 14/15

可直接改进项目评审与数据审计;文献回顾和清单不是偏差大小的因果估计,不能凭检查表证明 alpha,因此证据分不满。

尚未执行的实验思路

为每个决策保存 as-of 时间、证券池版本、模型快照、原始文档哈希、检索结果与执行时间;分别设“证据被撤掉”与“公司名被匿名化”的对照。先看输出是否仍随可见证据变化,再讨论收益。 这是本站提出的审计方案,尚未执行。它的验收不是收益变高,而是研究结果能够被另一位研究员重建。

原文 CC BY 4.0;本站为中文改写与独立评析

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

QuantaAlpha:会进化的因子研究员,还是更有效率的历史拟合器?

QuantaAlpha: An Evolutionary Framework for LLM-Driven Alpha Mining

Jun Han、Shuo Zhang、Wei Li、Zhi Yang、Yifan Dong 等

真正的新东西是让整段研究轨迹变异、交叉;真正该警惕的是把生成因子的研发过程留在样本外检验之外。

2 分钟看懂

让 AI 不断修改因子研究路径,能不能比反复换提示词找到更好的信号?

普通自动挖因子常重试同一种思路;这里把整条研究轨迹当作可以变异和交叉的对象。

编辑自设例子,非作者实验

自设例子:一个失败因子源自错误的经济解释,另一个来自不合理的计算窗口。只修代码不够;必须区分修改假设与修改实现。

  1. 提出因子假设
  2. 生成并约束代码
  3. 评价研究轨迹
  4. 变异 / 交叉后继续检验
关键结果与解释边界
核对项结果意味着什么
作者样本外年化27.75%论文的净超额收益口径,不是组合绝对年化收益。
最大回撤7.98%同属论文的超额曲线口径,不能与指数绝对回撤混比。
测试区间2022—2025训练 2016—2020、验证 2021;模型知识时间隔离仍需另外审查。

不能推出什么

更有效率的搜索也可能更有效率地拟合历史。必须记录搜索次数、失败路径及真实交易时点。

研究用途

先复核净超额定义与信号到成交的时间对齐,再考虑移植因子搜索流程。

详细讲解

编辑理解

有意思的不是让 AI 写公式,而是让它改自己的研究路线

普通因子生成器会改窗口、换算子、重新组合价量字段。更难的问题是:一个因子不好,究竟是经济假设、表达式、代码,还是评价方式出了错?如果每次都从头生成一遍,就没有把研究失败变成可复用经验。

读 QuantaAlpha,应该先看它如何定义“可继承的研究经验”,而不是先看收益排行。轨迹级搜索有机会减少重复踩坑,但也会把历史筛选结果积累得更充分;工程效率和统计可信度不天然同向。

原文证据

把作者结果压缩到同一口径

框架对完整研究轨迹做变异与交叉,并约束假设、公式、代码的一致性。CSI 300 股票样本:2016–2020 训练、2021 验证、2022–2025-12-26 测试。GPT-5.2 版本报告 IC 0.1501、ARR 27.75%、MDD 7.98%。附录定义后两者基于扣交易成本的超额序列,不是绝对净值。

策略用 50 只等权股,每次淘汰 5 只,次日开盘成交,买费 0.05%、卖费 0.15%;标签却是次日收盘到再下一日收盘的收益。

原文位置:§4–5,Table 1,Appendix A.1–A.2、B
编辑理解

为什么收益标签与成交时点的差别值得认真看

一个信号可以用收盘到收盘收益训练,再用于开盘交易,这本身不自动构成前视。但两者不是同一个目标:开盘价包含隔夜跳空,持仓可交易时点和预测标签覆盖的区间也不同。

研究员需要追踪的是“特征最后可见时间 → 输出信号 → 成交价格 → 实际持仓收益”。若这里无法逐步对齐,较高的 IC 可能没有等比例映射为可交易收益。不能把这个疑点直接写成作者用了未来数据,也不能因为使用了成熟回测框架就跳过审计。

编辑理解

轨迹进化的统计代价:你优化的不只有公式

假设两个搜索器最后都输出 20 个因子。甲只评估过 30 条候选,乙评估过 3,000 条,并反复调整生成提示。最终因子数一样,研究自由度却完全不同。只匹配最终库大小,不能公平比较研究系统。

一套有说服力的验证应冻结生成规则,让候选试验次数、可见验证区间、失败日志、累计计算资源都可比较;测试集只用于最后一次评估。变异和交叉如果依赖测试期表现,就已把所谓测试变成了训练搜索的反馈。

尤其不能把因子输入只含历史价量,误认为整个研究过程就满足历史可用性。后发模型可能通过对市场阶段和知名规律的知识影响候选选择。需要区分“公式在历史上能计算”与“当时的研究系统能生成并选择它”。

编辑理解

该抄的是研究日志,不是作者的最高收益参数

最值得迁移到团队内部的产物,是带谱系的候选库:每个因子记录原始假设、父因子、改动部位、代码验证、所有历史尝试,以及为什么被淘汰。它能让同事检查改进究竟来自机制,还是来自反复搜索。

把这篇与 Agentic Empirical Asset Pricing 配合阅读会更有效:前者让研究过程自动演化,后者促使我们问整个研究过程有没有被公平回测。两篇合起来提出的是一个研究治理问题,而不是两条可直接上线的策略。

核查记录

已核查正文方法、主要结果与限制;未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-02-06待核
推荐 80/100 · 问题 29/30 · 证据 18/30 · 方法 23/25 · 复现 10/15

与 A 股个股因子研究高度相关,轨迹级搜索有启发;历史评估使用后发模型,完整生成日志与等搜索预算需独立审计,收益证据折价。

尚未执行的实验思路

使用同一可用个股样本、相同候选调用预算,把随机公式搜索、单轮 LLM 生成、轨迹进化三组放在同一个验证与封存测试流程。下游预测器、交易规则和成本保持一致,同时报告候选有效率、重复率、残差 IC、净超额以及所有失败试验。 窗口长度按实际样本和标签决定,不默认长期滚动。先证明“同样的研究预算能更稳定地产生增量”,再扩大投入。方案尚未运行。

arXiv 非独占许可;本站仅提供有限事实摘要与独立评论

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

FinSheet-Bench:82.4% 的表格问答准确率,离放心交付还差什么?

FinSheet-Bench: From Simple Lookups to Complex Reasoning, Where LLMs Break on Financial Spreadsheets

Jan Ravnik、Matjaž Ličen、Felix Bührmann、Bithiah Yuan、Felix Stinson、Tanvi Singh

比模型排名更重要的是评分规则:数字允许误差,列表可能忽略顺序。一个“答对了”的答案,未必足以通过真实财务表的验收。

2 分钟看懂

模型能答对财务表里的问题,是否就可以放心把 Excel 交给它?

单个金额查找与跨基金、跨日期合并计算不是同一难度。小表的分数可能掩盖大表的失误。

编辑自设例子,非作者实验

自设例子:从一张表读出基金 A 的 NAV 很容易;问八只基金所有项目的现金流并按 IRR 排序,就同时要求识别实体、算数和排序。

  1. 把合成基金表序列化为文本
  2. 按固定模板生成问题
  3. 让模型回答
  4. 规则与模型裁判共同评分
关键结果与解释边界
核对项结果意味着什么
最高总体分82.4%特定题库和评估规则下的成绩,不是任意 Excel 任务成功率。
大文件表现48.6%152 家公司、8 只基金的大文件平均表现显著更低。
数据形式24 个文件来自 8 套合成基金表的变体,不是 24 个真实基金样本。

不能推出什么

模型读的是序列化文本,不是操作原生 Excel;宽松匹配和裁判规则会影响分数。

研究用途

验收财务助手应分别测字段、单位、公式、排序和大文件,不要只看总体均分。

详细讲解

编辑理解

你不是需要一份“看起来对”的表,而是需要每个数字能追回去

给模型一张持仓或基金明细,问“未退出项目的投入资本是多少”,表面上是加法,真正难处却可能在加法之前:哪些行属于哪个基金,括号是不是负数,币种是否统一,合并表头修饰的是哪一列。

因此,单看模型会不会算,往往找错了瓶颈。FinSheet-Bench 的价值是把这些接近工作现场的复杂性纳入测试;它的局限也来自同一处——输入和评分怎样设计,决定结果能否映射回真正的电子表格任务。

原文证据

这不是让 Agent 自由操作 Excel 的测试

作者构造私募股权基金风格的合成数据,8 份基础表各有 A/B/C 结构版本,共 24 个评估文件。16 类问题模板覆盖查找、计数、排序、筛选、汇总与多步骤计算;每个模型大约回答 500 个问题。

工作簿统一序列化成 CSV 风格文本,工作表由标题分隔。模型看到整份文本后一次回答,不是拥有原生 Excel 对象和计算工具的 Agent。标准答案来自人工规整后的表,由 Python 确定性函数计算。

原文位置:§3.1、§4.2–4.4
原文证据

排名看似接近,失败却有明显结构

整体最佳 Gemini 3.1 Pro 为 82.4%,GPT-5.2 reasoning 为 80.4%,Claude Opus 4.6 thinking 为 80.2%。最大的文件含 152 家公司、8 个基金,全模型平均仅 48.6%;最容易文件平均 86.2%。

这个差异说明文件复杂度可能比领先模型之间约 2 个百分点的差距更值得关注。GPT-3.5 因上下文溢出只能覆盖部分文件,必须区分它在可处理问题上的准确率与覆盖所有问题的有效准确率。

原文位置:Table 4,Table 8,§5
原文证据

真正值得研究员停下来的地方:准确率的判定器

评分分三层:规则精确匹配、更宽松匹配、LLM 裁判。数值第一层允许 2.5% 相对误差,第二层允许 5%;列表按集合比较,第一层 Jaccard 门槛 0.95,第二层 0.75,并不保留顺序和重复。

约 48% 答案进入模型裁判。作者用两个裁判独立检查这部分答案,意见不一致的 161 项再人工审阅。但两个裁判的一致性不是对全部答案的独立真值认证。

原文位置:§4.3.1,Table 3
编辑理解

排序题按集合打分,会发生什么?

用一个独立例子就能看清:要求按 EBITDA 从高到低列出甲、乙、丙,答案却给丙、乙、甲。若只核集合,两份答案完全相同;排序这项能力却没有被验证。

这并不意味着论文的所有排序答案都有这个错误,而是其公开的无序判定规则无法单独支持排序完全正确的主张。同样,允许数值误差可以缓解输出精度差异,但 5% 的估值误差和 5% 的格式舍入误差不是一回事。

因此不应将 82.4% 当作严格字段级全对率,也不能从论文直接推出“任何模型工具系统都无法处理财务表”。它检验的是特定文本输入与回答配置,不是经过解析、执行代码、校验和人工审核的完整生产链。

编辑理解

真正的落地指标:一份报告需要多少分钟复核

如果一个系统把 100 个答案中的 82 个答对,却无法告诉你错在哪里,研究员仍可能需要重算全部 100 个。平均准确率提高并不保证审核工时同比下降。

更有价值的接口应该同时交付原始单元格位置、字段映射、过滤条件、计算表达式和汇总校验。对于数值提取,算术交给确定性代码;对于无法消除的表头歧义,明确留待复核。这样才能把错误定位变成可管理的工作量。

核查记录

已核查正文方法、主要结果与限制;未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-03-07待核
推荐 83/100 · 问题 28/30 · 证据 23/30 · 方法 21/25 · 复现 11/15

输入形式和评分规则披露充分,直接对应投研表格工作;样本为合成数据,且容错评分与真实交付要求存在距离,未证明工具增强系统上限。

尚未执行的实验思路

建一个不含敏感数据的小型金标准:同一批数值保留原始排版、规整表格两种输入,分别测试直接问答与解析后代码计算。固定模型和预算,按字段绑定错误、算术错误、遗漏和排序错误分类,再报告整表全对率与人工复核分钟数。 这是本站的实验建议,尚未运行。它比只换最强模型更能定位你的瓶颈究竟在“理解表”还是“算对数”。

原文 CC BY 4.0;本站为中文改写与独立评析

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

FinSTaR:78.9% 的“金融推理准确率”,不是 78.9% 的涨跌预测胜率

FinSTaR: Towards Financial Reasoning with Time Series Reasoning Models

Seunghan Lee、Jun Seo、Jaehoon Lee 等

把能由历史数据算出的状态,与真正未知的未来分开。这项设计值得借鉴;将两类题混在一起的平均分,却很容易产生夸大的投资想象。

2 分钟看懂

“金融推理准确率”究竟混合了哪些任务?

解释已发生的财务事实与预测未来表现需要不同证据,把它们混成一个分数会误导读者。

编辑自设例子,非作者实验

自设例子:“利润率是否上升”可以查表核验;“这只股票会不会跑赢”必须面对未来不确定性。它们不能使用同一种成功标准。

  1. 区分评估任务与预测任务
  2. 生成适配任务的推理过程
  3. 分别检验子任务
  4. 再看总体分是否掩盖短板
关键结果与解释边界
核对项结果意味着什么
总体分78.9%多个任务聚合的得分,不是股票涨跌胜率。
评估 / 预测95.0 / 68.2事后事实判断明显比预测任务容易。
相对表现预测51.5%这个子项远弱于总体分,不能用总体分替它背书。

不能推出什么

样本筛选与类别平衡影响可迁移性。预测评价不等于可交易、扣费后的投资回报。

研究用途

读投资 AI 论文时先拆任务和标签,再看总分。

详细讲解

编辑理解

金融推理里,混着两种完全不同的难题

“目前回撤多深”和“接下来会不会修复”看似都在分析行情,实际上前者是对已知数据的计算,后者是对未知结果的预测。把两者用一个准确率汇总,会使模型的算术进步看起来像预测能力进步。

FinSTaR 值得读的起点,正是承认这两种任务不应共用同一套推理训练逻辑。量化研究员不必被术语吸引,先问每道题的答案在信息集里是否已被确定。

原文证据

方法与结果,只保留影响解释的几项

作者按单股/多股、状态评估/未来预测划分十项任务。状态题用程序生成计算推理链,预测题用情景推理链。Test A 总准确率 78.9%,其中评估均值 95.0%,预测均值 68.2%;相对表现题为 51.5%。这些不是交易胜率。

股票池取 2024 年 1 月市值前 250 的标普股,200 只训练、50 只留出;时间训练为 2010–2022,时间外测试为 2023–2025。分类通过下采样平衡。

原文位置:§3–4,Tables 3、5、10
编辑理解

总分怎样把结论推远了

这里的关键不是否认 78.9%,而是拒绝替这个数换含义。多分类题和二分类题的随机命中率不同;可直接计算的状态题和有噪声的未来题难度不同;不同题型也不对应相同的经济收益。

即便未来分类命中率更高,也还需要置信度、基准频率、样本覆盖和盈亏幅度。收益不对称时,高命中率可以亏钱;低命中率也可能赚钱。论文的标签准确率不能不经仓位规则就变成策略回报。

尤其对相对表现任务,更应该独立看其结果,而不是借状态题的高分抬高对选股能力的预期。

编辑理解

股票与时间两轴留出,是好开始,但仍有第三个时间问题

把证券和时间同时留出,比随机拆分更接近检验泛化。然而如果先按某个未来时点的市值排名挑选历史股票,训练世界就已经偏向后来变得重要、且能够存活到筛选时点的公司。

这不必然推翻论文在该固定宇宙中的分类比较,但它阻止我们把结果直接外推到当时真实可投的全市场。另外,历史价格文件的时间划分与基础模型权重的信息边界是两件事。它们需要分别核查,不能用一个 train/test 表格替代全部审计。

编辑理解

对量化团队最实用的迁移:让状态估计与概率预测分工

目前波动、回撤、相关性等定义清楚的量应由程序精确计算,模型负责解释计算口径与异常;未来题则输出经过校准的概率与条件,避免把一种可能情景写成确定结论。

两者的验收也应该分开。状态层看字段和公式是否正确,预测层看相对朴素基线的增量、时间外稳定性、概率校准以及成本后效用。用一个“金融理解总分”管理两层,只会让真实短板被平均数掩盖。

核查记录

已核查正文方法、主要结果与限制;未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-05-05待核
推荐 75/100 · 问题 26/30 · 证据 19/30 · 方法 22/25 · 复现 8/15

评估与预测分开有方法价值;固定事后股票池、均衡分类样本和混合总分限制投资解释,代码材料完整性未核实。

原文 CC BY-NC-ND 4.0;本站仅提供有限事实摘要与独立评论

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

TimeRLM:别把十万条数据塞进提示词,让模型回到数据里找证据

TimeRLM: Recursive Language Models Enable Precise Anomaly Localization in Long-Context Time-Series

Nicolas Zumarraga、Lorenzo Steno、Ning Wang 等

长上下文的另一条路不是继续扩窗口,而是把原始序列留在外面,用代码反复切片、计算、定位。它解决的是证据检索,不是未来收益预测。

2 分钟看懂

十万条时间序列太长,为什么非要一次全部塞进模型上下文?

直接给长文本或图像,模型可能看不全细节;这里保留外部数据,让模型按需写代码读取片段。

编辑自设例子,非作者实验

自设例子:怀疑某日成交量异常,先查全序列统计,再放大候选区间。更像研究员使用数据终端,而不是背下一整张表。

  1. 原始序列留在外部文件
  2. 模型提出数据查询
  3. 代码返回局部统计或片段
  4. 据此定位并回答
关键结果与解释边界
核对项结果意味着什么
异常区间重合度0.329 → 0.682GPT-5.5 对应图像基线与递归方案的 IoU;不是收益率或分类胜率。
文本方案0.677同类定位任务也接近图像递归方案,并非必须图像化。
数据长度16k—131k测试的序列长度范围,不能代表无限长数据都适用。

不能推出什么

读完整个序列后定位异常,和实时预警是两个问题。不能把事后定位包装成提前预测。

研究用途

适合研究数据检查与长序列诊断;上线预警必须单独做逐时点测试。

详细讲解

编辑理解

能说出“这里有异常”,与能指出异常在哪,不是同一能力

当一段很长的行情或系统日志只有几秒异常,压成摘要可能把关键证据丢掉;全部塞进上下文,又可能让模型在海量数值中漏看。真正要交付的是时间区间、通道和幅度,而不只是“波动加大”这样的描述。

TimeRLM 把问题从“模型能记住多少输入”改成“模型能否有效地查询输入”。这个转变对研究数据排错特别自然:人类研究员也不是一次读完所有 tick,而是先定位,再放大,再算数。

原文证据

实际操作链:原始数组不进提示词,查询结果才进

完整序列在沙箱里作为可访问的数据,模型可执行 Python,收到输出后再决定下一步。文本变体只读计算输出;图像变体还能绘图;另一配置允许对子区间发起子模型查询。

AnomalyXL 合成基准覆盖 16k–131k 个点、最多 16 个通道,任务包括定位、带证据分类、幅度、多通道定位和领先滞后。回答需要结构化结果,按真实注入位置等可验证目标评分。

原文位置:§3.1–3.2,Appendix E
原文证据

关键增量来自交互,不只是看图

Table 1 的 GPT-5.5 图像配置:单次读取的定位 IoU 为 0.329,TimeRLM 为 0.682;幅度得分却只从 0.440 到 0.480。递归文本与图像的定位结果分别为 0.677、0.682,差距很小,图像配置平均多用 3.1 轮。

摘要中带证据分类的 0.745 来自允许子模型查询的配置;基础图像 TimeRLM 在表中为 0.693。不能把不同配置最好的数字拼成一套同时实现的系统。

同骨干 GPT-5.5 的定位与幅度表现;不是收益指标
配置定位 IoU幅度得分
单次图像输入0.3290.440
TimeRLM 图像0.6820.480
TimeRLM 文本0.6770.496
原文位置:Table 1;§5
编辑理解

IoU 高,意味着什么?

假设真实异常在第 100 到 120 秒,系统报第 110 到 130 秒。按连续区间长度算,交集 10 秒、并集 30 秒,IoU 是 1/3。这比只回答“有异常”更严格,因为它要求证据边界。

但 IoU 没有告诉你异常是否可交易,也没有告诉你模型在第 110 秒已经能够判断。回看整条序列能定位异常,和异常发生时实时发出信号,信息条件完全不同。

因此这篇最自然的量化用途是历史数据质量检查、模型失效区间定位和交易日志诊断。若要做在线预警,需要把每次查询截断到当时已观测的序列,并另报检测延迟。

编辑理解

为什么不能省掉传统算法基线

对于孤立尖峰、缺失段或波动台阶,简单的稳健统计和变点检测可能又快又准。LLM 的潜在增量应在需要理解任务、选择分析工具、跨通道取证的复杂场景体现。

所以不能用弱单次输入模型代表所有传统方法,也不能把多轮工具系统的表现归因于某个语言骨干单独变聪明。公平的工程问题应是:同样墙钟时间和可用工具,交互控制带来了多少额外正确定位,代价又是多少。

核查记录

已核查正文方法、主要结果与限制;未独立复现

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-08-04待核
同骨干 GPT-5.5 的定位与幅度表现;不是收益指标
配置定位 IoU幅度得分
单次图像输入0.3290.440
TimeRLM 图像0.6820.480
TimeRLM 文本0.6770.496

原文位置:Table 1;§5

推荐 86/100 · 问题 26/30 · 证据 24/30 · 方法 24/25 · 复现 12/15

有明确定位指标、同骨干对照及工具实现;主要基准为合成异常,真实域验证不是金融交易,应用外推需折价。

尚未执行的实验思路

从本地脱敏时间序列构造已知错误:复权断点、时间戳错位、连续缺失、孤立尖峰。保留未注入异常的负样本,对比规则检查、变点模型与工具型 LLM;同时报告误报、定位 IoU、发现延迟、运行成本与证据日志。 不要只在“肯定有异常”的题里比较定位能力,否则会高估真实数据清洗中的价值。这是本站建议,尚未运行。

原文 CC BY 4.0;本站为中文改写与独立评析

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

回测研究流程,而不只回测最后一条因子

Agentic Empirical Asset Pricing: Methodological Foundations

Yingjian Pan、Xiaowei Ding、Kay Giesecke

研究对象是“会反复找因子的系统”。关键不只是 0.96 的 Sharpe,而是它是否在公平预算、固定历史信息和真正封存的测试下仍有增量。

2 分钟看懂

自动研究代理最后交出一个好因子,怎样知道不是它试了太多次碰巧撞上?

只回测最终因子会隐藏中间失败尝试。论文把规划、编码、检查和失败记忆一起放进评估。

编辑自设例子,非作者实验

自设例子:两个助手各交一个因子,一个只试 5 次,另一个试了 5,000 次。最终 Sharpe 相同,并不表示证据同样强。

  1. 规划因子研究
  2. 生成代码并执行检查
  3. 按统计门槛筛选
  4. 记录失败并进入下一轮
关键结果与解释边界
核对项结果意味着什么
联合模型滚动 Sharpe0.96 ± 0.04在论文指定设置中,原始特征与新因子联合模型的结果。
静态对照 / 原始特征0.71 / 0.62同组对照有改进,但不能混入另一张单因子实验表。
重复次数3 次有重复实验,但不足以把与 0.91、0.90 的差距直接判成稳定优势。

不能推出什么

结果是作者设置的毛收益口径;历史数据回测也没有自动解决当前模型的知识泄漏。

研究用途

值得移植的是研究日志和预算约束,而不是只复制最终因子。

详细讲解

编辑理解

一条曲线究竟是在检验因子,还是检验研究员

想象两个研究流程。甲在今天反复看过全部历史,最后挑出一个公式,再画出它过去几年的漂亮曲线。乙事先锁定研究规则,在每个历史截止点只能接触当时数据,从提出想法到筛选都重新运行,再评价随后没看过的时期。

甲能说明被挑中的公式适合这段历史;乙才开始回答“这个研究流程在不知道未来时会不会选中有效公式”。给公式留测试集仍然必要,但如果研究者看过测试结果后改了提示、筛选门槛或生成规则,整个研究流程就已把测试集当成开发集。这是阅读自动因子发现论文时应先检查的地方。

原文证据

作者系统的骨架与关键比较

SEADS 将规划、公式生成、执行检查、统计筛选和研究记忆分开;不仅保存通过的因子,也记录失败。滚动比较把发现因子与原始约 400 个特征联合建模,检验增量,而不是单独展示新因子组合。毛 Sharpe:滚动 SEADS 为 0.96±0.04,静态库 0.71±0.05,原始特征 0.62;前两项为三次重复的均值±SE。0.96 与其他领先系统的差异并不可靠显著。

原文位置:§3.3–3.5,§5.2,Figure 2
编辑理解

用一个虚构因子走完流程,才能看懂各模块在防什么

以下是我的教学例子,不是作者发布的公式。假设 AI 提出“现金回款质量高、近期涨幅又不过热的公司,下一期表现可能更好”,写成两种横截面排名的乘积。第一关不是收益,而是逻辑:变量的报告期和实际公告日是否一致?收入为零或负数时,比值怎么定义?停牌股票是不是被错误当成收益为零?

第二关是实现:代码真的是现金回款,而不是因为字段名相近取到了现金余额吗?经济故事写得好,不能替代逐行核对公式。第三关才是统计:这个分数与下期个股收益有无稳定联系?方向是否反复变化?

第四关是增量:它会不会只是低估值、低波动或质量因子的重新命名?第五关是组合:即使有新信息,若它只出现在很难成交的股票,或者每月换手过高,也未必能变成净收益。把这些关卡拆开,失败才有可诊断的含义;只有一个综合评分时,代码错误、重复信号和真实无效容易被混在一起。

编辑理解

新颖性与有效性为什么必须分开量

设已有因子为 x,新公式是 2x+3。表达式长得不同,但排序完全相同:公式文本的新颖不等于投资信息的新颖。再设新公式是随机数 u,它与 x 几乎不相关,却没有预测价值。仅以低相关性奖励“创新”,会奖励噪声。

更细的一种情况是 z=x+y:它对单独 x 或单独 y 的相关性不一定极高,但依然可能完全落在现有因子的线性组合里。因此,除了两两相关,还要问“控制已有信息后剩下的部分有没有用”。在研究上可以做残差化或联合模型比较,在投资上还应检查组合风险暴露。

这也是我不愿仅凭新增因子的 Sharpe 排名给系统定胜负的原因。发现很多相似信号,可能只是扩大了同一种风格押注;发现很少但互补的信号,也可能更有价值。数量、增量和净效用是不同目标。

编辑理解

0.96 与 0.71 能回答什么,不能回答什么

静态库对照比单纯比较“AI 与非 AI”更有意思:如果初始库相同,后续组合重估规则也相同,重新发现因子的系统更好,就给“持续研究值得做”提供证据。但它仍然要匹配实际计算预算,并确保刷新流程没有反复看到未来。

0.96−0.71=0.25 是 Sharpe 数值之差,不是多赚 25%,也不是年化收益提高 25 个百分点。0.96±0.04 里的 SE 是少量重复运行间均值的不确定性,不能覆盖样本期选择、费用估计、未来市场结构变化等所有风险。

还有一个极易误读的比较:原始特征上加新因子的联合模型,与仅用通过筛选因子的模型,不是同一个投资组合。两张图的数值不同不一定矛盾,但不能抽出各自最高数字拼成“全方位优胜”。这里应优先读比较对象,而不是曲线终点。

原文位置:Figure 2 图注,§5.2
编辑理解

这篇的价值与我仍不放心的地方

我认同把研究过程纳入测试的方向,但不会把“当时可用数据”误写成“完全当时可用信息”。今天的大模型可能已经见过过去行情与学术研究;把它放到历史截止点,输入端封锁未来也未必抹掉参数里的知识。对后续全新时期做真正前瞻记录,才是更强的补充证据。

另一个问题是预算。两个系统都提出 300 个候选,不代表调用次数、输入长度、修改次数与人工调试相同。更严格的比较应按研究费用或总调用预算画出性能曲线,而不是只有一个固定候选数终点。

我最愿意带走的是失败日志和嵌套测试纪律,而不是“加一个 agent 就会获得新 alpha”。若一个便宜的随机表达式搜索在相同预算下表现相当,复杂系统就需要重新证明自己的价值。

核查记录

已核查正文方法、主要结果与限制;未执行代码

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-09-01待核
作者滚动实验,Panel A,毛 Sharpe;不是独立复现
方案平均 Sharpe口径
SEADS 滚动发现0.96 ± 0.043 次重复的均值 ± SE
SEADS 静态库0.71 ± 0.05同一初始库,不重新发现
原始特征基线0.62无 LLM 发现环节

原文位置:§5.2 / Figure 2

推荐 87/100 · 问题 30/30 · 证据 23/30 · 方法 24/25 · 复现 10/15

评估完整研究过程而非仅评估赢家因子,方法价值高;三次重复与毛收益限制证据力度,完整独立复现尚未完成。

尚未执行的实验思路

先限定为个股横截面,不混入指数择时。检查实际有多少连续月份、多少独立市场阶段,再决定能承受几次重新发现;不在这里机械套用 10 年、20 年,也不把某个固定短窗口当成已经最优的答案。 最小试验只回答:在同一可投资个股池、同一数据截止日、同一费用预算下,AI 候选是否比固定因子及随机表达式提供增量?冻结最后一段数据,开发期内做选择,测试期只评价一次。训练期用于提出与估计,验证期用于筛选,测试期不能再返还给生成器。 交付物应是候选总账、失败原因、最终公式、逐期个股持仓与交易,以及统一费用下的净表现。样本不足时,应降低结论强度,而不是扩大尝试次数后挑最好结果。

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

同一份财报,换个角色就换了判断

The Analyst in the Prompt: Role, Retrieval, and Memory Biases in LLM Financial Analysis

Ahmed Asaad、Amr Mohamed、Yang Zhang、Omneya Abdelsalam

给模型“分析师人设”可能改变它对证据本身的评分;统一检索材料并不能消除这种影响。

2 分钟看懂

同一份财报、同一组证据,为什么换成看多或看空角色,结论就变了?

通常认为角色只是写作风格。作者通过固定检索证据,把“找到不同材料”和“对相同材料作不同解释”分开。

编辑自设例子,非作者实验

自设例子:同一段利润下滑说明,乐观角色强调暂时性投入,空头角色强调竞争恶化。证据没变,权重却变了。

  1. 对同一财报设置不同角色
  2. 先允许各自检索
  3. 再固定相同证据回答
  4. 拆出检索差异与解释差异
关键结果与解释边界
核对项结果意味着什么
财报样本3,575 份覆盖 2013—2024 年;不是同一公司的重复问答。
模型数量12 个结果不是只在单一模型上的个案。
固定证据后角色效应平均保留 69%指回归角色系数的保留比例,不是 69% 的回答都错误。

不能推出什么

作者展示的极端公司案例不是平均效果,不能把个案差值当全体样本结论。

研究用途

多角色评审应固定证据并统一评分准则;不同口吻不等于不同信息。

详细讲解

编辑理解

先把问题说准确:偏好可以改变建议,不该偷偷改变证据评分

假设一家公司同时披露利润增长和一笔重大或有负债。成长型投资者愿意承担风险,保守投资者不愿意,两人收到不同的投资建议完全合理。真正需要检查的是:系统能否先按一致标准描述材料,再单独讨论这份材料是否适合某个用户?

如果我们让模型“扮演做空分析师”,它不仅更强调风险,还把原本声称中性的证据评分调低,那么用户看到的就不再只是偏好适配。人设已经参与了证据解释。本文的研究对象是这种边界失守,而不是证明某种投资风格错误,也不是测试谁最会预测股价。

这比“提示词会影响回答”多走了一步:作者尝试拆开影响发生的位置。是模型搜到的材料变了,还是同样材料被读成了不同意思?这两种问题对应完全不同的修复方法。

原文证据

实验台:同一份文件、两个评分、三种提示条件

样本为 2013—2024 年的 3,575 份 SEC 10-K/10-Q,来自样本期内曾为标普 500 成分的公司;每家公司最多六份文件。抽取管理层讨论、风险因素等叙述部分,而不是把整份财报所有表格交给模型。12 个模型都返回相同 JSON,包含 EvidenceScore 与 PersonalizedScore,范围都是 −1 至 +1。前者要求中性,后者允许体现用户偏好。

检索将文本切成约 400 token 的片段,相邻重叠 80 token,使用 text-embedding-3-large,取前 8 个片段。生成温度为 0、top-p 为 1、输出上限 1,024 token。九种投资角色另加中性基准;记忆条件使用五组匹配用户画像。这里的“记忆”是放入提示的用户背景,不是对真正长期对话记忆系统的完整测试。

三组实验究竟改了什么(依据 §3.2 重组)
条件检索材料生成时的身份与偏好
PR角色参与检索查询;材料可能不同助手扮演投资角色
NR每份文件先做中性检索;所有角色收到逐字相同材料仍让助手扮演投资角色
MEM沿用 NR 同一份材料助手保持中性;偏好改写成第三人称用户画像
原文位置:§3.1–3.3
编辑理解

为什么这个对照有辨识力,又不能证明什么

PR 对比 NR,主要排查“看到了不同证据”。如果换成完全相同材料以后差异消失,问题就在检索;如果差异仍在,就必须检查生成与解释阶段。这里必须固定片段内容、顺序和截断方式,仅说“来自同一份年报”是不够的。

NR 对比 MEM,则把“你是一个什么样的分析师”改为“你服务的用户有什么偏好”。前者容易被模型当成自己的判断立场,后者更像需要单独满足的客户约束。这是一个可检验的机制解释,不是“所有人设提示都不能用”的禁令。

但三组之差不是纯粹的心理机制因果分解。角色措辞、中性助手声明和用户画像表述并非只有一个字符不同;缩小的效应不能全部归功于某个词的位置。可以把实验看成两套实际提示方案的对比,不能把其中的比例命名为大模型内部认知偏差的精确构成。

原文证据

69% 到底怎么算:它的分母不是文件数量

作者先在每种模型、条件和评分字段上做文件固定效应回归:评分 = 文件固定效应 + 角色系数 + 误差。角色系数衡量相对于中性提示,同一文件的评分平均移动多少。统计推断按文件聚类,使用 1,000 次 bootstrap。

对某一角色,保留比例 Retain = |NR 角色系数| ÷ |PR 角色系数|。使用绝对值是因为做多、做空可能朝相反方向移动。正文的平均 69%、中位数 68%,汇总的是四组强信号匹配角色;第五组动量因基准效应接近零而没有进入头条汇总。12 个模型的汇总保留比例为 44%—89%。

原文位置:§3.4–3.5,Table 1
编辑理解

用一组假设数字把三个指标算一遍

以下数字是我为解释公式设置的教学例子,不是论文观测值。假设某角色在 PR 下相对中性评分移动 −0.20,在 NR 下移动 −0.14,在 MEM 的证据字段移动 −0.04,而个性化字段移动 −0.16。

保留比例是 0.14÷0.20=70%:固定证据后,原来的角色效应还剩七成。角色改成用户画像后的缩减比例是 1−0.04÷0.14≈71.4%:这是对 NR 的进一步缩减,分母不是最初的 0.20。MEM 泄漏比例则是 0.04÷(0.04+0.16)=20%:它比较两个输出字段承载的偏好效应,不是说 20% 的回答错误。

这三个百分比不能相加,也不能相互替换。尤其不能写成“固定检索解决了 30% 的幻觉”。实验没有把幻觉数出来,而是在测评分系数。还有一个陷阱:若 PR 系数仅为 0.001,NR 为 0.002,保留比例就是 200%,但绝对移动非常小。因此读比例时必须同时看绝对效应。

原文证据

同一公司怎样从偏多变偏空:可口可乐案例

附录选择可口可乐 2023 年 10 月 24 日提交的 10-Q,作为 PR 下做多与做空角色分歧最大的案例。文件同时包含 154 亿美元现金及相关流动资产、约 56 亿美元税务诉讼相关潜在税费负债等材料。PR 下,做多角色检索到的流动性片段排名第二;做空角色下它排第九,因此落在 top-8 之外。这里确实有材料选择差异。

换成 NR 后,双方拿到同样八段,包括流动性和税务风险,却仍给出 +0.20 与 −0.30 的证据评分。MEM 下相应证据评分收敛到 +0.20 与 +0.10。注意,这是作者挑出的极端案例,不能把它当作全体文件的典型平均。

可口可乐个案的 EvidenceScore;不是模型准确率,也不是股价预测
条件做多角色/成长型画像做空角色/下行保护画像两者差距
PR+0.60−0.601.20
NR+0.20−0.300.50
MEM+0.20+0.100.10
原文位置:Appendix D.14,Table 9
编辑理解

原文也有值得纠正的表述,不能照单全收

这个案例很有说服力,但附录紧接着的文字不够严谨:它算出固定证据后的差距是原差距的约 42%(0.50÷1.20),却又将角色解释称为这个文件分歧的“较大部分”。只按所列数字,移除的差距是 0.70,保留的差距是 0.50,前者才更大。这个个案能证明同证据下仍有明显分歧,不能凭这组算术证明保留部分占多数。

这不推翻全文平均保留 69% 的结果:个案与跨模型、跨角色的平均本来就不是同一个统计量。它提醒我们必须把“作者想说明什么”与“这张表实际支持什么”分开。

原文位置:Appendix D.14,Reading the table 第 (2) 点
原文证据

究竟哪个改动有效:不能只归功于分成两个输出框

做空角色与下行保护画像这一组,NR 到 MEM 的缩减幅度在不同模型上为 51%—87%,中位数 73%。12 个模型的平均泄漏比例都低于 0.5,但不为零;范围为 0.05—0.37。0.5 表示用户偏好效应在证据字段与个性化字段的绝对系数相等,并非错误率的一半。

作者还做了角色/用户画像与单/双输出的 2×2 消融。在两种输出格式下,画像表述的证据侧效应仍只有角色表述的 16%—39%。所以减弱偏差不只是把 JSON 拆成两个键带来的;角色如何表述本身也起作用。机制核查只覆盖部分模型,不应外推为所有模型的稳定规律。

原文位置:§4.2–4.3,Limitations
编辑理解

排名有效与评分不稳为什么可以同时成立

举一个自设例子:中性角色给三家公司 0.2、0.4、0.6,悲观角色给 −0.2、0.0、0.2。三家的优劣顺序完全没变,Spearman 排名相关为 1;但如果系统在评分大于 0 时才入选,入选数量就改变了。一个信号可以保留横截面排序信息,同时严重影响绝对阈值决策。

这意味着应用评估至少应分两层:若只取前 20%,检验排序与入选名单变化;若按评分决定买卖、仓位或风险预警,还要检验校准与阈值穿越。只看 Rank IC 无法保证绝对评分可靠,只看评分平均偏移也不能断言选股完全失效。

论文的后续收益相关性分析因此只能作为旁证。它没有自动解决预训练知识、财报发布日期对齐、同公司重复观察、交易费用以及真正前瞻测试的问题。不能从“角色内排序含信息”跳到“换个提示词就能做出可交易策略”。

原文位置:§4.6,Table 3,Limitations
编辑理解

我的证据评级:机制诊断值得借鉴,正确性与投资效益仍未证明

最扎实的部分是固定证据后的角色对比:它给出了清楚的可反驳条件。如果复测时同文、同模型、同预算下的差异小到与重复调用噪声相当,那么对那个模型和任务,角色解释渠道就不再是主要问题。

我最在意的三个缺口是:第一,中性评分没有外部金标准,稳定地判断错也会通过不变性测试;第二,证据评分是复杂判断,不是营业收入这样的客观字段,评分准则本身可能允许合理分歧;第三,历史公开财报可能进入模型预训练,本文不是一场干净的历史选股竞赛。

所以我会给出很窄但有用的阅读结论:不要把“人设更专业”当作“证据更准确”的替代指标;把角色敏感性加入模型验收,但不要用它代替事实正确性验收。

核查记录

已核查正文、表 1/3/9、附录 D.14 和限制说明;未执行作者代码

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-09-02待核
作者 Table 1 的四组角色汇总;三列衡量不同现象,不能互相替代
模型或汇总PR 平均绝对系数NR 保留比例MEM 泄漏比例
DeepSeek-V3.10.2076%0.11
gpt-oss-120b0.3082%0.34
Llama-3.3-70B0.2574%0.05
Llama-3.1-8B0.4072%0.29
12 模型平均0.2069%0.19

原文位置:Table 1;展示部分模型与全体平均

三组实验究竟改了什么(依据 §3.2 重组)
条件检索材料生成时的身份与偏好
PR角色参与检索查询;材料可能不同助手扮演投资角色
NR每份文件先做中性检索;所有角色收到逐字相同材料仍让助手扮演投资角色
MEM沿用 NR 同一份材料助手保持中性;偏好改写成第三人称用户画像

原文位置:§3.1–3.3

可口可乐个案的 EvidenceScore;不是模型准确率,也不是股价预测
条件做多角色/成长型画像做空角色/下行保护画像两者差距
PR+0.60−0.601.20
NR+0.20−0.300.50
MEM+0.20+0.100.10

原文位置:Appendix D.14,Table 9

推荐 91/100 · 问题 29/30 · 证据 27/30 · 方法 23/25 · 复现 12/15

固定证据的对照、角色/记忆与输出通道消融较完整;不能由评分偏移直接推出投资损失,复现仍需多模型调用成本。

尚未执行的实验思路

优先做提示与输出结构的审计,不先回测股票。用一份冻结的公开中文报告片段集,分别运行角色提示、中性助手加用户画像;每种条件都保留模型版本、完整输入、片段哈希和原始输出。在每个条件内部重复调用,估计系统本身的波动。 输出拆为三个层次:事实表(数值、单位、报告期、原句位置)、证据评价(统一书面评分准则)、用户适配(明确使用哪些偏好)。同一用户偏好只能在第三层改变效用权重,不能回写事实表。检验事实错误、证据分差、符号翻转与入选名单重合率,并按公司聚类,而不是把同一家公司的多份报告当作完全独立样本。 通过标准应先由使用场景确定:例如硬事实的角色差异应为零;判断分差的容忍度应根据评分刻度和重复噪声制定。这里没有先拍一个看似科学的通用阈值,也没有宣称实验已经跑过。

CC BY 4.0;以下为中文改写、重组与独立评论,非作者原文

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

让模型分清多层表头与数据的归属

H2Table: Hierarchical Hypergraph-Enhanced Large Language Models for Complex Table Reasoning

Jia Ling、Yangfan Wang、Chen Tang、Haoming Tan、Yang Yang、Yi Guan、Jingchi Jiang

遇到财报多层表头,先保留“这个数字属于哪一层”,可能比单纯增大模型更值得尝试。

2 分钟看懂

表头套着表头时,模型能否分清“这个数字到底属于谁”?

把多层表格拍平成文本,容易丢掉年份、业务和地区之间的归属关系。

编辑自设例子,非作者实验

自设例子:表头依次为“2025 年 → 国内业务 → 收入”。只保存最近的“收入”二字,就可能把海外值或上一年值拿错。

  1. 保留多层表头结构
  2. 把层级关系编码为超图
  3. 结合结构学习表示
  4. 按完整归属回答表格问题
关键结果与解释边界
核对项结果意味着什么
深层表头任务62.86 → 71.43TAMO 四层表头上改善 8.57 个百分点。
浅层表头任务71.43 → 68.57一层表头反而下降,不能概括为所有表都更好。
平均分71.86 → 74.15平均改善需要与不同结构层级的结果一起看。

不能推出什么

效果取决于表结构复杂度;引入更复杂编码不是无条件占优。

研究用途

财务表处理先保留单位、表头路径与合并单元格,再谈模型推理。

详细讲解

编辑理解

模型算错之前,可能已经拿错了数

读财报表格时,真正麻烦的常常不是乘除法,而是一个数字同时属于哪个业务、地区、报告期和单位。如果数据提取后只剩一串列名与数字,模型可能计算得很准确,却在计算错误的对象。

下面用一个自设例子说明:营业收入分国内、海外,每个地区各有 2024 年和 2025 年。海外分别为 100、120,国内分别为 200、210。问题是“海外收入同比”。正确答案为 120÷100−1=20%。若错把国内 2024 年的 200 当分母,就得到 −40%。这不是推理步数不够,而是地址选错了。

原文证据

论文做的结构改动

H2Table 把单元格作为节点、表头作为超边,并保留父子表头。编码时依次让单元格汇入叶表头、子表头汇入父表头、父表头向下传递、表头回传单元格;可学习查询向量将图表示压缩成结构提示,与表格文本一起送入经 LoRA 调整的 LLM。它不是扫描 PDF 的 OCR 系统。

原文位置:§3,Figure 2
编辑理解

超图并不神秘:先把这个数字的完整地址保住

在上面的自设表格中,数字 120 的完整地址应是“营业收入/海外/2025 年”,而不是孤零零的“2025 年”。同一个年份可以出现在很多业务分支下;父节点决定子节点到底是什么意思。

普通的两两连线擅长表达 A 与 B 有关系;一张表头统辖很多单元格时,更自然的表达是一个集合。如果再把多层表头压成一层,虽然还知道很多节点彼此相关,却弱化了谁包含谁、谁与谁是同级的区别。

从机制上看,向上汇总让高层知道子项的内容,向下传播让局部带回全局语境。这里的“汇总”是可学习向量的信息融合,不是把收入数值做算术相加。读者不应误以为经过图网络后,财务勾稽关系就自动得到严格保证。

编辑理解

为什么还需要结构提示,而不是把图直接塞给模型

语言模型最终接收的是它能处理的输入表示。一个大型表格如果把每个节点和每条关系全展开,输入长度可能很快变得昂贵。结构压缩的作用,是用有限容量传递对任务有用的关系。

可以把它理解为两份并行材料:文字表格给原始内容,结构表示提醒模型如何组织这些内容。它不是把原文换成一个神奇摘要,也不是一种免费的压缩。容量有限时,稀有但关键的表格细节仍可能被忽略;因此最后仍要检查答案引用了哪些单元格,而不只是看生成文字流畅不流畅。

原文证据

看同一模型内的增量,不要先看跨模型冠军

HiTab 上,同为 Llama3.1-8B、LoRA:四层表头准确率由 TAMO 的 62.86% 到 H2Table 的 71.43%;一层则由 71.43% 降至 68.57%。各深度算术平均为 71.86% 与 74.15%。这些结果不支持“每种深度都改善”。

原文位置:Table 1
编辑理解

把提升算清楚,并辨认平均值隐藏了什么

四层表头的增量是 8.57 个百分点;相对 TAMO 的提高约为 13.6%,两种说法分母不同。各深度平均提高 2.29 个百分点,也不等于整份测试集中随机抽一道题的正确率提高 2.29 个百分点:宏平均给每个深度相同权重,而题目数量可能不同。

一层上的退步尤其有价值。它提示改进可能是有针对性的结构偏置,而非无条件提升语言能力。若实际工作中绝大多数是简单表,复杂度收益可能不足以抵消训练、解析和维护成本。

更公平的阅读顺序是:先看同一基础模型、同等训练条件下更换表示的差异;再看不同数据分布;最后才看小模型与大模型的跨组比较。训练过的专用小模型胜过零样本大模型,不等于它在任意财报工作流里都更强。

编辑理解

我认为论文之外还缺一个廉价但很强的对手

回到教学表格,把每个数明确写成“业务=海外;指标=营业收入;期间=2025 年;单位=亿元;值=120”,再要求模型只负责选择字段、计算器负责算术。这种完整路径展开没有学习型图编码,却保留了语义地址。

如果它已经解决绝大多数错误,图模型的必要性就较弱;如果图方法在相同预算下,面对更深表头、同名列和跨层比较仍有明显优势,额外复杂度才更值得投入。这不是声称路径展开一定赢,而是要求新方法战胜与痛点直接相关的基线。

另一个风险在上游:如果 PDF 解析阶段把“海外”挂到了错误父表头,再强的层级编码也可能忠实地学习错误结构。评价应同时包含“给正确结构”和“从真实 PDF 起步”两种条件,把结构推理能力与解析可靠性分开。

核查记录

已核查方法、主表和实验设置;未训练模型

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-09-01待核
HiTab / Llama3.1-8B,同为 LoRA;准确率百分比
表头层数TAMOH2Table
一层71.4368.57
四层62.8671.43
各深度算术平均71.8674.15

原文位置:Table 1

推荐 81/100 · 问题 25/30 · 证据 23/30 · 方法 22/25 · 复现 11/15

结构归属对财务表重要,深层表头对照清楚;部分浅层任务退步,训练与迁移成本需要另验。

尚未执行的实验思路

建立一套按整张表划分训练/测试的中文题集,避免同一表的近似问题泄漏。每题存正确单元格地址、原始数值、单位和计算表达式。 先比较原始表格文本、完整表头路径、路径加确定性计算三条链路,再决定是否投入 H2Table 训练。统计取数错误、父子归属错误、单位错误、算术错误,不能只有一个总准确率。如此即使最终不使用图网络,这篇论文仍能帮我们定位财报阅读的真正瓶颈。

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

回答一个问题,如何找全分散在多篇材料里的证据

A Tree-based RAG Framework for Evidence-Intensive QA via Adaptive Planning and Topology-Aware Evidence Gathering

Songeun Lee、Kyungjin Min、Injae Na、Suyeong Lee、Chiyoung Kim、Woohwan Jung

研究类问答的难点常常不是读懂一篇文档,而是发现自己还缺哪部分材料。

2 分钟看懂

问一个跨多份材料的问题,模型怎样知道自己还漏了什么?

普通 RAG 像一次只拿几份材料给研究员:拿到的都相关,但相关不等于齐全。

编辑自设例子,非作者实验

自设投研例子:判断 A、B、C 三家公司收入改善主要来自提价还是销量。A 公司直接披露了量价;B 公司只给收入和销量,需要核对单位再算平均单价;C 公司没有销量,就应保留“证据不足”,不能用同行补上。这个例子用来解释流程,不是论文的金融实验。

  1. 列出需要回答的公司与问题
  2. 已有材料够 → 复用;问题简单 → 检索
  3. 仍然复杂 → 拆成更小问题
  4. 汇总子问题,并保留证据缺口
关键结果与解释边界
核对项结果意味着什么
证据召回31.68 → 50.79应找到的证据,确实找回更多;仍没有全部找齐。单位为百分点口径的召回分数。
回答 F146.64 → 50.84答案质量改善 4.20 个点。不是投资判断准确率,也不是收益率。
效率模块的代价104.59 秒 / 50.84 F1去掉聚类与横向复用,变为 183.95 秒 / 53.96 F1:完整版本更快,但不一定答得最好。

不能推出什么

这篇测的是通用多文档问答,不是财报量价分析。召回率与 F1 衡量不同环节,不能把两个增量当同一种准确率比较。

研究用途

对量化研究的用途是组织跨材料查证,不是直接预测股票。先看 Table 2,再看 Table 3 的速度—质量取舍。

详细讲解

编辑理解

先把问题说清:不是找到一篇相关材料,而是把该找的找齐

我们用一个问题贯穿这篇:A、B、C 三家公司本期收入都改善了,主要靠提价还是销量?这是编辑自设的投研例子,不是作者做过的金融实验。

只搜这句话,系统可能找回几篇行业景气文章,内容看上去很相关,却没有覆盖三家公司的量价数据。反过来,直接塞入三份年报,也不保证相关附注、历史口径和补充公告都在其中。

所以这篇研究处理的不是“模型能不能把话写顺”,而是:如何发现缺口,并决定下一份该找什么。

编辑理解

传统的一次检索,卡在了哪里

假设第一轮拿到了 A 公司的收入和销量,以及一篇行业价格新闻。模型现在确实有材料,但它没有 B、C 两家的证据。若直接开始总结,就可能把 A 的情况推广到所有公司。

把问题预先拆成 A、B、C 三个固定任务也还不够:B 可能需要继续核对收入口径,C 可能需要翻附注。每个分支的难度不一样,不能要求每家公司都只搜同样几次。

APT-RAG 的思路是:边做边决定下一步,而不是在一开始就把路线完全固定。

原文证据

到每一步,只作三个选择:复用、查找、继续拆

作者把总问题和子问题组织成树,按深度优先顺序交错进行规划与回答。到一个新问题时,先用之前完成的同层问题补全指代和约束。

第一种选择:已完成的问答足以回答当前问题,就复用已有证据。第二种选择:问题已足够简单,但还缺材料,就直接检索。第三种选择:问题依然复杂,就拆成更小的子问题;子问题完成后,再向上合成答案。

论文把这三条路叫横向、外部和纵向证据收集。名字不是重点:重点是已有答案可以被后面的任务利用,复杂分支可以继续展开。

原文位置:§3.2–3.4;Figure 2
编辑理解

把这三个选择放回我们的公司例子

A 公司直接披露量价贡献,找到对应表格即可回答。B 公司只披露收入与销量,需要继续追问单位、统计范围和是否包含新并表业务;确认口径后,才有资格推导平均单价。C 公司缺少销量披露,就应保留无法确定,不能用行业价格新闻补成公司事实。

等 A、B 的分析已经完成,再问“哪家收入改善更依赖价格”,就可以复用前面的结果,不必重搜同一份表格。但若继续问“提价能否持续”,已有量价数据并不够,还需要竞争和订单证据。

这也说明为什么这套方法不是自动正确:负责决定“够不够”的规划器本身也可能判断错。流程能够组织查证,却不能代替查证。

原文证据

真正的实验:证据找得更多了,答案只改善了一部分

作者的 MoNaCo 测试有 1,315 个问题,平均涉及 43.3 篇金标准证据文档。它不是上面的公司量价任务。

在 Qwen3-30B-Inst 设置下,一次式 NaiveRAG 的检索召回为 31.68,APT-RAG 为 50.79;回答 F1 则从 46.64 到 50.84。前者衡量证据有没有被找回,后者衡量最终回答的质量,不能把两者看成同一个准确率。

MoNaCo 还包含模型辅助的语义评估。50.84 不是“财务字段有 50.84% 正确”,更不是投资胜率。

MoNaCo:同模型、同数据集下的两段效果
环节NaiveRAGAPT-RAG变化
找到证据:召回31.6850.79+19.11 个百分点
组织答案:F146.6450.84+4.20 个点
原文位置:§4.1;Table 1–2
原文证据

另一个反转:完整配置更快,却不是分数最高

为了减少重复发送相同文档,作者加入证据聚类和批量回答,也使用同层答案复用。这些是效率设计,不应先入为主地认为它们一定提高质量。

完整配置的 F1 是 50.84,平均延迟 104.59 秒;去掉证据聚类与横向复用后,F1 为 53.96,但要 183.95 秒。也就是说,省时间确实有收益,也确实可能付出质量代价。

两项效率模块的取舍:同一消融实验
配置F1平均延迟
完整框架50.84104.59 秒
去掉聚类与横向复用53.96183.95 秒
原文位置:§3.5;Table 3
编辑理解

量化研究员应借鉴什么,而不是直接照搬什么

我的判断是,这篇的价值在“按证据缺口分配研究工作”。做财报、公告或跨公司事件研究时,可以让每个子问题都留下数据来源、所属公司、期间、单位和仍未解决的矛盾。

最需要防的是把中间总结当成原始证据。假如 B 的收入被错认成 A 的,后续复用可能把错误越写越自洽。因此每条中间结论都要能回到原文,允许它被后面的反证推翻。

对每周一次的研究看板,节省几十秒未必比少漏一条证据重要;对实时服务则可能相反。先明确质量和延迟预算,再决定是否采用论文的效率模块。不要因为它是默认配置,就认为它最适合自己的产品。

核查记录

已核查方法、表 1–2 与评测设置;未运行仓库

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-09-04待核
Qwen3-30B-Inst / MoNaCo,作者报告
方法回答 F1检索召回
NaiveRAG46.6431.68
ToQ46.6631.91
APT-RAG50.8450.79

原文位置:Table 2

MoNaCo:同模型、同数据集下的两段效果
环节NaiveRAGAPT-RAG变化
找到证据:召回31.6850.79+19.11 个百分点
组织答案:F146.6450.84+4.20 个点

原文位置:§4.1;Table 1–2

两项效率模块的取舍:同一消融实验
配置F1平均延迟
完整框架50.84104.59 秒
去掉聚类与横向复用53.96183.95 秒

原文位置:§3.5;Table 3

推荐 86/100 · 问题 27/30 · 证据 25/30 · 方法 23/25 · 复现 11/15

检索完整性与成本的消融有实用价值;全系统并非最高 F1,自动裁判与跨金融域外推限制结论。

尚未执行的实验思路

这只是未执行的实验设计:准备 30 个能人工核对的跨文档问题,预先列出必要证据和至少一条反证。固定语料与总费用,比较一次检索、固定拆题和动态拆题。分别记录证据遗漏、错误引用、未回答部分、费用和延迟;不要只比较答案长度或引用数量。

CC BY 4.0;以下为中文改写、重组与独立评论

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

模型升级后,旧记忆究竟丢在哪一步

Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability

Ankit Goyal、Jaideep Ray

资料库不要只保存模型摘要;原始证据、结构化事实和模型生成笔记应分开存。

2 分钟看懂

换了模型或向量编码器,为什么旧知识明明还在,系统却变笨了?

外部记忆可能包含旧模型习惯的写法或旧向量空间。文件能打开,不代表新系统能正确取用。

编辑自设例子,非作者实验

自设例子:老研究员写的私人缩写交接给新人。笔记没丢,但有些意思只有原作者懂;统一字段表通常更容易交接。

  1. 让不同模型写入记忆
  2. 交换记忆的读取者
  3. 分别检查检索与理解
  4. 比较笔记、原文和结构化存储
关键结果与解释边界
核对项结果意味着什么
Llama 读取 NOTES37.62 → 47.53继承其他模型笔记后反而提升,迁移不是必然变差。
Qwen 读取 NOTES47.19 → 33.91反向迁移大幅下降;方向不对称。
混用向量空间54.47 → 47.53该实验中混合索引弱于完整新索引,维度相同也不能保证兼容。

不能推出什么

合成任务和固定结构有适用边界;不能推广为知识图谱永远优于文本记忆。

研究用途

升级模型与 embedding 时分别验收存储、检索、理解,不要只验文件是否迁移成功。

详细讲解

编辑理解

把忘记拆成三件事,不然很容易修错地方

一个研究助手回答不出上周的决策,至少有三种可能:当时写摘要时就没记下来;记下来了但检索没找到;已经放进上下文却被新模型误读。它们看起来都是“忘了”,修法却不同。

第一种需要回到原始记录,第二种要修检索,第三种才更像读者能力或格式兼容的问题。如果一概换更强模型,前两类问题可能完全不动。本文有价值的地方,是把记忆看成数据处理链路,而不只看成聊天软件里的一个功能开关。

原文证据

实验怎样隔离写作者与读者

作者使用 48 组合成历史与随机答案编码,比较两个模型:Llama-3.1-8B 与 Qwen2.5-7B。随机编码用于降低预训练直接知道答案的可能,采用精确评分而非模型裁判。

四类存储是原文长上下文 LC-RAW、原文分块检索 RAG、模型自由摘要 NOTES,以及按固定字段构造的知识图谱 KG-fixed。迁移 A→B 时,关键比较是“B 读 A 写的存储”与“B 读自己写的存储”,读者始终为 B。这样才能把旧存储兼容性与 B 本身的能力区分开。

RAG 的向量模型变化另做实验,而不是把读者升级、写作者升级、索引升级一次性混在一起。

原文位置:§2.1–2.3,§3
原文证据

为什么 A→B 和 B→A 必须分别看

自由摘要的结果明显不对称:Qwen 读自己的笔记为 47.19%,读 Llama 的笔记为 33.91%,下降 13.28 个百分点;Llama 读自己的笔记为 37.62%,读 Qwen 的笔记为 47.53%,反而上升 9.91 个百分点。

同表中固定结构的变动很小:Llama 为 84.56%→84.45%,Qwen 为 98.78%→98.80%。但 KG-fixed 的结构按合成任务字段设计,读取方式也不同,不能把它概括为知识图谱在所有真实任务上都达到接近 99% 的准确率。

固定读者,只更换存储写作者;准确率与方向性变化
格式/读者读自身存储读另一模型存储变化(百分点)
NOTES/Llama37.62%47.53%+9.91
NOTES/Qwen47.19%33.91%−13.28
KG-fixed/Llama84.56%84.45%−0.11
KG-fixed/Qwen98.78%98.80%+0.02
原文位置:Table 3
编辑理解

保留率的分母为何必须是新模型自己的存储

假设新模型在理想的新存储上能答对 80 题,接手旧存储后答对 60 题,它丢失的是相对自己可达能力的 20 题。若旧模型以前只答对 50 题,那么从用户体验看升级仍进步了,但从迁移质量看,新模型的潜力没有充分发挥。

这两种问题都值得问,却不能混成一个指标。前后产品效果是“60 对 50”;记忆兼容性是“60 对 80”。固定新读者的对照正是为了避免偷换问题。

双向平均也有类似风险。一个方向提高、一个方向下降,平均接近零不表示两种存储可以安全互换。实际部署只发生某一个方向,不能用另一方向的收益来抵消本次迁移损失。

原文证据

预先设的五点门槛,没有全部通过

作者在收集主结果前固定四个检验,要求效应超过 5 个点,并通过四重比较的 Holm 校正。对称的笔记迁移损失 H1 与“笔记比固定结构更差”H4a 都未得到计划检验支持;混合向量索引的损失 H2 为 +6.95 个准确率百分点,原始历史修复的优势 H7a 为 +8.90 个百分点,得到支持。

这里 H1/H4a 的尺度是机会校正后的保留表现,H2/H7a 是准确率百分点,不能把四个数字不加区分地排在一起。作者先做 t 检验,之后补做预定 bootstrap,结论一致,但后者是在看过初步结果后进行,不能重新包装成完全按原计划的一次性检验。

原文位置:§3.5,Table 1–2
编辑理解

这个负结果为什么反而值得读

如果只看标题和方向性大幅下降,很容易写成“论文证明换模型普遍破坏记忆”。但预先计划的对称检验并不支持这个强结论。更稳妥的说法是:存在明显方向依赖,需要逐方向验收;混合索引和丢弃原文是本实验中证据更明确的问题。

统计上,“没通过超过五点的检验”不等于“没有任何影响”,也不等于“两个系统完全等价”。这只是原先声称足够大的效应没有得到支持。阈值和统计单位在这里直接决定结论,而不是文章末尾无关紧要的技术细节。

48 组历史才是主要独立单位;不能把同一历史里的大量问题都当独立样本来夸大把握。实际使用时,应按项目、客户或文档集合组织检验,而不是只追求题目总数。

原文证据

向量维度一样为什么仍不能混用

向量实验把 bge-large-en v1.0 升至 v1.5,两者都是 1,024 维。完整重建后的答案准确率为 54.47%,旧索引为 42.57%,50/50 混合索引为 47.53%。混合方案仍比旧版好,但损失了完整迁移的大部分增益;没有维度报错不代表空间兼容。

原文位置:§4.3,Table 4
编辑理解

用坐标系解释这件事,比记住版本号更有用

这是我的自设几何例子:旧模型把某主题映成向量 (1,0),新模型因整体旋转把同一主题映成 (0,1)。新查询也是 (0,1)。它与新文档余弦相似度为 1,与语义相同的旧文档却为 0。两个都是二维、数组长度完全合法,但跨空间距离不再对应同一种语义。

所以更新“回答问题的模型”和更新“计算向量的模型”是两种迁移。如果向量模型没变,换读者并不必然要求重建索引;如果向量模型变了,应分别建立与测试新旧索引,不能只因维度一致就合并排序。

原文证据

只有摘要时,润色为什么救不回被删除的事实

作者的笔记修复实验中,仅改写存储在所测预算下未达到 90% 的恢复目标;保留原始历史时,Qwen 在 48 组中恢复 34 组,而另一方向受到输出长度限制,未恢复成功。原文可用不等于一定恢复,但没有原文会失去找回已删事实的路径。

因此不能把结果解释成“让新模型把旧摘要重写一遍就好了”。修复输入是否包含原始证据,是比文风兼容更根本的变量。

原文位置:§4.4,Appendix E

核查记录

已核查实验设计、表 2–3 与限制;未复现实验

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-09-04待核
固定读者,只更换存储写作者;准确率与方向性变化
格式/读者读自身存储读另一模型存储变化(百分点)
NOTES/Llama37.62%47.53%+9.91
NOTES/Qwen47.19%33.91%−13.28
KG-fixed/Llama84.56%84.45%−0.11
KG-fixed/Qwen98.78%98.80%+0.02

原文位置:Table 3

推荐 87/100 · 问题 28/30 · 证据 25/30 · 方法 22/25 · 复现 12/15

双向迁移与阴性结果值得读;合成工作负载及模型方向依赖限制泛化,不能宣称所有旧记忆都损坏。

尚未执行的实验思路

本周刊保留原论文地址、精确版本、证据位置和结构化笔记;中文解读只作为派生内容。未来修订观点时追加修订记录,不直接抹去旧结论。事实记录至少包含对象、时间、原始来源和限定条件,不能只存一句“这篇很好”。 若将来增加长期检索,给每条向量记录版本并隔离索引;先用冻结的历史问题验收,再切换。题目要包括时间更新、意见撤回和“材料没说”的情况,避免只验证简单记忆题。 这不是立即建设知识图谱的理由。先保留可恢复的证据和稳定字段,已经能获得大部分工程收益;只有复杂关系查询确实需要时,再引入图数据库。

CC BY 4.0;以下为中文改写、重组与独立评论

返回全年目录 ↑

AI / 研究补充 / 正文核查完成

个股历史长短不齐,怎样估计组合风险

End-to-End Neural Shrinkage of Indefinite Pairwise Correlation Matrices for Small-Cap-Inclusive Portfolios

Christian Bongiorno、Lorenzo Villassero

保留历史不完整的个股需要正面处理缺失数据,而不是删掉它们或把缺失收益填成零。

2 分钟看懂

新上市股票历史短、老股票历史长,怎样一起估计组合风险?

只取共同历史会浪费老股票数据,粗暴补齐又可能扭曲相关性。作者让风险估计适应不等长样本。

编辑自设例子,非作者实验

自设例子:甲股票有 8 年历史,乙只有 1 年。我们既不愿删掉甲的前 7 年,也不愿假装乙在那 7 年有真实行情。

  1. 按股票对提取可用重叠信息
  2. 学习并约束风险矩阵结构
  3. 据此构造长期多头组合
  4. 在逐年扩展样本中检验
关键结果与解释边界
核对项结果意味着什么
作者年化波动11.17%是所测组合的风险结果,不是单只股票预测误差。
年化收益9.30%作者 2000—2025 实验设置,不能当作 A 股复现。
最大回撤−41.3%风险改善不等于没有大幅回撤。

不能推出什么

本文实验区间与约束是作者设置;本看板没有替用户运行 A 股回测。

研究用途

适合研究新股或数据缺失下的风险估计,先核对训练目标与实际组合约束。

详细讲解

编辑理解

先分清:它在估计风险,不是在预测哪只股票涨

组合优化需要知道股票彼此怎样一起波动。即使完全不预测收益,也可以尝试把权重分配给组合风险较低的方向。问题是,新上市、间歇交易或历史不齐的个股,没有一张所有日期都完整的收益矩阵。

删除所有不完整个股会改变股票池;删除所有存在缺失的日期又可能丢掉大半历史。更自然的做法是每对股票使用各自重叠的数据,但不同配对来自不同时间段,最后拼出的关系未必能同时成立。这是论文要处理的数学问题,不是“缺失值填好就行”。

原文证据

作者方法和测试条件

RIEnet 用带缺失掩码的收益、成对重叠长度和带符号的特征值,学习正的逆谱并重建有效协方差。训练目标为未来五日最小方差组合风险,测试统一使用只做多优化器。美国个股测试期 2000—2025,最多 1,500 只,回看 1,200 个交易日,每五日调仓,并模拟交易成本。首个训练模型使用 1990—1999,不能当作短样本 A 股复现。

原文位置:§2–4,Table 1
编辑理解

三只股票的例子:每一对都合理,合在一起却不可能

以下矩阵是我自设的数学例子,不是作者数据。设 A 与 B 的相关为 0.9,A 与 C 为 0.9,B 与 C 却为 −0.9,三只股票方差都为 1。每个单独相关系数都在 −1 到 1 之间,看起来合法。

但把它们拼成矩阵后,特征值为 1.9、1.9、−0.8。取权重 (−1,1,1),组合估计方差 w′Cw = −2.4。现实方差不可能小于零,这说明三组局部估计没有构成一个整体有效的风险模型。

例子中的负方差方向含卖空;只做多约束可能避开这个具体方向,但不能因此宣布原矩阵就是合法协方差。数学有效性和某组投资约束下是否恰好出错,是两件事。

自设相关矩阵,仅用于解释不一致的成对估计
ABC
A10.90.9
B0.91−0.9
C0.9−0.91
编辑理解

修成合法矩阵与修成好预测矩阵,仍是两道关

最直接的修复是把负特征值抬到一个小正数。但这只保证不会出现负方差,不保证未来风险估计好。一个很小的正特征值在取逆后会变得很大,优化器仍可能把权重集中到估计噪声造成的“便宜风险方向”。

在刚才的例子中,用 C_new=(1−α)C+αI 做一个简单收缩。最小特征值变成 −0.8+1.8α;因此 α 大于 4/9 后才严格为正。取 α=0.5 时最小特征值为 0.1。这个算例只说明怎样恢复有效性,不说明 0.5 是实际投资的最优参数。

这便是收缩的实质:宁可牺牲一点对历史样本的贴合,也不要对不可靠方向过度自信。可学习的收缩需要进一步证明,它比廉价、固定的修复规则更能降低未来风险,而不是只会把训练数据拟合得更漂亮。

编辑理解

为什么重叠样本长度应该进入风险模型

两个相关估计都为 0.3,一个来自约 500 天重叠记录,一个只有 25 天,置信程度显然不同。如果优化器把它们当同样可靠,短历史个股可能因为偶然低相关而被分到过高权重。

因而缺失掩码不是清洗结束就丢掉的辅助变量,它包含“这个估计有多可靠”的信息。更困难的是,组合方向由很多股票共同构成,不能只给每只股票一个历史长度就完全概括不确定性;需要考虑各对股票实际共同出现多久。

对真实样本,这也提示一个额外检查:缺失是否随机?停牌、上市与退市往往关联公司状态。仅处理矩阵正定性,不能自动解决这种经济上的选择问题。

编辑理解

把作者的结果放回风险目标里

下表是作者在其模拟执行条件下的结果,不是我们跑出的数据。RIEnet 与 Factor 的年化波动为 11.17% 与 14.08%,差 2.91 个百分点,相对下降约 20.7%;CAGR 是另一项指标,不能拿波动的相对下降冒充收益提升。

如果最终目的是风险控制,我会先看不同市场阶段的实现风险、预测风险与集中度,再看 Sharpe。较高 CAGR 可以是组合路径的结果,却不能证明模型学会了预测个股收益。更不能把 26 年汇总数字直接搬到当前短样本。

成本已模拟是加分项,但其规模、冲击函数和成交假设仍然决定结果。在另一个市场,交易限制与流动性不同,不能把“作者扣过费”理解成“我们的费用也已经被处理”。

原文位置:§4.3–5,Table 1
编辑理解

我最想追问的对照是什么

同一股票池、同一只做多约束下,应把风险估计器与执行器完全分离。否则若某方案额外限制了单股权重、少交易或避开难成交股票,风险改善未必来自矩阵估计。

还应同时比较“只修复正定性”“修复后简单收缩”“因子或回归补全”与神经方法。若复杂模型只战胜明显脆弱的样本估计,而没有战胜这些强基线,就不足以支持部署。短样本尤其需要这种克制:股票数量多不代表拥有很多独立市场阶段,横截面不能无限替代时间样本。

我的重点不是质疑所有神经风险模型,而是把成功条件说清:它应当在未参与选择的时期,以可比换手和集中度,实现更稳定的风险。

核查记录

已核查方法、交易假设及表 1–2;未执行回测

四种日期不混用
收录日来源网页日论文首次公开最新版本日
非 Quantocracy 补充待核2026-08-31待核
作者美国个股回测,2000–2025,已含所模拟交易成本
方法年化五日波动CAGR最大回撤
RIEnet11.17%9.30%−41.3%
Factor14.08%7.33%−51.5%
等权20.90%7.53%−58.5%

原文位置:Table 1

自设相关矩阵,仅用于解释不一致的成对估计
ABC
A10.90.9
B0.91−0.9
C0.9−0.91

原文位置:NOT_FOUND

推荐 86/100 · 问题 28/30 · 证据 24/30 · 方法 23/25 · 复现 11/15

处理不齐个股样本直接相关,统一执行约束下比较风险;历史长期验证不等于当前 A 股可迁移,需重估稳定性。

尚未执行的实验思路

不照搬多年扩展训练。先画出当前个股样本的有效历史长度和成对重叠分布,检查负特征值是否真实存在、严重到什么程度。若缺失问题很小,论文复杂度可能没有必要。 在相同股票池与实际可用短窗口内,先比较等权、只做多最小方差、正定修复加简单收缩等轻量基线;窗口在看测试结果前锁定,并报告敏感性,而不是挑最好的一档。若再加入神经模型,必须把调参月份与最终评价月份隔离。 输出不仅是净值,还包括每期权重、实现波动、换手、持仓集中度、最短重叠长度与费用。这个试验回答“缺失处理是否改善组合风险”,不冒充选股 alpha,更不混入转债。

返回全年目录 ↑