Advanced A · 概率与统计
用分布、更新、检验和模拟,把交易判断变成可推翻的统计结论。
- 第 3 章 · K 线与成交量收益率的分布长什么样?肥尾为什么让基于形态的统计经常失真?
- 第 7 章 · 概率条件概率和贝叶斯更新,怎样让判断随新证据改变?
- 第 8 章 · 期望值怎样从历史样本估计期望值?估计本身的误差有多大?
- 第 10 章 · 方差与回撤怎样用 Monte Carlo 模拟一个策略可能经历的回撤分布?
先固定问题和观察单位
研究「信号出现后下一期净收益是否为正」,必须先规定一期是一天还是一笔交易、信号何时可见、费用怎样扣、重叠仓位怎样计数。同一笔持仓连续十天都发出信号,不等于十次独立实验。以下收益、概率和阈值都是教学假设,不是市场估计或交易建议。
本领域沿一份 Research Memo 推进:先写假设与数据字典,再计算,最后允许结论是「证据不足」或「推翻」。研究工作簿提供可复制模板和可运行代码;章节入口表说明它对应哪些 Foundation 节点。
Probability Distribution:先看分布,再看平均
把净收益记作随机变量 X,分布描述每种结果出现的概率。离散分布可以用结果表表示,连续价格变化可以用直方图或经验分位数表示。平均数相同,左尾可以完全不同;波动率只度量相对平均数的离散程度,并不包含所有跳空、流动性和破产风险。
练习采用四个等概率结果:−3%、−1%、1%、3%。均值为 0%,总体方差为 0.0005,总体标准差约 2.2361%。若这四个数是用来估计未知分布的样本,使用分母 n−1,样本方差变为 0.0006667。先写清是在描述有限总体还是估计未知总体,不能根据哪个数更好看来换分母。
把最差结果替换成 −15%,重新列均值、标准差、最差值和经验分位数。这个变化首先破坏「小幅对称波动」的假设。用正态分布拟合少量数据,不会让从未观察到的尾部风险消失。作品中必须同时给出分布图、样本数和最大损失;不接受只有 Sharpe 的结果页。
Conditional Probability:分母决定问题
P(A|B) 的分母是 B 出现的次数。假设 100 个不重叠观察中,有 40 次信号,其中 24 次下一期上涨;另外 60 次无信号中有 30 次上涨。信号后的上涨比例为 24/40=60%,全样本为 54/100=54%。这只是样本中的条件差异,不能证明信号导致上涨。
若信号总在高波动期出现,需要在相同状态内比较信号与无信号。否则可能把状态差异误认为信号贡献。练习按事前可知的高、低波动标签重新做两张列联表,并记录缺失标签。验收要求写出每个分母、时间戳与分组规则;不得在看见未来收益之后定义「趋势日」。
Bayesian Thinking:更新信念而非追逐连胜
把 H 定义为「策略确有正的净优势」,把 E 定义为「观察到预先规定的验证结果」。Bayes 更新的是 P(H|E),需要先验 P(H)、在 H 成立时看到 E 的概率,以及 H 不成立时误中 E 的概率。
P(H|E) = P(E|H) × P(H) /
[P(E|H) × P(H) + P(E|非H) × P(非H)]教学设定 P(H)=20%、P(E|H)=60%、P(E|非H)=10%,则后验为 0.12/(0.12+0.08)=60%。「验证通过」并未变成确定事实。若试验本来就是挑选出来的赢家,10% 的误中概率通常不能继续直接使用;选择过程也必须进入模型。
练习保持似然不变,把先验改成 5%,算出后验约 24%。解释先验为什么改变,以及什么证据会使它继续下降。作品必须列出先验来源与敏感性区间。没有合理似然时,宁可保留情景范围,也不要把主观把握伪装成精确概率。
Expected Value 与 Variance:估计也有误差
期望值是概率加权收益;历史平均值只是估计。教学策略有 40% 概率赚 2R、60% 概率亏 1R,每笔固定总成本 0.1R:毛期望 0.2R,净期望 0.1R。净结果为 1.9R 和 −1.1R,方差为 2.16R²。R 是预先定义的风险金额,不能用事后实际亏损重定义。
把每笔总成本提高到 0.3R,净期望变为 −0.1R。固定成本平移分布,不改变这个例子的方差;实际冲击与波动相关,成本并不总是常数。练习比较固定成本与最差状态成本翻倍两种估计,并说明后者怎样改变左尾。验收时给出净收益序列、成本字段和误差范围,不能只报毛胜率。
Covariance 与 Correlation:共同波动不等于共同机制
协方差把两个收益序列同一时刻偏离均值的乘积取平均;相关系数再除以各自标准差,消除量纲。若任一序列方差为零,相关系数未定义,不应记成零。价格水平共同上涨可能制造伪相关,应先明确为何使用收益率、价差或残差。
取 X=[−1%, 1%]、Y=[−2%, 2%],总体协方差为 0.0002,相关系数为 1;两条头寸看起来来自不同资产,却没有在这个例子里提供分散。练习改成 Y=[2%, −2%],再观察相关系数的符号。样本只有两点,只能演示公式,不能用于配置。
真实研究需要同步时钟、说明缺失处理、报告滚动窗口与压力窗口。不得把未成交时段的旧价格当作新观察。作品中必须注明估计窗口、有效重叠样本和压力时的相关假设,进入组合与风险后再决定仓位。
Regression:解释的是条件关系
线性模型 r策略 = α + β × r市场 + ε,把市场共振与剩余部分分开。β 是样本中的敏感度,α 是控制该因子后的截距;遗漏因子、非线性期权暴露、错误时钟都会使解释失真。「α 为正」并不自动等于可交易优势。
教学数据 X=[−1%, 0%, 1%],Y=[−1%, 1%, 3%],直线为 Y=1%+2X。它只验证计算,三点且残差为零不能证明未来有 1% 的超额收益。练习在最后一个 Y 加入异常值,比较斜率变化;再讨论异常值应保留还是有证据证实为坏数据。
验收提供残差图、训练期与测试期的 β、因子定义以及费用是否已扣。残差有自相关时,普通独立同分布标准误不再可靠;采用时间块重采样或明确适用的稳健误差方法,写清窗口选择而非只换软件选项。
Hypothesis Testing:事前定义反驳条件
先写 H0「扣费后平均收益不大于零」,再写单侧还是双侧、检验统计量、样本截止日和试验次数。p 值是在零假设及模型条件成立时,看到至少同样极端统计量的概率;它不是策略为假的概率。
练习把同一批收益随机打乱信号标签,保留原有收益和成本,构造没有信号预测力的对照。但标签若有时序依赖,逐点乱序会破坏依赖;应在不跨越保留边界的时间块上置换,并说明可交换性假设。试过大量参数后才报最小 p 值,会夸大证据。
作品必须提交研究尝试登记表,包括失败试验。可以预先固定一个主假设,其余标探索性,并把最终候选移到未看过的测试期。不得一边查看测试结果一边改主假设后仍称其为样本外。
Confidence Interval:区间表达估计的不确定
在独立同分布、样本足够且均值近似正态的条件下,可用样本均值 ± 临界值 × 标准误建立区间;标准误为样本标准差除以样本数平方根。小样本、重尾和连续持仓会破坏简单近似。
95% 置信区间指相同方法在反复抽样中的覆盖性质,不是「这个固定区间有 95% 概率包含已固定的真值」。交易决策还应问经济意义:区间即使略大于零,也可能覆盖不了未建模冲击。
练习对同一序列分别逐笔和按连续时间块 bootstrap,比较均值区间宽度;记录块长、随机种子和重采样次数。验收必须说明区间跨零、有效样本少或结果对块长敏感时如何保留「证据不足」,禁止用更多模拟次数掩盖原始数据太少。
Monte Carlo:让路径风险显形
同一批收益的平均值不变,先后次序会改变回撤。随机模拟必须先选生成机制:独立抽样估计理想独立环境,块抽样保留局部连亏结构,状态转移模拟允许压力状态持续。每一步用期初权益乘以收益更新,再计算相对历史高点的回撤。
研究工作簿的固定种子代码同时输出均值区间与路径最大回撤分位数。它是教学生成数据,不是历史验证。练习把块长增加、成本增加、插入一次压力损失,每次只改一个条件,并保留全部结果。
不能从有限模拟里未破产推断「不会破产」。用历史样本重采样也无法凭空生成未经历的交易所冻结;这类事件需单独压力情景。作品需列模型未覆盖的机制、停机阈值与重启条件,交给机构治理处理。
作品:Research Memo
按可复制模板提交:问题、机制、数据可见时间、样本与分组、试验登记、方法假设、净收益分布、区间、反例、下一步决定。附可运行代码和输入,不只贴图。
验收采用三个重算动作:删除一个极端样本检查结论敏感性;把成本提高检查经济意义;把测试段完全隔离检查选择偏差。它们都是敏感性分析,原始样本结果仍需保留。合格作品可以否定策略,但不能删除不利结果,或把教学假设当成外部事实。