量化学习术语表
遇到陌生词时,不必硬背公式。先理解它在研究流程中解决什么问题,再回到对应章节看例子。本表的解释刻意保持简短,适合作为阅读时的随手索引。
Python 入门
| 术语 |
白话解释 |
| Python |
用明确步骤让电脑处理数据的一种编程语言。 |
| 编辑器 |
编写和修改代码文字的工具,本身不负责计算。 |
| 终端 |
用文字向电脑发出运行命令的窗口。 |
| 变量 |
给一个值起的名字,方便后续继续使用。 |
| 数据类型 |
一个值所属的类别,决定它能进行哪些操作。 |
| 列表 |
按顺序保存多个值的容器。 |
| 字典 |
使用名称查找对应值的容器。 |
| 条件 |
根据真或假选择执行路径的代码结构。 |
| 循环 |
对一组数据重复执行同一动作。 |
| 函数 |
有名字、可以反复调用的一组步骤。 |
| 模块 |
可以被其他代码导入的 Python 文件。 |
| DataFrame |
pandas 中带行列名称的二维表格。 |
| Series |
pandas 中带索引的一列数据。 |
| NaN |
当前位置缺少可用数值的标记。 |
市场与数据
| 术语 |
白话解释 |
| OHLCV |
一段时间内的开盘、最高、最低、收盘价格和成交量。 |
| K 线 |
把一个时间周期的开高低收画成图形。 |
| 复权 |
调整分红、拆股等事件造成的价格跳变,让不同时点更可比。 |
| 前复权 |
以较新的价格为锚,调整过去价格。 |
| 后复权 |
以较早的价格为锚,向后累积调整。 |
| 股票池 |
某个日期允许策略选择的资产集合。它应该随历史日期变化。 |
| 时间点数据 |
保存“历史当时能看到什么”的数据,而不是用今天修订后的答案回看过去。 |
| 停牌 |
资产暂时不能交易;回测不能假设它仍能按理想价格成交。 |
| 涨跌停 |
价格达到交易所限制后,订单可能无法成交。 |
| 幸存者偏差 |
只研究今天仍存在的资产,遗漏退市和失败样本。 |
| 未来函数 |
历史决策偷用了当时尚未公开的信息。 |
| 数据泄露 |
特征、预处理或训练过程接触了本不该知道的验证或测试信息。 |
研究与验证
| 术语 |
白话解释 |
| 假设 |
一个可以被数据推翻的明确判断,不是“找一个赚钱参数”。 |
| 基线 |
用来比较的简单方案,例如买入并持有、等权或简单动量。 |
| 样本内 |
用于提出规则、训练模型或选择参数的数据。 |
| 样本外 |
没参与拟合,用来检查方法能否面对新时期的数据。 |
| 过拟合 |
方法记住了历史噪声,看似漂亮但难以重复。 |
| Walk-Forward |
按时间不断用过去训练,再测试紧接着的一小段未来。 |
| Gap / Embargo |
在训练和测试之间留空档,避免标签窗口或信息互相重叠。 |
| 稳健性 |
日期、成本、参数或样本稍微改变后,结论仍大致成立。 |
| 前缀稳定 |
给程序追加未来数据,不应改变更早日期已经生成的信号。 |
| 多重检验 |
同时尝试大量策略时,偶然出现“赢家”的概率会显著增加。 |
| 可复现 |
别人能凭数据说明、参数和步骤得到相同结果。 |
收益与风险
| 术语 |
白话解释 |
| Alpha |
在给定基准或因子解释后,仍未被解释的收益部分。 |
| Beta |
策略随市场共同涨跌的敏感程度。 |
| CAGR |
把整个区间的复利增长换算成年均增长率。 |
| 波动率 |
收益上下变化幅度的统计摘要。 |
| 回撤 |
当前净值相对之前最高点下降了多少。 |
| 最大回撤 |
整段历史里最深的一次回撤。 |
| 夏普比率 |
平均超额收益相对总体波动的比值。 |
| 索提诺比率 |
平均超额收益相对下行波动的比值。 |
| 卡玛比率 |
年化收益相对最大回撤的比值。 |
| VaR |
在给定概率和历史假设下,损失可能达到的阈值;它不是最坏情况。 |
| 预期损失 |
已经超过 VaR 阈值后,那些尾部损失的平均水平。 |
| 胜率 |
盈利交易或盈利周期占全部样本的比例。 |
| 盈亏比 |
平均一次盈利相对平均一次亏损有多大。 |
| 收益因子 |
全部正收益之和除以全部负收益绝对值。 |
信号、组合与执行
| 术语 |
白话解释 |
| 信号 |
策略根据当时已知数据作出的判断。 |
| 目标权重 |
希望某项资产占组合资金的比例。 |
| 总敞口 |
所有多空权重绝对值之和,反映组合用了多少风险仓位。 |
| 净敞口 |
多头权重减去空头权重,反映组合偏多还是偏空。 |
| 杠杆 |
总风险仓位超过自有资金的程度。 |
| 换手 |
组合为了从旧权重变到新权重,需要交易的规模。 |
| 手续费 |
经纪商、交易所或税费带来的明确交易成本。 |
| 滑点 |
计划成交价与实际成交价之间的差异。 |
| 市场冲击 |
订单本身推动市场价格造成的额外成本。 |
| 容量 |
在不明显破坏策略效果的前提下,大致能容纳多少资金。 |
| 风险平价 |
让不同资产对组合风险的贡献更接近的权重方法。 |
| 协方差 |
两项收益共同变化程度的尺度。 |
| 相关 |
标准化后的共同变化程度,通常介于 −1 与 1 之间。 |
| 中性化 |
去除行业、规模或市场方向等指定暴露。 |
经典策略
| 术语 |
白话解释 |
| 动量 |
过去相对强势在一段时期内继续的现象或信号。 |
| 趋势跟随 |
价格方向确认后顺势持有,方向反转后退出的策略家族。 |
| 均值回归 |
假设价格或价差偏离某个中心后会部分修复。 |
| 唐奇安通道 |
由过去一段时间最高价与最低价形成的价格通道。 |
| RSI |
比较一段时期平均上涨与下跌强度的指标。 |
| ATR |
把日内振幅和跳空都考虑进去的平均真实波幅。 |
| 因子 |
用来解释或预测资产之间收益差异的变量。 |
| IC |
某日因子排序与未来收益排序之间的截面相关。 |
| 协整 |
若干会漂移的序列存在一种相对稳定的线性组合。 |
| 配对交易 |
交易两项相关资产之间的相对偏离,而非只押单边方向。 |
机器学习与深度学习
| 术语 |
白话解释 |
| 特征 |
模型作出预测时能够获得的输入变量。 |
| 标签 |
监督学习希望预测的未来答案。 |
| Pipeline |
把预处理和模型绑在一起,保证每次只从训练数据学习。 |
| 分类 |
预测离散类别,例如上涨或下跌。 |
| 回归 |
预测连续数值,例如未来收益。 |
| 截距 |
当所有输入都为零时,线性模型给出的基础预测值。它让拟合直线不必强行经过原点。 |
| 残差 |
真实答案减去模型预测后留下的误差。检查残差能帮助判断模型漏掉了什么。 |
| 均方误差 |
把每个残差平方后取平均的损失。较大的错误会受到更重惩罚。 |
| 逻辑回归 |
先计算线性分数,再把分数变成零到一之间概率的分类模型。 |
| 正则化 |
在训练目标里约束过大的参数,降低模型死记训练样本的倾向。 |
| 排序学习 |
直接学习资产之间相对次序的方法。 |
| 概率校准 |
让模型给出的概率更接近现实中真正发生的频率。 |
| LightGBM |
一类高效的树模型工具,常用于表格型特征和截面排序。 |
| HMM |
用可观察数据推测隐藏状态及其转换规律的模型。 |
| Transformer |
主要用注意力机制处理序列或集合关系的神经网络架构。 |
| 注意力 |
让模型根据当前任务,为不同输入分配不同重要程度。 |
| Query |
注意力计算中的查询向量,表示当前位置正在寻找哪类信息。 |
| Key |
注意力计算中的索引向量,用来和查询比较匹配程度。 |
| Value |
注意力计算中真正被加权汇总的内容向量。 |
| Softmax |
把一组任意分数转成总和为一的非负权重。 |
| 位置编码 |
告诉模型各个输入在序列中处于什么位置的信息。 |
| Patch |
把连续若干时间点组合成一个小片段,再交给模型学习。 |
| 神经元 |
对输入做加权、加偏置并经过激活函数的计算单元。 |
| 激活函数 |
给神经网络加入非线性关系的函数。 |
| 损失函数 |
用一个数衡量模型答案离正确答案有多远,训练过程会努力让它下降。 |
| 梯度 |
损失相对每个参数变化的方向和速度,训练程序据此调整参数。 |
| 优化器 |
根据梯度更新模型参数的一套规则,例如随机梯度下降和 Adam。 |
| 批次 |
一次送进模型并共同计算梯度的一小组样本。 |
| 轮次 |
训练程序完整看过一遍训练集,通常写作一个 epoch。 |
| RNN |
按顺序处理数据,并把隐藏状态传给下一步的循环神经网络。 |
| 隐藏状态 |
序列模型从过去压缩并传递到下一步的信息。 |
| 梯度消失 |
误差信号向很早位置传递时越来越小,导致长期关系难学。 |
| LSTM |
使用细胞状态与遗忘、输入、输出门控制记忆的循环网络。 |
| GRU |
使用更新门和重置门简化记忆控制的循环网络。 |
| CNN |
使用共享小窗口寻找局部形状的卷积神经网络。 |
| TCN |
使用因果和扩张卷积处理时间序列的网络。 |
| 消融实验 |
逐项拿掉模型组件,检查每项是否真的提供增量。 |
模拟与实盘
| 术语 |
白话解释 |
| 模拟盘 |
使用实时或准实时数据演练,但不动用真实资金。 |
| 影子运行 |
只生成并记录信号,不把订单发送给交易系统。 |
| 风险闸门 |
下单前阻止超限、异常或过期数据的硬性检查。 |
| 停机开关 |
达到预设异常或损失条件时停止继续扩大风险。 |
| 对账 |
比较策略记录、订单记录和券商持仓,找出差异。 |
| 漂移 |
数据分布、市场环境或模型表现逐渐偏离研究时期。 |
| 幂等 |
同一订单请求重复到达时,系统只执行一次的性质。 |
| 数据闸门 |
在策略运行前检查数据是否完整、及时且没有异常的硬性规则。 |
| 执行缺口 |
从作出投资决定到真正完成交易之间,由价格变化和交易成本造成的差额。 |
如果一个词仍然模糊,最有效的方法是把它放回完整流程。追问它来自哪一步、输入是什么、输出会影响谁,以及出错时会让结论怎样改变。