跳转至

量化学习术语表

遇到陌生词时,不必硬背公式。先理解它在研究流程中解决什么问题,再回到对应章节看例子。本表的解释刻意保持简短,适合作为阅读时的随手索引。


Python 入门

术语 白话解释
Python 用明确步骤让电脑处理数据的一种编程语言。
编辑器 编写和修改代码文字的工具,本身不负责计算。
终端 用文字向电脑发出运行命令的窗口。
变量 给一个值起的名字,方便后续继续使用。
数据类型 一个值所属的类别,决定它能进行哪些操作。
列表 按顺序保存多个值的容器。
字典 使用名称查找对应值的容器。
条件 根据真或假选择执行路径的代码结构。
循环 对一组数据重复执行同一动作。
函数 有名字、可以反复调用的一组步骤。
模块 可以被其他代码导入的 Python 文件。
DataFrame pandas 中带行列名称的二维表格。
Series pandas 中带索引的一列数据。
NaN 当前位置缺少可用数值的标记。

市场与数据

术语 白话解释
OHLCV 一段时间内的开盘、最高、最低、收盘价格和成交量。
K 线 把一个时间周期的开高低收画成图形。
复权 调整分红、拆股等事件造成的价格跳变,让不同时点更可比。
前复权 以较新的价格为锚,调整过去价格。
后复权 以较早的价格为锚,向后累积调整。
股票池 某个日期允许策略选择的资产集合。它应该随历史日期变化。
时间点数据 保存“历史当时能看到什么”的数据,而不是用今天修订后的答案回看过去。
停牌 资产暂时不能交易;回测不能假设它仍能按理想价格成交。
涨跌停 价格达到交易所限制后,订单可能无法成交。
幸存者偏差 只研究今天仍存在的资产,遗漏退市和失败样本。
未来函数 历史决策偷用了当时尚未公开的信息。
数据泄露 特征、预处理或训练过程接触了本不该知道的验证或测试信息。

研究与验证

术语 白话解释
假设 一个可以被数据推翻的明确判断,不是“找一个赚钱参数”。
基线 用来比较的简单方案,例如买入并持有、等权或简单动量。
样本内 用于提出规则、训练模型或选择参数的数据。
样本外 没参与拟合,用来检查方法能否面对新时期的数据。
过拟合 方法记住了历史噪声,看似漂亮但难以重复。
Walk-Forward 按时间不断用过去训练,再测试紧接着的一小段未来。
Gap / Embargo 在训练和测试之间留空档,避免标签窗口或信息互相重叠。
稳健性 日期、成本、参数或样本稍微改变后,结论仍大致成立。
前缀稳定 给程序追加未来数据,不应改变更早日期已经生成的信号。
多重检验 同时尝试大量策略时,偶然出现“赢家”的概率会显著增加。
可复现 别人能凭数据说明、参数和步骤得到相同结果。

收益与风险

术语 白话解释
Alpha 在给定基准或因子解释后,仍未被解释的收益部分。
Beta 策略随市场共同涨跌的敏感程度。
CAGR 把整个区间的复利增长换算成年均增长率。
波动率 收益上下变化幅度的统计摘要。
回撤 当前净值相对之前最高点下降了多少。
最大回撤 整段历史里最深的一次回撤。
夏普比率 平均超额收益相对总体波动的比值。
索提诺比率 平均超额收益相对下行波动的比值。
卡玛比率 年化收益相对最大回撤的比值。
VaR 在给定概率和历史假设下,损失可能达到的阈值;它不是最坏情况。
预期损失 已经超过 VaR 阈值后,那些尾部损失的平均水平。
胜率 盈利交易或盈利周期占全部样本的比例。
盈亏比 平均一次盈利相对平均一次亏损有多大。
收益因子 全部正收益之和除以全部负收益绝对值。

信号、组合与执行

术语 白话解释
信号 策略根据当时已知数据作出的判断。
目标权重 希望某项资产占组合资金的比例。
总敞口 所有多空权重绝对值之和,反映组合用了多少风险仓位。
净敞口 多头权重减去空头权重,反映组合偏多还是偏空。
杠杆 总风险仓位超过自有资金的程度。
换手 组合为了从旧权重变到新权重,需要交易的规模。
手续费 经纪商、交易所或税费带来的明确交易成本。
滑点 计划成交价与实际成交价之间的差异。
市场冲击 订单本身推动市场价格造成的额外成本。
容量 在不明显破坏策略效果的前提下,大致能容纳多少资金。
风险平价 让不同资产对组合风险的贡献更接近的权重方法。
协方差 两项收益共同变化程度的尺度。
相关 标准化后的共同变化程度,通常介于 −1 与 1 之间。
中性化 去除行业、规模或市场方向等指定暴露。

经典策略

术语 白话解释
动量 过去相对强势在一段时期内继续的现象或信号。
趋势跟随 价格方向确认后顺势持有,方向反转后退出的策略家族。
均值回归 假设价格或价差偏离某个中心后会部分修复。
唐奇安通道 由过去一段时间最高价与最低价形成的价格通道。
RSI 比较一段时期平均上涨与下跌强度的指标。
ATR 把日内振幅和跳空都考虑进去的平均真实波幅。
因子 用来解释或预测资产之间收益差异的变量。
IC 某日因子排序与未来收益排序之间的截面相关。
协整 若干会漂移的序列存在一种相对稳定的线性组合。
配对交易 交易两项相关资产之间的相对偏离,而非只押单边方向。

机器学习与深度学习

术语 白话解释
特征 模型作出预测时能够获得的输入变量。
标签 监督学习希望预测的未来答案。
Pipeline 把预处理和模型绑在一起,保证每次只从训练数据学习。
分类 预测离散类别,例如上涨或下跌。
回归 预测连续数值,例如未来收益。
截距 当所有输入都为零时,线性模型给出的基础预测值。它让拟合直线不必强行经过原点。
残差 真实答案减去模型预测后留下的误差。检查残差能帮助判断模型漏掉了什么。
均方误差 把每个残差平方后取平均的损失。较大的错误会受到更重惩罚。
逻辑回归 先计算线性分数,再把分数变成零到一之间概率的分类模型。
正则化 在训练目标里约束过大的参数,降低模型死记训练样本的倾向。
排序学习 直接学习资产之间相对次序的方法。
概率校准 让模型给出的概率更接近现实中真正发生的频率。
LightGBM 一类高效的树模型工具,常用于表格型特征和截面排序。
HMM 用可观察数据推测隐藏状态及其转换规律的模型。
Transformer 主要用注意力机制处理序列或集合关系的神经网络架构。
注意力 让模型根据当前任务,为不同输入分配不同重要程度。
Query 注意力计算中的查询向量,表示当前位置正在寻找哪类信息。
Key 注意力计算中的索引向量,用来和查询比较匹配程度。
Value 注意力计算中真正被加权汇总的内容向量。
Softmax 把一组任意分数转成总和为一的非负权重。
位置编码 告诉模型各个输入在序列中处于什么位置的信息。
Patch 把连续若干时间点组合成一个小片段,再交给模型学习。
神经元 对输入做加权、加偏置并经过激活函数的计算单元。
激活函数 给神经网络加入非线性关系的函数。
损失函数 用一个数衡量模型答案离正确答案有多远,训练过程会努力让它下降。
梯度 损失相对每个参数变化的方向和速度,训练程序据此调整参数。
优化器 根据梯度更新模型参数的一套规则,例如随机梯度下降和 Adam。
批次 一次送进模型并共同计算梯度的一小组样本。
轮次 训练程序完整看过一遍训练集,通常写作一个 epoch。
RNN 按顺序处理数据,并把隐藏状态传给下一步的循环神经网络。
隐藏状态 序列模型从过去压缩并传递到下一步的信息。
梯度消失 误差信号向很早位置传递时越来越小,导致长期关系难学。
LSTM 使用细胞状态与遗忘、输入、输出门控制记忆的循环网络。
GRU 使用更新门和重置门简化记忆控制的循环网络。
CNN 使用共享小窗口寻找局部形状的卷积神经网络。
TCN 使用因果和扩张卷积处理时间序列的网络。
消融实验 逐项拿掉模型组件,检查每项是否真的提供增量。

模拟与实盘

术语 白话解释
模拟盘 使用实时或准实时数据演练,但不动用真实资金。
影子运行 只生成并记录信号,不把订单发送给交易系统。
风险闸门 下单前阻止超限、异常或过期数据的硬性检查。
停机开关 达到预设异常或损失条件时停止继续扩大风险。
对账 比较策略记录、订单记录和券商持仓,找出差异。
漂移 数据分布、市场环境或模型表现逐渐偏离研究时期。
幂等 同一订单请求重复到达时,系统只执行一次的性质。
数据闸门 在策略运行前检查数据是否完整、及时且没有异常的硬性规则。
执行缺口 从作出投资决定到真正完成交易之间,由价格变化和交易成本造成的差额。

如果一个词仍然模糊,最有效的方法是把它放回完整流程。追问它来自哪一步、输入是什么、输出会影响谁,以及出错时会让结论怎样改变。