‖ Jev Trader
← 返回 FAQ

如何正确理解 Jev confidence 并评估交易模拟

模型给出的答案很集中,容易让人觉得可信。但研究者仍要分别验证几个问题:概率与后来发生的结果是否一致?模拟订单能否成交?计入成本后,结果是否还成立?换到更晚的一段数据,结论是否仍然成立?这些问题需要不同的证据。本文给开发者和研究者提供一套评估思路,不报告回测成绩,也不提出交易建议。

1. 先区分几个数值

Choice 的 probabilities 为已定义的选项分配概率,总和为 1;choice 对应概率最高的选项。选项及其描述决定了答案的含义。见 Choice 官方文档。

TypeSafe 的 confidence 是根据整个分布形状计算的 0 到 1 概括值。分布越集中,表达的确定性越高。它不能与某个选项的概率互换,也不是已经测得的成功率。此次核对的官方页面没有说明具体公式。Choice 和 Score 有此字段,Noul 没有。见 confidence 官方说明与 HTTP 返回值文档。

实际胜率又是另一回事。它按明确的记账规则,统计已完成交易中盈利交易的比例。分类准确率统计的是标签判断正确的比例。方向判断可能正确,但订单没有成交,或扣除成本后仍然亏损。现有 Jev Score 指南介绍了输出字段;本文进一步讨论如何用结果检验这些数值。

2. 先定义结果,再收集预测

标签应当让另一位研究者能够复现。明确市场、价格来源、观察时间、预测窗口、价格不变和数据缺失的处理方式。输入快照不能包含未来信息。

以下仅为示意,不是模型返回值或实测数据: 研究问题是“30 秒后的中间价是否严格高于当前中间价”。两个结果是 higher 与 not_higher,示意概率分别为 0.70 和 0.30。这不能证明有 70% 的交易会盈利。这里也没有计算 confidence。

预测标签和操作标签应分开。当前交易提示同时涉及未来方向、post-only 挂单和允许操作的限制。因此,buy 的权重不能直接当成已经校准的上涨概率。若要研究上涨预测,应先固定一个只判断结果的问题,再单独评估执行。记录问题、标准、实际模型版本、时间和原始回答,然后再观察结果标签。

3. 实测校准,不预设它成立

在留出的评估数据上,把针对同一事件的预测按概率区间分组。每组比较平均预测概率与实际事件发生比例,并展示样本数。这就是可靠性图。方法可参考 scikit-learn 的校准说明。

再单独按 confidence 分组,观察分布更集中的回答是否具有更高的标签准确率。这需要数据回答。可靠性图的预测概率不能用 confidence 替代。

对于定义清楚的二元结果,还可以报告 Brier score,即 (p − y)² 的平均值,y 取 0 或 1。它评价概率预测,但不能单独证明校准质量,也不衡量交易收益。见 Brier score 文档。

样本很少的区间也要展示。相邻行情记录可能相关,尤其是预测窗口重叠时。可使用不重叠窗口,或按时间块估计不确定性,并报告剔除规则。如果需要拟合校准映射,应在单独的开发数据上拟合,再用未看过的后续数据评估。

4. 单独检查执行与成本

执行评估必须说明假设。包括 maker/taker 费用、价差、滑点、延迟、部分成交、撤单,以及适用的网络成本。说明哪些因素已经模拟,哪些尚未测量。成交价格已包含价差影响时,避免再次重复扣除。

报价触及某个显示价格,不代表订单具备排队优先级,也不证明已经成交。比较有利与不利的成交假设。分别报告已完成交易、未成交订单、毛结果和净结果。若报告模拟胜率,要写明分母,以及未平仓部分如何计价。还要观察亏损大小和回撤:多次小额盈利可以被少数较大亏损抵消。这里列出的是待执行的检查,没有声称本站已获得这些结果。

5. 用后续数据和简单基线对照

先用较早的数据设计问题、标准和评估规则,再固定它们,测试更晚的数据。两段之间留出足够间隔,避免结果窗口重叠导致信息泄漏。如果看完测试结果后再修改阈值,这段数据就已经成为开发数据。按时间切分的原则可参考 TimeSeriesSplit 文档;行情结果窗口需要另行明确处理。

概率预测可与一个固定事件频率基线比较,该频率只能从开发数据估计。执行实验可与预先写明的简单规则及不下单的参考组比较。各组使用相同输入、时间段和成本假设。报告差异及不确定性,并说明筛选高 confidence 后覆盖的样本比例。设置了置信度筛选,不代表已经证明效果更好。

6. 当前演示能说明什么

已核实的 Jev Trader 源码将看板后端配置为 MODEL=mock 和 dry run。它通过本地规则组合动量、盘口不平衡、成交流和确定性噪声,不调用 Jev。公开行情和模拟成交不能证明 Jev 的准确率,也不是实际账户收益。交易流程指南解释了接入方式;当前决策适配器没有读取官方 confidence 字段。

若想练习阅读输出,可以打开 Ask Jev Trading,修改一个教学问题,再展开返回结构。工具生成随机示例,不评估你输入的文字,也不执行交易。它用归一化熵演示分布置信度,没有声称复现 TypeSafe 的公式。可以用它理解字段,不能用它建立 Jev 的校准数据集。

Jev Trader 是基于 Jarrod Watts 原项目独立维护的版本。本文说明研究方法。当前 mock 看板和教学工具都没有证明 Jev 已通过这套评估。