标题、market 数、首末成交、事件跨度
READING GUIDE
这份 Data Atlas 回答什么?
每个问题先给可直接引用的结论,再展开数据证据、字段和案例。
Q1 / SCALE & TIME
数据包含多少事件、多少时间点以及多大的时间跨度?
“时间点”同时报告全局 UTC bucket 和 market-time 观测行:同一时刻可以有大量 markets 同时活跃。
正在读取已验收数据……
数字口径:万级以上的规模同时显示精确值与“约 X 万/X 亿”;日期、比例、概率、容量和 ID 不换算。Observed 层只保存至少发生一笔可信成交的 bucket,不创建全市场稠密空桶。
Q2 / UNIT & SCHEMA
每个事件包含哪些字段,单条轨迹是什么形式?
event 是现实事件容器,market 是可交易命题,单条轨迹是一个 market 按 UTC 时间排序后的状态序列。
事件目录有 — 个字段,market 目录有 — 个字段,每个 observed bar 有 — 个字段。建模单位是 market_id × bucket_start_utc,不是将父事件下的 markets 直接平均。
题目、answer 方向、生命周期、身份状态
UTC bucket、OHLC、活动和成交顺序
事件身份与容器规模
event_id、标题、market 数、首末成交、事件跨度、成交数与成交额,回答“这个现实事件容纳了什么”。
命题、方向与可训练性
market_id、问题文本、answer1/answer2、父事件、生命周期、身份状态和轨迹摘要,回答“价格究竟对应哪个命题”。
一个时间点的市场状态
bucket_start_utc、OHLC、成交量、成交数、signed flow 与首末成交顺序,组成按时间排序的概率轨迹。
一条轨迹 = 同一 market 的有序 bar 序列
例如 [(t₀, p_close, volume, count), …, (tₙ, …)]。价格统一为 p_answer1;无成交日历位置通过规则状态、mask 与 staleness 表达,而不是把下一个成交点当作相邻时刻。
{
"market_id": "253591",
"bucket_start_utc": "2024-11-05T13:00:00Z",
"p_answer1": 0.609,
"trade_count": 4779,
"usd_volume": 1542857.36
}
价格始终表示 answer1 方向。体育市场中的 0.7 可能是 “Seahawks 概率 70%”,不能无条件改名为 Yes 概率。
Q3 / DISTRIBUTION
不同事件的轨迹长度、采样频率和数据量如何分布?
长尾决定了样本协议:不能为所有 markets 强行使用同一个长历史窗口,也不能只汇报最活跃子集。
正在计算轨迹长度分位数……
—
每个父事件包含多少 markets?
中位 event 只有 1 个 market,但尾部事件可以包含上百个命题。事件级建模必须先处理命题关系。
Q4 / CASE GALLERY
数据中有哪些具有代表性的具体案例?
七个案例覆盖政治长轨迹、电竞多 market、短 deadline、非 Yes/No 方向、日期异常、身份隔离与无成交 catalog。
案例不是“好看的曲线”集合,而是七类会改变建模选择的数据结构:长轨迹、父事件内机械约束、相邻截止日期、命题方向、元数据异常、身份缺失和无成交记录。
SEMANTICS ABLATION DEMO
加入事件语义,闭源 LLM 能更好地预测隐藏末段吗?
这是对网页案例的三臂消融,不是正式 Track A:匿名轨迹、匿名轨迹+结构化语义+距截止时间、匿名轨迹+完整原始语义。
正在读取闭源模型预测结果……
固定同一预测任务
三组使用相同的 5 条历史、49 个隐藏点、模型和解码设置,并在独立隔离会话中运行;工具调用合计 —。
只看匿名轨迹
只输入相对小时和概率;移除事件、outcome、market ID、绝对日期和截止时间。
加入匿名化语义
增加领域、合约结构、匿名 outcome 方向和距 catalog deadline 小时数,不暴露实体与绝对日期。
加入完整原始语义
增加原始问题、父事件标题、真实答案标签与绝对时间;可能受预训练知识污染。
匿名语义臂用于检验事件类型、合约结构和截止时间是否提供增量;完整语义臂会暴露真实事件文本与日期,因此即使禁止搜索,也无法排除模型在预训练中见过事件或结果。三组结果接近,不支持语义在这 5 条展示轨迹上带来稳定改善;完整语义结果必须标注为“可能受预训练知识污染”。
下载逐点结果 →RESEARCH BASELINES / AGENTIC COMPONENTS
EventConnector 与 SWM-Bench,各自解决什么?
EventConnector 研究“应检索哪些历史事件”,SWM-Bench 研究“给定候选事件后,信念状态怎样转移”。它们构成检索与条件转移 baseline,但还不是包含 trader、订单簿和制度互动的完整多智能体模拟器。
两篇工作的共同价值,是把聚合预测市场轨迹从普通时序数据推进为可检索、可条件化的 belief-state world model。对本项目而言,EventConnector 对应 H2 / P2 的候选检索,SWM-Bench 对应 H3 的条件证据增量;只有另行完成 target-only 对照、公共状态控制、负对照和 rolling OOS 的 P3,才能讨论 H4 跨事件预测性关系。
检索相关经验
EventConnector 让 query 根据轨迹、文本和图关系选择历史训练事件,相当于一个 relation-aware memory。
选择条件证据
SWM 的 attributor 在新闻候选中分配权重,并保留“没有候选新闻足以解释变化”的 null 分支。
预测条件转移
SWM 的 decoder 将当前价格历史与单条事件映射到下一日概率变化,可用于 forecasting mixture 或假设事件条件预测。
多主体制度仿真
两篇工作都不生成个体 trader、信息网络、预算约束、订单簿清算或适应性制度均衡。
哪些历史事件,是当前 query 更有用的训练经验?
它不是直接预测“事件之间是否存在真实关系”,而是用局部共波动图和语义锚点,为每个 query 选择一个小而相关的训练池,再让同一基础时序模型预测未来轨迹。
- 任务
- 过去 10 个日点 → 未来 7 日概率路径;主设置 top-k = 10。
- 方法链
- 训练事件 → 局部相关图 / DTW / pairwise Granger → 文本+价格 hybrid anchor → 两跳检索 → query-specific predictor。
- Polymarket 证据
- 9,803 个训练窗口、3,692 个测试窗口、9 类预测器;EC-Fusion 相对每个单元最强可比检索平均降低 RMSE 6.87%。
- 证据边界
- 下游误差验证的是 retrieved set utility,不是单条 graph edge 的真实性;相关、lag 与 Granger 也不是结构因果。
当前信念与候选新闻,怎样共同决定下一步信念?
它把“哪条新闻相关”和“这条新闻对应多大概率变化”拆成 attributor 与 event-conditioned decoder;训练期用看过未来变化的 teacher 生成弱归因,部署期只能使用 prior。
- 任务
- 16 个日点+目标前最多 30 条候选新闻 → 下一日概率与变化。
- 方法链
- hindsight teacher → prior attributor → 单事件 shift decoder → 带 persistence null 的加权预测。
- Polymarket 证据
- 6,705 个训练 transition、3,483 个测试 transition;SWM prior 全集 MASE 1.141,新闻归因子集 MASE 0.933、方向准确率 0.685。
- 证据边界
- 它在条件子集的方向预测更强,却未在全测试集稳定超过 persistence;future-aware posterior 只能作训练监督或诊断,不能作为部署结果。
| 比较层 | EventConnector | SWM-Bench | 本项目中的位置 |
|---|---|---|---|
| 核心问题 | 哪些历史事件应进入训练集合? | 哪条候选新闻相关,它对应多大下一步变化? | 先分开检验检索增量 H2 与条件证据增量 H3 |
| 主要输出 | query-specific retrieved set 与 7 日路径 | 事件权重、逐事件 shift 与下一日预测 | 统一放入 A-D / A-S 协议比较 |
| 什么得到验证 | 小训练预算下,检索集合能否降低预测误差 | 截止日前候选新闻能否改善概率变化预测 | 在相同 sample ID、预测器和预算下做成对增量 |
| 什么没有得到验证 | 单条事件边真实、稳定或具有因果传导 | 新闻是价格变化的真实原因或社会信念的无偏来源 | 跨事件关系必须另经 P3;首阶段结论仍是预测性增量 |
参考它们,但不能原样搬运
迁移目标不是复刻论文宣传数字,而是在本项目冻结的时间、身份和样本边界下,判断对应能力是否仍有增量。
保留
10→7 多步接口、固定 top-k、相同预测器与训练预算下的 random / BM25 / SBERT / DTW / graph retrieval 消融。
必须改动
- 按真实共同 UTC 日期对齐,不按窗口数组位置直接相关;
- 图、阈值和索引只使用 forecast origin 前的数据,并做 rolling rebuild;
- 显式保留 market / event / family、answer 方向、mask、staleness 与共同活跃覆盖;
- 相关、DTW、lag、Granger 只进入 P2 候选;逐边结论交给 P3 的公共因子控制、反向边、时间置换、随机 pair、FDR 与 rolling OOS。
当前:A-D 的 2,680,165(约 268.02 万)条正式样本已完成;E10–E12 尚未运行,43,971(约 4.40 万)条 P2 seed 也还没有 calendar-EC 轨迹信号。
保留
16→1 接口、persistence + expected move 分解、严格 evidence cutoff,以及 full test / 条件子集 / posterior diagnostic 分开报告。
必须改动
- 先完成 history-only,对所有复杂方法使用同一 persistence 与训练型 target-only 地板;
- 新闻实验必须建立独立的
published_at ≤ as_of_time契约,不能把 source market 文本冒充外部新闻; - 主结果使用自然分布和 cold-family test,高变化或 attributed subset 只能作为诊断;
- future-aware teacher 只能生成训练弱标签,测试推理不得看到 target;新闻增量与跨市场 source innovation 分成 H3 / H4 两个问题。
当前:A-S 的 2,368,577(约 236.86 万)条正式样本及简单 history-only 地板已完成;E20/E21 尚未运行,P1B 也尚无满足截止契约的新闻语料。
先冻结 persistence、线性与标准时序模型。
在论文公开数据上复核接口、指标与方法量级。
同一 P1B 样本、预测器与预算下比较是否有增量。
检索有效之后,才逐边做控制、负对照与时间外稳定性。
来源:指定的 EventConnector / SWM-Bench 论文与研究笔记;页面数字按论文 Polymarket split 与当前本地实验进度整理。论文结果与本项目结果在文中明确分列。
Q5 / TRAINING SHAPE
如何将原始 JSON 整理成统一的“历史信息—预测目标”训练样本?
核心不是截取若干成交点,而是先统一身份、价格方向和日历状态,再以 as_of_time 切分历史输入与未来目标。
原始 JSON / parquet 记录经过六步转化:身份与方向统一 → 可信成交筛选 → 多尺度聚合 → 规则日历状态 → history/target 窗口 → 时间与事件族切分。最终得到 31,949,309(约 3,194.93 万)条固定日历样本,其中 26,330,043(约 2,633.00 万)条属于 cold-family 主视图。
读取原始 JSON / parquet
market、event、trade 身份,时间、outcome、price、size。
统一身份与价格方向
冻结 market_id/event_id,所有价格转为 p_answer1。
去重并隔离异常
核对成交视图、方向、重复表示和事件身份。
聚合多尺度状态
生成 1m / 15m / 1h observed bars 与规则小时状态。
按日历切 history / target
保留 mask、has_trade、staleness;不压缩长缺口。
冻结训练边界
完整 target path 留在同一时间 split,并执行 family 隔离。
| 协议 | 历史输入 | 预测目标 | 样本量 | 研究用途 |
|---|---|---|---|---|
| A-H | 过去 24 个日历小时 | 未来 1 / 6 / 24 小时 | 26,900,567(约 2,690.06 万) | Track A 与 P3 主协议 |
| A-D | 过去 10 个 UTC 日 | 未来 7 日路径 | 2,680,165(约 268.02 万) | EventConnector 可比实验 |
| A-S | 过去 16 个 UTC 日 | 下一日概率与变化 | 2,368,577(约 236.86 万) | SWM history-only 实验 |
旧版:observed points → future points
正式版:calendar history → fixed horizons
06 / CURRENT BOUNDARY
现在能回答什么?
网页展示的是数据基础与样本准备度,不是跨事件关系结果。
数据基础、正式样本与简单基线已经完成
多尺度数据通过全量验收;Track A 已生成 31,949,309(约 3,194.93 万)条固定日历样本;P2 已生成 43,971(约 4.40 万)条 lexical/calendar 候选。
还没有稳定跨事件关系标签
P2 候选仍需轨迹信号和人工审核,P3 时间外增量验证尚未开始,更不能直接声称结构因果。