ECONWM / DATA ATLAS V1

COLLABORATOR ACCESS

请输入访问口令

该页面用于 Economic World Model 项目协作。验证后,本浏览器会话将保持解锁。

ECONWM / DATA ATLAS V1
Q1 规模 Q2 结构 Q3 分布 Q4 案例 研究 Baseline Q5 样本

ECONOMIC WORLD MODEL · POLYMARKET DATA ATLAS

从市场信念,
到世界模型数据。

我们从 763,126,566(约 7.63 亿)笔可信成交中重建 379,711(约 37.97 万)个事件、897,580(约 89.76 万)个市场命题的多尺度概率轨迹,并将其物化为统一的“历史信息—预测目标”样本,为单事件预测、跨事件检索与预测性关系验证建立数据和评估基础。

探索数据与实验接口 机器可读数据 查看当前研究边界 ↓
— events — traded markets — years
RESEARCH READINESS LOADING

READING GUIDE

这份 Data Atlas 回答什么?

每个问题先给可直接引用的结论,再展开数据证据、字段和案例。

Q1规模与跨度事件、时间点和覆盖范围 Q2字段与轨迹event、market 与 bar 的关系 Q3分布与频率长度、采样和数据量长尾 Q4代表案例具体轨迹与治理边界 Q5训练样本raw records → history / target

Q1 / SCALE & TIME

数据包含多少事件、多少时间点以及多大的时间跨度?

“时间点”同时报告全局 UTC bucket 和 market-time 观测行:同一时刻可以有大量 markets 同时活跃。

DIRECT ANSWER

正在读取已验收数据……

数字口径:万级以上的规模同时显示精确值与“约 X 万/X 亿”;日期、比例、概率、容量和 ID 不换算。Observed 层只保存至少发生一笔可信成交的 bucket,不创建全市场稠密空桶。

Q2 / UNIT & SCHEMA

每个事件包含哪些字段,单条轨迹是什么形式?

event 是现实事件容器,market 是可交易命题,单条轨迹是一个 market 按 UTC 时间排序后的状态序列。

DIRECT ANSWER

事件目录有 — 个字段,market 目录有 — 个字段,每个 observed bar 有 — 个字段。建模单位是 market_id × bucket_start_utc,不是将父事件下的 markets 直接平均。

EVENT现实事件容器

标题、market 数、首末成交、事件跨度

1 → N
MARKET可交易命题

题目、answer 方向、生命周期、身份状态

1 → T
BAR时间观测

UTC bucket、OHLC、活动和成交顺序

EVENT CATALOG—
MARKET CATALOG—
OBSERVED BAR—
EVENT FIELDS

事件身份与容器规模

event_id、标题、market 数、首末成交、事件跨度、成交数与成交额,回答“这个现实事件容纳了什么”。

MARKET FIELDS

命题、方向与可训练性

market_id、问题文本、answer1/answer2、父事件、生命周期、身份状态和轨迹摘要,回答“价格究竟对应哪个命题”。

BAR FIELDS

一个时间点的市场状态

bucket_start_utc、OHLC、成交量、成交数、signed flow 与首末成交顺序,组成按时间排序的概率轨迹。

SINGLE TRAJECTORY

一条轨迹 = 同一 market 的有序 bar 序列

例如 [(t₀, p_close, volume, count), …, (tₙ, …)]。价格统一为 p_answer1;无成交日历位置通过规则状态、mask 与 staleness 表达,而不是把下一个成交点当作相邻时刻。

{
  "market_id": "253591",
  "bucket_start_utc": "2024-11-05T13:00:00Z",
  "p_answer1": 0.609,
  "trade_count": 4779,
  "usd_volume": 1542857.36
}
IMPORTANT

价格始终表示 answer1 方向。体育市场中的 0.7 可能是 “Seahawks 概率 70%”,不能无条件改名为 Yes 概率。

Q3 / DISTRIBUTION

不同事件的轨迹长度、采样频率和数据量如何分布?

长尾决定了样本协议:不能为所有 markets 强行使用同一个长历史窗口,也不能只汇报最活跃子集。

DIRECT ANSWER

正在计算轨迹长度分位数……

POINTS PER MARKET

—

—
EVENT CONTAINER

每个父事件包含多少 markets?

中位 event 只有 1 个 market,但尾部事件可以包含上百个命题。事件级建模必须先处理命题关系。

Q4 / CASE GALLERY

数据中有哪些具有代表性的具体案例?

七个案例覆盖政治长轨迹、电竞多 market、短 deadline、非 Yes/No 方向、日期异常、身份隔离与无成交 catalog。

DIRECT ANSWER

案例不是“好看的曲线”集合,而是七类会改变建模选择的数据结构:长轨迹、父事件内机械约束、相邻截止日期、命题方向、元数据异常、身份缺失和无成交记录。

SEMANTICS ABLATION DEMO

加入事件语义,闭源 LLM 能更好地预测隐藏末段吗?

这是对网页案例的三臂消融,不是正式 Track A:匿名轨迹、匿名轨迹+结构化语义+距截止时间、匿名轨迹+完整原始语义。

RESULT

正在读取闭源模型预测结果……

01 / SHARED CONTROL

固定同一预测任务

三组使用相同的 5 条历史、49 个隐藏点、模型和解码设置,并在独立隔离会话中运行;工具调用合计 —。

02 / TRAJECTORY ONLY

只看匿名轨迹

只输入相对小时和概率;移除事件、outcome、market ID、绝对日期和截止时间。

03 / SANITIZED

加入匿名化语义

增加领域、合约结构、匿名 outcome 方向和距 catalog deadline 小时数,不暴露实体与绝对日期。

04 / FULL SEMANTICS

加入完整原始语义

增加原始问题、父事件标题、真实答案标签与绝对时间;可能受预训练知识污染。

可见历史隐藏真实值匿名轨迹+匿名语义+完整语义Persistence
如何解释:

匿名语义臂用于检验事件类型、合约结构和截止时间是否提供增量;完整语义臂会暴露真实事件文本与日期,因此即使禁止搜索,也无法排除模型在预训练中见过事件或结果。三组结果接近,不支持语义在这 5 条展示轨迹上带来稳定改善;完整语义结果必须标注为“可能受预训练知识污染”。

下载逐点结果 →

RESEARCH BASELINES / AGENTIC COMPONENTS

EventConnector 与 SWM-Bench,各自解决什么?

EventConnector 研究“应检索哪些历史事件”,SWM-Bench 研究“给定候选事件后,信念状态怎样转移”。它们构成检索与条件转移 baseline,但还不是包含 trader、订单簿和制度互动的完整多智能体模拟器。

DIRECT ANSWER

两篇工作的共同价值,是把聚合预测市场轨迹从普通时序数据推进为可检索、可条件化的 belief-state world model。对本项目而言,EventConnector 对应 H2 / P2 的候选检索,SWM-Bench 对应 H3 的条件证据增量;只有另行完成 target-only 对照、公共状态控制、负对照和 rolling OOS 的 P3,才能讨论 H4 跨事件预测性关系。

01 / MEMORY

检索相关经验

EventConnector 让 query 根据轨迹、文本和图关系选择历史训练事件,相当于一个 relation-aware memory。

→
02 / CONDITION

选择条件证据

SWM 的 attributor 在新闻候选中分配权重,并保留“没有候选新闻足以解释变化”的 null 分支。

→
03 / TRANSITION

预测条件转移

SWM 的 decoder 将当前价格历史与单条事件映射到下一日概率变化,可用于 forecasting mixture 或假设事件条件预测。

≠
NOT INCLUDED

多主体制度仿真

两篇工作都不生成个体 trader、信息网络、预算约束、订单簿清算或适应性制度均衡。

EVENTCONNECTOR · 2026论文 ↗

哪些历史事件,是当前 query 更有用的训练经验?

它不是直接预测“事件之间是否存在真实关系”,而是用局部共波动图和语义锚点,为每个 query 选择一个小而相关的训练池,再让同一基础时序模型预测未来轨迹。

任务
过去 10 个日点 → 未来 7 日概率路径;主设置 top-k = 10。
方法链
训练事件 → 局部相关图 / DTW / pairwise Granger → 文本+价格 hybrid anchor → 两跳检索 → query-specific predictor。
Polymarket 证据
9,803 个训练窗口、3,692 个测试窗口、9 类预测器;EC-Fusion 相对每个单元最强可比检索平均降低 RMSE 6.87%。
证据边界
下游误差验证的是 retrieved set utility,不是单条 graph edge 的真实性;相关、lag 与 Granger 也不是结构因果。
SWM-BENCH · 2026
论文 ↗代码 ↗

当前信念与候选新闻,怎样共同决定下一步信念?

它把“哪条新闻相关”和“这条新闻对应多大概率变化”拆成 attributor 与 event-conditioned decoder;训练期用看过未来变化的 teacher 生成弱归因,部署期只能使用 prior。

任务
16 个日点+目标前最多 30 条候选新闻 → 下一日概率与变化。
方法链
hindsight teacher → prior attributor → 单事件 shift decoder → 带 persistence null 的加权预测。
Polymarket 证据
6,705 个训练 transition、3,483 个测试 transition;SWM prior 全集 MASE 1.141,新闻归因子集 MASE 0.933、方向准确率 0.685。
证据边界
它在条件子集的方向预测更强,却未在全测试集稳定超过 persistence;future-aware posterior 只能作训练监督或诊断,不能作为部署结果。
比较层EventConnectorSWM-Bench本项目中的位置
核心问题哪些历史事件应进入训练集合?哪条候选新闻相关,它对应多大下一步变化?先分开检验检索增量 H2 与条件证据增量 H3
主要输出query-specific retrieved set 与 7 日路径事件权重、逐事件 shift 与下一日预测统一放入 A-D / A-S 协议比较
什么得到验证小训练预算下,检索集合能否降低预测误差截止日前候选新闻能否改善概率变化预测在相同 sample ID、预测器和预算下做成对增量
什么没有得到验证单条事件边真实、稳定或具有因果传导新闻是价格变化的真实原因或社会信念的无偏来源跨事件关系必须另经 P3;首阶段结论仍是预测性增量
BASELINE TRANSFER

参考它们,但不能原样搬运

迁移目标不是复刻论文宣传数字,而是在本项目冻结的时间、身份和样本边界下,判断对应能力是否仍有增量。

A-D / EVENTCONNECTOR检索 baseline

保留

10→7 多步接口、固定 top-k、相同预测器与训练预算下的 random / BM25 / SBERT / DTW / graph retrieval 消融。

必须改动

  • 按真实共同 UTC 日期对齐,不按窗口数组位置直接相关;
  • 图、阈值和索引只使用 forecast origin 前的数据,并做 rolling rebuild;
  • 显式保留 market / event / family、answer 方向、mask、staleness 与共同活跃覆盖;
  • 相关、DTW、lag、Granger 只进入 P2 候选;逐边结论交给 P3 的公共因子控制、反向边、时间置换、随机 pair、FDR 与 rolling OOS。

当前:A-D 的 2,680,165(约 268.02 万)条正式样本已完成;E10–E12 尚未运行,43,971(约 4.40 万)条 P2 seed 也还没有 calendar-EC 轨迹信号。

A-S / SWM-BENCH条件证据 baseline

保留

16→1 接口、persistence + expected move 分解、严格 evidence cutoff,以及 full test / 条件子集 / posterior diagnostic 分开报告。

必须改动

  • 先完成 history-only,对所有复杂方法使用同一 persistence 与训练型 target-only 地板;
  • 新闻实验必须建立独立的 published_at ≤ as_of_time 契约,不能把 source market 文本冒充外部新闻;
  • 主结果使用自然分布和 cold-family test,高变化或 attributed subset 只能作为诊断;
  • future-aware teacher 只能生成训练弱标签,测试推理不得看到 target;新闻增量与跨市场 source innovation 分成 H3 / H4 两个问题。

当前:A-S 的 2,368,577(约 236.86 万)条正式样本及简单 history-only 地板已完成;E20/E21 尚未运行,P1B 也尚无满足截止契约的新闻语料。

G1Target-only floor

先冻结 persistence、线性与标准时序模型。

→
G2Public reproduction

在论文公开数据上复核接口、指标与方法量级。

→
G3Local paired test

同一 P1B 样本、预测器与预算下比较是否有增量。

→
G4P3 relation evidence

检索有效之后,才逐边做控制、负对照与时间外稳定性。

来源:指定的 EventConnector / SWM-Bench 论文与研究笔记;页面数字按论文 Polymarket split 与当前本地实验进度整理。论文结果与本项目结果在文中明确分列。

Q5 / TRAINING SHAPE

如何将原始 JSON 整理成统一的“历史信息—预测目标”训练样本?

核心不是截取若干成交点,而是先统一身份、价格方向和日历状态,再以 as_of_time 切分历史输入与未来目标。

DIRECT ANSWER

原始 JSON / parquet 记录经过六步转化:身份与方向统一 → 可信成交筛选 → 多尺度聚合 → 规则日历状态 → history/target 窗口 → 时间与事件族切分。最终得到 31,949,309(约 3,194.93 万)条固定日历样本,其中 26,330,043(约 2,633.00 万)条属于 cold-family 主视图。

01RAW RECORDS

读取原始 JSON / parquet

market、event、trade 身份,时间、outcome、price、size。

→
02NORMALIZE

统一身份与价格方向

冻结 market_id/event_id,所有价格转为 p_answer1。

→
03TRUSTED TRADES

去重并隔离异常

核对成交视图、方向、重复表示和事件身份。

→
04MARKET STATES

聚合多尺度状态

生成 1m / 15m / 1h observed bars 与规则小时状态。

→
05WINDOW

按日历切 history / target

保留 mask、has_trade、staleness;不压缩长缺口。

→
06SPLIT

冻结训练边界

完整 target path 留在同一时间 split,并执行 family 隔离。

协议历史输入预测目标样本量研究用途
A-H过去 24 个日历小时未来 1 / 6 / 24 小时26,900,567(约 2,690.06 万)Track A 与 P3 主协议
A-D过去 10 个 UTC 日未来 7 日路径2,680,165(约 268.02 万)EventConnector 可比实验
A-S过去 16 个 UTC 日下一日概率与变化2,368,577(约 236.86 万)SWM history-only 实验
EARLY PILOT · FOR COMPARISON

旧版:observed points → future points


          
FORMAL TRACK A CONTRACT

正式版:calendar history → fixed horizons


          

06 / CURRENT BOUNDARY

现在能回答什么?

网页展示的是数据基础与样本准备度,不是跨事件关系结果。

CAN SAY

数据基础、正式样本与简单基线已经完成

多尺度数据通过全量验收;Track A 已生成 31,949,309(约 3,194.93 万)条固定日历样本;P2 已生成 43,971(约 4.40 万)条 lexical/calendar 候选。

NOT YET

还没有稳定跨事件关系标签

P2 候选仍需轨迹信号和人工审核,P3 时间外增量验证尚未开始,更不能直接声称结构因果。

NEXT

下一阶段将完成训练型 target-only baseline、EventConnector / SWM 迁移、P2 候选审核与 P3 小规模闭环。

回看样本接口 ↑
Economic World Model × PolymarketData Atlas v1 · Public static release返回顶部 ↑