淘金币跳一跳 · Level 2 Agent 实验看板

数据状态当前页面展示历史五表离线基线与实验设计值。Agent、固定规则、Holdout 的实时流量、Dify 时延与动作结果需要生产埋点回流后才会显示真实数据。

历史基线

来源:五张原始 CSV

Level 2 体验断点

范围:`standard` 游戏用户

关卡用户漏斗

失败与退出不是互斥事件;用户可能失败后再次尝试,故不按简单加总解释。

模式完成率与退出率

本地 Agent 决策测试

来源:8,100 名合成用户的全量五表回放
该区域验证 Agent V1 的场景识别、Guardrail、Mock 工具执行与日志闭环。为核验分组字段,三组均运行同一 Agent Mock;不展示或推断真实业务 uplift。

Agent Mock 测试输入

尚未连接

所有动作均为模拟执行,不调用真实淘金币、教程、优惠券或游戏配置接口。

决策结果

连接 Render API 后,选择场景并运行测试。

规则判断轨迹

暂无运行记录。

完整 Mock 响应

{}

端到端 Pipeline Mock

验证前端埋点、Backend 监听、实验分桶、特征构建、策略决策、动作执行和数据回流。

尚未运行完整链路。

{}

Agent 决策树

场景与决策状态

场景命中用户占全量比例

实验分组覆盖

分组评估用户

全量回放分布

实验分组最终场景用户数组内占比

回放测试审计

校验项结果

全量数据保留于脱敏 CSV;看板仅展示按场景聚合和固定抽样明细。

脱敏决策样本

每个“实验分组 × 场景”最多展示 6 条;用于核查单条决策。

打开全量结果 CSV
脱敏用户分组最终场景动作计划工具执行五表覆盖

实验评估

实验设计、上线监控与离线效果预测
实验结构
三组随机对照
Holdout固定规则Agent
同时回答“干预是否有效”与“Agent 是否优于固定规则”。
最小样本量
1,898 / 组
三组共 5,694 名完整用户,用于识别 Level 2 通过率至少 +5pp 的效果。
当前数据状态
等待线上回流
离线预测用于立项和容量规划;真实效果必须依据成熟队列的 ITT 实验结果判断。
三组实验监控上线后按 5 分钟、小时或成熟队列更新
主分析口径:ITT
监控维度Holdout固定规则组Agent 组当前状态阈值 / 规则

以首次满足 `standard + Level 2 + level_fail` 的入组用户为分母,不以实际接受干预者为分母。未成熟的 24 小时及 7 日队列不得提前作出效果判断。

基于历史数据的离线挽回预测来源:`game_behavior_log.csv` + `intervention_test.csv` PSM-DID
仅用于实验规划

情景预测

策略情景可触达用户效应预计新增完成

5pp MDE 所需样本量

每组完整用户
1,898
三组总入组
5,694

双主比较使用 Bonferroni 校正:双侧 alpha=0.025、power=80%。预测值不可替代新实验结论。

离线数据刷新:重新运行 `offline_simulation/build_level2_forecast.py` 并更新本页面数据文件;线上刷新:由事件流、实验宽表和 BI 任务驱动。