数据状态当前页面展示历史五表离线基线与实验设计值。Agent、固定规则、Holdout 的实时流量、Dify 时延与动作结果需要生产埋点回流后才会显示真实数据。
历史基线
来源:五张原始 CSVLevel 2 体验断点
范围:`standard` 游戏用户关卡用户漏斗
失败与退出不是互斥事件;用户可能失败后再次尝试,故不按简单加总解释。
模式完成率与退出率
本地 Agent 决策测试
来源:8,100 名合成用户的全量五表回放该区域验证 Agent V1 的场景识别、Guardrail、Mock 工具执行与日志闭环。为核验分组字段,三组均运行同一 Agent Mock;不展示或推断真实业务 uplift。
Agent Mock 测试输入
尚未连接
所有动作均为模拟执行,不调用真实淘金币、教程、优惠券或游戏配置接口。
决策结果
连接 Render API 后,选择场景并运行测试。
规则判断轨迹
暂无运行记录。
完整 Mock 响应
{}端到端 Pipeline Mock
验证前端埋点、Backend 监听、实验分桶、特征构建、策略决策、动作执行和数据回流。
尚未运行完整链路。
{}
Agent 决策树
场景与决策状态
| 场景 | 命中用户 | 占全量比例 |
|---|
实验分组覆盖
| 分组 | 评估用户 |
|---|
全量回放分布
| 实验分组 | 最终场景 | 用户数 | 组内占比 |
|---|
回放测试审计
| 校验项 | 结果 |
|---|
全量数据保留于脱敏 CSV;看板仅展示按场景聚合和固定抽样明细。
| 脱敏用户 | 分组 | 最终场景 | 动作计划 | 工具执行 | 五表覆盖 |
|---|
实验评估
实验设计、上线监控与离线效果预测实验结构
三组随机对照
Holdout固定规则Agent
同时回答“干预是否有效”与“Agent 是否优于固定规则”。
最小样本量
1,898 / 组
三组共 5,694 名完整用户,用于识别 Level 2 通过率至少 +5pp 的效果。
当前数据状态
等待线上回流
离线预测用于立项和容量规划;真实效果必须依据成熟队列的 ITT 实验结果判断。
三组实验监控上线后按 5 分钟、小时或成熟队列更新
主分析口径:ITT| 监控维度 | Holdout | 固定规则组 | Agent 组 | 当前状态 | 阈值 / 规则 |
|---|
以首次满足 `standard + Level 2 + level_fail` 的入组用户为分母,不以实际接受干预者为分母。未成熟的 24 小时及 7 日队列不得提前作出效果判断。
基于历史数据的离线挽回预测来源:`game_behavior_log.csv` + `intervention_test.csv` PSM-DID
仅用于实验规划情景预测
| 策略情景 | 可触达用户 | 效应 | 预计新增完成 |
|---|
5pp MDE 所需样本量
双主比较使用 Bonferroni 校正:双侧 alpha=0.025、power=80%。预测值不可替代新实验结论。
离线数据刷新:重新运行 `offline_simulation/build_level2_forecast.py` 并更新本页面数据文件;线上刷新:由事件流、实验宽表和 BI 任务驱动。