历史基线
来源:五张原始 CSVLevel 2 体验断点
范围:`standard` 游戏用户关卡用户漏斗
失败与退出不是互斥事件;用户可能失败后再次尝试,故不按简单加总解释。
模式完成率与退出率
本地 Agent 决策测试
来源:8,100 名合成用户的全量五表回放Agent Mock 测试输入
所有动作均为模拟执行,不调用真实淘金币、教程、优惠券或游戏配置接口。
决策结果
连接 Render API 后,选择场景并运行测试。
规则判断轨迹
暂无运行记录。
完整 Mock 响应
{}端到端 Pipeline Mock
验证前端埋点、Backend 监听、实验分桶、特征构建、策略决策、动作执行和数据回流。
尚未运行完整链路。
{}
测试记录与报告
记录保存在当前浏览器,不含真实用户数据;关闭页面后仍可保留,清除浏览器数据或点击清空后删除。
| 测试时间 | 类型 | 场景 / 分组 | 结果 | 请求标识 |
|---|
Agent 决策树
场景与决策状态
| 场景 | 命中用户 | 占全量比例 |
|---|
实验分组覆盖
| 分组 | 评估用户 |
|---|
全量回放分布
| 实验分组 | 最终场景 | 用户数 | 组内占比 |
|---|
回放测试审计
| 校验项 | 结果 |
|---|
全量数据保留于脱敏 CSV;看板仅展示按场景聚合和固定抽样明细。
| 脱敏用户 | 分组 | 最终场景 | 动作计划 | 工具执行 | 五表覆盖 |
|---|
实验评估
实验设计、上线监控与离线效果预测数据口径说明
历史基线来源于五张原始数据表;Agent 决策、异常兜底和 Pipeline 结果来源于合成数据及 Mock 服务。Agent、固定规则组和 Holdout 的真实流量、Dify 时延、动作执行及业务效果,需要生产埋点与数仓回流后更新。当前数据仅用于方案验证,不代表线上 A/B 实验结论。
Agent 运行健康度
当前展示本浏览器 Mock 测试记录;上线后替换为 5 分钟实时决策日志。
崩溃率阈值:低于 0.1% 正常;0.1%–0.5% 预警;高于 0.5% 暂停扩量;高于 1% 自动降级固定规则或静态兜底。本地故障注入会被计入测试值,不代表线上真实稳定性。
| 监控维度 | Holdout | 固定规则组 | Agent 组 | 当前状态 | 阈值 / 规则 |
|---|
以首次满足 `standard + Level 2 + level_fail` 的入组用户为分母,不以实际接受干预者为分母。未成熟的 24 小时及 7 日队列不得提前作出效果判断。
监控异常排查 Runbook
| 告警 | 优先核验 | 责任团队 | 临时处置 | 恢复标准 |
|---|
排查顺序统一为:前端事件 → Backend → Dify/策略 → 业务工具 → 数据回流。P0/P1 事故必须保留 trace_id、版本号与原始错误码。
游戏完成挽回情景
| 策略情景 | 可触达用户 | 效应 | 预计新增完成 |
|---|
5pp MDE 所需样本量
双主比较使用 Bonferroni 校正:双侧 alpha=0.025、power=80%。预测值不可替代新实验结论。
订单与 ROI 基准情景
| 策略 | 订单效应 | 预计增量订单 | 毛贡献 | 变动成本 | 运营 ROI | 一次性成本上限 |
|---|
基准假设:单笔增量订单贡献毛利 ¥8.00,单可触达用户 Agent/工具变动成本 ¥0.50。ROI 不含一次性建设成本;货币参数须在正式立项前由财务与技术团队替换。查看保守/基准/积极三档明细
离线数据刷新:重新运行 `offline_simulation/build_level2_forecast.py` 并更新本页面数据文件;线上刷新:由事件流、实验宽表和 BI 任务驱动。