淘金币跳一跳 · Level 2 Agent 实验看板

当前环境离线基线 + 合成数据 Mock 测试,尚未接入生产流量。

历史基线

来源:五张原始 CSV

Level 2 体验断点

范围:`standard` 游戏用户

关卡用户漏斗

失败与退出不是互斥事件;用户可能失败后再次尝试,故不按简单加总解释。

模式完成率与退出率

本地 Agent 决策测试

来源:8,100 名合成用户的全量五表回放
该区域验证 Agent V1 的场景识别、Guardrail、Mock 工具执行与日志闭环。为核验分组字段,三组均运行同一 Agent Mock;不展示或推断真实业务 uplift。

Agent Mock 测试输入

尚未连接

所有动作均为模拟执行,不调用真实淘金币、教程、优惠券或游戏配置接口。

决策结果

连接 Render API 后,选择场景并运行测试。

规则判断轨迹

暂无运行记录。

完整 Mock 响应

{}

端到端 Pipeline Mock

验证前端埋点、Backend 监听、实验分桶、特征构建、策略决策、动作执行和数据回流。

尚未运行完整链路。

{}

测试记录与报告

记录保存在当前浏览器,不含真实用户数据;关闭页面后仍可保留,清除浏览器数据或点击清空后删除。

测试时间类型场景 / 分组结果请求标识

Agent 决策树

场景与决策状态

场景命中用户占全量比例

实验分组覆盖

分组评估用户

全量回放分布

实验分组最终场景用户数组内占比

回放测试审计

校验项结果

全量数据保留于脱敏 CSV;看板仅展示按场景聚合和固定抽样明细。

脱敏决策样本

每个“实验分组 × 场景”最多展示 6 条;用于核查单条决策。

打开全量结果 CSV
脱敏用户分组最终场景动作计划工具执行五表覆盖

实验评估

实验设计、上线监控与离线效果预测
实验结构
三组随机对照
Holdout固定规则Agent
同时回答“干预是否有效”与“Agent 是否优于固定规则”。
最小样本量
1,898 / 组
三组共 5,694 名完整用户,用于识别 Level 2 通过率至少 +5pp 的效果。
线上实验状态
等待线上回流
离线预测用于立项和容量规划;真实效果必须依据成熟队列的 ITT 实验结果判断。

数据口径说明

历史基线来源于五张原始数据表;Agent 决策、异常兜底和 Pipeline 结果来源于合成数据及 Mock 服务。Agent、固定规则组和 Holdout 的真实流量、Dify 时延、动作执行及业务效果,需要生产埋点与数仓回流后更新。当前数据仅用于方案验证,不代表线上 A/B 实验结论。

三组实验监控上线后按 5 分钟、小时或成熟队列更新
主分析口径:ITT

Agent 运行健康度

当前展示本浏览器 Mock 测试记录;上线后替换为 5 分钟实时决策日志。

等待测试
运行状态
暂无样本
Agent 决策请求 0 次
Agent 崩溃率
引擎异常请求 / Agent 决策请求
fallback 率
fallback 或客户端超时 / Agent 请求
决策成功率
success 或 no_action / Agent 请求

崩溃率阈值:低于 0.1% 正常;0.1%–0.5% 预警;高于 0.5% 暂停扩量;高于 1% 自动降级固定规则或静态兜底。本地故障注入会被计入测试值,不代表线上真实稳定性。

监控维度Holdout固定规则组Agent 组当前状态阈值 / 规则

以首次满足 `standard + Level 2 + level_fail` 的入组用户为分母,不以实际接受干预者为分母。未成熟的 24 小时及 7 日队列不得提前作出效果判断。

监控异常排查 Runbook

告警优先核验责任团队临时处置恢复标准

排查顺序统一为:前端事件 → Backend → Dify/策略 → 业务工具 → 数据回流。P0/P1 事故必须保留 trace_id、版本号与原始错误码。

基于历史数据的离线挽回预测来源:`game_behavior_log.csv` + `intervention_test.csv` PSM-DID
仅用于实验规划

游戏完成挽回情景

策略情景可触达用户效应预计新增完成

5pp MDE 所需样本量

每组完整用户
1,898
三组总入组
5,694

双主比较使用 Bonferroni 校正:双侧 alpha=0.025、power=80%。预测值不可替代新实验结论。

订单与 ROI 基准情景

策略订单效应预计增量订单毛贡献变动成本运营 ROI一次性成本上限

基准假设:单笔增量订单贡献毛利 ¥8.00,单可触达用户 Agent/工具变动成本 ¥0.50。ROI 不含一次性建设成本;货币参数须在正式立项前由财务与技术团队替换。查看保守/基准/积极三档明细

离线数据刷新:重新运行 `offline_simulation/build_level2_forecast.py` 并更新本页面数据文件;线上刷新:由事件流、实验宽表和 BI 任务驱动。