淘金币游戏 Agent 业务监控看板

问题定位、Agent 干预与上线实验决策

当前阶段:离线验证完成,等待生产实验
当前环境离线基线 + 合成数据 Mock 测试,尚未接入生产流量。
当前业务判断
在已观测的 treatment 游戏用户中,standard Level 2 是当前优先体验断点。

Agent V1 已完成离线决策、异常兜底和日志回流闭环。下一步通过 Holdout、固定规则与 Agent 三组随机实验,验证 Agent 是否提升 Level 2 通过率并带动游戏完成与后续转化。

当前阶段离线验证完成
是否可下业务结论否,等待生产实验
下一决策门槛每组 1,898 名成熟用户
问题定位Level 2 体验断点已识别
Agent 闭环决策、工具、兜底和日志已跑通
三组 A/B等待生产流量和成熟队列
业务结论依据 ITT 与显著性判断

业务结果指标

判断是否创造业务增量

Agent 运行指标

判断系统是否可靠运行

实验判断指标

判断当前能否作出结论

Agent 如何干预

从行为信号到可执行动作
01 识别读取用户与会话特征

关卡、失败次数、规则状态、设备与历史行为

02 判断识别当前阻断原因

规则未建立、难度受阻、性能风险或交易阻断

03 执行选择个性化干预

教程、Guided Mode、降难度、性能提示或权益提醒

04 回流记录结果并进入实验

动作状态、失败原因、业务结果与评估窗口

优先级触发信号业务判断Agent 动作失败兜底验证指标

历史诊断

用于定位问题,不替代线上实验结论

关卡用户漏斗

失败与退出不是互斥事件;用户可能失败后再次尝试,故不按简单加总解释。

模式完成率与退出率

范围:已观测的 treatment 游戏用户;不能直接解释 control 与 treatment 的总效果。

Agent 决策与测试明细

来源:8,100 名合成用户的全量五表回放
该区域验证 Agent V1 的场景识别、Guardrail、Mock 工具执行与日志闭环。为核验分组字段,三组均运行同一 Agent Mock;不展示或推断真实业务 uplift。

Agent Mock 测试输入

尚未连接

所有动作均为模拟执行,不调用真实淘金币、教程、优惠券或游戏配置接口。

决策结果

连接 Render API 后,选择场景并运行测试。

规则判断轨迹

暂无运行记录。

完整 Mock 响应

{}

端到端 Pipeline Mock

验证前端埋点、Backend 监听、实验分桶、特征构建、策略决策、动作执行和数据回流。

尚未运行完整链路。

{}

测试记录与报告

记录保存在当前浏览器,不含真实用户数据;关闭页面后仍可保留,清除浏览器数据或点击清空后删除。

测试时间类型场景 / 分组结果请求标识

Agent 决策树

场景与决策状态

场景命中用户占全量比例

实验分组覆盖

分组评估用户

全量回放分布

实验分组最终场景用户数组内占比

回放测试审计

校验项结果

全量数据保留于脱敏 CSV;看板仅展示按场景聚合和固定抽样明细。

脱敏决策样本

每个“实验分组 × 场景”最多展示 6 条;用于核查单条决策。

打开全量结果 CSV
脱敏用户分组最终场景动作计划工具执行五表覆盖

上线后如何判断有效

三组随机实验、成熟队列与运行护栏
实验结构
三组随机对照
Holdout固定规则Agent
同时回答“干预是否有效”与“Agent 是否优于固定规则”。
最小样本量
1,898 / 组
三组共 5,694 名完整用户,用于识别 Level 2 通过率至少 +5pp 的效果。
当前决策状态
暂不可下结论
生产入组与成熟样本均为 0。历史基线和 Mock 结果只证明方案可运行,不证明业务增量。

决策规则

主分析采用 ITT,以首次满足 standard + Level 2 + level_fail 的随机入组用户为分母。只有达到最小样本量、观察窗成熟、SRM 与数据质量通过、护栏指标未恶化时,才读取 Agent 相对 Holdout 和固定规则组的效应、置信区间与显著性。

三组实验决策台上线后按小时更新入组与质量,按成熟队列更新业务结果
当前状态:等待生产回流
指标 / 观察窗Holdout固定规则AgentAgent vs HoldoutAgent vs 固定规则当前判断

以首次满足 `standard + Level 2 + level_fail` 的入组用户为分母,不以实际接受干预者为分母。未成熟的 24 小时及 7 日队列不得提前作出效果判断。

Agent 运行健康度本地展示浏览器 Mock 测试;上线后切换为 5 分钟实时决策日志
等待测试
运行状态
暂无样本
Agent 决策请求 0 次
Agent 崩溃率
引擎异常请求 / Agent 决策请求
fallback 率
fallback 或客户端超时 / Agent 请求
决策成功率
success 或 no_action / Agent 请求

崩溃率低于 0.1% 为正常;0.1%–0.5% 预警;高于 0.5% 暂停扩量;高于 1% 自动降级到固定规则或静态兜底。本地故障注入计入测试值,不代表线上稳定性。

基于历史数据的离线挽回预测来源:`game_behavior_log.csv` + `intervention_test.csv` PSM-DID
仅用于实验规划

游戏完成挽回情景

策略情景可触达用户效应预计新增完成

5pp MDE 所需样本量

每组完整用户
1,898
三组总入组
5,694

双主比较使用 Bonferroni 校正:双侧 alpha=0.025、power=80%。预测值不可替代新实验结论。

订单与 ROI 基准情景

策略订单效应预计增量订单毛贡献变动成本运营 ROI一次性成本上限

基准假设:单笔增量订单贡献毛利 ¥8.00,单可触达用户 Agent/工具变动成本 ¥0.50。ROI 不含一次性建设成本;货币参数须在正式立项前由财务与技术团队替换。查看保守/基准/积极三档明细

监控异常排查 Runbook从数据采集到业务工具执行的标准排障顺序
P0 / P1 必须保留 trace_id
告警优先核验责任团队临时处置恢复标准

排查顺序统一为:前端事件 → Backend → Dify/策略 → 业务工具 → 数据回流。P0/P1 事故必须保留 trace_id、版本号与原始错误码。

离线数据通过 offline_simulation/build_level2_forecast.py 刷新;上线后由事件流、实验宽表和 BI 任务更新生产指标。