A/B测试分析
自动解析A/B实验数据,输出统计显著性、置信区间与业务决策建议,替代人工跑数。
适用场景
1
电商平台对推荐算法进行A/B测试,自动判断CTR提升是否显著
2
SaaS产品新注册流程A/B实验,分析转化率差异与置信区间
3
金融APP推送文案A/B测试,输出留存率显著性结论与放量建议
4
内容平台标题样式A/B实验,自动生成实验报告并推送给运营团队
核心Prompt(安装配置用)
你是企业A/B测试分析专家。你的任务是基于用户提供的实验数据,自动完成统计显著性检验并输出业务结论。 输入要求:用户会提供实验名称、对照组与实验组的样本量、转化数或均值、标准差(如有)、显著性水平(默认0.05)。 分析步骤: 1. 识别指标类型:转化率类使用双样本比例Z检验,均值类使用双样本T检验。 2. 计算检验统计量与p值,判断是否拒绝原假设。 3. 计算实验组相对对照组的提升幅度及95%置信区间。 4. 结合样本量判断检验效能,若效能低于0.8需提示样本不足风险。 5. 给出业务结论:显著提升、显著下降、无显著差异、数据不足。 输出格式: 【实验名称】 【指标类型】 【样本量】对照组/实验组 【核心指标】对照组值 vs 实验组值 【相对提升】xx%(95% CI: xx% ~ xx%) 【p值】x.xxxx 【结论】显著提升/显著下降/无显著差异/数据不足 【业务建议】是否放量、是否继续观察、是否需要扩大样本 约束条件: 1. 不得编造数据,缺失字段需明确标注“数据缺失”。 2. 当p值接近0.05时需提示边界情况,建议延长实验周期。 3. 不得将统计显著直接等同于业务显著,需结合提升幅度判断。 4. 所有结论必须可追溯到输入数据。 5. 若样本量低于每组1000,需提示结果仅供参考。
所需工具 / API对接
需对接:数据仓库(Hive/ClickHouse/MySQL)读取实验数据;统计计算服务(Python scipy/statsmodels)执行检验;企业IM(钉钉/飞书/企微)推送报告;BI系统(Tableau/Superset)写入结果;任务调度(Airflow/Cron)定时触发。
安装部署步骤
11. 环境准备:确认服务器Python 3.9+,执行 python -m venv abenv && source abenv/bin/activate。
22. 安装依赖:pip install pandas numpy scipy statsmodels requests pyyaml。
33. 配置参数:创建 config.yaml,写入数据源连接串、显著性水平、最小样本量、IM webhook。
44. 导入Prompt:将 core_prompt 写入 prompts/ab_analysis.txt,UTF-8编码保存。
55. 连接工具API:在 agent_config.json 中配置数据库DSN、IM webhook、BI写入地址,执行 python test_conn.py 验证连通。
66. 测试验证:运行 python run_agent.py --test,使用内置样例数据,检查输出是否包含p值与置信区间。
77. 上线部署:配置Airflow DAG每日9点触发,或使用 systemd 注册为常驻服务,日志输出到 logs/ab_agent.log。
88. 监控告警:对p值计算失败、数据缺失、IM推送失败设置告警,接入 Prometheus + Grafana。
配置参数
| 参数名 | 说明 | 默认值 |
|---|---|---|
significance_level |
显著性水平α,默认0.05 | 0.05 |
min_sample_size |
每组最小样本量,低于此值提示数据不足 | 1000 |
metric_type |
指标类型:conversion(转化率)或 mean(均值) | conversion |
confidence_interval |
置信区间水平 | 0.95 |
notify_channel |
IM通知渠道webhook地址 | https://hook.example.com/ab |
效果示例
输入:实验“首页推荐改版”,对照组样本10000,转化800;实验组样本10000,转化920;α=0.05。
输出:
【实验名称】首页推荐改版
【指标类型】转化率
【样本量】对照组10000 / 实验组10000
【核心指标】对照组8.00% vs 实验组9.20%
【相对提升】15.00%(95% CI: 12.1% ~ 17.9%)
【p值】0.0021
【结论】显著提升
【业务建议】p值远小于0.05,样本量充足,建议全量放量;同时监控长期留存是否受负面影响。
输出:
【实验名称】首页推荐改版
【指标类型】转化率
【样本量】对照组10000 / 实验组10000
【核心指标】对照组8.00% vs 实验组9.20%
【相对提升】15.00%(95% CI: 12.1% ~ 17.9%)
【p值】0.0021
【结论】显著提升
【业务建议】p值远小于0.05,样本量充足,建议全量放量;同时监控长期留存是否受负面影响。
常见问题
Q1:Agent能否直接连接生产数据库?
A:建议通过只读账号或数据仓库视图连接,避免直接访问生产库,确保权限最小化。
Q2:统计检验结果和人工跑数不一致怎么办?
A:检查指标类型选择是否正确,转化率用Z检验、均值用T检验;同时核对样本量口径与去重逻辑。
Q3:样本量不足时Agent会怎么处理?
A:会输出“数据不足”结论,并提示当前检验效能,建议延长实验周期或扩大流量。
Q4:支持多指标同时分析吗?
A:支持,但需注意多重比较问题,建议开启Bonferroni校正参数,避免假阳性。
Q5:能否自动触发实验报告推送?
A:可以,通过Airflow定时触发并调用IM webhook,报告自动发送到指定群组。
A:建议通过只读账号或数据仓库视图连接,避免直接访问生产库,确保权限最小化。
Q2:统计检验结果和人工跑数不一致怎么办?
A:检查指标类型选择是否正确,转化率用Z检验、均值用T检验;同时核对样本量口径与去重逻辑。
Q3:样本量不足时Agent会怎么处理?
A:会输出“数据不足”结论,并提示当前检验效能,建议延长实验周期或扩大流量。
Q4:支持多指标同时分析吗?
A:支持,但需注意多重比较问题,建议开启Bonferroni校正参数,避免假阳性。
Q5:能否自动触发实验报告推送?
A:可以,通过Airflow定时触发并调用IM webhook,报告自动发送到指定群组。
企业落地建议
建议采用“旁路部署+定时分析”方式,Agent只读实验数据,不侵入线上业务。初期可先接入1-2个核心实验,验证结论准确性后再扩展。成本估算:云服务器2核4G约200元/月,IM与BI接口通常免费,人力投入约3人日。注意事项:必须统一指标口径与样本去重规则,避免统计显著但业务无感;对p值边界情况设置人工复核环节。
需要我们帮你落地?
专业团队帮你从0到1部署企业AI Agent,含安装配置、定制开发、持续运营