Skip to content

Ab test/agent action shadow - #55

Closed
AlexBybye wants to merge 4 commits into
masterfrom
ab-test/agent-action-shadow
Closed

Ab test/agent action shadow#55
AlexBybye wants to merge 4 commits into
masterfrom
ab-test/agent-action-shadow

Conversation

@AlexBybye

Copy link
Copy Markdown
Owner

实跑证据

  • 6d992cc0...:AB 分支最近一次成功后端运行
  • 81ec11ae...:master 最近一次成功后端运行

输出表现

AB 输出的内容表现:

  • 复习主线清楚;
  • 结合了用户大纲和历年题;
  • 给了行列式、矩阵、秩、方程组、向量组、特征值和二次型的复习顺序;
  • 给了具体易错点;
  • 引用了 4 条历年卷资料;
  • Bilibili 关键词已经进入具体知识点,而不是只复制用户原句。
    主要问题:
  • 总耗时很长;
  • Agent 出现了第二次生成决策;
  • 发生了一次模型输出重试;
  • 可见回答仍然偏长;
  • “未覆盖内容”重新复制用户大纲,带来明显冗余;
  • 统计说明篇幅较大,但对用户真正的复习安排帮助有限。
    AB 的核心结论是:
证据和引用比 master 更完整,但运行过程多了一次生成重试,耗时明显更高。

master 输出的内容表现:

  • 同样完成了完整复习大纲;
  • 章节顺序和易错点基本齐全;
  • 只保留了 2 条课程引用;
  • Bilibili 关键词更具体:
    • 线性代数
    • 伴随矩阵求逆公式
    • 线性方程组解的判定
      主要问题:
  • 也存在“未覆盖内容”复制用户大纲的问题;
  • 引用数量少于 AB;
  • 虽然运行更快,但供应商记录的输出 token 反而更多。

master 的核心结论是:

运行更快,没有重试,回答也能完成;
但引用覆盖少于 AB,token 用量记录反而更高。

两边直接对比

指标 AB AB-2 master master-2 观察
总耗时 84.77 秒 90.83秒 80.17 秒 82.59秒 master 更快
Agent 步骤 6个,3步 5个 5个,2步 5个 AB 多一步
生成重试 1 0 0 0 AB 有额外成本
可见回答长度 5648 字符 5420 字符 5930 字符 6516 字符 基本同量级
引用数量 4 2 2 2 AB 更多
引用接受数 4/5 2/5 2/5 2/5 AB 更完整
Bilibili 资源 1 1 1 1 相同
课程越权 0 0 0 0 相同
证据状态 sufficient sufficient sufficient sufficient 相同
输入 token 4992 1536 4992 0 相同
未命中缓存 5098 3509 159 5074 master更高
输出 token 10541 10091 10005 7754 master 更高
成本 0.05 0.05 0.04 0.04 master 更低

master 的表现

master 的回答更像“直接完成任务”:先根据考试大纲安排复习顺序,再补充行列式、矩阵、秩、线性方程组等核心公式,整体内容完整,且没有触发重试。

它的问题是仓库引用偏少,只有 2 条。回答虽然能用,但有一部分内容主要来自用户大纲和通用知识,历年卷证据支撑相对弱。语言也更口语化,出现了“学妹”“考完请你喝奶茶”等风格化表达,是否合适取决于你想不想保留这种陪伴式语气。

abtest 的表现

abtest 的回答结构更规整,明确按五个章节组织:

行列式 → 矩阵 → 秩与方程组 → 向量组 → 特征值与二次型

它还把“公式记不住”转成了“记母公式、理解公式之间的关系”,教学组织比 master 更清晰。引用数量是 master 的两倍,说明 Agent 的额外动作确实让最终回答覆盖了更多仓库依据。

代价也很明确:

  • 多了一步 Agent 决策;
  • 发生了一次模型输出重试;
  • 总耗时接近 master 的 3 倍;
  • 输出 token 比 master 多约 30%;
  • 花费从 0.04 元增加到 0.05 元。

回答质量上的共同问题

两边都存在同一个问题:在“未覆盖内容”里重新粘贴了用户提供的大纲。这不是事实错误,但对用户价值不高,会让回答显得冗长,也会稀释真正有用的复习建议。

两边还都把“历年题没有按知识点完整归组”说得比较诚实,没有直接编造命题概率或“必考结论”,这一点是可靠的。

AB 实验结论

这次结果不是“abtest 全面胜出”,而是一个很清楚的取舍:

  • 如果优先考虑响应速度、稳定性和成本,master 更好。
  • 如果优先考虑仓库引用覆盖和复习内容的结构化程度,abtest 更好。
  • Workflow 护栏在两边都正常,没有出现任务漂移、课程越权或证据状态失控。
  • abtest 的 Agent 决策机制带来了可观察的引用收益,但目前收益不足以抵消它带来的额外延迟和重试风险。

我的判断是:当前不建议直接把 abtest 当成默认方案合并回 master。master 更适合作为线上基线;abtest 的“引用增强”值得保留,但需要先解决重复输出、重试导致的延迟,以及为什么一次额外决策会显著增加输出 token 的问题。

这只是各一次运行,不能证明长期稳定性;但就这两次最新基线而言,结论已经足够明确:master 胜在效率,abtest 胜在证据覆盖,整体上 master 暂时更划算。

@AlexBybye
AlexBybye marked this pull request as ready for review August 28, 2026 17:27
@AlexBybye AlexBybye closed this Aug 28, 2026
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant