产品

你的代理在重复已经付过代价的错误。今天一个搞挂了生产环境,明天它的同事以同样的方式再搞一次。CommonTrace 把这些经验变成教训,并衡量它们是否真的改变了行为。

没有学习层时

客服、销售、人力、市场和代码代理各自积累任务、决策、成功、失败与反馈,但这些都到不了彼此手里。经验被孤立,同样的错误被一个又一个代理重复。原始记忆本身解决不了:它存下从不迁移的片段,和在代理真正行动那一刻从不触发的规则。

这个协议做什么

从代理的原始经验,到在下一次决策时生效的一条教训,中间是五个步骤。它与你现有的代理并行工作。

  1. 采集经验, 来自你已在生产运行的代理的会话、记录、结果与反馈。
  2. 结构化上下文, 当时想做什么、状态如何、实际发生了什么。
  3. 提炼教训, 把重复出现的失败提炼到足够通用,能用在它从未出现过的地方。
  4. 存为可复用知识, 经过校验和批准,放在整个代理群都能取到的地方。
  5. 回注恰当的教训, 在决策发生的那一刻,也是唯一能改变结果的时刻。

经验变成教训,教训变成共享知识,而共享知识会累积:新代理上手更快、决策更好、重复错误更少、用户挫败更少。时间一长这就是护城河,因为它由你的代理群已经付过代价的工作构成,别人没有。

生产环境中

在一位客户运行代码、市场与客服代理的代理群上测得。两个数字都是 CommonTrace 部署前后的对比,并已由客户确认。

−53%
解决一个客服问题所需时间

同一条客服流程上的前后对比。

−29%
客户流失

在面向客户的市场代理上部署之后,它不再重复那些赶走客户的错误。

在学习基准上

在一位客户代理的较早版本上测得。问题不是代理能否记住见过的东西,而是它在没见过的情况下是否表现正确。

~9% → ~78%
在新的泛化用例上的正确行为

学习过程中没有给任何提示。原始记忆得到第一个数字,提炼后的教训得到第二个。

58% → 89%
P1 上的成功率,原始记忆对比 CommonTrace
−9.5%
输入 token,从 1100 万降到 1000 万
−9%
LLM 调用次数

方法说明:这是初步结果,已获授权发布。泛化探针使用了经过筛选的 P1/P5 切分,覆盖约 32 个任务、每个 5 到 8 次试验,且只有 level 0 覆盖了完整基准。token 与调用次数来自同等负载下配对的 P5 运行,共八次试验。这里更好的学习与更低的运行成本同时出现,但一次运行终究只是一次运行。

一次部署是怎样进行的

从你已有的记录出发,先做一条生产流程,衡量共享的教训是否改善了随后的决策。

我们接入什么

  • 代理会话与记录
  • 反馈与结果
  • 已有记忆
  • 可观测性数据
  • 失败与升级日志

CommonTrace 做什么

  • 找出重复出现的失败模式
  • 提取候选教训
  • 校验并批准教训
  • 把它们注入相关决策
  • 与基线对比表现

我们衡量什么

  • 重复错误率
  • 任务成功率或解决率
  • 转人工率
  • 用户挫败感
  • token 与推理成本

最适合: 生产环境中的代理群、重复性流程、可衡量的结果,以及行为不一致会带来挫败或流失的面向客户的代理。

先做一个为期 30 天的代理群学习试点。

一条流程。一个代理群。可衡量的成效。

  • 不需要替换任何基础设施。
  • 从你的历史记录开始。
  • 教训上线前由你批准。
  • 与既有基线对比。
价格:按月订阅,按代理群规模计价,每月 2,500 美元起。

申请部署

申请部署

留下你的邮箱,我们会为你的舰队安排一次部署。绝无垃圾邮件, 我们仅用它来联系你。