产品
你的代理在重复已经付过代价的错误。今天一个搞挂了生产环境,明天它的同事以同样的方式再搞一次。CommonTrace 把这些经验变成教训,并衡量它们是否真的改变了行为。
没有学习层时
客服、销售、人力、市场和代码代理各自积累任务、决策、成功、失败与反馈,但这些都到不了彼此手里。经验被孤立,同样的错误被一个又一个代理重复。原始记忆本身解决不了:它存下从不迁移的片段,和在代理真正行动那一刻从不触发的规则。
这个协议做什么
从代理的原始经验,到在下一次决策时生效的一条教训,中间是五个步骤。它与你现有的代理并行工作。
- 采集经验, 来自你已在生产运行的代理的会话、记录、结果与反馈。
- 结构化上下文, 当时想做什么、状态如何、实际发生了什么。
- 提炼教训, 把重复出现的失败提炼到足够通用,能用在它从未出现过的地方。
- 存为可复用知识, 经过校验和批准,放在整个代理群都能取到的地方。
- 回注恰当的教训, 在决策发生的那一刻,也是唯一能改变结果的时刻。
经验变成教训,教训变成共享知识,而共享知识会累积:新代理上手更快、决策更好、重复错误更少、用户挫败更少。时间一长这就是护城河,因为它由你的代理群已经付过代价的工作构成,别人没有。
生产环境中
在一位客户运行代码、市场与客服代理的代理群上测得。两个数字都是 CommonTrace 部署前后的对比,并已由客户确认。
同一条客服流程上的前后对比。
在面向客户的市场代理上部署之后,它不再重复那些赶走客户的错误。
在学习基准上
在一位客户代理的较早版本上测得。问题不是代理能否记住见过的东西,而是它在没见过的情况下是否表现正确。
学习过程中没有给任何提示。原始记忆得到第一个数字,提炼后的教训得到第二个。
方法说明:这是初步结果,已获授权发布。泛化探针使用了经过筛选的 P1/P5 切分,覆盖约 32 个任务、每个 5 到 8 次试验,且只有 level 0 覆盖了完整基准。token 与调用次数来自同等负载下配对的 P5 运行,共八次试验。这里更好的学习与更低的运行成本同时出现,但一次运行终究只是一次运行。
一次部署是怎样进行的
从你已有的记录出发,先做一条生产流程,衡量共享的教训是否改善了随后的决策。
我们接入什么
- 代理会话与记录
- 反馈与结果
- 已有记忆
- 可观测性数据
- 失败与升级日志
CommonTrace 做什么
- 找出重复出现的失败模式
- 提取候选教训
- 校验并批准教训
- 把它们注入相关决策
- 与基线对比表现
我们衡量什么
- 重复错误率
- 任务成功率或解决率
- 转人工率
- 用户挫败感
- token 与推理成本
最适合: 生产环境中的代理群、重复性流程、可衡量的结果,以及行为不一致会带来挫败或流失的面向客户的代理。
先做一个为期 30 天的代理群学习试点。
一条流程。一个代理群。可衡量的成效。
- 不需要替换任何基础设施。
- 从你的历史记录开始。
- 教训上线前由你批准。
- 与既有基线对比。