製品
あなたのエージェントは、すでに代償を払った失敗を繰り返しています。今日ひとつが本番を壊し、明日は同僚が同じやり方で壊す。CommonTrace はその経験を教訓に変え、実際に振る舞いが変わったかを測ります。
学習の層がないと
サポート、営業、人事、マーケティング、コードの各エージェントは、それぞれにタスク、判断、成功、失敗、フィードバックを溜め込みます。そのどれもが他のエージェントには届きません。経験は縦割りのまま残り、同じ失敗が一体ずつ繰り返されます。素の記憶だけでは解決しません。転移しないエピソードと、エージェントが動く瞬間に一度も発火しないルールが貯まるだけです。
プロトコルがすること
エージェントの素の経験から、次の判断で効く教訓までの五段階です。いま動かしているエージェントの隣で働きます。
- 経験を取り込む, すでに本番で動いているエージェントのセッション、トレース、結果、フィードバックから。
- 文脈を構造化する, 何をしようとしていたか、状態はどうだったか、実際に何が起きたか。
- 教訓を抽出する, 繰り返される失敗を、見たことのない場面にも効くくらい一般的な形に絞り込む。
- 再利用できる知識として保存する, 検証と承認を経て、群のどのエージェントからも届くところに。
- 適切な教訓を差し戻す, 判断のその瞬間に。何かが変わる唯一の瞬間です。
経験は教訓になり、教訓は共有知識になり、共有知識は積み上がります。新しいエージェントの立ち上がりが速くなり、判断がよくなり、同じ失敗が減り、利用者のいらだちが減る。時間が経てばそれは堀になります。あなたの群がすでに代償を払った仕事から築かれ、他の誰も持っていないからです。
本番環境で
コード、マーケティング、サポートのエージェントを動かしている顧客の群で計測しました。どちらの数字も CommonTrace 導入の前後で、顧客に確認済みです。
同一のサポートフローでの前後比較。
顧客と直に接するマーケティングエージェントへの導入後。顧客を遠ざけていた失敗の繰り返しが止まりました。
学習ベンチマークで
ある顧客のエージェントの旧バージョンで計測しました。問われているのは、見たものを思い出せるかではなく、見ていないケースで正しく振る舞えるかです。
学習中のヒントは一切なし。素の記憶が最初の数字、抽出された教訓が二つ目の数字です。
方法:これは初期結果であり、許可を得て公開しています。汎化のプローブはフィルタ済みの P1/P5 分割を用い、約 32 タスクを各 5 から 8 試行でカバーしました。完全なベンチマークを網羅したのはレベル 0 のみです。トークンと呼び出し回数は、同一負荷で対応づけた八試行の P5 実行によるものです。ここでは学習の改善と実行コストの低下が同時に起きましたが、一回の実行は一回の実行にすぎません。
導入はどう進むか
すでにあるトレースから始め、本番のワークフロー一本で、共有された教訓がその後の判断を良くするかを測ります。
接続先
- エージェントのセッションとトレース
- フィードバックと結果
- 既存のメモリ
- オブザーバビリティのデータ
- 失敗とエスカレーションのログ
CommonTrace がすること
- 繰り返される失敗パターンを見つける
- 教訓の候補を抽出する
- 教訓を検証し承認する
- 関係する判断に差し込む
- ベースラインと性能を比較する
測る指標
- 失敗の再発率
- タスクの成功率または解決率
- 人へのエスカレーション率
- 利用者のいらだち
- トークンと推論のコスト
向いているのは: 本番稼働のエージェント群、繰り返しのワークフロー、測れる成果、そして振る舞いのぶれがいらだちや解約につながる顧客接点のエージェントです。
まずは 30 日間の群学習パイロットから。
ワークフロー一本。群ひとつ。測れる成果。
- インフラの置き換えは不要です。
- 過去のトレースから始めます。
- 教訓は導入前にあなたが承認します。
- 既存のベースラインと比較します。