使用量課金時代—トークン効率が経営課題に

2026年6月、Microsoft と GitHub は VS Code 上の Copilot エージェント機能におけるトークン効率化の最新施策を 発表 しました。背景にあるのは、GitHub Copilot の課金モデルが従量課金へシフトしたことです。

使用量ベース課金が導入されたことで、エージェント型の長時間タスクでは、トークン消費そのものが直結するコスト・レイテンシ・コンテキストウィンドウの制約に影響する状況が生まれました。

これまでのサブスクリプション型では、ユーザー側でトークン効率をあまり意識する必要がありませんでした。しかし従量課金では、1回のリクエストあたりのトークン消費が課金額に直結します。

さらに、AI モデルの世代が進むほどタスクあたりのトークン消費が増える傾向も観察されているとのこと。これを抑制する「ハーネスレベルの効率化」が急務なのです。

Microsoft と GitHub のアプローチは、小さな最適化を積み重ねるというものです。A/B テストとオフライン評価で、タスク成功率を維持しつつトークン削減を確認してから施策を導入する方針を取っているといいます。

エージェントリクエストの構造—2つの効率化ターゲット

エージェント型のコーディング支援では、複数ターンにわたってリクエストが繰り返されます。その過程で、大きく分けて 2つのトークン消費の塊 が発生します。

プロンプトプレフィックスとキャッシング

各ターンのリクエストの冒頭には、毎回同じ情報が含まれます:

  • システム命令(プロンプト)
  • ツール定義
  • リポジトリコンテキスト
  • 対話履歴

これら再利用される部分を「プロンプトプレフィックス」と呼びます。OpenAI や Anthropic などの推論プロバイダーは、このプレフィックスの計算結果をキャッシュし、次のリクエスト時に再利用できます。キャッシュされたトークンは通常の入力トークンの 最大 10倍安い とのこと。

個人的には、この 10倍というコスト差は想像以上に大きいと感じます。もし自分のローカル LLM で同様のメカニズムを実装できれば、実行時間とメモリ効率が大幅に改善される可能性があります。

ツール定義のオーバーヘッド

エージェントが利用できるツールは、MCP サーバー、組み込みツール、拡張機能から提供されます。従来、ツール数が増えるほど、毎ターン全ツールの完全な定義(名前、説明、JSON パラメータスキーマ)がコンテキストに送られていました。

全ツール定義を毎回送信する仕様では、ツール数の増加がそのままコンテキストウィンドウの固定オーバーヘッドになります。

OpenAI モデル向け最適化—3つの改善

Microsoft は OpenAI モデルを使用する Copilot ユーザー向けに、3つの最適化を実施しました:

  1. 拡張プロンプトキャッシング
  2. OpenAI は推論エンジン側でプレフィックスを自動検出しキャッシュします
  3. キャッシュの有効期限を延長し、セッション全体で再利用可能に

  4. ツール定義の削減

  5. 初期状態では、ツールのメタデータ(名前と説明)のみをコンテキストに含める
  6. パラメータスキーマなどの詳細は、モデルが検索を実行した際にオンデマンド読み込み
  7. コンテキストウィンドウを圧縮し、実際のタスク用に容量を確保

  8. WebSocket による永続接続

  9. 従来の HTTP リクエスト・レスポンスの往復を削減
  10. 通信レイテンシとリソース消費の低減
最適化項目 対象 効果
プロンプトキャッシング プレフィックス部分 トークンコスト最大10倍削減、レイテンシ低減
ツール検索 ツール定義 コンテキスト圧縮、未使用ツールのオーバーヘッド削減
WebSocket 接続 通信層 往復通信削減、レイテンシ改善

記事では、Anthropic モデル向けの施策についても詳述されているはずですが、公開情報が途中で途切れているため、詳細な比較は難しい状況です。ただし、OpenAI と Anthropic の両プロバイダーに対応する必要があるというのは、実装の複雑さを示唆しています。

参考情報:他の Copilot 施策

この効率化の動きとは別に、Microsoft は Copilot の機能拡充も進めています。例えば、Azure DevOps 向けに Copilot Autofix という脆弱性自動修復機能が限定プレビュー公開されました。AI がコード生成を高速化しても、テストやレビューのボトルネックが課題という GitLab の調査結果 も報告されており、トークン効率化と併行して、下流のガバナンス面での改善も求められている構図が見えてきます。

開発者にとっての実践的な意味

これらの効率化は、ユーザー側で明示的な設定を要求することなく、バックエンド側で実施されるケースがほとんどです。ただし、AI コーディング支援を日常的に使うエンジニアの方は、以下の点を意識するといいでしょう:

  • エージェント型の長時間実行タスクでは、トークン消費がコストに直結することを認識する
  • リポジトリコンテキストやツール数が多すぎる場合は、セッション毎に不要な部分を削減する
  • VS Code の Copilot 設定で、ツール数や コンテキスト範囲をチューニングできないか確認する