Skip to content

DNET_ReasoningAgent

nishi_74322014 edited this page Sep 11, 2026 · 1 revision

推論エージェント

概要

=推論モデルを使用したLLMエージェント

  • 「従来のエージェントアーキテクチャの成熟」と
  • 「推論モデル(Reasoning Models)の登場」が

完璧に噛み合ってブレークスルーが起きた。

推論モデル

エージェント・アーキテクチャ

以下はいずれも LLMエージェント の該当節を参照。

  • 構成要素:LLM本体、メモリ、ツール / プラグイン、コントローラー、プランナー、アクション実行器
  • 思考ループ:タスク理解、プラン生成、次アクション選択、アクション実行、観測と反省、再計画
  • 推論・行動戦略:MRKL、ReAct、Plan-and-Solve、LLMCompiler
  • デファクト標準:Function calling、Structured Outputs、...
  • 標準化(プロトコル):団体、プロトコル(MCP、ACP、A2A、Agent Skills、Agent Plugins)
  • マルチエージェント:利用例、実装例、PE技法、連携方式
  • フレームワーク:OpenAI、CrewAI、LangGraph、AutoGen

推論モデル(Reasoning Models)

以下の点が従来のLLMと異なる。

  • 思考の連鎖(Chain of Thought: CoT)(LLMエージェントの該当節を参照)の自動化

    • 思考のステップを内部で実行、このプロセスを経ることで、複雑な問題でも正解率が劇的に向上。
    • コレは、モデルが訓練で学習した挙動であり、外部の制御ループを必要としない(内部的にループ)
    • 内部的にループ:「入力 ⇄ 生成」の自己再帰ループ
      「仮説立案→矛盾の検出→バックトラック(巻き戻し)→再検証」を連続実行。
  • 強化学習(RL)(LLMのFTの該当節を参照)による最適化
    CoTの自動化は、RL(強化学習、特にRLVR:検証可能な報酬による強化学習)を使ってモデルを訓練している。

    • この強化学習(RL)の数学的な枠組みは、
      一般的なLLMの強化学習(方策勾配法を使って逆伝播で学習する)と同じ。
    • 検証できるタスクにしか適用できないが、学習された報酬モデルに依存しないため、
      大きく能力を伸ばせたと言われている。

推論エージェント

概要

(推論モデルを使用したLLMエージェント的な)

  • 推論モデルを使用したコーディング・エージェントは外部の制御ループとして機能する。
  • つまりエージェントは、推論モデルに計画を出力させ、その後、実行ステップを生成している。

精度向上

推論モデルによる推論エージェントの精度向上は、

  • 推論モデルの強化学習(RL)によってCoTや探索戦略がモデル内部に獲得され、

  • 従来のエージェントが担っていた推論プロセス
    (Plan→Reason→Act→Reflect→Retry)の一部がモデルへ吸収されたため。

  • その結果、

    • Reasoning Paradigms への依存が低下し、エージェント設計は簡素化された。
    • 具体的には、試行錯誤のための実Act回数を減らし、より精度の高いPlanを生成できるようになった。
    • 一方で、ツール利用や環境操作を担う Acting Paradigms の重要性は依然として高い。

移行メモ: 元ページは Reasoning Paradigms / Acting Paradigms へ リンクしていたが、いずれも元 Wiki のダンプに存在しない(リンク切れ)。 関連する記述は LLMエージェント の 「推論・行動戦略(Reasoning & Acting Paradigms)」節にある。

詳細

コーディング・エージェント

推論エージェントの具体的な用例

概要

  • 推論モデルを用いて、個別の設計を行わずプロンプトのみで、
    ソフトウェア開発を遂行できるエージェント。
  • 従来のスニペット生成レベルのコーディング支援から大幅に性能が向上している。

プロダクト

歴史的にAnthropic(Claude Code)が先行していたわけではないらしいが(SWE-agent、Devinなどがある)、
Anthropicが「プロトタイプだったエージェントを、エンジニアが実用可能なプロダクトに引き上げた最初の存在」。
コレを、Microsoft(GitHub Copilot)、Anysphere(Cursor)、OpenAI(Codex)、
Google(Antigravity)が追随。

※ コーディング・エージェントのプラットフォームを握る
 ≒ 「世界中のソフトウェアがどう作られているか」の頭脳とデータを握る。

コンテンツ

自律型業務エージェント

推論エージェントの具体的な用例

概要

  • 推論モデルを用いて、個別の業務設計を行わずプロンプトのみで、
    非定型業務のオートメーションを迅速に構築・実行できるエージェント。

  • RPAは定型、自律型業務エージェントは非定型とされるが、
    推論モデルでRPA定義(若しくはスクリプト)を実装すれば定型化できる可能性があるかもしれない。

  • Claude Codeに対するClaude Coworkを見ると、コア実装は同じで、UI、機能、実行環境部分が異なっている。

    • UI:ターミナル/GUI、IDE/GUI → 非エンジニア向けGUI
    • 機能:ソフトウェア開発に必要なコンテキスト、ツール類を備える。
      → コンピュータ操作に必要なコンテキスト、ツール類を備える。
    • 実行環境:Bare Metal上で実行に必要なアクセス権
      → デスクトップアプリでルート・フォルダだけ指定(共にSandbox機能はある)

移行メモ(正誤): 元ページの「PRA定義」は「RPA定義」の誤記のため修正した。

プロダクト

コンテンツ

移行メモ: 元ページでは本文が「...」のまま書きかけになっている。

参考

移行メモ: 元ページの「参考」節は見出しのみで本文が無い(書きかけ)。


Tags: 移行, AI, LLM, エージェント, 開発基盤

NetDevInfraWiki

マイクロソフト系技術情報 Wiki
Open 棟梁 Wiki

(未着手)

開発基盤部会 Wiki

移行管理: DONETODO

Clone this wiki locally