-
Notifications
You must be signed in to change notification settings - Fork 0
DNET_ReasoningAgent
- 戻る(LLMエージェント)
- 推論エージェント
=推論モデルを使用したLLMエージェント
- 「従来のエージェントアーキテクチャの成熟」と
- 「推論モデル(Reasoning Models)の登場」が
完璧に噛み合ってブレークスルーが起きた。
以下はいずれも LLMエージェント の該当節を参照。
- 構成要素:LLM本体、メモリ、ツール / プラグイン、コントローラー、プランナー、アクション実行器
- 思考ループ:タスク理解、プラン生成、次アクション選択、アクション実行、観測と反省、再計画
- 推論・行動戦略:MRKL、ReAct、Plan-and-Solve、LLMCompiler
- デファクト標準:Function calling、Structured Outputs、...
- 標準化(プロトコル):団体、プロトコル(MCP、ACP、A2A、Agent Skills、Agent Plugins)
- マルチエージェント:利用例、実装例、PE技法、連携方式
- フレームワーク:OpenAI、CrewAI、LangGraph、AutoGen
以下の点が従来のLLMと異なる。
-
思考の連鎖(Chain of Thought: CoT)(LLMエージェントの該当節を参照)の自動化
- 思考のステップを内部で実行、このプロセスを経ることで、複雑な問題でも正解率が劇的に向上。
- コレは、モデルが訓練で学習した挙動であり、外部の制御ループを必要としない(内部的にループ)
- 内部的にループ:「入力 ⇄ 生成」の自己再帰ループ
「仮説立案→矛盾の検出→バックトラック(巻き戻し)→再検証」を連続実行。
-
強化学習(RL)(LLMのFTの該当節を参照)による最適化
CoTの自動化は、RL(強化学習、特にRLVR:検証可能な報酬による強化学習)を使ってモデルを訓練している。- この強化学習(RL)の数学的な枠組みは、
一般的なLLMの強化学習(方策勾配法を使って逆伝播で学習する)と同じ。 - 検証できるタスクにしか適用できないが、学習された報酬モデルに依存しないため、
大きく能力を伸ばせたと言われている。
- この強化学習(RL)の数学的な枠組みは、
(推論モデルを使用したLLMエージェント的な)
- 推論モデルを使用したコーディング・エージェントは外部の制御ループとして機能する。
- つまりエージェントは、推論モデルに計画を出力させ、その後、実行ステップを生成している。
推論モデルによる推論エージェントの精度向上は、
-
推論モデルの強化学習(RL)によってCoTや探索戦略がモデル内部に獲得され、
-
従来のエージェントが担っていた推論プロセス
(Plan→Reason→Act→Reflect→Retry)の一部がモデルへ吸収されたため。 -
その結果、
- Reasoning Paradigms への依存が低下し、エージェント設計は簡素化された。
- 具体的には、試行錯誤のための実Act回数を減らし、より精度の高いPlanを生成できるようになった。
- 一方で、ツール利用や環境操作を担う Acting Paradigms の重要性は依然として高い。
移行メモ: 元ページは
Reasoning Paradigms/Acting Paradigmsへ リンクしていたが、いずれも元 Wiki のダンプに存在しない(リンク切れ)。 関連する記述は LLMエージェント の 「推論・行動戦略(Reasoning & Acting Paradigms)」節にある。
推論エージェントの具体的な用例
- 推論モデルを用いて、個別の設計を行わずプロンプトのみで、
ソフトウェア開発を遂行できるエージェント。 - 従来のスニペット生成レベルのコーディング支援から大幅に性能が向上している。
歴史的にAnthropic(Claude Code)が先行していたわけではないらしいが(SWE-agent、Devinなどがある)、
Anthropicが「プロトタイプだったエージェントを、エンジニアが実用可能なプロダクトに引き上げた最初の存在」。
コレを、Microsoft(GitHub Copilot)、Anysphere(Cursor)、OpenAI(Codex)、
Google(Antigravity)が追随。
- GitHub Copilot CLI
- Claude Code
- OpenAI Codex
- Google Antigravity
- Anysphere(Cursor)
※ コーディング・エージェントのプラットフォームを握る
≒ 「世界中のソフトウェアがどう作られているか」の頭脳とデータを握る。
推論エージェントの具体的な用例
-
推論モデルを用いて、個別の業務設計を行わずプロンプトのみで、
非定型業務のオートメーションを迅速に構築・実行できるエージェント。 -
RPAは定型、自律型業務エージェントは非定型とされるが、
推論モデルでRPA定義(若しくはスクリプト)を実装すれば定型化できる可能性があるかもしれない。 -
Claude Codeに対するClaude Coworkを見ると、コア実装は同じで、UI、機能、実行環境部分が異なっている。
- UI:ターミナル/GUI、IDE/GUI → 非エンジニア向けGUI
- 機能:ソフトウェア開発に必要なコンテキスト、ツール類を備える。
→ コンピュータ操作に必要なコンテキスト、ツール類を備える。 - 実行環境:Bare Metal上で実行に必要なアクセス権
→ デスクトップアプリでルート・フォルダだけ指定(共にSandbox機能はある)
移行メモ(正誤): 元ページの「PRA定義」は「RPA定義」の誤記のため修正した。
- Claude Cowork
- OSS系:OpenClaw、OpenWork、Zapier
- Microsoft Scout(OpenClawが基盤)
移行メモ: 元ページでは本文が「...」のまま書きかけになっている。
移行メモ: 元ページの「参考」節は見出しのみで本文が無い(書きかけ)。
Tags: 移行, AI, LLM, エージェント, 開発基盤
このWikiは「Open棟梁Project」,「OSSコンソーシアム 開発基盤部会」によって運営されています。