Meta AIとイリノイ大学アーバナ・シャンペーン(UIUC)の研究者は、エージェント用のハーネスを活用する強化学習手法「EvoHarness-RL」を提案しました。従来は人が手順やルールを固定的に書き込むため、長時間の業務で環境状態の更新や失敗からの復帰がうまくいかない課題がありました。
同手法は、ハーネスが提供する実行ログや状態追跡を、エージェントがいつ参照しどう更新するかを学習させることで、外部状態の読み取り・更新・統合を最適化します。
EvoHarness-RLでは外部情報を「Belief(環境理解)」「Progress(完了・未完了の管理)」「Experience(過去知識の再利用)」の3領域に整理し、track、commit、recall、noteの4つのメタ行動で扱います。
検証ではALFWorldベンチマークで、Qwen3-8Bを学習させたところ平均成功率96.9%を達成し、ReAct比で49.0ポイント改善しました。
さらにClaude Opus 4.5(96.4%)に相当する性能まで到達し、GPT-4.1やGPT-5でもBPEを適用した際に成功率が大幅に上がりました。
研究者は、学習が進むにつれ外部ツール参照を減らす「harness annealing」などの行動変化も観測し、エンタープライズでの推論コスト低減につながる可能性を示しました。
参照元:2026/08/29 「Meta researchers taught an 8B AI model to match Claude Opus 4.5 — without the frontier price tag」 https://venturebeat.com/orchestration/meta-researchers-taught-an-8b-ai-model-to-match-claude-opus-4-5-without-the-frontier-price-tag
この記事へのリアクション
このニュースをどう受け止めましたか?



コメント