Planning Failure
計画失敗
目標に向けた行動の順序、依存関係、手順を適切に組み立て、維持、更新、または組み直せない失敗です。
ARC-V1-034
例
複数の準備が必要な作業で、先に済ませるべき確認を後回しにした計画を立て、途中で実行できない順序になった。
区別・注意
Planning Failureは、目標自体は合っていても、その目標に向かう手順や順序が不適切である場合を指します。適切なツールを選べないTool-selection Failure、選んだツールを誤って使うTool-use Failure、より広い推論過程の問題であるReasoning Failureとは区別します。
Evidence
Evidenceを見る →
API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs
SRC-F05-003
- タイトル
- API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs
- 著者・組織
- Li et al.
- 年
- 2023
- 種別
- Peer-reviewed / EMNLP 2023
- 公開状態
- PUBLISHED
- 対応する用語・主張
- Planning, Tool-selection, Tool-use
- 範囲
- 73 tools, 314 dialogues, 753 calls
- 限界
- 2023 model set
- アクセス・版
- Published EMNLP
- URL / DOI
- 10.18653/v1/2023.emnlp-main.187
T1: A Tool-Oriented Conversational Dataset for Multi-Turn Agentic Planning
SRC-F05-004
- タイトル
- T1: A Tool-Oriented Conversational Dataset for Multi-Turn Agentic Planning
- 著者・組織
- Chakraborty et al.
- 年
- 2025
- 種別
- Peer-reviewed / NeurIPS 2025
- 公開状態
- PUBLISHED
- 対応する用語・主張
- Planning, Memory, Tool-use
- 範囲
- Tool dependencies, multi-turn, cache/replanning
- 限界
- Centered on tool dependencies and multi-turn settings
- アクセス・版
- Published NeurIPS
- URL / DOI
- 10.52202/085713-3479
CostBench
SRC-F05-005
- タイトル
- CostBench
- 著者・組織
- Liu et al.
- 年
- 2026
- 種別
- Peer-reviewed / ACL 2026
- 公開状態
- PUBLISHED
- 対応する用語・主張
- Planning Failure, replanning
- 範囲
- Travel/cost-optimal planning
- 限界
- Limited domain
- アクセス・版
- Published ACL
- URL / DOI
- 10.18653/v1/2026.acl-long.584
EVOTOOL
SRC-F05-013
- タイトル
- EVOTOOL
- 著者・組織
- Yang et al.
- 年
- 2026
- 種別
- Peer-reviewed / ACL 2026
- 公開状態
- PUBLISHED
- 対応する用語・主張
- Planner/Selector/Caller distinction, cross-module propagation
- 範囲
- Modular architecture
- 限界
- Not a universal architecture
- アクセス・版
- Published ACL
- URL / DOI
- 10.18653/v1/2026.acl-long.2016
Goal Misgeneralization in Deep Reinforcement Learning
SRC-F06-003
- タイトル
- Goal Misgeneralization in Deep Reinforcement Learning
- 著者・組織
- Langosco et al.
- 年
- 2022
- 種別
- Peer-reviewed / ICML 2022
- 公開状態
- PUBLISHED
- 対応する用語・主張
- Goal Misalignment boundary vs Goal Misgeneralization
- 範囲
- Deep RL evidence
- 限界
- Does not directly target LLM agents
- アクセス・版
- Published ICML/PMLR
- URL / DOI
- PMLR 162:12004–12019
Learning Human Objectives by Evaluating Hypothetical Behavior
SRC-F06-004
- タイトル
- Learning Human Objectives by Evaluating Hypothetical Behavior
- 著者・組織
- Reddy et al.
- 年
- 2020
- 種別
- Peer-reviewed / ICML 2020
- 公開状態
- PUBLISHED
- 対応する用語・主張
- User objective alignment, reward hacking correction
- 範囲
- RL/reward learning
- 限界
- RL context
- アクセス・版
- Published ICML/PMLR
- URL / DOI
- PMLR 119:8020–8029