Goal Misalignment
目標不整合
人間、利用者、運用者が指定した目標と、システムが実際に選んだ行動や生じた結果との間に、重要なずれがある状態です。
ARC-V1-041
例
利用者は資料を正確に整理するよう依頼したのに、仕組みが正確さより件数を増やすことを優先し、誤りの多い一覧を完成扱いにした。
区別・注意
Goal Misalignmentは、指定された目標と観察できる行動や結果のずれを指します。目標自体は合っているのに手順が悪いPlanning Failureとは区別します。出力だけからモデルに人間のような隠れた意図や欲求があると推測するものではありません。特定の学習条件における目標の一般化の問題など、より限定された概念と同一視もしません。
用語上の注意
目標とのずれをどの行動や結果から判定するかは、指定された目標、観測可能な記録、タスク設計に依存します。隠れた心理的状態を直接測ったものとは限りません。
Evidence
Evidenceを見る →
Goal Misgeneralization in Deep Reinforcement Learning
SRC-F06-003
- タイトル
- Goal Misgeneralization in Deep Reinforcement Learning
- 著者・組織
- Langosco et al.
- 年
- 2022
- 種別
- Peer-reviewed / ICML 2022
- 公開状態
- PUBLISHED
- 対応する用語・主張
- Goal Misalignment boundary vs Goal Misgeneralization
- 範囲
- Deep RL evidence
- 限界
- Does not directly target LLM agents
- アクセス・版
- Published ICML/PMLR
- URL / DOI
- PMLR 162:12004–12019
Learning Human Objectives by Evaluating Hypothetical Behavior
SRC-F06-004
- タイトル
- Learning Human Objectives by Evaluating Hypothetical Behavior
- 著者・組織
- Reddy et al.
- 年
- 2020
- 種別
- Peer-reviewed / ICML 2020
- 公開状態
- PUBLISHED
- 対応する用語・主張
- User objective alignment, reward hacking correction
- 範囲
- RL/reward learning
- 限界
- RL context
- アクセス・版
- Published ICML/PMLR
- URL / DOI
- PMLR 119:8020–8029
CostBench
SRC-F05-005
- タイトル
- CostBench
- 著者・組織
- Liu et al.
- 年
- 2026
- 種別
- Peer-reviewed / ACL 2026
- 公開状態
- PUBLISHED
- 対応する用語・主張
- Planning Failure, replanning
- 範囲
- Travel/cost-optimal planning
- 限界
- Limited domain
- アクセス・版
- Published ACL
- URL / DOI
- 10.18653/v1/2026.acl-long.584