← Catalogへ戻る

Goal Misalignment

目標不整合

人間、利用者、運用者が指定した目標と、システムが実際に選んだ行動や生じた結果との間に、重要なずれがある状態です。

ARC-V1-041

利用者は資料を正確に整理するよう依頼したのに、仕組みが正確さより件数を増やすことを優先し、誤りの多い一覧を完成扱いにした。

区別・注意

Goal Misalignmentは、指定された目標と観察できる行動や結果のずれを指します。目標自体は合っているのに手順が悪いPlanning Failureとは区別します。出力だけからモデルに人間のような隠れた意図や欲求があると推測するものではありません。特定の学習条件における目標の一般化の問題など、より限定された概念と同一視もしません。

用語上の注意

目標とのずれをどの行動や結果から判定するかは、指定された目標、観測可能な記録、タスク設計に依存します。隠れた心理的状態を直接測ったものとは限りません。

Evidence

Evidenceを見る →

Goal Misgeneralization in Deep Reinforcement Learning

SRC-F06-003

タイトル
Goal Misgeneralization in Deep Reinforcement Learning
著者・組織
Langosco et al.
2022
種別
Peer-reviewed / ICML 2022
公開状態
PUBLISHED
対応する用語・主張
Goal Misalignment boundary vs Goal Misgeneralization
範囲
Deep RL evidence
限界
Does not directly target LLM agents
アクセス・版
Published ICML/PMLR
URL / DOI
PMLR 162:12004–12019

Learning Human Objectives by Evaluating Hypothetical Behavior

SRC-F06-004

タイトル
Learning Human Objectives by Evaluating Hypothetical Behavior
著者・組織
Reddy et al.
2020
種別
Peer-reviewed / ICML 2020
公開状態
PUBLISHED
対応する用語・主張
User objective alignment, reward hacking correction
範囲
RL/reward learning
限界
RL context
アクセス・版
Published ICML/PMLR
URL / DOI
PMLR 119:8020–8029

CostBench

SRC-F05-005

タイトル
CostBench
著者・組織
Liu et al.
2026
種別
Peer-reviewed / ACL 2026
公開状態
PUBLISHED
対応する用語・主張
Planning Failure, replanning
範囲
Travel/cost-optimal planning
限界
Limited domain
アクセス・版
Published ACL
URL / DOI
10.18653/v1/2026.acl-long.584