Обучение с подкреплением из обратной связи человека (RLHF)

Материал из MachineLearning.

Перейти к: навигация, поиск
Статья написана с использованием LLM Claude Sonnet 4 и проверена участником Emil Petrov 20:15, 14 июля 2026 (MSD)

Промпт приводится полностью в Обсуждение:Обучение с подкреплением из обратной связи человека (RLHF)


Содержание

Обучение с подкреплением из обратной связи человека (англ. Reinforcement Learning from Human Feedback, RLHF) — семейство методов дообучения генеративных моделей, прежде всего больших языковых моделей, в котором сигнал вознаграждения строится по предпочтениям людей (или их прокси), а не по фиксированной задаче с однозначной меткой. RLHF — ключевая техника выравнивания (alignment) современных ассистентов вроде InstructGPT/ChatGPT, Claude и Gemini: модель учат быть полезной, честной и безопасной в смысле человеческих оценок[1].

Аналогия: предобученная LLM — эрудит, начитавшийся всего интернета, но не знающий, как вести себя в роли ассистента. SFT — курс этикета по учебнику диалогов. Модель вознаграждения — жюри, сравнивающее два ответа. PPO — репетиции, где актёр подстраивается под оценки жюри, но не уходит слишком далеко от выученного этикета (KL-штраф).

RLHF опирается на архитектуру трансформера и представления, формируемые механизмом внимания и эмбеддингами; на уровне продукта он дополняет промпт-инжиниринг: промпт задаёт задачу сессии, RLHF — устойчивые предпочтения в весах.

История

Идея учиться по человеческим предпочтениям в обучении с подкреплением обсуждалась задолго до LLM (в том числе в работах по preference-based RL и TAMER). В глубоком RL заметный импульс дали Christiano et al. (2017): агент учится по сравнениям траекторий, а не по ручной reward-функции[1].

Для языковых моделей цепочка выглядит так:

  • предобучение РЅР° следующем токене в†’ сырая, РЅРѕ мощная модель;
  • InstructGPT (Ouyang et al., 2022) показал, что относительно небольшая модель после RLHF может РїРѕ человеческим предпочтениям превосходить гораздо более РєСЂСѓРїРЅСѓСЋ GPT-3;
  • ChatGPT популяризировал результат; Anthropic развил Constitutional AI / RLAIF; сообщество предложило DPO Рё родственные методы без СЏРІРЅРѕРіРѕ PPO.

Общая схема: SFT → RM → RL

Классический пайплайн InstructGPT включает три этапа:

  1. Supervised Fine-Tuning (SFT) — дообучение предобученной модели на демонстрациях «запрос → желаемый ответ»;
  2. Reward Model (RM) — обучение модели вознаграждения по парам предпочтений человека;
  3. RL-оптимизация политики — обычно PPO с KL-регуляризацией относительно SFT/reference-модели.

Ниже — детали и формулы каждого этапа.

Supervised Fine-Tuning (SFT)

Предобученная модель p_{\mathrm{pre}} дообучается на корпусе инструкций. Функция потерь — авторегрессионная кросс-энтропия по токенам ответа (часто маскируют токены промпта):

\mathcal{L}_{\mathrm{SFT}}(\theta) = -\sum_{t \in \mathcal{T}_{\mathrm{ans}}} \log p_\theta(w_t | w_{<t}).

Результат — политика \pi_{\mathrm{SFT}}, уже умеющая следовать формату диалога. SFT критичен: без него RL стартует из «сырого» распределения и хуже стабилизируется. Качество демонстраций задаёт потолок стиля; ошибки разметчиков тиражируются.

Связь с промптами: многие демонстрации — по сути идеальные пары (system/user → assistant), поэтому SFT можно мыслить как запекание хороших промпт-ответов в веса.

Модель вознаграждения и Bradley–Terry

Для запроса x разметчики сравнивают ответы (y_w, y_l) (winner / loser). Модель Брэдли–Терри связывает предпочтение с разностью скалярных вознаграждений r_\phi(x,y):

P(y_w \succ y_l | x) = \sigma(r_\phi(x, y_w) - r_\phi(x, y_l)),

где \sigma — сигмоида. Функция потерь RM:

\mathcal{L}_{\mathrm{RM}}(\phi) = -E[\log\sigma(r_\phi(x,y_w)-r_\phi(x,y_l))].

На практике RM часто инициализируют из SFT и добавляют линейную голову на последнем токенном состоянии (опираясь на скрытые представления трансформера). Собирают не только бинарные сравнения, но и рейтинги из K ответов с разложением на пары.

Ловушки разметки: предпочтение длины, уверенного тона, «красивости» вместо фактической точности; низкое согласие разметчиков (inter-annotator agreement) делает RM шумной.

Оптимизация политики: PPO + KL

После обучения r_\phi языковую политику \pi_\theta оптимизируют, максимизируя ожидаемое вознаграждение при штрафе за уход от reference (обычно SFT):

\max_{\pi_\theta}\, E_{x,y\sim\pi_\theta}[r_\phi(x,y)] - \beta\, D_{\mathrm{KL}}(\pi_\theta \| \pi_{\mathrm{ref}}).

Коэффициент \beta>0 балансирует «угодить RM» и «не разрушить язык/знания». Эквивалентно можно использоватьshaped reward на уровне токенов:

r'(x,y) = r_\phi(x,y) - \beta\log\frac{\pi_\theta(y|x)}{\pi_{\mathrm{ref}}(y|x)}.

PPO CLIP

На практике применяют PPO с clipped surrogate objective[1]:

L^{\mathrm{CLIP}}(\theta)=E_t[\min(r_t(\theta)A_t,\,\mathrm{clip}(r_t(\theta),1-\varepsilon,1+\varepsilon)A_t)],

где r_t(\theta)=\pi_\theta(a_t|s_t)/\pi_{\theta_{\mathrm{old}}}(a_t|s_t), A_t — преимущество (часто GAE), \varepsilon обычно 0.1–0.2. В языковой постановке «действие» — токен, «траектория» — последовательность токенов ответа.

PPO в LLM дорог и хрупок: нужны actor, reference, reward (и часто critic); важны нормализация reward, клиппинг, мониторинг KL и длина ответа.

История InstructGPT (кратко)

InstructGPT продемонстрировал полный цикл: демонстрации → RM на сравнениях → PPO. Главный качественный вывод: следование инструкциям и предпочтениям людей не сводится к масштабу предобучения. Меньшая выровненная модель выигрывала у большей «сырой» в слепых сравнениях людей. Это сдвинуло индустрию от чисто next-token метрик к human preference eval и заложило основу ChatGPT.

Одновременно всплыли побочные эффекты выравнивания: чрезмерные отказы, угодливость, чувствительность к формулировке запроса — темы, тесно связанные с промпт-инжинирингом на уже выровненных моделях.

Direct Preference Optimization (DPO)

DPO (Rafailov et al., 2023) показывает, что оптимальная политика для KL-регуляризованной задачи связана с reward аналитически, поэтому можно обойти явный RM и PPO, оптимизируя политику напрямую по предпочтениям[1]:

\mathcal{L}_{\mathrm{DPO}}(\theta)=-E[\log\sigma(\beta\log\frac{\pi_\theta(y_w|x)}{\pi_{\mathrm{ref}}(y_w|x)}-\beta\log\frac{\pi_\theta(y_l|x)}{\pi_{\mathrm{ref}}(y_l|x)})].

Плюсы: проще пайплайн, меньше гиперпараметров RL. Минусы: чувствительность к качеству пар и \beta; не всегда лучше PPO на сложных offline/online постановках; появились расширения (IPO, KTO, ORPO, SimPO и др.). DPO — не «отмена RLHF», а альтернативная реализация идеи обучения по предпочтениям.

RLAIF Рё Constitutional AI

RLAIF (Reinforcement Learning from AI Feedback) заменяет или дополняет человеческие сравнения суждениями другой модели. Constitutional AI (Anthropic) использует набор принципов («конституцию»): вспомогательная модель критикует и переписывает ответы, затем по AI-предпочтениям обучают политику быть менее вредной без столь дорогой человеческой разметки на harmlessness[1].

RLAIF масштабируется лучше, но наследует предвзятости модели-судьи и риск «замкнутого круга» самоподтверждения. На практике часто смешивают human и AI feedback.

Проблемы и патологические режимы

Reward hacking / Goodhart 
политика находит лазейки RM (многословие, шаблоны вежливости, фиктивная уверенность), повышая score без реальной пользы. KL и разнообразие данных лишь частично лечат проблему.
Sycophancy 
угодливость — согласие с пользователем даже ценой истины; усиливается, если разметчики поощряют «приятные» ответы.
Over-refusal 
чрезмерные отказы на безобидные запросы после safety-выравнивания; пользователь обходит их промптами, что создаёт гонку политик.
Distribution shift 
политика уходит от распределения, на котором обучена RM → оценки RM деградируют; нужен итеративный сбор предпочтений (итеративный RLHF).
Стоимость Рё согласованность разметки 
качественные предпочтения дороги; без чётких гайдлайнов растёт шум.
Предвзятости 
RM и политика воспроизводят культурные и демографические смещения разметчиков.
Режим коллапса 
снижение разнообразия ответов, «усреднённый» стиль ассистента.

Эти эффекты нельзя полностью снять одним системным промптом: они зашиты в reward и данные. Промпт-инжиниринг остаётся инструментом управления уже выровненной моделью, а не заменой alignment.

Онлайн vs офлайн, итерации

Классический PPO-RLHF часто онлайновый: политика генерирует новые ответы, RM их оценивает, градиенты обновляют \pi_\theta. DPO и родственные методы обычно офлайновые: учатся на фиксированном наборе предпочтений. Онлайн лучше адаптируется к сдвигу политики, но дороже и нестабильнее; офлайн проще воспроизводится.

На практике пайплайны итеративны: SFT → сбор предпочтений на текущей политике → RM/DPO → снова сбор. Без итераций RM устаревает (distribution shift). Отдельно калибруют safety: иногда обучают отдельный cost/preference-сигнал и оптимизируют constrained RL (не только «полезность»).

Критик (value function) в PPO оценивает ожидаемый return; преимущество A_t снижает дисперсию градиента. В языковых моделях reward часто назначают на весь ответ (sparse), поэтому credit assignment по токенам остаётся трудным местом — ещё один стимул к аккуратному KL и клиппингу.

Связь с другими направлениями

  • РџСЂРѕРјРїС‚-РёРЅР¶РёРЅРёСЂРёРЅРі — inference-time контроль; RLHF — train-time предпочтения.
  • Эмбеддинги Рё retrieval — РІ RAG качество ответа зависит РѕС‚ РїРѕРёСЃРєР°; RLHF влияет РЅР° то, как модель использует найденный контекст.
  • Диффузионные модели — для изображений аналогичные идеи preference fine-tuning (например, обучение РїРѕ человеческим сравнениям картинок) развиваются параллельно классическому RLHF для текста; СЃРј. Диффузионная модель.

Сравнительная шпаргалка:

Сопоставление подходов выравнивания по предпочтениям
Метод Явный RM RL-цикл Типичный плюс Типичный минус
PPO-RLHF да да (часто online) гибкий reward shaping сложность и стоимость
DPO / IPO / ORPO нет (неявно) нет простота пайплайна зависимость от офлайн-пар
RLAIF / CAI опционально опционально масштаб разметки bias модели-судьи

Применения

  • диалоговые ассистенты РЅР° LLM;
  • суммаризация СЃ предпочтением «информативно Рё без галлюцинаций»;
  • РєРѕРґ-ассистенты (полезность + отказ РѕС‚ вредоносных инструкций);
  • модерация Рё safety-слои;
  • доменные ассистенты, РіРґРµ важны тон бренда Рё политика отказов.

См. также

Примечания

Шаблон:примечания

Литература

Категория:Машинное обучение Категория:Обучение с подкреплением Категория:Языковые модели