Обучение с подкреплением из обратной связи человека (RLHF)
Материал из MachineLearning.
| | Статья написана с использованием LLM Claude Sonnet 4 и проверена участником Emil Petrov 20:15, 14 июля 2026 (MSD)
Промпт приводится полностью в Обсуждение:Обучение с подкреплением из обратной связи человека (RLHF) |
Обучение с подкреплением из обратной связи человека (англ. Reinforcement Learning from Human Feedback, RLHF) — семейство методов дообучения генеративных моделей, прежде всего больших языковых моделей, в котором сигнал вознаграждения строится по предпочтениям людей (или их прокси), а не по фиксированной задаче с однозначной меткой. RLHF — ключевая техника выравнивания (alignment) современных ассистентов вроде InstructGPT/ChatGPT, Claude и Gemini: модель учат быть полезной, честной и безопасной в смысле человеческих оценок[1].
Аналогия: предобученная LLM — эрудит, начитавшийся всего интернета, но не знающий, как вести себя в роли ассистента. SFT — курс этикета по учебнику диалогов. Модель вознаграждения — жюри, сравнивающее два ответа. PPO — репетиции, где актёр подстраивается под оценки жюри, но не уходит слишком далеко от выученного этикета (KL-штраф).
RLHF опирается на архитектуру трансформера и представления, формируемые механизмом внимания и эмбеддингами; на уровне продукта он дополняет промпт-инжиниринг: промпт задаёт задачу сессии, RLHF — устойчивые предпочтения в весах.
Рстория
Рдея учиться РїРѕ человеческим предпочтениям РІ обучении СЃ подкреплением обсуждалась задолго РґРѕ LLM (РІ том числе РІ работах РїРѕ preference-based RL Рё TAMER). Р’ глубоком RL заметный импульс дали Christiano et al. (2017): агент учится РїРѕ сравнениям траекторий, Р° РЅРµ РїРѕ ручной reward-функции[1].
Для языковых моделей цепочка выглядит так:
- предобучение на следующем токене → сырая, но мощная модель;
- InstructGPT (Ouyang et al., 2022) показал, что относительно небольшая модель после RLHF может по человеческим предпочтениям превосходить гораздо более крупную GPT-3;
- ChatGPT популяризировал результат; Anthropic развил Constitutional AI / RLAIF; сообщество предложило DPO и родственные методы без явного PPO.
Общая схема: SFT → RM → RL
Классический пайплайн InstructGPT включает три этапа:
- Supervised Fine-Tuning (SFT) — дообучение предобученной модели на демонстрациях «запрос → желаемый ответ»;
- Reward Model (RM) — обучение модели вознаграждения по парам предпочтений человека;
- RL-оптимизация политики — обычно PPO с KL-регуляризацией относительно SFT/reference-модели.
Ниже — детали и формулы каждого этапа.
Supervised Fine-Tuning (SFT)
Предобученная модель дообучается на корпусе инструкций. Функция потерь — авторегрессионная кросс-энтропия по токенам ответа (часто маскируют токены промпта):
Результат — политика , уже умеющая следовать формату диалога. SFT критичен: без него RL стартует из «сырого» распределения и хуже стабилизируется. Качество демонстраций задаёт потолок стиля; ошибки разметчиков тиражируются.
Связь с промптами: многие демонстрации — по сути идеальные пары (system/user → assistant), поэтому SFT можно мыслить как запекание хороших промпт-ответов в веса.
Модель вознаграждения и Bradley–Terry
Для запроса разметчики сравнивают ответы
(winner / loser). Модель Брэдли–Терри связывает предпочтение с разностью скалярных вознаграждений
:
где — сигмоида. Функция потерь RM:
На практике RM часто инициализируют из SFT и добавляют линейную голову на последнем токенном состоянии (опираясь на скрытые представления трансформера). Собирают не только бинарные сравнения, но и рейтинги из ответов с разложением на пары.
Ловушки разметки: предпочтение длины, уверенного тона, «красивости» вместо фактической точности; низкое согласие разметчиков (inter-annotator agreement) делает RM шумной.
Оптимизация политики: PPO + KL
После обучения языковую политику
оптимизируют, максимизируя ожидаемое вознаграждение при штрафе за уход от reference (обычно SFT):
Коэффициент балансирует «угодить RMВ» Рё «не разрушить язык/знания». Рквивалентно РјРѕР¶РЅРѕ использоватьshaped reward РЅР° СѓСЂРѕРІРЅРµ токенов:
PPO CLIP
На практике применяют PPO с clipped surrogate objective[1]:
РіРґРµ ,
— преимущество (часто GAE),
обычно
–
. В языковой постановке «действие» — токен, «траектория» — последовательность токенов ответа.
PPO в LLM дорог и хрупок: нужны actor, reference, reward (и часто critic); важны нормализация reward, клиппинг, мониторинг KL и длина ответа.
Рстория InstructGPT (кратко)
InstructGPT продемонстрировал полный цикл: демонстрации в†’ RM РЅР° сравнениях в†’ PPO. Главный качественный вывод: следование инструкциям Рё предпочтениям людей РЅРµ сводится Рє масштабу предобучения. Меньшая выровненная модель выигрывала Сѓ большей «сырой» РІ слепых сравнениях людей. Рто сдвинуло индустрию РѕС‚ чисто next-token метрик Рє human preference eval Рё заложило РѕСЃРЅРѕРІСѓ ChatGPT.
Одновременно всплыли побочные эффекты выравнивания: чрезмерные отказы, угодливость, чувствительность к формулировке запроса — темы, тесно связанные с промпт-инжинирингом на уже выровненных моделях.
Direct Preference Optimization (DPO)
DPO (Rafailov et al., 2023) показывает, что оптимальная политика для KL-регуляризованной задачи связана с reward аналитически, поэтому можно обойти явный RM и PPO, оптимизируя политику напрямую по предпочтениям[1]:
Плюсы: проще пайплайн, меньше гиперпараметров RL. Минусы: чувствительность к качеству пар и ; не всегда лучше PPO на сложных offline/online постановках; появились расширения (IPO, KTO, ORPO, SimPO и др.). DPO — не «отмена RLHF», а альтернативная реализация идеи обучения по предпочтениям.
RLAIF Рё Constitutional AI
RLAIF (Reinforcement Learning from AI Feedback) заменяет или дополняет человеческие сравнения суждениями другой модели. Constitutional AI (Anthropic) использует набор принципов («конституцию»): вспомогательная модель критикует и переписывает ответы, затем по AI-предпочтениям обучают политику быть менее вредной без столь дорогой человеческой разметки на harmlessness[1].
RLAIF масштабируется лучше, но наследует предвзятости модели-судьи и риск «замкнутого круга» самоподтверждения. На практике часто смешивают human и AI feedback.
Проблемы и патологические режимы
- Reward hacking / Goodhart
- политика находит лазейки RM (многословие, шаблоны вежливости, фиктивная уверенность), повышая score без реальной пользы. KL и разнообразие данных лишь частично лечат проблему.
- Sycophancy
- угодливость — согласие с пользователем даже ценой истины; усиливается, если разметчики поощряют «приятные» ответы.
- Over-refusal
- чрезмерные отказы на безобидные запросы после safety-выравнивания; пользователь обходит их промптами, что создаёт гонку политик.
- Distribution shift
- политика уходит от распределения, на котором обучена RM → оценки RM деградируют; нужен итеративный сбор предпочтений (итеративный RLHF).
- Стоимость и согласованность разметки
- качественные предпочтения дороги; без чётких гайдлайнов растёт шум.
- Предвзятости
- RM и политика воспроизводят культурные и демографические смещения разметчиков.
- Режим коллапса
- снижение разнообразия ответов, «усреднённый» стиль ассистента.
Рти эффекты нельзя полностью снять РѕРґРЅРёРј системным промптом: РѕРЅРё зашиты РІ reward Рё данные. РџСЂРѕРјРїС‚-РёРЅР¶РёРЅРёСЂРёРЅРі остаётся инструментом управления СѓР¶Рµ выровненной моделью, Р° РЅРµ заменой alignment.
Онлайн vs офлайн, итерации
Классический PPO-RLHF часто онлайновый: политика генерирует новые ответы, RM их оценивает, градиенты обновляют . DPO и родственные методы обычно офлайновые: учатся на фиксированном наборе предпочтений. Онлайн лучше адаптируется к сдвигу политики, но дороже и нестабильнее; офлайн проще воспроизводится.
На практике пайплайны итеративны: SFT → сбор предпочтений на текущей политике → RM/DPO → снова сбор. Без итераций RM устаревает (distribution shift). Отдельно калибруют safety: иногда обучают отдельный cost/preference-сигнал и оптимизируют constrained RL (не только «полезность»).
Критик (value function) в PPO оценивает ожидаемый return; преимущество снижает дисперсию градиента. В языковых моделях reward часто назначают на весь ответ (sparse), поэтому credit assignment по токенам остаётся трудным местом — ещё один стимул к аккуратному KL и клиппингу.
Связь с другими направлениями
- Промпт-инжиниринг — inference-time контроль; RLHF — train-time предпочтения.
- Рмбеддинги Рё retrieval — РІ RAG качество ответа зависит РѕС‚ РїРѕРёСЃРєР°; RLHF влияет РЅР° то, как модель использует найденный контекст.
- Диффузионные модели — для изображений аналогичные идеи preference fine-tuning (например, обучение по человеческим сравнениям картинок) развиваются параллельно классическому RLHF для текста; см. Диффузионная модель.
Сравнительная шпаргалка:
| Метод | Явный RM | RL-цикл | Типичный плюс | Типичный минус |
|---|---|---|---|---|
| PPO-RLHF | да | да (часто online) | гибкий reward shaping | сложность и стоимость |
| DPO / IPO / ORPO | нет (неявно) | нет | простота пайплайна | зависимость от офлайн-пар |
| RLAIF / CAI | опционально | опционально | масштаб разметки | bias модели-судьи |
Применения
- диалоговые ассистенты на LLM;
- суммаризация с предпочтением «информативно и без галлюцинаций»;
- код-ассистенты (полезность + отказ от вредоносных инструкций);
- модерация и safety-слои;
- доменные ассистенты, где важны тон бренда и политика отказов.
См. также
- Большая языковая модель
- Трансформер (модель)
- Механизм внимания
- РџСЂРѕРјРїС‚-РёРЅР¶РёРЅРёСЂРёРЅРі
- Нейросетевое встраивание
- Диффузионная модель
- Обучение с подкреплением
- Проксимальная оптимизация политики
Примечания
Литература
- Шаблон:статья
- Шаблон:статья
- Шаблон:статья
- Шаблон:статья
- Шаблон:статья
- Шаблон:РєРЅРёРіР°
- Шаблон:статья
Категория:Машинное обучение Категория:Обучение с подкреплением Категория:Языковые модели

