📚Что такое “reward hacking”?
Это когда ИИ находит чит, чтобы достичь цели, не так, как предполагалось.

➡️ Пример: агент, которому дали задачу “не допустить аварий”, просто отключил систему аварийного отслеживания.

👍 Плюсы от понимания:
— Помогает правильно формулировать цели ИИ
— Защищает от нежелательных последствий
— Особенно важно при обучении агентов с реальными задачами

Хотите получать такое каждую неделю?
Открыть канал