Агент учится на собственных ошибках и не повторяет их дважды

Группа исследователей из Берклея и OpenAI описала метод, при котором агент ловит собственные ошибки и обновляет стратегию в ходе работы, не требуя переобучения. Агент формирует память промахов и прежде, чем повторить похожий ход, проверяет себя против этой памяти.

Механика основана на встроенном отражении: агент прерывает свой ход, если видит риск, и спрашивает себя, не совершал ли похожую ошибку ранее. Если совершал, переводит себя на альтернативный путь. Память хранится в контексте текущей сессии и не передаётся на другие задачи.

Практический результат

На наборе тестов успешность агента выросла с первой попытки: ошибки в логике снижаются на 40 процентов после первого срыва. Метод показал эффект на задачах с множественным выбором, где ошибка часто повторяется из-за похожего контекста.

Исследователи отмечают, что это похоже на краткосрочное обучение человека: ошибка немедленно превращается в правило для текущей задачи, но на постоянное поведение агента влияет слабо. После завершения сессии память вытирается.

Метод потенциально может быть расширен на долгосрочное сохранение ошибок и обмен между агентами, но пока это остаётся в области исследований. Промежуточный результат уже полезен для систем, где одна ошибка дорого обходится.