Модель научилась обнаруживать и объяснять свои галлюцинации

Разработчики внедрили в ChatGPT алгоритм самопроверки, позволяющий модели выявлять места, где она может ошибаться или выдумывать информацию. При обнаружении сомнительных участков модель помечает их и объясняет причину недоверия к собственному выводу.

Механизм работает на уровне семантического анализа и проверки логической согласованности. Модель анализирует согласованность фактов между собой, а также сличает информацию с величиной уверенности в знаниях.

Снижение рисков

Система не устраняет галлюцинации полностью, но делает их видимыми для пользователя. Это позволяет человеку критически оценивать ответы и проверять спорные утверждения дополнительно.

OpenAI указывает, что функция особенно важна для профессионального использования, где ошибка в фактах может иметь серьёзные последствия.

Обновление не требует переобучения модели и развёртывается через улучшение интерпретации её внутренних сигналов уверенности.