Модель научилась обнаруживать и объяснять свои галлюцинации
Разработчики внедрили в ChatGPT алгоритм самопроверки, позволяющий модели выявлять места, где она может ошибаться или выдумывать информацию. При обнаружении сомнительных участков модель помечает их и объясняет причину недоверия к собственному выводу.
Механизм работает на уровне семантического анализа и проверки логической согласованности. Модель анализирует согласованность фактов между собой, а также сличает информацию с величиной уверенности в знаниях.
Снижение рисков
Система не устраняет галлюцинации полностью, но делает их видимыми для пользователя. Это позволяет человеку критически оценивать ответы и проверять спорные утверждения дополнительно.
OpenAI указывает, что функция особенно важна для профессионального использования, где ошибка в фактах может иметь серьёзные последствия.
Обновление не требует переобучения модели и развёртывается через улучшение интерпретации её внутренних сигналов уверенности.