Гипертекстовые ссылки обучают ИИ эффективнее, чем полные статьи
Группа исследователей из лаборатории машинного обучения обнаружила, что якорные тексты гиперссылок содержат более концентрированную и релевантную информацию для обучения языковых моделей, чем полный текст целевых страниц. Эксперименты с моделями среднего размера показали, что использование только ссылок улучшает качество предсказаний на 12–18 процентов при одном и том же объёме данных.
Результаты особенно значимы для оптимизации процессов обучения больших моделей, где объём используемых данных критичен для итоговой производительности. Анкорные тексты часто создаются авторами специально, чтобы кратко описать содержимое целевой страницы, что делает их более информативными для задач классификации и извлечения смысла.
Практические применения открытия
Вывод может изменить подходы к созданию датасетов для обучения моделей следующего поколения. Вместо сбора полного текста веб-страниц провайдеры могут сосредоточиться на агрегировании структурированных ссылок, что снизит вычислительные затраты на предварительную обработку и ускорит цикл разработки.
Однако специалисты отмечают, что этот метод работает лучше всего для фактических данных и навигационных концепций, тогда как сложные рассуждения и контекстуальные нюансы по-прежнему требуют полного текста источников.
Крупные провайдеры моделей уже начали адаптировать свои конвейеры обучения с учётом этих находок, чтобы повысить эффективность использования ресурсов.