Представьте: модель подготовила справку для коммерческого предложения и уверенно написала, что нужное требование действует с 1 января. Ссылка выглядит правдоподобно, дедлайн близко — текст хочется сразу отправить клиенту. Проверка показывает, что документ существует, но дата относится к проекту, а не к действующей редакции. Ошибка помещалась в одной строке, а испортила бы всё решение.
Нейросеть может написать ясный и убедительный ответ, в котором окажется неверная дата, перепутанная причинно-следственная связь или несуществующий источник. Поэтому фактчекинг начинается не с доверия к тону ответа, а с разложения текста на утверждения. Такой подход похож на метод FActScore: авторы разбивают длинный ответ на отдельные атомарные факты, а затем проверяют каждый из них по источнику знаний.
Шаг 1. Выделите проверяемые утверждения
Отметьте числа, даты, имена, цитаты, названия документов, нормы, характеристики продуктов и причинные выводы. Общую рекомендацию проверить сложнее, чем конкретную фразу «показатель вырос на 18% в 2025 году».
Сначала проверяйте утверждения, от которых зависит решение. Не все ошибки одинаково опасны.
Я использую простую приоритизацию:
| Тип утверждения | Пример | Стоимость ошибки | Что делать |
|---|---|---|---|
| Факт с низким риском | Формулировка вводного абзаца | Низкая | Выборочная проверка |
| Число, дата, цитата | Срок действия правила | Средняя | Открыть первоисточник и сверить контекст |
| Основание решения | Норма, тариф, медицинское ограничение | Высокая | Проверка специалистом и журнал доказательств |
Так вы не тратите одинаковое время на запятую и на условие договора. Глубина проверки должна расти вместе с последствиями ошибки.
Шаг 2. Попросите модель показать основания
Можно запросить список исходных фактов, логику вывода и предполагаемые источники. Это помогает увидеть слабые места ответа, но не превращает модель в первоисточник.
LLM способна придумать правдоподобное название статьи, автора или ссылку. Любой источник нужно открыть и проверить отдельно.
Есть важная ловушка: вопрос «ты уверен?» часто приводит лишь к новой уверенной формулировке. В исследовании OpenAI о причинах галлюцинаций отмечается, что оценивание, которое награждает угадывание, может делать признание неопределённости менее выгодным для модели. Поэтому просите не уверенность, а проверяемый след: какое утверждение сделано, на какой фрагмент источника оно опирается и чего в источнике нет.
Шаг 3. Найдите первичный источник
Для закона это официальный текст нормы, для научного утверждения — оригинальная публикация, для характеристики продукта — документация производителя, для показателя компании — её отчётность.
Пересказ в блоге или агрегаторе может помочь понять тему, но важное утверждение лучше подтверждать источником, который отвечает за исходные данные.
Поисковая выдача тоже не доказательство. Сниппет бывает обрезан, взят из старой версии страницы или показывает слова без нужного контекста. Откройте документ, найдите фрагмент внутри него и проверьте дату обновления. Если материал изменяется со временем, сохраните версию или дату доступа.
Шаг 4. Проверьте контекст
Даже точное число может вводить в заблуждение, если перепутаны период, выборка или единица измерения. Сравните формулировку модели с тем, что действительно сказано в источнике.
Полезные вопросы: к какому периоду относится факт, кого исследовали, какие были ограничения, не изменилось ли определение показателя?
Отдельно проверьте направление вывода. Источник может говорить, что два показателя связаны, а модель превратит связь в причину. Может описывать результат для одной выборки, а ответ распространит его на всех. Текст останется гладким, поэтому такую подмену легче заметить только при сопоставлении утверждения с исходным абзацем.
Шаг 5. Зафиксируйте уверенность
Для рабочих процессов удобно разделять выводы на подтверждённые, вероятные и непроверенные. Если система используется регулярно, источник, дата проверки и ответственный должны сохраняться вместе с результатом.
Минимальная карточка проверки выглядит так:
| Поле | Что записать |
|---|---|
| Утверждение | Одна фраза без объединения нескольких фактов |
| Риск | Что произойдёт, если фраза неверна |
| Источник | Прямая ссылка на документ, а не на выдачу |
| Фрагмент и версия | Раздел, страница, дата публикации или обновления |
| Статус | Подтверждено, спорно, не найдено |
| Ответственный | Кто проверил и когда |
Эта карточка полезнее общего комментария «ответ проверен». По ней другой человек может воспроизвести проверку, а команда — понять, что устарело.
Как встроить проверку в процесс
Для низкорисковых черновиков достаточно выборочной проверки человеком. Для финансовых, юридических, медицинских или кадровых решений нужен более строгий контур: разрешённый набор источников, автоматические проверки формата, журналирование и обязательное подтверждение специалистом.
Хорошая система не маскирует неопределённость. Она показывает, откуда взялся ответ, где модель делает вывод и что должен проверить человек. NIST относит уверенно представленное ложное содержание — confabulation — к отдельным рискам генеративного ИИ. Это не повод отказаться от LLM; это требование спроектировать контроль до запуска, а не после первой неприятности.
Для повторяемого процесса я разделяю четыре слоя:
- Разрешённые источники. Система знает, где искать данные и каким документам можно доверять.
- Проверяемый формат. Числа, даты, ссылки и статусы возвращаются в отдельных полях.
- Автоматические правила. Схема, диапазоны, обязательные значения и существование URL проверяются кодом.
- Человеческое решение. Специалист подтверждает то, что влияет на деньги, права или безопасность.
Поиск по корпоративным документам уменьшает вероятность выдумки, но не отменяет проверку: система может выбрать не тот фрагмент или потерять оговорку. Подробнее о причинах таких ошибок — в статье о галлюцинациях нейросетей. Базовый механизм самой модели я разобрал в материале о том, как работает LLM.
Быстрый протокол перед отправкой ответа
Если времени мало, пройдите пять пунктов:
- выделите утверждения, которые меняют решение;
- откройте первоисточник для каждого критического факта;
- сравните дату, область применения и единицы измерения;
- пометьте то, что не удалось подтвердить;
- передайте высокорисковое решение профильному специалисту.
Не заставляйте модель изображать определённость. Полезный ответ может честно закончиться фразой «данных недостаточно» и списком того, что нужно уточнить.
Главное
Не спрашивайте только «правда ли это?». Разберите ответ на утверждения, найдите первичные источники, проверьте контекст и соотнесите глубину проверки со стоимостью ошибки.