Можно ли доверять нейросети в вопросах по строительным нормам?
Универсальной модели без доступа к корпусу нормативов — нельзя: в нашем измерении DeepSeek V4-Pro, отвечая по памяти, получил 120 пометок «выдуманная ссылка» на 400 оценок. Тот же генератор с агентным поисковым контуром по корпусу получил 8. Проверяемость даёт не размер модели, а доступ к тексту документов в момент ответа.
Чем подтверждён ответ
-
Собственное исследование SP-AI, июль 2026 — 6 систем × 100 вопросов, 3000 слепых оценок пятью LLM-судьями
-
«120 выдуманных ссылок против 8» — методика и полные таблицы
Что именно измеряли
Вопрос «доверять или нет» бессмыслен без указания, что считается ошибкой. Для проекта, который пойдёт в экспертизу, ошибка — это не корявый слог, а ссылка на пункт, которого нет. Ответ может быть написан профессионально, с правильной терминологией и уверенным тоном, и при этом опираться на норму, существующую только внутри модели.
Поэтому в нашем измерении достоверность ссылок вынесена в отдельную ось (NRA), и судья обязан был не оценивать правдоподобность, а открыть документ и найти пункт — у всех пяти судей был доступ к тому же корпусу из примерно 200 нормативных документов.
Результат
Сколько раз судьи пометили в ответах несуществующий документ или пункт. По 400 оценок на систему (четыре судьи).
| Система | Выдуманная ссылка |
|---|---|
| DeepSeek V4-Pro, соло по памяти | 120 |
| Gemini 3.1 Pro | 108 |
| Claude Sonnet 5 | 64 |
| GPT-5.5 | 19 |
| Claude Opus 4.8 | 16 |
| SP-AI (тот же V4-Pro + поисковый контур) | 8 |
Верхняя и нижняя строки — один и тот же генератор. Разница только в том, читает он текст документов в момент ответа или вспоминает его.
Когда не так
Восемь — это не ноль. Наша система тоже ошибается, и делает это иначе: она чаще остальных отказывается отвечать — 7 раз против 0–3 у прочих. Когда нужный пункт не находится, она говорит, что ответа нет, вместо того чтобы сочинить его содержание.
Такую ошибку хотя бы видно. Но цена в том, что качество упирается в полноту корпуса: если документа в базе нет, ответа не будет. Это осознанный размен, а не побочный эффект.
Три оговорки, без которых цифры выше читаются неправильно:
- пометки ставили LLM-судьи по единой инструкции; независимой ручной разметки пока нет;
- все 100 вопросов покрыты корпусом — стресс-тест на вопросах вне корпуса ещё впереди;
- внешнего автоматического верификатора цитат в этом прогоне не было, проверка шла силами судьи с доступом к документам.
Что из этого следует для работы
Ответ любой системы — включая нашу — это черновик, который проверяется по пункту. Разница в том, сколько времени эта проверка занимает: когда рядом с утверждением стоит «СП 1.13130.2020 п. 7.13.2», её можно сделать за минуту. Когда ссылки нет или она выдумана — проверка превращается в самостоятельный поиск, и смысл инструмента теряется.
Ссылки сверены с текстом документов
Смежные вопросы
- Почему нейросеть выдумывает пункты СП и ГОСТ? Потому что языковая модель без доступа к тексту документа не хранит нормы как факты — она достраивает правдоподобное продолжение. Номер пункта устроен статистически предсказуемо, поэтому модель уверенно порождает несуществующий «п. 7.13.2» там, где не знает настоящего. Ошибка выглядит как знание, а не как пробел.
- Как проверить, что ссылка на пункт СП настоящая? Проверять надо три вещи подряд, и в этом порядке: существует ли документ в такой редакции, есть ли в нём пункт с таким номером, и говорит ли этот пункт то, что ему приписали. Чаще всего ломается третья: документ и номер настоящие, а содержание пересказано неверно или взято из отменённой редакции.