Сравнение ИИ на строительных нормах
Шесть систем ответили на одни и те же 100 вопросов, отобранных из реальных запросов пользователей. Каждый ответ независимо оценили пять языковых моделей вслепую, проверяя каждую ссылку по корпусу нормативов. Ниже — цифры и то, чего они не показывают.
Постановка
| Вопросов | 100 — отобраны из ~6 000 реальных запросов пользователей |
|---|---|
| Систем | 6 |
| Ответов | 600 |
| Судей | 5 языковых моделей, вслепую |
| Оценок | 3 000 |
| Корпус | ~200 нормативных документов в зафиксированных редакциях |
Вопросы не придумывались и не генерировались. На момент формирования набора в логах сервиса накопилось около 6 000 запросов; из них после дедупликации и чистки отобрали 100 со стратификацией по дисциплине, типу задачи, сложности и типу рассуждения. Обязательное условие отбора — однозначная формулировка и принципиальная возможность верифицируемого эталона: конкретный пункт документа или детерминированный расчёт. Поэтому распределение ниже — слепок реального спроса, а не выбор авторов.
| Дисциплина | Вопросов |
|---|---|
| Пожарная безопасность | 34 |
| Вентиляция | 23 |
| Строительные нормы и правила | 15 |
| Водоснабжение и канализация | 13 |
| Электроснабжение | 9 |
| Градостроительство | 6 |
По сложности: 23 простых, 47 средних, 30 сложных.
Чем мерили
Ответ, который блестяще объясняет инженерную логику, но ссылается на несуществующий пункт, — хороший или плохой? Смотря для чего. Для проекта, который пойдёт в экспертизу, — плохой. Поэтому вместо общего впечатления — шесть критериев, каждый по пятибалльной шкале.
| Ось | Что оценивается |
|---|---|
| FA | Фактическая корректность |
| Comp | Полнота ответа |
| RG | Работа с нормативной базой |
| NRA | Достоверность ссылок |
| PA | Практическая применимость |
| Safety | Безопасность рекомендаций |
WΣ = 2·FA + 2·Comp + 1·RG + 2·NRA + 2·PA + 1·Safety Максимум 50. Основную доказательную нагрузку несёт NRA с двойным весом; RG вдвое легче большинства осей — 5 баллов из 50.
Три решения, без которых этой оценке нельзя было бы верить:
Судьи работали вслепую. Они видели «Ответ A»…«Ответ F» без имён систем; в инструкции стояло прямо: авторство неизвестно, определять его не пытайтесь. Отдельно проверено, что имя ни одной системы не всплыло ни в ответах, ни в вердиктах.
Судьи проверяли ссылки по корпусу. У каждого был доступ к тем же ~200 документам. Инструкция требовала: нашёл ссылку — открой документ, найди пункт, сравни с утверждением. NRA ставится по результату проверки, а не по правдоподобности.
Итоговый балл считал скрипт. Судья выставляет только шесть осей. В ранней версии судью просили писать сумму самому — модели стабильно прикидывали её на глаз с ошибками.
Главный результат
Контрольная пара: один и тот же генератор, DeepSeek V4-Pro, с агентным поисковым контуром и без него. Всё различие — контур. Третья колонка — сильнейший универсальный генералист на тех же вопросах. Среднее по пяти судьям.
| Ось | SP-AI | V4-Pro соло | GPT-5.5 |
|---|---|---|---|
| Фактическая корректность | 4,35 | 3,21 | 4,01 |
| Полнота ответа | 4,17 | 4,09 | 4,14 |
| Работа с нормативной базой | 4,32 | 2,95 | 3,81 |
| Достоверность ссылок | 4,25 | 2,60 | 3,60 |
| Практическая применимость | 4,26 | 3,63 | 4,19 |
| Безопасность рекомендаций | 4,65 | 3,94 | 4,51 |
Куда ушла прибавка — видно сразу. Полнота почти не сдвинулась: 4,09 → 4,17. Достоверность ссылок — с 2,60 до 4,25. От контура ответ не становится умнее или длиннее, он становится проверяемым.
И это не эффект длины: по медиане ответ соло даже длиннее — около 2 300 знаков против 2 000. В 54 вопросах из 100, где ответ соло длиннее или равен по объёму, разрыв по достоверности ссылок остаётся: 4,09 против 2,60. Модель без контура пишет не меньше — она пишет недоказуемо.
Профиль ошибок
Сколько раз судьи пометили в ответах несуществующий документ или пункт — и сколько раз система отказалась отвечать. Четыре судьи, 400 оценок на систему.
| Система | Выдуманная ссылка | Отказ |
|---|---|---|
| DeepSeek V4-Pro, соло по памяти | 120 | 0 |
| Gemini 3.1 Pro | 108 | 0 |
| Claude Sonnet 5 | 64 | 3 |
| GPT-5.5 | 19 | 2 |
| Claude Opus 4.8 | 16 | 1 |
| SP-AI — тот же V4-Pro с поисковым контуром | 8 | 7 |
Верхняя и нижняя строки — один и тот же генератор. Без контура 120 пометок, с контуром 8.
Но интереснее правая колонка. Система с контуром — единственная из шести, которая сколько-нибудь заметно отказывается отвечать. Это два разных режима ошибки. Генералист ошибается уверенно: профессиональный текст, верная терминология, ссылки на СП — и часть этой нормативной базы существует только внутри модели. Система с контуром ошибается молчанием: такую ошибку хотя бы видно, но качество теперь упирается в полноту корпуса.
Завышают ли судьи оценки своим
Вопрос обязателен: среди судей есть модели, оценивавшие в том числе собственные ответы. Сравнивать средние здесь нельзя — в них перемешаны качество, щедрость судьи и его вкусы. Правильный тест: взять конкретный ответ и посмотреть, насколько балл «родного» судьи отличается от того, что этому же ответу поставили остальные четверо.
| Судья → своя система | Надбавка | Значимо |
|---|---|---|
| Gemini → Gemini 3.1 | +3,7 | да, p < 0,001 |
| Opus → Claude Sonnet 5 | +2,8 | да, p < 0,001 |
| Opus → Claude Opus 4.8 | +2,7 | да, p < 0,001 |
| GPT → GPT-5.5 | +1,2 | нет |
| DeepSeek → своим двум слотам | +0,3 | нет |
| Sonnet → Claude Sonnet 5 | −0,9 | нет |
Самопредпочтение есть, но только у двух судей из пяти. У GPT, DeepSeek и Sonnet оно статистически неотличимо от нуля, у Sonnet даже слегка отрицательное — то есть «вендор предпочитает своих» неверно: это свойство конкретной модели-судьи. Высокий балл GPT-5.5 под судьёй GPT — не лояльность, а качество: чужие судьи ставят примерно столько же.
Единица наблюдения — конкретный ответ; надбавка считается как балл «родного» судьи минус среднее четырёх остальных по тому же ответу, в баллах шкалы WΣ. В каждой строке 100 парных разностей. Значимость — одновыборочный t-критерий против нуля, порог с поправкой Бонферрони на восемь пар (α = 0,00625); нижние границы 95%-ных интервалов значимых строк выше +1,7 балла. Критерий Уилкоксона воспроизводит тот же набор значимых строк.
Мораль неудобная: способ измерения меняет ответ. Наивные средние показывали самопредпочтение там, где его нет, и прятали там, где оно есть. Поэтому ни один вывод выше не опирается на одного судью.
Чего это измерение не показывает
- Пометки «выдуманная ссылка» ставили LLM-судьи по единой инструкции. Независимой ручной разметки пока нет.
- Все 100 вопросов покрыты корпусом. Стресс-тест на вопросах вне корпуса не проводился — а именно там отказ важнее всего.
- Внешнего автоматического верификатора цитат в этом прогоне не было: ссылки проверял сам судья, имея доступ к документам.
- Контрольная пара изолирует вклад всего контура целиком, но не разделяет вклад звеньев — планировщика, поиска и курации по отдельности.
- Пользовательские логи не публикуются. Вердикты судей и скрипты пересчёта планируются к публикации вместе с научной статьёй.
Как сослаться
Бекшенев Руслан Фаритович. Сравнение ИИ-систем на строительных нормах: 6 систем, 100 вопросов, 3 000 слепых оценок. ООО «ИИ37», июль 2026. https://sp-ai.ru/research/
Полный разбор — с устройством поискового контура, разбором методической ошибки, которую мы едва не опубликовали, и всеми промежуточными таблицами — в статье «120 выдуманных ссылок против 8».
Проверьте на своём вопросе
Ответ придёт со ссылками на конкретные пункты действующих документов