Сервис переехал на app.sp-ai.ru — новая версия с расчётными агентами
Агенты Вопросы Технология Тарифы Для организаций Блог Войти

Сравнение ИИ на строительных нормах

Шесть систем ответили на одни и те же 100 вопросов, отобранных из реальных запросов пользователей. Каждый ответ независимо оценили пять языковых моделей вслепую, проверяя каждую ссылку по корпусу нормативов. Ниже — цифры и то, чего они не показывают.

Июль 20263 000 оценокСудьи вслепую

Постановка

Вопросов 100 — отобраны из ~6 000 реальных запросов пользователей
Систем 6
Ответов 600
Судей 5 языковых моделей, вслепую
Оценок 3 000
Корпус ~200 нормативных документов в зафиксированных редакциях

Вопросы не придумывались и не генерировались. На момент формирования набора в логах сервиса накопилось около 6 000 запросов; из них после дедупликации и чистки отобрали 100 со стратификацией по дисциплине, типу задачи, сложности и типу рассуждения. Обязательное условие отбора — однозначная формулировка и принципиальная возможность верифицируемого эталона: конкретный пункт документа или детерминированный расчёт. Поэтому распределение ниже — слепок реального спроса, а не выбор авторов.

ДисциплинаВопросов
Пожарная безопасность 34
Вентиляция 23
Строительные нормы и правила 15
Водоснабжение и канализация 13
Электроснабжение 9
Градостроительство 6

По сложности: 23 простых, 47 средних, 30 сложных.

Чем мерили

Ответ, который блестяще объясняет инженерную логику, но ссылается на несуществующий пункт, — хороший или плохой? Смотря для чего. Для проекта, который пойдёт в экспертизу, — плохой. Поэтому вместо общего впечатления — шесть критериев, каждый по пятибалльной шкале.

ОсьЧто оценивается
FA Фактическая корректность
Comp Полнота ответа
RG Работа с нормативной базой
NRA Достоверность ссылок
PA Практическая применимость
Safety Безопасность рекомендаций
WΣ = 2·FA + 2·Comp + 1·RG + 2·NRA + 2·PA + 1·Safety

Максимум 50. Основную доказательную нагрузку несёт NRA с двойным весом; RG вдвое легче большинства осей — 5 баллов из 50.

Три решения, без которых этой оценке нельзя было бы верить:

Судьи работали вслепую. Они видели «Ответ A»…«Ответ F» без имён систем; в инструкции стояло прямо: авторство неизвестно, определять его не пытайтесь. Отдельно проверено, что имя ни одной системы не всплыло ни в ответах, ни в вердиктах.

Судьи проверяли ссылки по корпусу. У каждого был доступ к тем же ~200 документам. Инструкция требовала: нашёл ссылку — открой документ, найди пункт, сравни с утверждением. NRA ставится по результату проверки, а не по правдоподобности.

Итоговый балл считал скрипт. Судья выставляет только шесть осей. В ранней версии судью просили писать сумму самому — модели стабильно прикидывали её на глаз с ошибками.

Главный результат

Контрольная пара: один и тот же генератор, DeepSeek V4-Pro, с агентным поисковым контуром и без него. Всё различие — контур. Третья колонка — сильнейший универсальный генералист на тех же вопросах. Среднее по пяти судьям.

Ось SP-AI V4-Pro соло GPT-5.5
Фактическая корректность 4,35 3,21 4,01
Полнота ответа 4,17 4,09 4,14
Работа с нормативной базой 4,32 2,95 3,81
Достоверность ссылок 4,25 2,60 3,60
Практическая применимость 4,26 3,63 4,19
Безопасность рекомендаций 4,65 3,94 4,51

Куда ушла прибавка — видно сразу. Полнота почти не сдвинулась: 4,09 → 4,17. Достоверность ссылок — с 2,60 до 4,25. От контура ответ не становится умнее или длиннее, он становится проверяемым.

И это не эффект длины: по медиане ответ соло даже длиннее — около 2 300 знаков против 2 000. В 54 вопросах из 100, где ответ соло длиннее или равен по объёму, разрыв по достоверности ссылок остаётся: 4,09 против 2,60. Модель без контура пишет не меньше — она пишет недоказуемо.

Профиль ошибок

Сколько раз судьи пометили в ответах несуществующий документ или пункт — и сколько раз система отказалась отвечать. Четыре судьи, 400 оценок на систему.

Система Выдуманная ссылка Отказ
DeepSeek V4-Pro, соло по памяти 120 0
Gemini 3.1 Pro 108 0
Claude Sonnet 5 64 3
GPT-5.5 19 2
Claude Opus 4.8 16 1
SP-AI — тот же V4-Pro с поисковым контуром 8 7

Верхняя и нижняя строки — один и тот же генератор. Без контура 120 пометок, с контуром 8.

Но интереснее правая колонка. Система с контуром — единственная из шести, которая сколько-нибудь заметно отказывается отвечать. Это два разных режима ошибки. Генералист ошибается уверенно: профессиональный текст, верная терминология, ссылки на СП — и часть этой нормативной базы существует только внутри модели. Система с контуром ошибается молчанием: такую ошибку хотя бы видно, но качество теперь упирается в полноту корпуса.

Завышают ли судьи оценки своим

Вопрос обязателен: среди судей есть модели, оценивавшие в том числе собственные ответы. Сравнивать средние здесь нельзя — в них перемешаны качество, щедрость судьи и его вкусы. Правильный тест: взять конкретный ответ и посмотреть, насколько балл «родного» судьи отличается от того, что этому же ответу поставили остальные четверо.

Судья → своя система Надбавка Значимо
Gemini → Gemini 3.1 +3,7 да, p < 0,001
Opus → Claude Sonnet 5 +2,8 да, p < 0,001
Opus → Claude Opus 4.8 +2,7 да, p < 0,001
GPT → GPT-5.5 +1,2 нет
DeepSeek → своим двум слотам +0,3 нет
Sonnet → Claude Sonnet 5 −0,9 нет

Самопредпочтение есть, но только у двух судей из пяти. У GPT, DeepSeek и Sonnet оно статистически неотличимо от нуля, у Sonnet даже слегка отрицательное — то есть «вендор предпочитает своих» неверно: это свойство конкретной модели-судьи. Высокий балл GPT-5.5 под судьёй GPT — не лояльность, а качество: чужие судьи ставят примерно столько же.

Единица наблюдения — конкретный ответ; надбавка считается как балл «родного» судьи минус среднее четырёх остальных по тому же ответу, в баллах шкалы WΣ. В каждой строке 100 парных разностей. Значимость — одновыборочный t-критерий против нуля, порог с поправкой Бонферрони на восемь пар (α = 0,00625); нижние границы 95%-ных интервалов значимых строк выше +1,7 балла. Критерий Уилкоксона воспроизводит тот же набор значимых строк.

Мораль неудобная: способ измерения меняет ответ. Наивные средние показывали самопредпочтение там, где его нет, и прятали там, где оно есть. Поэтому ни один вывод выше не опирается на одного судью.

Чего это измерение не показывает

  • Пометки «выдуманная ссылка» ставили LLM-судьи по единой инструкции. Независимой ручной разметки пока нет.
  • Все 100 вопросов покрыты корпусом. Стресс-тест на вопросах вне корпуса не проводился — а именно там отказ важнее всего.
  • Внешнего автоматического верификатора цитат в этом прогоне не было: ссылки проверял сам судья, имея доступ к документам.
  • Контрольная пара изолирует вклад всего контура целиком, но не разделяет вклад звеньев — планировщика, поиска и курации по отдельности.
  • Пользовательские логи не публикуются. Вердикты судей и скрипты пересчёта планируются к публикации вместе с научной статьёй.

Как сослаться

Бекшенев Руслан Фаритович. Сравнение ИИ-систем на строительных нормах: 6 систем, 100 вопросов, 3 000 слепых оценок. ООО «ИИ37», июль 2026. https://sp-ai.ru/research/

Полный разбор — с устройством поискового контура, разбором методической ошибки, которую мы едва не опубликовали, и всеми промежуточными таблицами — в статье «120 выдуманных ссылок против 8».

Проверьте на своём вопросе

Ответ придёт со ссылками на конкретные пункты действующих документов