Kitabı oxu: «CDC Core. Как научить компьютер разбирать строительную документацию»
CDC Core. Как научить компьютер разбирать строительную документацию
История проекта, боли, решения и технологии — без единой строчки кода
Исходный код проекта: https://github.com/AndreyLeonov80/cdc-core
Telegram: https://t.me/aidialog
GitHub: https://github.com/AndreyLeonov80/about
E-mail: aidialog@mail.ru
© 2026 Автор кода CDC Core. Все права защищены.
Содержание
Введение. Зачем эта книга
Глава 1. Боль первая: хаос строительной документации
Глава 2. Боль вторая: ручная работа с кодами и ревизиями
Глава 3. Боль третья: система, которую нельзя развивать
Глава 4. Как создавался CDC Core
Глава 5. Что делает система: конвейер из девяти этапов
Глава 6. Технологии: почему именно они
Глава 7. Кому и сколько это экономит
Глава 8. Безопасность и честная коммерция
Глава 9. Запуск и повседневная работа
Глава 10. Куда расти: дорожная карта
Об авторе
Глава 11. Типовые ошибки ручной классификации: пять кейсов
Глава 12. Глоссарий
Глава 13. Частые вопросы
Глава 14. Почему конвейер устроен именно так
Глава 15. Чек-лист внедрения за неделю
Глава 16. Заключение
Глава 17. Анатомия проектного архива
Глава 18. Экономика ручной обработки
Глава 19. Оператор: профессия, которую меняет машина
Глава 20. Как нейросети читают страницу
Глава 21. Русский язык глазами машины
Глава 22. Математика похожести
Глава 23. Базы данных и интерфейсы для не-программистов
Глава 24. Контейнеры и автопроверки
Глава 25. Как измерять качество классификации
Глава 26. Сопротивление внедрению и как его пройти
Глава 27. Право, лицензии и чужие документы
Приложение А. Паспорт файла: что система помнит о документе
Приложение Б. Настройки окружения
Послесловие
Введение. Зачем эта книга
Эта книга — история одного практического проекта и одновременно инструкция по мышлению. Ее герой — CDC Core, система автоматической классификации строительной проектной документации. Каждый день проектные организации выпускают сотни чертежей, пояснительных записок, спецификаций и смет. Каждый документ нужно распознать, понять, к какому комплекту он относится, определить его ревизию и положить в правильную папку. Вручную эта работа занимает часы и дни, а ошибка стоит дорого: документ, попавший не в тот комплект, может задержать стройку или привести к переделкам.
CDC Core берет эту рутину на себя. Система принимает сканы и текстовые выгрузки, распознает текст на русском языке, определяет код комплекта чертежей, выстраивает иерархию раздел — подраздел — часть — книга — том, фиксирует ревизию документа и раскладывает файлы по папкам. Результат сохраняется в базу данных и сводный отчет, с которыми работает человек-оператор через веб-интерфейс.
Книга написана без единой строчки исходного кода. Все технические решения объяснены словами: что делает каждый этап, зачем он нужен и какие задачи решает. Полный исходный код проекта открыт и доступен по ссылке: https://github.com/AndreyLeonov80/cdc-core. Книга — это карта, код — территория. Читайте карту, а за деталями реализации заглядывайте в репозиторий.
Кому адресована книга? Руководителям проектных отделов, которые хотят понять, что реально может автоматизация. Инженерам, которые выбирают инструменты для обработки документации. Разработчикам, которым интересен разбор полного цикла: от сканированного листа до базы данных. И всем, кому любопытно, как устроены прикладные системы искусственного интеллекта изнутри — без математики и без кода, на уровне идей и решений.
Глава 1. Боль первая: хаос строительной документации
Строительный проект — это тысячи документов. Генеральный план, архитектурные решения, железобетонные конструкции, отопление и вентиляция, водоснабжение, электрика, технология производства, сметы, пояснительные записки. Каждый комплект чертежей имеет свой буквенный код: ГТ, АР, КЖ, ЭОМ, ОВ, ВК и десятки других. Внутри комплекта — разделы, подразделы, части, книги, тома. Отдельная ось — стадии строительства и ревизии: документ живет, меняется, и каждая его версия должна лежать на своем месте.
На практике документы приходят в самом разном виде. Сканы разного качества, фотографии с телефона, выгрузки из разных систем, файлы с именами вроде «скан_023_финал_2». Один и тот же чертеж может существовать в пяти копиях с разными именами в разных папках. Сотрудник открывает файл, вчитывается в штамп, определяет код комплекта, сверяется со структурой проекта, переименовывает файл и переносит его в нужную папку. На один документ уходят минуты. На тысячу — недели.
Цена ошибки высока. Чертеж, попавший в чужой комплект, не найдут, когда он понадобится. Устаревшая ревизия, выданная в работу вместо новой, превращается в переделки на площадке. Потерянный документ приходится запрашивать заново. Хаос в документации — это не абстрактное неудобство, а прямые финансовые потери и срывы сроков.
Первая боль, которую решает CDC Core, — это именно хаос на входе. Система не требует, чтобы файлы были аккуратно названы или разложены. Она принимает то, что есть: гору сканов и текстовых файлов — и сама разбирает, что есть что. Вместо недель ручной сортировки — автоматический прогон, после которого человек проверяет результат, а не выполняет его с нуля.
Pulsuz fraqment bitdi.