OCR-платформа для документов и интеграция с 1С
Технологический стек
- Python
- PaddleOCR
- Flask
- Docker
- JSON
- 1C
- Nginx
Задача
Внутренним процессам требовался не сырой OCR-текст, а структурированные данные. Сервис должен был распознавать несколько типов внутренних документов, проверять сомнительные поля и передавать подтверждённый результат в 1С без внешнего сервиса распознавания.
Что я сделал
- Реализовал распознавание внутренних и иностранных паспортов, СНИЛС, ИНН и патентов на базе PaddleOCR.
- Добавил нормализацию полей, валидацию, дедупликацию, обработку ошибок и журналирование операций.
- Построил JSON- и multipart-интерфейсы с асинхронной передачей данных в процессы 1С.
Архитектура
document image → image checks → PaddleOCR → field extraction and validation → review-ready structure → 1C integration
Flask-сервис упакован в Docker и доступен внутри инфраструктуры через Nginx. Ошибки распознавания и интеграции сохранялись для проверки.
Результат
- Создан локально работающий внутренний OCR-процесс для нескольких форматов документов.
- Проведены beta-проверки поддерживаемых вариантов и сформирован структурированный интеграционный контракт с 1С.