Задачкин — OCR + LLM платформа для разбора задач
Технологический стек
- Python
- PaddleOCR
- Flask
- Telegram API
- Ollama
- LLM APIs
- Docker
Продукт
Задачкин обрабатывает фотографии задач и превращает их в структурированный текст для интерпретации и решения через LLM. Основной сложностью была надёжная граница между пользовательскими изображениями, OCR и ответом модели.
Что я сделал
- Разработал Flask OCR API на PaddleOCR с проверками MIME, размера изображения и timeout.
- Добавил hash-based cache, журналирование запросов и единую точку получения распознанного текста.
- Создал Telegram-бота, принимающего фото или файлы и передающего распознанный текст в LLM-сервис.
- Проверил API-модели и локальный Ollama/Qwen путь с фильтрацией ответа в Markdown или LaTeX.
Архитектура
Telegram image → validation → PaddleOCR service → normalized text → local or API LLM → formatted answer
OCR-компонент и бот контейнеризованы отдельно: распознавание можно заменять, а локальные эксперименты не связаны с bot-flow.
Результат
- Реализован end-to-end OCR-to-LLM процесс для сфотографированных задач.