Независимые проекты

Задачкин — OCR + LLM платформа для разбора задач

Технологический стек

  • Python
  • PaddleOCR
  • Flask
  • Telegram API
  • Ollama
  • LLM APIs
  • Docker

Продукт

Задачкин обрабатывает фотографии задач и превращает их в структурированный текст для интерпретации и решения через LLM. Основной сложностью была надёжная граница между пользовательскими изображениями, OCR и ответом модели.

Что я сделал

  • Разработал Flask OCR API на PaddleOCR с проверками MIME, размера изображения и timeout.
  • Добавил hash-based cache, журналирование запросов и единую точку получения распознанного текста.
  • Создал Telegram-бота, принимающего фото или файлы и передающего распознанный текст в LLM-сервис.
  • Проверил API-модели и локальный Ollama/Qwen путь с фильтрацией ответа в Markdown или LaTeX.

Архитектура

Telegram image → validation → PaddleOCR service → normalized text → local or API LLM → formatted answer

OCR-компонент и бот контейнеризованы отдельно: распознавание можно заменять, а локальные эксперименты не связаны с bot-flow.

Результат

  • Реализован end-to-end OCR-to-LLM процесс для сфотографированных задач.