Создали инструмент, который превращает PDF-полосы газет и журналов в структурированную базу статей: заголовок, автор, текст, изображения, сноски.
Клиент
РБК
Отрасль
Медиа
Работы
Backend, frontend, UX/UI
Формат
Разработка продукта
РБК
Задача
Печатные издания, выходящие в России, существуют в виде PDF-полос: искать по ним нельзя, использовать в аналитике — тоже. Ручной перенос статей в базу занимал столько времени, что архив не успевал наполняться быстрее, чем выходили новые номера.
Решение
Собрали конвейер оцифровки под работу оператора:
- Распознавание полос через OCR Tesseract с выделением областей на странице
- Разметка распознанного: заголовок, автор, текст, изображения, сноски
- Редактор статьи рядом с исходной полосой — сверка без переключения окон
- Админ-панель с горячими клавишами: поиск и замена, словари, нумерация, пустые страницы
- Очередь номеров со статусами «новые» и «обработанные»
PHPPostgreSQLOCR TesseractJavaScript
Результат
OCR
автоматическое распознавание полос
hot keys
разметка номера без мыши
база
статьи вместо PDF-сканов
Расскажите о задаче — обсудим формат и сроки.
проект →

