Медиа

Создали инструмент, который превращает PDF-полосы газет и журналов в структурированную базу статей: заголовок, автор, текст, изображения, сноски.

Клиент
РБК
Отрасль
Медиа
Работы
Backend, frontend, UX/UI
Формат
Разработка продукта
РБК

Задача

Печатные издания, выходящие в России, существуют в виде PDF-полос: искать по ним нельзя, использовать в аналитике — тоже. Ручной перенос статей в базу занимал столько времени, что архив не успевал наполняться быстрее, чем выходили новые номера.

Решение

Собрали конвейер оцифровки под работу оператора:

  • Распознавание полос через OCR Tesseract с выделением областей на странице
  • Разметка распознанного: заголовок, автор, текст, изображения, сноски
  • Редактор статьи рядом с исходной полосой — сверка без переключения окон
  • Админ-панель с горячими клавишами: поиск и замена, словари, нумерация, пустые страницы
  • Очередь номеров со статусами «новые» и «обработанные»
PHPPostgreSQLOCR TesseractJavaScript

Результат

OCR
автоматическое распознавание полос
hot keys
разметка номера без мыши
база
статьи вместо PDF-сканов

Расскажите о задаче — обсудим формат и сроки.

Обсудить
проект →