# Из PDF в таблицу, которую можно проверить

Источник: https://quicklanding.ru/services/development/data/pdf-data/

Данные есть в PDF, но переносить строки вручную неудобно. Разберём реальные документы и сделаем обработку, которая выдаёт нужную таблицу и показывает места, требующие проверки человеком.

Компания: QuickLanding

Стоимость: 2 900 ₽/час

Сроки: По согласованному плану

## Как PDF превращается в данные для работы

- Строки копируются вручную: Сотрудник переносит значения из прайса или документа, выравнивая колонки после каждой вставки.
- Сканы распознаются с ошибками: Цифры, знаки и мелкий текст могут выглядеть правдоподобно, но менять значение результата.
- Документы устроены по-разному: Заголовки, переносы и таблицы меняются, поэтому один пример не покрывает остальные файлы.

## Что входит в извлечение документов

- Способ обработки ваших образцов: Определим извлечение текста или распознавание и подходящий набор правил для документов.
- Таблицу в нужной структуре: Согласуем колонки, типы, единицы и связь результата с исходными страницами.
- Проверки и исключения: Выделим сомнительные значения и случаи, которые нельзя принять автоматически.

## Последние работы QuickLanding

Посмотрите последние проекты QuickLanding. Для PDF покажем пробную таблицу по вашим файлам и сопоставим результат с исходными страницами.

- [MP CMS — платформа интернет-магазинов](https://quicklanding.ru/projects/mpcms/)
- [Магнитоф — магазин неодимовых магнитов](https://quicklanding.ru/projects/magnitof/)
- [GSO Moscow — SEO и AI-поиск](https://quicklanding.ru/projects/gso/)

## Значения можно сверить с документом

Покажите обычный файл, сложную таблицу и ожидаемые колонки. Определим способ извлечения, правила и проверку, затем оценим обработку.

- Строки относятся к правильным полям: Контрольная таблица сохраняет согласованную структуру.
- Источник доступен для сверки: Результат содержит выбранную связь с документом и страницей.
- Неуверенное значение выделено: Спорный результат не принимается за подтверждённый без нужной проверки.

## Как обрабатываем PDF

- Изучаем примеры: Смотрим качество и разные виды таблиц.
- Согласуем колонки: Определяем поля, строки и преобразования.
- Разрабатываем извлечение: Подключаем подходящий способ обработки.
- Сверяем результат: Проверяем контрольные страницы и спорные значения.

## Стоимость извлечения данных

Работа стоит 2 900 ₽/час. Объём зависит от структуры документов, качества сканов, полей и подготовки результата.

## Способ извлечения зависит от самого документа

Смотрим структуру, качество и разные образцы. Определяем поля результата и признаки ошибок до автоматической обработки.

## Текстовый PDF и скан различаются

Документ может содержать доступный текст или только изображение страницы. В первом случае всё равно нужно восстановить строки и колонки, во втором потребуется распознавание. Проверяем образцы, не обещая один способ для любого файла с расширением PDF.

## Несколько документов показывают реальные ограничения

Просим разные версии, длинные таблицы и сложные страницы. Заголовок может повторяться, строка переходить на следующий лист, а примечание выглядеть как товар. По примерам определяем границы и признаки, которые помогают отделить данные от оформления.

![Тематическое изображение: Извлечение таблиц и данных из PDF](/assets/images/stock-data.webp)

## Структуру результата согласуем заранее

Артикул, количество и цена требуют разных проверок. Сохраняем исходные обозначения там, где преобразование опасно. Если нужны единицы и числа, задаём правила чтения разделителей, отрицательных значений и пустых ячеек по вашим документам.

## Распознавание должно оставлять путь проверки

Неверная цифра в цене может быть важнее десятка удачных страниц. Определяем сомнительные значения и способы сверки. Не выдаём отсутствие ошибки программы за стопроцентную точность содержимого. Для ответственных документов сохраняем согласованный контроль человеком.

## Выгрузка и дальнейшее применение

Передаём выбранный формат и ссылки на исходные страницы там, где это предусмотрено. Для регулярной загрузки в систему можно разработать [конвейер данных](/services/development/data/etl/). Приёмку проводим на контрольных файлах и правильной таблице.

Для приёмки нужен эталон, подготовленный по выбранным страницам. Сравниваем строки, колонки и важные числа, отдельно отмечаем пропуски и ложные записи. Затем проверяем другой документ того же типа. Это показывает, работает ли согласованное правило обработки за пределами первого образца и где остаётся необходимость ручной сверки.

## Оценка обработки

Работа стоит 2 900 ₽/час. Стоимость зависит от структуры и качества, а не только числа страниц. После проверки образцов покажем возможности, ограничения и ожидаемый объём ручной сверки.

### Какие документы нужно превращать в данные?

## Эксперт

Владимир Николаев

Владимир Николаев разберёт контрольные документы и ожидаемые строки. Согласуем признаки правильного извлечения и список случаев, требующих проверки.

## Частые вопросы

### Можно обработать скан?

Проверим качество и подходящее распознавание. Не все сканы позволяют получить надёжные значения автоматически.

### Результат можно выгрузить в Excel?

Да. Согласуем колонки, типы значений и отдельный список исключений для проверки.

### Один обработчик подойдёт всем PDF?

Не обязательно. Структуры различаются, поэтому поддерживаемые виды документов определяем по образцам.

### Как проверить цены и артикулы?

Зададим правила и контрольные примеры, сохраним исходные сведения и выделим сомнительные значения.

### Вы гарантируете точность распознавания?

Абсолютной гарантии нет. Оценим качество на ваших файлах и предусмотрим проверку важных данных.

### Что прислать для оценки?

Несколько разных обезличенных документов и образец правильного результата, включая сложные страницы.

## Связанные услуги

- [Разработка парсеров товарных каталогов](https://quicklanding.ru/services/development/data/catalog-parser/index.md)
- [Разработка конвейеров обработки данных](https://quicklanding.ru/services/development/data/etl/index.md)
- [Автоматическая генерация отчётов](https://quicklanding.ru/services/development/data/reporting/index.md)

## Какие документы нужно превращать в данные?

Пришлите несколько обезличенных PDF и пример нужной таблицы. Проверим извлечение, неоднозначности и оценим обработчик.

