OCR PDF
Распознайте текст в отсканированных документах и изображениях прямо в браузере.
Загрузите
Выберите файл или перетащите его сюда.
Настройте
Выберите параметры — всё происходит прямо в вашем браузере.
Скачайте
Мгновенно сохраните готовый файл. Без водяных знаков.
Отсканированный PDF — это просто стопка фотографий. По нему нельзя искать, из него не скопировать абзац и не вытащить номер договора. Инструмент OCR от PDFora читает текст внутри этих изображений страниц с помощью Tesseract — того самого движка с открытым исходным кодом, которому доверяют серьёзные системы документооборота, — и отдаёт распознанный текст аккуратным файлом .txt, по которому можно искать, который можно править и использовать дальше.
Вот чем этот OCR отличается от прочих: он работает целиком внутри вашего браузера. Почти все онлайн-сервисы распознавания отправляют ваш скан на сервер. Наш — нет. Распознавание идёт на вашем собственном устройстве, поэтому отсканированный паспорт, подписанный договор аренды или лист с результатами анализов никуда не передаётся. Для таких документов это не приятное дополнение, а весь смысл.
Сейчас инструмент распознаёт английский, хинди, испанский и французский, и язык вы выбираете перед запуском. Он бесплатный: без регистрации, без водяных знаков и без лимита страниц. Скорость распознавания зависит от вашего устройства, ведь всю работу делает ваш процессор, но обычная страница на современном ноутбуке занимает всего несколько секунд.
Как распознать текст в PDF онлайн
- Откройте инструмент OCR для PDF на PDFora в современном браузере.
- Перетащите отсканированный PDF в область загрузки или нажмите, чтобы выбрать его на устройстве.
- Выберите язык документа: английский, хинди, испанский или французский. Правильный язык кардинально повышает точность.
- Нажмите «Распознать текст» и дайте Tesseract локально обработать каждую страницу в браузере.
- Следите за прогрессом по мере готовности страниц; длинным документам нужно чуть больше времени.
- Скачайте извлечённый текст файлом .txt и свободно ищите по нему, правьте и копируйте.
When to use this tool
- Вытащить текст из отсканированного судебного решения на 60 страниц, чтобы найти конкретный пункт поиском, а не вычитывать всё подряд.
- Извлечь цитаты из сфотографированных страниц учебника для научной работы, не перепечатывая их вручную.
- Оцифровать папку старых бумажных счетов, чтобы суммы и номера документов стали доступны для поиска.
- Превратить отсканированный правительственный циркуляр на хинди в редактируемый текст для перевода или краткого пересказа.
- Восстановить текст документа, от которого уцелела только распечатка: отсканировать её и прогнать через OCR.
- Сделать раздаточные материалы совещаний и печатные отчёты пригодными для цитирования в письмах, забирая из них текст вместо скриншотов.
Tips for the best results
- Подавайте на вход самый чистый скан, какой у вас есть. 300 DPI, хорошее освещение и тёмный текст на светлом фоне дают куда лучший результат, чем тусклое фото с телефона.
- Сначала выровняйте скан. Перекошенные страницы сбивают распознавание символов, поэтому прогоните наклонённый документ через инструмент выравнивания PDFora перед OCR.
- Ставьте язык, соответствующий документу. Испанское письмо, прогнанное через английскую модель, даст исковерканный результат, и наоборот.
- На телефонах и старых ноутбуках работа идёт медленнее. Движок использует процессор вашего устройства, так что скан на 100 страниц — задача для настольного компьютера, а не для планшета пятилетней давности.
- Перепроверяйте цифры. OCR очень хорош, но не безупречен, и числа в номерах счетов или итоговых суммах заслуживают беглой ручной проверки, прежде чем на них полагаться.
Часто задаваемые вопросы
Загружается ли мой отсканированный документ для обработки?
Нет, и среди онлайн-инструментов OCR это редкость. Движок Tesseract работает внутри вашего браузера, поэтому каждая страница распознаётся на вашем устройстве. На сервер ничего не отправляется ни на каком этапе, что делает инструмент безопасным для удостоверений личности, договоров и медицинских документов.
Что я получу на выходе?
Инструмент извлекает распознанный текст и отдаёт его в виде скачиваемого файла .txt. Дальше вы можете искать по нему, вставлять его в документ или передавать в любой другой процесс, где нужен простой текст.
Какие языки поддерживаются?
Сейчас доступны английский, хинди, испанский и французский. Выберите язык, соответствующий вашему документу, до запуска распознавания: движок загружает модель конкретного языка, и точность напрямую зависит от правильного выбора.
Насколько точно распознаётся текст?
На чистом, хорошо освещённом скане печатного текста точность обычно очень высокая. Она падает на размытых фото, необычных шрифтах, рукописном тексте и сильном перекосе. Качество исходника — главный рычаг, поэтому плохую страницу лучше пересканировать или выровнять, а не винить движок.
Почему на моём устройстве OCR медленнее, чем у коллеги?
Потому что обработка локальная, и скорость зависит от вашего железа. Свежий ноутбук проглатывает страницы за секунды, а старый телефон возится заметно дольше. Плата за это — полная приватность, и она того стоит.
Есть ли лимит на страницы или файлы и сколько это стоит?
Никакой платы, аккаунта, водяных знаков и квоты на страницы. Хотите — прогоняйте через OCR целый архив сканов. Единственное практическое ограничение — время, ведь длинные документы дольше обрабатываются на вашей машине.