OCR PDF

Spraw, by zeskanowane strony stały się przeszukiwalne i zaznaczalne.

Przeciągnij i upuść pliki tutaj

Obsługiwane: PDF, JPG, PNG

Pliki są przetwarzane prywatnie i automatycznie usuwane. Podgląd interfejsu - przetwarzanie nie jest jeszcze włączone.

O narzędziu OCR PDF

Funkcja OCR PDF rozpoznaje tekst na skanach i dodaje niewidoczną warstwę tekstową pod obrazem, dzięki czemu możesz przeszukiwać, kopiować i indeksować dokument, choć nadal wygląda on jak oryginał.

  • Dziesiątki języków
  • Zachowuje oryginalny wygląd strony
  • Umożliwia kopiowanie, wyszukiwanie i indeksowanie

Jak to zrobić ocr pdf

  1. 1

    Wgraj skan

    Zdjęcia dokumentów też zadziałają.

  2. 2

    Wybierz język

    Dokładność rozpoznawania mocno rośnie przy właściwym języku.

  3. 3

    Pobierz

    Wygląda identycznie, ale tekst jest teraz przeszukiwalny.

Praktyczny przewodnik po ocr pdf

Co OCR faktycznie dodaje do Twojego skanu

Zeskanowana strona to tylko obraz tekstu, więc komputer widzi piksele, a nie słowa, i nie potrafi w niej wyszukiwać ani z niej kopiować. OCR odczytuje ten obraz, rozpoznaje litery i wpisuje je do niewidocznej warstwy umieszczonej dokładnie pod obrazem. Strona nadal wygląda dokładnie jak oryginalny skan, ale teraz możesz zaznaczyć zdanie, uruchomić wyszukiwanie, skopiować akapit oraz pozwolić wyszukiwarkom i systemom dokumentów zindeksować treść. Nic w widocznym wyglądzie się nie zmienia; wartość tkwi w całości w przeszukiwalnej warstwie jadącej pod spodem, po cichu zamieniającej płaski obraz w użyteczny dokument.

Uzyskanie najdokładniejszego rozpoznawania

Dokładność ściśle podąża za jakością wejścia. Czysty skan w przyzwoitej rozdzielczości, prosty i ostry, odczytuje się niemal idealnie, podczas gdy przyciemnione zdjęcie z telefonu, skośna strona lub blady faks pogubią znaki. Dwa ustawienia pomagają najbardziej: wybierz właściwy język lub języki, aby rozpoznawanie wiedziało, jakiego alfabetu i akcentów oczekiwać, oraz upewnij się, że strona jest prosta przed startem. Jeśli skan jest krzywy lub ziarnisty, wyprostowanie i poprawienie źródła najpierw opłaca się bardziej niż jakakolwiek opcja OCR. Blade lub nietypowe czcionki i pismo odręczne pozostają najtrudniejszymi przypadkami, więc sprawdzaj wszystko krytyczne.

Gdzie OCR pasuje wśród innych narzędzi

OCR jest często krokiem umożliwiającym, który dopiero pozwala wykonać inne zadania na skanie. Gdy warstwa tekstowa istnieje, możesz wyodrębnić czysty tekst, przekonwertować dokument na Word lub Excel z prawdziwą edytowalną treścią zamiast płaskiego obrazu albo podzielić partię wyciągów według nazwiska klienta wydrukowanego na każdej stronie, a wszystko to wymaga czytelnego tekstu, by działać. Kolejność ma znaczenie: najpierw wyprostuj i oczyść skan, potem OCR, a dopiero potem kompresja, tak by rozpoznawanie działało na najostrzejszych obrazach, a przeszukiwalna warstwa przetrwała do finalnego, mniejszego pliku.

Najczęściej zadawane pytania

Jak poznać, czy PDF faktycznie potrzebuje OCR?
Spróbuj zaznaczyć lub wyszukać słowo na stronie. Jeśli nic się nie podświetla, a wyszukiwarka nic nie znajduje, strona jest obrazem i potrzebuje OCR. Jeśli tekst zaznacza się normalnie, jest już cyfrowy i OCR nic by nie dodał, więc możesz go pominąć.
Mój dokument miesza dwa języki. Czy OCR sobie z tym poradzi?
Tak. Możesz wybrać więcej niż jeden język, aby rozpoznawanie spodziewało się obu alfabetów i znaków specjalnych na tej samej stronie, co ma znaczenie dla liter z akcentami i pism niełacińskich. Wybranie tylko jednego języka na dwujęzycznej stronie zwykle zniekształca słowa w tym drugim.
Czy OCR powiększa plik?
Nieznacznie. Dodaje niewidoczną warstwę tekstową pod istniejącym obrazem, więc obraz strony pozostaje bez zmian i dochodzi tylko rozpoznany tekst, który jest niewielki. Jeśli rozmiar jest problemem, skompresuj po OCR, a nie przed.
Czy OCR wyprostuje lub oczyści krzywy skan?
Nie, OCR tylko odczytuje i dodaje warstwę tekstową; nie koryguje obrazu. Przechylony lub skośny skan obniża dokładność, więc uruchom najpierw prostowanie i upewnij się, że strona stoi prosto, a wtedy OCR odczyta znacznie więcej poprawnie.