PDF Metin Çıkarma

Her kelimeyi düz bir metin dosyasına kopyalayın.

Dosyalarınızı buraya sürükleyip bırakın

Desteklenen: PDF

Dosyalar gizli olarak işlenir ve otomatik olarak kaldırılır. Arayüz önizlemesi - işleme henüz etkinleştirilmedi.

Hakkında PDF Metin Çıkarma

Düzeni ve resimleri bir kenara bırakıp kelimeleri saklayın. PDF metin çıkarma; bir belgeyi çeviriciye, arama dizinine veya yapay zekâ asistanına vermek için kullanışlıdır.

  • UTF-8 çıktısı
  • Okuma sırası korunur
  • İsteğe bağlı sayfa ayırıcıları

Nasıl yapılır pdf metin çıkarma

  1. 1

    Belgeyi yükleyin

    Metin tabanlı PDF'ler ya da OCR yapılmış taramalar.

  2. 2

    Kapsamı seçin

    Tüm dosya ya da bir sayfa aralığı.

  3. 3

    .txt dosyasını indirin

    Okuma sırası korunmuş düz UTF-8 metin.

Pratik bir rehber: pdf metin çıkarma

Düz metin için doğru iş

Yalnızca kelimeleri ve başka hiçbir şeyi istediğinizde metni çıkarın: bir sözleşmeyi bir çeviri aracına vermek, içeriği bir içerik yönetim sistemine çekmek, bir arama dizini oluşturmak ya da düzeni değil metni okuyan bir yapay zekâ asistanına bir belge vermek. Bir raporun kelimelerini saymanın veya birçok dosyada bir ifadeyi aramanın da en hızlı yoludur. Bunun yerine tabloları gerçek hücreler olarak istiyorsanız PDF to Excel'i, düzenlenebilir biçimlendirme istiyorsanız PDF to Word'ü kullanın. Buradaki amaç, her yerde yeniden kullanabileceğiniz temiz, taşınabilir içeriktir.

Boş bir dosyadan kaçınmak

En yaygın sürpriz, boş veya neredeyse boş bir sonuçtur ve bu neredeyse her zaman sayfaların altta bir metin katmanı olmayan taranmış resimler olduğu anlamına gelir. Çözüm, karakterlerin makine tarafından okunabilir olması için önce OCR çalıştırmak, sonra çıkarmaktır. PDF'in kopyalamaya karşı parola korumalı olmadığını doğrulamak da yardımcı olur, çünkü bu çıkarmayı engeller. Gerçek metni ve taranmış eklemeleri karıştıran belgelerde, hiçbir şeyin sessizce atlanmaması için önce tüm dosyayı OCR'dan geçirin, sonra metni tek geçişte çekin.

Sonucu temizlemek ve zincirlemek

Çıkarıcı, satır sonlarında tireyle bölünen kelimeleri yeniden birleştirir, böylece parçalar değil bütün kelimeler alırsınız, ama yine de tekrar eden yürüyen başlıkları veya sayfa numarası satırlarını temizlemek isteyebilirsiniz. Sayfa ayırıcılarını açmak bunları bulmayı ve ayıklamayı kolaylaştırır. Buradan .txt sayısız iş akışına oturur: bir belgenin iki sürümünü karşılaştırmak, terimleri saymak veya analizden önce ön işleme yapmak. Dosyalar yalnızca oturumunuz için işlenip hesaba gerek olmadan sonrasında silindiği için, hassas belgeleri çıkarmak ve kaynağı hemen sonra silmek rahattır.

Sık sorulan sorular

Bu, PDF to Word'den nasıl farklı?
Bu araç size yalnızca kelimeleri içeren, düzenden, yazı tiplerinden, resimlerden ve tablolardan arındırılmış düz bir .txt dosyası verir. PDF to Word ise biçimlendirmeyi düzenlenebilir bir belge olarak yeniden kurar. Ham içeriği bir çeviriciye, bir arama dizinine veya bir betiğe yapıştırmanız gerektiğinde metin çıkarmayı, görsel yapı önemli olduğunda Word'ü seçin.
Metin hangi sırayla çıkar?
Çıkarıcı, her sayfanın yukarıdan aşağıya doğal okuma sırasını izler, böylece paragraflar karışmak yerine sırada kalır. Çok sütunlu düzenler, yapı belirginken sütun sütun okunur, ancak kenar çubuklu yoğun tasarlanmış sayfalar ara sıra iç içe geçebilir, bu yüzden hızlı bir okuma yapmakta fayda vardır.
Yalnızca belirli sayfaları çıkarabilir miyim?
Evet. Aracı çalıştırmadan önce bir sayfa aralığı belirleyin, yalnızca o sayfalar dönüştürülsün; bu, tüm bir kitap yerine bir bölüm veya tek bir kısım istediğinizde kullanışlıdır. Bir sayfanın nerede bitip diğerinin nerede başladığının belli olması için isteğe bağlı ayırıcılar da ekleyebilirsiniz.
Çıktı hangi karakter kodlamasını kullanır?
Çıktı UTF-8 olarak kaydedilir, böylece aksanlı harfler, para birimi simgeleri ve Latin dışı yazılar bozulmadan kalır ve düzenleyicilerde, elektronik tablolarda ve kodda doğru açılır. Bu, dosyayı bozuk karakter temizliği adımı olmadan doğrudan başka yazılıma beslemeyi güvenli kılar.