PDF ke teks
Ambil kata-katanya menjadi file .txt polos.
Alat ini berjalan sepenuhnya di browser Anda. Berkas Anda tidak pernah diunggah, dan Anda bisa membuktikannya sendiri di tab jaringan browser. Buktikan sendiri: buka tab jaringan di browser Anda dan perhatikan. Anda akan melihat satu permintaan kecil yang menanyakan sisa jatah - nama alat dan sebuah hash, bukan berkasnya.
Apa yang dilakukan alat ini
Alat ini menarik kata-kata dari sebuah PDF dan menuliskannya ke file .txt polos. PDF tidak menyimpan teks sebagai kalimat - yang disimpannya adalah glif pada koordinat - jadi urutan baca, batas kata, dan pemenggalan paragraf semuanya disusun ulang dari geometri halaman. Tiap pengambil teks menebaknya sedikit berbeda, dan itulah sebabnya dokumen yang sama memberi hasil berbeda di alat yang berbeda, dan sebabnya di sini ada dua mode, bukan satu.
Mengangkat kutipan dari sebuah laporan tanpa mengetik ulang, memasukkan dokumen ke sebuah skrip atau model bahasa, mencari kata di buku yang hanya Anda punya dalam bentuk PDF, atau memastikan apa isi sebuah halaman ketika pendeteksi tabel bersikeras tidak menemukan apa-apa.
Cara kerjanya
- Jatuhkan PDF ke halaman ini. Satu file sekali jalan, sampai 300 MB.
- Pilih urutan baca untuk prosa yang akan Anda tempel ke tempat lain, atau tata letak supaya kolom dan tabel tetap lurus dengan spasi.
- Tentukan apakah antar halaman diberi garis penanda dan apakah nomor halaman ikut dicetak ke dalam file.
- Biarkan sambung kata terpenggal tetap aktif supaya kata yang terpotong pergantian baris kembali utuh.
- Di opsi lanjutan, isi rentang halaman, atau ganti pengodean ke UTF-8 dengan BOM kalau file-nya akan dibuka Excel atau Notepad.
- Tekan Ubah jadi teks, dan .txt-nya terunduh sendiri.
Kedua mode menyelesaikan masalah yang berlawanan. Urutan baca menyambung kembali baris-baris sebuah paragraf menjadi prosa yang mengalir, dan itulah yang Anda inginkan di email, skrip, atau kutipan. Mode tata letak membiarkan tiap baris di tempatnya semula di halaman, mengganjal dengan spasi supaya kolom tetap lurus - tepat untuk tabel, cuplikan kode, atau formulir, dan keliru untuk prosa, karena ganjalannya berubah menjadi spasi bergerigi yang harus Anda bersihkan lagi. Kalau hasilnya terlihat aneh, biasanya modenyalah penyebabnya.
Menyambung kata terpenggal dikerjakan lebih hati-hati daripada cari-ganti biasa. Tanda hubung di ujung baris hanya disambung kalau huruf sebelumnya dan huruf pertama baris berikutnya sama-sama huruf kecil, jadi kata yang terpenggal sebagai antar- dan bangsa kembali menjadi antarbangsa, sementara kata majemuk berhubung seperti anak-anak, atau tanda hubung yang diikuti nama berhuruf besar, dibiarkan seperti aslinya. Aturannya condong membiarkan tanda hubung asli tetap ada ketimbang mengubah teks Anda.
Dokumen hasil pindai dikenali sebelum pekerjaan dimulai. Lima halaman pertama dicuplik untuk mencari lapisan teks, dan kalau tidak ada, alat ini berhenti lalu mengarahkan Anda ke OCR, sebab scan adalah foto dari kata-kata dan tidak ada apa pun di dalamnya yang bisa diambil. Melaporkan teks tidak ditemukan memang benar secara teknis, tapi tidak ada gunanya sama sekali.
Opsi pengodean terlihat sepele dan menyelamatkan satu sore yang sudah dikenal banyak orang. UTF-8 tanpa byte order mark adalah yang diinginkan skrip, repositori git, atau penyunting teks. UTF-8 dengan BOM adalah yang membuat Excel dan Notepad mengenali file-nya sebagai UTF-8, bukan menebak-nebak sandi lama dan mengacak setiap huruf beraksen. Kalau nama-nama keluar sebagai deretan simbol, BOM itulah yang kurang.
Pengambilan teks berjalan di Web Worker dan file teksnya ditulis di sana juga, jadi dokumen rahasia tidak pernah dikirim ke mana pun untuk dibaca isinya. Hasilnya melaporkan jumlah halaman, jumlah karakter dan kata, serta berapa halaman yang keluar kosong - sering kali itulah tanda tercepat bahwa sebagian dokumen berupa hasil pindai sementara sisanya tidak.
Yang tidak bisa dilakukan alat ini
- Kolom, kotak samping, kop, dan catatan kaki keluar dalam urutan yang diputuskan penyusunan ulang, yang tidak selalu sama dengan urutan baca manusia. Untuk halaman semacam itu, mode tata letak sering lebih jelas.
- Halaman hasil pindai tidak berisi teks yang bisa diambil. Itu dikenali dan dilaporkan dengan tautan ke OCR, bukan dengan menulis file kosong.
Pertanyaan yang sering diajukan
- Apa bedanya urutan baca dan tata letak?
- Urutan baca membangun ulang paragraf, menyambung baris-barisnya menjadi teks mengalir yang bisa Anda tempel ke mana saja. Tata letak menjaga bentuk halaman dengan mengganjal spasi, sehingga kolom, tabel, dan cuplikan kode tetap lurus di tampilan berhuruf seragam. Pakai urutan baca untuk prosa, dan tata letak ketika posisi mendatar teksnya justru membawa makna.
- Tidak ada apa pun yang keluar dari PDF saya. Kenapa?
- Hampir pasti karena file-nya hasil pindai. Halaman hasil pindai memuat foto dari kata-kata, bukan kata-kata, jadi tidak ada lapisan teks yang bisa diambil. Lima halaman pertama dicuplik sebelum pekerjaan dimulai, dan kalau tidak ada, alat ini berhenti lalu mengirim Anda ke OCR PDF, yang mengubah fotonya menjadi teks sungguhan untuk kemudian Anda ambil di sini.
- Teksnya keluar acak. Bisakah itu diperbaiki?
- Coba mode tata letak lebih dulu - hasil yang acak biasanya berarti halaman berkolom yang baris-barisnya tersambung melintasi kolom. Tata letak membiarkan tiap kolom di tempatnya, yang lebih mudah dibaca dan lebih mudah dirapikan. Sebagian dokumen juga menaruh kop, kaki, dan catatan pinggir dalam urutan yang tidak ada hubungannya dengan cara membacanya, dan tidak ada pengambil teks yang bisa menebaknya dengan andal.
- Huruf beraksen terlihat salah waktu file-nya saya buka. Sekarang bagaimana?
- Ganti pengodean ke UTF-8 dengan BOM lalu ubah sekali lagi. Byte order mark memberi tahu Excel dan Notepad bahwa file-nya UTF-8, alih-alih membiarkan keduanya menebak sandi lama, dan tebakan itulah yang mengubah satu huruf beraksen menjadi dua simbol. Biarkan di UTF-8 polos untuk skrip, penyunting teks, dan kontrol versi.
- Apakah dokumennya diunggah untuk diambil teksnya?
- Tidak. PDF-nya dibaca dan file teksnya ditulis di browser Anda, dan tidak ada apa pun dari dokumen itu yang dikirim pada tahap mana pun - hal yang patut diketahui ketika dokumennya berupa kontrak atau rekam medis. Anda bisa mengawasi tab jaringan di alat pengembang selama konversi untuk memastikannya: yang muncul di sana hanya pemeriksaan jatah harian, dengan nama alat dan sebuah hash.