OCR PDF
Tambahkan lapisan teks yang bisa dicari ke dokumen hasil pindai.
Alat ini berjalan sepenuhnya di browser Anda. Berkas Anda tidak pernah diunggah, dan Anda bisa membuktikannya sendiri di tab jaringan browser. Buktikan sendiri: buka tab jaringan di browser Anda dan perhatikan. Anda akan melihat satu permintaan kecil yang menanyakan sisa jatah - nama alat dan sebuah hash, bukan berkasnya.
Apa yang dilakukan alat ini
PDF hasil pindai sebenarnya hanya gambar dokumen, jadi pencarian tidak menemukan apa-apa dan kata yang Anda blok tidak menghasilkan apa-apa. Alat ini menggambar ulang tiap halaman, mengenali kata-kata di dalamnya, lalu menuliskannya kembali secara tak terlihat di atas gambar itu, sehingga tampilan halaman tetap sama tetapi kata-katanya kini benar-benar ada. Halaman yang dikenali dibangun ulang dari hasil penggambaran tadi: keluarannya abu-abu pada resolusi yang Anda pilih, dan tautan, isian formulir, maupun anotasi di halaman itu tidak ikut terbawa. Halaman yang sudah punya teks asli dibiarkan utuh, byte demi byte.
Pakai alat ini setiap kali dokumen datang berupa gambar, bukan tulisan: kontrak yang dipindai lalu dikirim lewat email, struk yang difoto dengan ponsel, laporan lima puluh halaman dari mesin fotokopi kantor, atau dokumen lama yang isinya perlu Anda kutip tanpa mengetik ulang satu per satu.
Cara kerjanya
- Jatuhkan hasil pindaian ke halaman ini. Selain PDF, gambar JPEG, PNG, WebP, dan TIFF juga diterima - gambar akan dijadikan PDF satu halaman lebih dulu.
- Pilih bahasanya. Inggris dan Indonesia sudah terpasang, dan mode gabungan mengenali keduanya sekaligus pada dokumen yang isinya bercampur.
- Biarkan modenya pada hanya halaman tanpa teks, kecuali Anda benar-benar yakin bahwa setiap halaman memang hasil pindaian.
- Atur resolusi bila perlu. 300 dpi pas untuk cetakan biasa; naikkan ke arah 400 untuk huruf yang sangat kecil, atau turunkan ke 150 untuk dokumen panjang di perangkat yang lambat.
- Tentukan apakah Anda ingin PDF yang bisa dicari, berkas teks biasa, atau keduanya, lalu tekan Jalankan OCR.
Pengenalan teks selalu ada harganya pada halaman yang disentuhnya, dan lebih baik Anda tahu sebelum daripada sesudah. Tiap halaman yang dikenali digambar ulang menjadi gambar abu-abu pada resolusi pilihan Anda, lalu halaman barunya adalah gambar itu dengan kata-kata tak terlihat di atasnya. Warna pada halaman tersebut hilang, dan tautan, isian formulir, serta anotasinya tidak dibawa serta. Halaman yang dilewati disalin apa adanya. Ukuran berkas biasanya membesar, kadang jauh membesar, karena gambar halaman 300 dpi lebih berat daripada hasil pindaian terkompresi yang digantikannya - karena itu Kompres PDF biasanya menjadi langkah kedua.
Kata harus mendarat di posisi yang tepat, sebab lapisan teks yang meleset justru lebih buruk daripada tidak ada lapisan teks sama sekali. Mesin pengenal mengembalikan kotak tiap kata dalam piksel gambar hasil render, dihitung menurun dari sisi atas, sedangkan halaman PDF menghitung menaik dari sisi bawah. Jadi setiap kotak diskalakan menurut rasio render lalu dibalik. Kata yang skornya di bawah 40 dari 100 sengaja tidak disertakan: kata keliru yang terlihat meyakinkan akan melempar pencarian ke halaman yang salah, sedangkan lubang kosong hanya membuat pencarian tidak menemukan apa pun.
Tidak ada yang diunggah, dan itu termasuk mesin pengenalnya sendiri. Secara bawaan tesseract.js mengambil inti WebAssembly dan data bahasanya dari CDN pihak ketiga, yang berarti menjalankan OCR di sini akan diam-diam menghubungi server orang lain pada detik pertama. Karena itu semuanya disajikan dari situs ini. Ongkosnya adalah satu kali unduhan di awal. Setelah itu pengenalannya berjalan tanpa menghubungi siapa pun selain pemeriksaan jatah kami, dan Anda dipersilakan memeriksanya sendiri di tab jaringan.
Resolusi menentukan dua hal sekaligus: seberapa akurat pembacaannya dan seberapa lama Anda menunggu. Di bawah kira-kira 200 dpi, kait huruf yang tipis dan cetakan kecil mulai terputus-putus dan akurasi turun cepat. Di atas 300 dpi, tambahan ketelitiannya kecil sementara waktu render dan ukuran keluaran terus naik. Angka 300 dipakai sebagai bawaan karena di sekitar situlah kurvanya mulai mendatar untuk teks isi yang biasa.
Yang tidak bisa dilakukan alat ini
- Tulisan tangan tidak dikenali. Mesinnya dilatih pada huruf cetak, dan halaman tulisan tangan kembali sebagai rangkaian karakter acak, bukan kata.
- Hanya model bahasa Inggris dan Indonesia yang terpasang, jadi dokumen dalam bahasa lain tidak bisa dibaca dengan benar di sini.
- Halaman yang dikenali dibangun ulang sebagai gambar abu-abu, sehingga warnanya hilang dan tautan, isian formulir, serta anotasinya tidak ikut terbawa.
- Keluarannya adalah hasil pembacaan mesin, bukan transkrip yang sudah dikoreksi. Pindaian pudar, huruf tidak lazim, tabel, dan kolom yang rapat sama-sama menghasilkan kesalahan.
Pertanyaan yang sering diajukan
- Seberapa akurat hasil pengenalannya?
- Pada pindaian 300 dpi yang bersih dari teks cetak, satu halaman biasanya kembali dengan segelintir kesalahan saja, dan hasilnya melaporkan skor keyakinan rata-rata sehingga Anda bisa melihat sendiri bagaimana mesin menilai pekerjaannya. Fotokopi yang pudar, halaman yang miring, kolom yang rapat, dan huruf hias sama-sama menurunkan angka itu. Kata yang skornya di bawah 40 dari 100 dibuang, bukan ditebak-tebak.
- Bahasa apa saja yang bisa dibaca?
- Inggris dan Indonesia, ditambah mode gabungan yang menangani keduanya dalam satu dokumen - berguna untuk kontrak yang dicetak berdampingan dengan terjemahannya. Model bahasa itulah yang membuat pengenalan teks bisa bekerja sama sekali, dan hanya dua model itu yang disertakan. Jadi dokumen dalam bahasa lain memang bukan pekerjaan yang bisa dilakukan alat ini dengan baik.
- Kenapa ada unduhan beberapa megabyte saat pertama kali dipakai?
- Itu mesin pengenal beserta data bahasanya, yang disajikan dari situs ini alih-alih dari CDN pihak ketiga, supaya menjalankan OCR tidak diam-diam menghubungi pihak lain. Inggris sekitar 11 MB, Indonesia sekitar 4 MB. Browser Anda menyimpannya di cache, jadi jalan kedua langsung dimulai tanpa mengunduh apa pun lagi, dan sejak itu satu-satunya yang diambil halaman ini adalah pemeriksaan jatah harian.
- Sebenarnya apa yang dilakukan mode hanya halaman tanpa teks?
- Mode ini memeriksa tiap halaman untuk mencari lapisan teks yang sudah ada, lalu hanya mengenali halaman yang belum punya. Kebanyakan dokumen pindaian berisi setidaknya satu halaman yang sebenarnya tidak dipindai, dan menjalankan OCR di atasnya berarti menukar teks yang akurat dengan kira-kira. Kalau seluruh dokumen ternyata sudah punya teks, alat ini mengatakannya terang-terangan alih-alih berjalan dan menghasilkan sesuatu yang lebih buruk daripada bahan awal Anda.
- Bisakah tulisan tangan dibaca?
- Tidak. Mesinnya dilatih pada huruf cetak, dan tulisan tangan kembali sebagai derau - huruf yang menyerupai bentuknya, bukan katanya. Tanda tangan, catatan di pinggir halaman, atau formulir yang diisi dengan pena tidak akan dikenali. Teks cetak di halaman yang sama tetap dikenali seperti biasa.
- Apakah hasil pindaian saya diunggah ke suatu tempat?
- Tidak. Penggambaran halaman berjalan di satu Web Worker di dalam browser Anda dan pengenalan teks di worker lain, bahkan inti WebAssembly dan data bahasanya pun diambil dari asal situs ini, bukan dari CDN. Buktikan langsung: buka tab jaringan lalu jalankan sebuah pindaian sampai selesai - yang lewat di sana hanya pemeriksaan jatah harian, dengan nama alat dan sebuah hash, tidak pernah halaman pindaian Anda.