PDF ke CSV
Tarik tabel di dalam PDF menjadi berkas berpemisah koma.
Alat ini berjalan sepenuhnya di browser Anda. Berkas Anda tidak pernah diunggah, dan Anda bisa membuktikannya sendiri di tab jaringan browser. Buktikan sendiri: buka tab jaringan di browser Anda dan perhatikan. Anda akan melihat satu permintaan kecil yang menanyakan sisa jatah - nama alat dan sebuah hash, bukan berkasnya.
Apa yang dilakukan alat ini
PDF sama sekali tidak tahu apa itu tabel. Di dalam berkasnya tidak ada sel dan tidak ada baris, hanya teks yang ditaruh pada koordinat yang kebetulan sejajar, jadi memulihkan sebuah tabel berarti menemukan kembali kolomnya. Alat ini mengelompokkan posisi mendatar tiap potongan teks, mencari deretan baris yang seluruh potongannya jatuh di pita yang sama, lalu menuliskan temuannya sebagai CSV. Karena ini penyimpulan dan bukan pembacaan, tiap tabel datang dengan nilai keyakinan, dan ambangnya Anda sendiri yang menentukan.
Kasus yang paling sering adalah angka yang kalau tidak begini harus diketik ulang: rekening koran yang hanya terbit sebagai PDF, baris-baris faktur yang harus dicocokkan, daftar harga dari pemasok, atau ekspor dari sistem yang cuma menyediakan PDF dan tidak ada yang lain.
Cara kerjanya
- Jatuhkan PDF ke halaman ini. Kalau berkasnya hasil pindai tanpa lapisan teks, Anda diarahkan ke OCR PDF alih-alih diberi lembar kerja kosong.
- Pilih pemisahnya. Koma adalah yang baku; titik koma yang diharapkan Excel di sebagian besar Eropa; tab paling enak untuk ditempel langsung ke lembar kerja.
- Atur ambang keyakinannya. Bawaannya 55 persen; turunkan untuk menjaring tabel yang sejajarnya longgar, naikkan kalau prosa biasa malah terbaca sebagai tabel.
- Tentukan satu berkas per tabel, atau satu berkas berisi semua tabel berurutan.
- Tekan Ambil tabel. Tiap keluaran menampilkan halaman asalnya dan nilai keyakinannya, jadi tabel yang meragukan sudah terlihat meragukan sebelum Anda memakainya.
Yang membedakan pendeteksi tabel yang bekerja dari yang tidak adalah perataan kanan. Kolom angka disusun rata kanan, jadi potongan teksnya berbagi posisi akhir, bukan posisi awal - dan pendeteksi yang hanya mengelompokkan tempat teks dimulai akan melewatkan setiap tabel keuangan, padahal itulah sebagian besar tabel yang orang ubah. Di sini kedua tepinya sama-sama dikelompokkan.
Apa pun yang nilai keyakinannya di bawah ambang tidak dikembalikan, dan itu penolakan yang disengaja, bukan kebolongan. Lembar kerja yang penuh potongan tidak sejajar tampak seperti hasil, dan itu justru lebih buruk daripada tidak ada hasil, karena akan ada orang yang memakainya.
Ambangnya benar-benar tombol yang berguna, bukan hiasan. Di 30 persen hampir semua deretan baris yang sejajar akan ditawarkan, yang berguna untuk tabel bertata huruf longgar yang Anda sendiri sudah tahu ada di situ. Di 90 persen hanya tabel berkolom bersih dan konsisten yang lolos, dan itulah yang Anda mau ketika mengubah seratus halaman tanpa ditunggui. Bawaan 55 adalah titik ketika tabel di laporan biasa ikut terjaring sementara paragrafnya tidak.
Pendeteksian dan penulisannya sama-sama berjalan di browser Anda. Angka di rekening koran termasuk isi dokumen yang paling sensitif, dan tidak satu pun angkanya dikirim: PDF-nya dibaca dan CSV-nya ditulis tanpa ada bagian dari keduanya yang menyentuh jaringan.
Yang tidak bisa dilakukan alat ini
- Garis tabel diabaikan. Kolom dicari dari tempat teksnya duduk, jadi tabel bergaris tebal yang teksnya tidak sejajar tetap terlewat, sementara tabel tanpa garis sama sekali terbaca mulus asal perataannya rapi.
- Sel gabungan diratakan. Sel yang membentang tiga kolom ditulis ke salah satunya saja dan sisanya dibiarkan kosong, karena CSV memang tidak punya cara menyatakan bahwa satu sel menutupi lebih dari satu kolom.
- Tabel di halaman hasil pindai tidak punya teks untuk dikelompokkan, jadi tidak ada yang ditemukan. Jalankan OCR PDF dulu untuk menambahkan lapisan teksnya, baru kembali ke sini.
Pertanyaan yang sering diajukan
- Bagaimana cara alat ini menemukan tabelnya?
- Lewat geometri. Sebuah tabel menampakkan diri sebagai deretan baris berurutan yang teksnya jatuh di pita tegak yang sama. Kedua tepi tiap potongan teks dikelompokkan, karena kolom angka rata kanan dan kalau tidak begitu ia tidak akan terlihat oleh pendeteksinya. Tiap calon tabel mendapat nilai keyakinan, dan apa pun yang di bawah ambang Anda dibuang, bukan dikira-kira.
- Ada tabel yang jelas-jelas kelihatan tapi tidak terjaring. Harus apa?
- Turunkan ambang keyakinannya - 40 persen sudah menjaring sebagian besar tabel longgar yang ditolak nilai bawaan. Kalau itu belum menolong, kemungkinan besar teks tabelnya memang tidak tersusun rapi menjadi kolom, yang lazim terjadi pada sel yang isinya melipat ke banyak baris. Dalam kasus itu PDF ke Teks setidaknya memberi Anda isinya untuk dirapikan sendiri.
- Pemisah mana yang sebaiknya saya pilih?
- Koma kalau berkasnya akan dibuka di mana pun selain Excel bersetelan Eropa. Titik koma kalau angka di setelan wilayah Anda memakai koma sebagai pemisah desimal, karena Excel lalu membaca berkas berpemisah titik koma dan mengacaukan yang berpemisah koma. Tab pilihan paling aman untuk ditempel langsung ke lembar kerja yang sudah terbuka.
- Bisakah tabel dari halaman hasil pindai dibaca?
- Tidak dengan alat ini saja. Halaman pindaian adalah gambar, jadi tidak ada posisi teks yang bisa dikelompokkan. Jalankan OCR PDF dulu dan tabelnya menjadi terdeteksi - meski ketelitian OCR pada angka tetap layak Anda periksa sel per sel sebelum angkanya dipercaya.
- Apakah berkasnya diunggah ke suatu tempat?
- Tidak. PDF-nya dibaca dan CSV-nya ditulis sepenuhnya di browser Anda, jadi rekening koran atau tabel gaji tidak pernah meninggalkan perangkat tempat Anda membukanya. Tidak ada akun yang wajib dibuat untuk memakainya, dan yang menyeberang ke jaringan hanyalah pemeriksaan jatah harian - nama alat dan sebuah hash.