PDF ke Markdown
Ubah PDF menjadi Markdown, lengkap dengan judul, daftar, dan tabel.
Alat ini berjalan sepenuhnya di browser Anda. Berkas Anda tidak pernah diunggah, dan Anda bisa membuktikannya sendiri di tab jaringan browser. Buktikan sendiri: buka tab jaringan di browser Anda dan perhatikan. Anda akan melihat satu permintaan kecil yang menanyakan sisa jatah - nama alat dan sebuah hash, bukan berkasnya.
Apa yang dilakukan alat ini
Alat ini membaca teks di dalam PDF lalu menuliskannya kembali sebagai Markdown: menentukan baris mana yang judul, di mana sebuah paragraf mulai dan berakhir, serta blok mana yang sebenarnya daftar atau tabel. PDF sendiri tidak menyimpan satu pun keterangan itu - yang ada hanya karakter pada titik koordinat - jadi strukturnya disimpulkan dari geometri, kecuali kalau dokumennya punya daftar bookmark, yang dipakai lebih dulu karena daftar itu adalah keterangan penulisnya sendiri tentang struktur dokumennya. Hasilnya satu berkas .md yang mengalir mengikuti lebar layar; ia tidak menirukan penomoran halaman maupun tata letak aslinya.
Pakai ketika sebuah dokumen harus kembali menjadi teks yang bisa disunting: laporan yang akan dipindahkan ke wiki, dokumentasi yang telanjur beredar sebagai PDF dan sekarang perlu hidup di repositori bersama kodenya, atau catatan yang lebih enak dicari dan ditulis ulang daripada digulir terus-menerus.
Cara kerjanya
- Jatuhkan PDF ke halaman ini. Lima halaman pertama diperiksa dulu apakah punya lapisan teks, supaya hasil pindaian ketahuan sebelum Anda telanjur mengunduh berkas kosong.
- Biarkan Pakai daftar bookmark tetap menyala kalau dokumennya memang punya. Daftar bookmark yang sungguhan lebih bisa dipercaya daripada tebakan apa pun dari ukuran huruf.
- Tentukan apa lagi yang perlu dikenali: judul di bagian yang tidak tercakup bookmark, daftar, dan tabel yang ditulis sebagai tabel pipa Markdown.
- Di opsi lanjutan, tambahkan blok front matter kalau berkasnya akan masuk ke pembangkit situs statis, dan isi rentang halaman kalau Anda hanya butuh sebagian dokumen.
- Tekan Ubah ke Markdown. Berkas .md-nya terunduh sendiri.
Sebuah baris baru dianggap judul kalau hurufnya lebih besar daripada teks isi di sekitarnya, barisnya pendek, dan sesudahnya adalah prosa - tiga syarat sekaligus, bukan satu, karena masing-masing kalau berdiri sendiri akan ikut menaikkan kepala halaman berjalan dan keterangan gambar menjadi judul. Bookmark mengalahkan semuanya, dan itulah sebabnya dokumen yang punya daftar isi rapi terasa jauh lebih bersih hasil konversinya daripada dokumen yang tidak punya.
Paragraf dirangkai ulang dengan menanyakan kenapa tiap baris berakhir. Baris yang mentok sampai tepi kanan kolomnya dipenggal oleh penata huruf, jadi baris sesudahnya disambung ke situ; baris yang berhenti lebih awal memang sengaja diakhiri, jadi paragraf baru dimulai. Tanda hubung di ujung baris disambung kembali hanya kalau lanjutannya diawali huruf kecil, dan aturan kecil itulah yang mencegah Coca- dan Cola dilebur menjadi satu kata yang sebenarnya tidak pernah ada di dokumen.
Tabel adalah bagian paling tidak pasti dari konversi ini. Batas kolom dicari dengan mengelompokkan posisi mendatar tiap potongan teks, sehingga tabel yang memang tabel keluar rapi, sementara halaman bertata letak dua kolom sesekali bisa terbaca sebagai satu tabel. Kalau angkanya memang akan masuk ke lembar kerja, PDF ke CSV rute yang lebih tepat.
Ekstraksinya berjalan lewat PDF.js di Web Worker di dalam browser Anda. Yang akan diunggah oleh alat sejenis adalah teks dokumennya, dan justru teks itulah bagian yang biasanya rahasia. Tidak ada yang dikirim ke mana pun, dan begitu halaman ini terbuka sekali, konversinya tetap bekerja meski jaringan dimatikan.
Yang tidak bisa dilakukan alat ini
- Gambar tidak ikut diambil. Keluarannya hanya teks dan struktur; kalau yang Anda inginkan halamannya sebagai gambar, PDF ke JPG alat yang tepat.
- Tata letak tidak dipertahankan. Kolom, kotak teks, dan penempatan mutlak runtuh menjadi satu urutan baca - memang begitulah maksud Markdown, dan itu juga yang membuat hasilnya bisa mengalir mengikuti layar.
Pertanyaan yang sering diajukan
- Bagaimana alat ini memutuskan sesuatu itu judul?
- Kalau PDF-nya punya daftar bookmark, bookmark itulah yang menjadi judul dan kedalamannya menjadi tingkat judul, jadi tidak ada yang ditebak. Kalau daftarnya tidak ada, sebuah baris baru dinaikkan menjadi judul ketika hurufnya lebih besar daripada teks isi di sekelilingnya, barisnya pendek, dan sesudahnya prosa biasa. Kedua sumber itu punya sakelarnya masing-masing, jadi Anda bisa mematikan salah satunya.
- Apakah tabel saya ikut diubah?
- Ya, menjadi tabel pipa Markdown, selama pendeteksinya cukup yakin dengan kolom yang ditemukannya. Posisi dikelompokkan dari kedua tepi teks, jadi kolom angka yang rata kanan ikut terbaca, bukan hanya kolom yang rata kiri. Kalau angkanya memang akan diolah di lembar kerja, PDF ke CSV memberi hasil yang lebih siap pakai.
- Gambar di dokumen saya jadi bagaimana?
- Gambarnya ditinggalkan. Markdown hanya merujuk gambar, tidak memuatnya, jadi membawa gambar itu berarti menulis satu folder berkas di samping berkas .md-nya. Konversi ini memilih menghasilkan satu berkas teks yang utuh berdiri sendiri.
- PDF saya hasil pindai dan tidak ada apa pun yang keluar. Kenapa?
- Halaman hasil pindai itu foto dari teks: tidak ada karakter yang bisa dibaca pengubahnya. Karena itu alat ini berhenti sambil menjelaskan alasannya, bukan menuliskan dokumen kosong yang terlihat seperti hasil. Jalankan OCR PDF dulu untuk menambahkan lapisan teks, baru ubah ke Markdown.
- Apakah dokumen saya diunggah untuk diubah?
- Tidak. Teksnya diambil di browser Anda dan Markdown-nya ditulis di sana juga, tanpa satu byte pun dokumen yang keluar. Ini bisa Anda periksa sendiri alih-alih dipercaya begitu saja: buka tab jaringan di alat pengembang browser sambil menjalankan konversi, dan yang tampil hanyalah pemeriksaan jatah harian - nama alat dan sebuah hash.