ผมมีไฟล์ pdf ที่คาดว่าทำจาก word ซึ่งเป็นภาษาไทยด้วยครับ จำนวน 50 กว่าหน้า ลองแปลงเป็น word ด้วยโปรแกรมต่างๆ ปรากฎว่าไม่ได้แฮะ เป้นภาษาอะไรไม่รู้ เลยอยากถามว่ามีใครเคยประสบความสำเร็จในการแปลงภาษาไทยมั่งครับ แล้วทำยังไง หรือใช้โปรแกรมอะไรครับ
ปล. Ms word ผมยังเป็น word XP อยู่เลย ไม่ทราบว่าเกี่ยวกันมั้ยครับ
ป๋าแปลงด้วยวิธีไหนอะครับ
ถ้ายังไง ลองลากมาวางที่ word แทนน่าจะพอถูไถนะครับ :42:
(http://img2.f0nt.com/15/f510151060efe4bcf2960caeeffd8b3a.jpg)
ลองแล้วจ้า ทั้งลากวาง ทั้งใช้โปรแกรมแปลง จะได้ประมาณเนี้ย
:42:\ ไม่เคยทำได้เลยครับ
ลองใช้แบบนี้ดูครับ Copy ข้อความ จาก .pdf แล้วไป เอาข้อความไปวางใส่ไว้ Notepad แล้วค่อยเอา ข้อความจาก Notepad ไปใส่ใน word แล้วก็จัดหน้า เอาเองครับ
ลองดูครับ ผมก็ใช้วิธีนี้ ได้ผลครับ
(http://img2.f0nt.com/15/79f01eb3e90fd5518ff674104b0da53e.jpg)
ขอโทษทีนะครับ ถ้าไม่เป็นการรบกวนช่วยทดสอบไฟล์นี้หน่อยนะครับ
http://www.exa-studio.com/upload2/5.pdf
ไม่ได้เลยครับ แปลก มันก็ตัวอักษรไทยอยู่นะ
แปลกแฮะ ..เพิ่งเจอกรณีนี้กรณีแรกเหมือนกัน :06:
แต่ตรงอักษรภาษาอังกฤษ ไม่มีปัญหานะ มีแต่ตรงตัวอักษรไทยที่มีปัญหา อืมมมมมมมมมมมมมมม
1) PDC (Personal Digital Cellular) 45))*3)4 i4$j 02
%, 1,429 MHz ,! 1,453 MHz
งงงวย :18:
จนปัญญาละ เล่นใช้ GhostScript
ซึ่งมัน "PostScript to PDF conversion"
:08: เละ
(http://img2.f0nt.com/15/a26b0bcfbdd279b2145de116ed7925d9.jpg)
eng นี่พอได้ครับ
แต่ไทยนี่ เอ๋อๆ
ที่ไม่ได้ก็เพราะว่ามันถกเข้ารหัสเอาไว้ครับ พูดง่ายๆก็คือคนที่เขาทำไฟล์เขาไม่ต้องการให้เอกสารนี้ถูกก็อปปี้(ง่ายๆ) จึงเซ็ตการเข้ารหัสฟอนต์ในฟล์เอาไว้
ซึ่งปัญหาคือเราไม่รู้ว่าเจ้ของไฟล์ดั้งเดิมเขาใช้โปรแกรมอะไรเข้ารหัสไว้ เพราะแต่ละโปรแกรมก็จะมีการเข้ารหสด้วยสมการทางคณิตศาสตร์หรืออัลกอริทึ่มที่ต่างกันออกไป :39:
อ้างคำพูดจาก: auytoday เมื่อ 15 ธ.ค. 2006, 13:40 น.
จนปัญญาละ เล่นใช้ GhostScript
ซึ่งมัน "PostScript to PDF conversion"
ผมไปโหลดมาลองเล่น นึกว่าจะเหมือนกับ แปลง pdf ทั่วไป เปิดโปรแกรมมา โอ้วพระเจ้า มันใช้ยังไงเนี่ย
update คาดว่า เขาใช้โปรแกรม PDFCreator ที่มี Ghostscript ครับ สุดยอดจริงๆ ผมลองทำ .pdf แล้ว Copy ข้อความ เป็นเหมือนกันเลยครับ โดนเข้ารหัสไว้
Word 2007 จะทำได้ไหมครับ
ผมว่าจะแก้ให้เป็นข้อความได้จริง ๆ ก็น่าจะต้องใช้เทคโนโลยี OCR น่ะครับ (Optical character recognition = การรู้จำตัวอักษร) แต่ว่าภาษาไทยยังไม่เคยเห็นเหมือนกันครับ
รู้จักคนที่ทำโครงงานเรื่องทำ OCR ภาษาไทยด้วยน่ะครับ แล้วถ้าใช้งานได้จะนำมาบอกกล่าวอีกทีนึงครับ
ที่ใช้ image processing แล้วแกะมาเป็น text นะเหรอครับ :17:
อ้างคำพูดจาก: ^-FakE-^ เมื่อ 22 ธ.ค. 2006, 19:09 น.
ที่ใช้ image processing แล้วแกะมาเป็น text นะเหรอครับ :17:
ใช่ครับ ที่มีในไทยตอนนี้ ก็ nectec กำลังพัฒนาอยู่น่ะครับ
http://arnthai.nectec.or.th/arnthai_thai.htm
แต่ยังไม่สมบูรณ์เท่าไหร่น่ะครับ
:25: รอมานาน พัฒนาเป็นรูปเป็นร่างแล้วหรือนี้
มหาลัยอะไรพัฒนาครับ :12:
รู้จักคนที่ทำอยู่เป็น รุ่นน้อง ม.6 น่ะครับ โครงงานของโครงการ NSC (National Software Contest) ของ NECTEC
มหาลัยอะไรที่พัฒนานั้น ไม่ทราบเหมือนกันครับ