• pdf转txt


    ubuntu pdf转jpg或txt

    chenlei posted @ 2009年12月30日 17:22 inLinux , 1818 阅读

    呵呵,刚刚在网上定购了一款mp5,后来才发现它不支持PDF!

    没办法,只好查一下转换的方法,呵呵,

    (1)PDF转JPG:

    安装一个软件ImageMagick:

    # sudo apt-get install imageMagick

    然后就可以转换了,yes!!

    # convert XXX.pdf XXX.jpg

    这样XXX.pdf 就转换成了一大堆的XXX-*.jpg,一页一张JPG。

    如果想清晰些(实验中):

    # convert -verbose -colorspace RGB -resize 1800 -interlace none -density 300 -quality 100 XXX.pdf XXX.jpg

    (2)PDF转txt:

    我们要用poppler来做,它是系统自带的,

    呵呵,先加一个中文支持:

    # sudo apt-get install poppler-data

    嘻嘻,转换啦!!

    # pdftotext -layout -nopgbrk XXX.pdf

    因为pdftotext不支持同时处理多个 pdf,所以用批处理要脚本搞定,打开终端,进入放置 pdf 的目录,运行下面命令

    find ./ -name '*.pdf' | while read i; do pdftotext -layout -nopgbrk $i; done

    很快就在当前目录下输出很多 txt 文件,“-layout”参数表示保留页面布局,“-nopgbrk”表示不输出换行符,自己对比一下就知道区别了。

    doc docx to txt

    abiword --to=txt example.doc

  • 相关阅读:
    Linux Shell tr 命令详解
    Shell统计每个单词出现的个数
    启明4-29团队进度博客
    启明4-28团队进度博客
    启明4-27团队进度博客
    启明4-26团队进度博客
    启明4-25团队进度博客
    启明4-24团队博客
    每日总结8
    启明4-23团队进度博客
  • 原文地址:https://www.cnblogs.com/smallcoderhujin/p/3412697.html
Copyright © 2020-2023  润新知