Apache-Tika解析Excell文档

通常在使用爬虫时，爬取到网上的文章都是各式各样的格式处理起来比较麻烦，这里我们使用Apache-Tika来处理Excell格式的文章，如下：

package com.mengyao.tika.app;

import java.io.File;
import java.io.FileInputStream;

import org.apache.tika.metadata.Metadata;
import org.apache.tika.parser.ParseContext;
import org.apache.tika.parser.microsoft.ooxml.OOXMLParser;
import org.apache.tika.sax.BodyContentHandler;

public class ExcellApp {

    public static void main(final String[] args) throws Exception {

        // Tika默认是10*1024*1024，这里防止文件过大导致Tika报错
        BodyContentHandler handler = new BodyContentHandler(1024 * 1024 * 10);
        Metadata metadata = new Metadata();
        FileInputStream inputstream = new FileInputStream(new File("D:/报价清单.xlsx"));
        ParseContext pcontext = new ParseContext();

        // 解析Excell文档时应由超类AbstractParser的派生类OOXMLParser实现
        OOXMLParser msofficeparser = new OOXMLParser();
        msofficeparser.parse(inputstream, handler, metadata, pcontext);
        // 获取Excell文档的内容
        System.out.println("Excell文档内容:" + handler.toString());

        // 获取Excell文档的元数据
        System.out.println("Excell文档元数据:");
        String[] metadataNames = metadata.names();

        for (String name : metadataNames) {
            System.out.println(name + " : " + metadata.get(name));
        }
    }

}

相关阅读:
java的sha1加密，转化为python版本
VUE:页面跳转时传递参数，及参数获取
如何使用 Django中的 get_queryset, get_context_data和 get_object 等方法
django orm 外键id返回对应的名称
spring boot(一)：入门篇
redis学习（四）——Hash数据类型
redis学习（三）——List数据类型
redis学习（二）——String数据类型
Java多线程（七）——线程休眠
MySQL和B树的那些事

原文地址：https://www.cnblogs.com/mengyao/p/4975616.html