• Python相对完美的URL拼接函数


     

    首先说下什么叫URL拼接,我们有这么一个HTML片段:

    做为一只辛苦的爬虫,我们要跟踪到这个click me指向的页面,假设这个片段来自:http://www.xxxdu.com,那么目标页面是什么呢?

    显然不是

    而是

    第一个结果看着很脑残,但是这就是Python的urljoin给出的结果,按理说urljoin应该解决这个“路径非正规化”(Normalize path )的问题,但是它没有:

    OK,其实这个问题的解决根本不再URL上,因为URL已经拼接了,更准确的描述这个问题应该是路径的正规化,即xxx.com后面的这部分路径,如果我们把它想象成Unix路径,不就是求相对论路径”/../../a.html”的绝对路径么?

    我们可以用查找、正则表达式把后面这部分分离出来,更省事的方法是urlparse:

    上述结果的第2部分, arr[2]就是我们要的path啦。

    然后Python提供了Unix路径的正规化函数posixpath.normpath

    最后我们把正规化好的path重新组装成url,于是整个函数出炉:

    输出结果:

  • 相关阅读:
    Quora的技术探索
    基于移动互联网的电子商务个性化推荐的一些思考
    想个法子找出性能差的SQL
    结束——2012年微软精英挑战赛
    sql 查询时间执行长的sql语句
    NET好书盘点
    最后两个编程题
    网络七层协议
    使用WCF创建Restful服务
    一步一步学Entity FrameWork 4
  • 原文地址:https://www.cnblogs.com/shijiaoyun/p/4863813.html
Copyright © 2020-2023  润新知