• awk 正则匹配指定字段次数统计


    1. 文本数据 

    head 12315_industry_business.csv
    name,business,label,label_name
    沧州光松房屋拆迁有限公司,旧房拆迁、改造;物业服务(依法须经批准的项目,经相关部门批准后方可开展经营活动),E4,建筑装饰和其他建筑业
    上海托帕化工材料有限公司,"从事化工材料领域内的技术开发、技术转让、技术咨询、技术服务、化工原材料及产品(除危险化学品、监控化学品、烟花爆竹、易制毒化学品、民用爆炸物品)、机械设备、电子产品、橡塑制品、机电设备、五金建材、日用百货的销售,从事货物及技术的进出口业务。
    【依法须经批准的项目,经相关部门批准后方可开展经营活动】",F2,零售业
    上海利昂节能灯具有限公司,节能灯管,节能灯配件,电子镇流器,灯具,电子产品,生产,加工,C26,电气机械和器材制造业
    裕福支付有限公司海南分公司,"企业管理咨询,计算机数据处理,应用软件技术服务,会议服务,经济信息咨询",L2,商务服务业
    龙川县联生农贸市场管理中心,自建农贸市场管理服务,L2,商务服务业
    安徽国茂机电设备有限公司,"风工业设备、水工业设备、机械式停车设备、环保设备、暖通空调设备、消防排烟风机、防火排烟阀门(防火阀、排烟防火阀、排烟阀)、消防设备、人防设备、电力设备、厨房设备、净化设备、化工设备、特种设备及交通(公共)设施标识、农业机械、工程机械、起重机械、通用机械及新能源、电子产品、计算机软(硬)件产品的开发、设计、制造、安装、维修和销售及机电成套系统工程控制应用的设计、施工、维修和安装;车用零部件的开发、生产和销售;日用百货、五金交电、钢材、建材、化工产品、保温制品销售;物流、仓储服务(危险品除外);废旧物资收购、销售(依法须经批准的项目,经相关部门批准后方可开展经营活动)",C23,专用设备制造业
    如皋市中萃米业有限公司南门桥店,"预包装食品批发与零售(依法须经批准的项目,经相关部门批准后方可开展经营活动)",F1,批发业
    新疆金沙漠能源有限公司策勒县分公司,"新能源技术开发及推广服务,能源业投资;销售机械设备,石油制品,化工产品,机电产品,仪器仪表,汽车配件,电子产品;商务信息咨询,电子过磅、停车场服务、货物与运输代理服务;销售壁挂炉、家用电器、煤炭、润滑油、防冻液、采油",F2,零售业

    2. 结合cat, awk , sort, uniq 等小命令

    cat 12315_industry_business.csv | awk -F ',' '{if(NF>2 && $(NF-1)~/^[A-Z][0-9]/) {print $(NF-1)}}' | sort | uniq -c | sort -n -r > 12315_label_distribution.txt

    瑞士军刀,小巧精焊!

  • 相关阅读:
    STC项目风险分析
    “四则运算练习器”的开发心得与优化方案
    针对“订餐系统”的分析、改进建议与阅读心得
    记一次leetcode翻车之路---给自己做个记录
    数据库基础(一)MYSQL
    面试题第1发---记20年某次面试
    go之“hello word”
    利用python简单实现unittest
    web自动化(python)——selenium工具基本使用
    2015最强java开源oa源码
  • 原文地址:https://www.cnblogs.com/jkmiao/p/7246362.html
Copyright © 2020-2023  润新知