某芯片制造企业敏感文件自动识别

芯片制造
📄

项目背景

该企业为世界领先的集成电路芯片代工企业,也是中国内地规模最大、技术最先进的芯片制造企业。面对上百套业务系统产生的千万计非结构化文本及图纸文件,企业亟需建立有效的敏感文件管理和分类分级标识体系。

⚠

面临挑战

1
上百套业务系统,产生千万计非结构化文本及图纸文件,数据规模庞大
2
缺乏有效管理和分类分级标识,非结构化数据难以被系统化识别和保护
⚙

解决方案

小样本学习与深度学习模型

利用有标签/无标签数据初始化微调深度学习模型,实现对长文本的高精度预测分析,在小样本条件下依然保持优秀的识别能力。

FastText模型迁移学习

采用FastText模型迁移学习构建自学习特征,有效杜绝传统规则和深度学习的单一性,提升模型泛化能力和识别准确率。

自适应智能实体识别分类系统

结合有监督和无监督学习,构建自适应智能实体识别分类核心系统,实现从聚类到人工标注、深度学习到知识库的迭代循环训练更新。

聚类
→
人工标注
→
深度学习
→
知识库迭代
↻
🏆

项目成果

93.4%
人力资源部门文件测试中,人员/组织/地点等信息识别率
📚 新类别
发现教育、职位、专业、教育背景等新类别
🔄 自适应
自适应迭代训练更新,持续提升识别能力