博客
关于我
从人工到机器智能,盗版监测在 AI 时代如何破局?
阅读量:124 次
发布时间:2019-02-26

本文共 1740 字,大约阅读时间需要 5 分钟。

简介: 随着 5G 时代来临,新媒体行业快速发展,盗版传播平台多样化、形式多样化,版权方难 以通过有限的人力实现最大限度的维权。根据 MUSO 报告显示 2017 年盗版网站访问量达到 3000 亿次。人工智能逐渐成熟,盗版监测覆盖难、查找难的问题将迎刃而解。那么如何运行将人工智能技术运用到盗版监测中?

作者| 阿里文娱高级开发工程师 千起

一、背景

随着 5G 时代来临,新媒体行业快速发展,盗版传播平台多样化、形式多样化,版权方难 以通过有限的人力实现最大限度的维权。根据 MUSO 报告显示 2017 年盗版网站访问量达到 3000 亿次。人工智能逐渐成熟,盗版监测覆盖难、查找难的问题将迎刃而解。

那么如何运行将人工智能技术运用到盗版监测中?我们先从一个例子开始:下面是一个普 通用户查找盗版资源的过程:

image.png

上面的例子中有两个操作:搜索查找 + 结果筛选。其中“结果筛选”是用户阅读搜索结果, 并确认当前结果是否包含盗版内容。这一过程在人工智能领域叫识别,因为用户阅读的是文字, 所以我们叫它:自然语言识别。

普通用户可以很容易的判断出“哪些搜索结果包含盗版内容?”,那么机器是怎样模拟阅搜 索结果呢?下面我们分析 3 个典型的盗版搜索例子。

二、盗版搜索结果分析

1. 用户搜索盗版影片示例

image.png

2.“判断难点”分析

1)归类“判断难点” 名称近似类:系列类影片、名称包含类影片;

(1)主题不相关类:结果是资讯、新闻、彩票、广告等等信息;
(2)同名影片类:相同影片的歌曲、游戏、戏剧、通用名词等有歧义的信息;
(3)变换类:影片名称缩写、人工故意添加的干扰信息。

image.png

1)自然语言识别中怎样处理这几种情况?

(1)名称近似类:
答:回想一下人是怎样处理的?如果一个人是它知道所有影片信息,那么他就知道两个影片是不一样的。这类问题在自然语言中属于知识图谱(Knowledge Graph,简写:KG)的范畴。
(2)主题不相关类:结果是资讯、新闻、彩票、广告等等信息;
答:普通人因为有一些背景知识,是知道哪些是属于新闻类,哪些属于广告类。由于这些分类是有限的,所以自然语言中通常使用文本分类(Text classification)。常见的文本分类有二分类和多分类(输出大于 2 种分类结果)。
(3)同名影片类:相同影片的歌曲、游戏、戏剧、通用名词等有歧义的信息;
答:识别同名需要有两步。第一步提取句子中的影片实体名称,第二步辨别句子描述的是哪个领域的影片。这里需要自然语言领域中的 实体识别 (Named-entity recognition,简写:NER)+文本分类。通俗讲,实体识别是找中句子中的影片,而文本分类是区分这个句子说的是哪个领 域的影片。
(4)变换类: 影片名称缩写、人工故意添加的干扰信息。
答:这类问题和问题 1)一样,这类问题在自然语言中属于知识图谱(Knowledge Graph, 简写:KG)的范畴。模型需要背景知识,知道影片有哪些缩写。

三、自然语言识别如何识别盗版呢?

在自然语言处理领域通过有三部分。分别为:文本预处理、特征计算、模型训练/预测。

文本预处理:清洗样本,并将文本格式、符号转化为统一的形式;
特征计算: 将文本转化为数字。这一步可以使用特征工程,或者 词袋(oneHot)、文 本嵌入(word embedding)模型、深度 Transformer 模型。
模型训练/预测:选择合适的模型算法,训练模型。模型方面可以使用决策树类型(例如: XGBoost、LightGBM、Deep Forest 等等),也可以使用深度网络(例如:LSTM、BERT、 Transformer-XL 等等)。当然也可以使用多个模型(一个模型的输出,作为一个模型的输入)

image.png

那么模型是什么样子的?

image.png

下面是从样本输入到模型产出,落地一个模型需要做的步骤:

image.png

四、总结

这篇文章中提到的方法已经落地到实际工程中,准确率可以达到超越人工盗版结果判断水 平。目前自然语言仍然有非常强的业务领域特点,不同业务领域会遇到不同的行业特定问题, 而且前沿的模型提供原生的英文支持,所以在工程落地场景中,需要结合实际业务场景不断的 优化模型。

转载地址:http://ktwy.baihongyu.com/

你可能感兴趣的文章
NIFI从MySql中增量同步数据_通过Mysql的binlog功能_实时同步mysql数据_根据binlog实现数据实时delete同步_实际操作04---大数据之Nifi工作笔记0043
查看>>
NIFI从MySql中增量同步数据_通过Mysql的binlog功能_实时同步mysql数据_配置binlog_使用处理器抓取binlog数据_实际操作01---大数据之Nifi工作笔记0040
查看>>
NIFI从MySql中增量同步数据_通过Mysql的binlog功能_实时同步mysql数据_配置数据路由_实现数据插入数据到目标数据库_实际操作03---大数据之Nifi工作笔记0042
查看>>
NIFI从MySql中增量同步数据_通过Mysql的binlog功能_实时同步mysql数据_配置数据路由_生成插入Sql语句_实际操作02---大数据之Nifi工作笔记0041
查看>>
NIFI从MySql中离线读取数据再导入到MySql中_03_来吧用NIFI实现_数据分页获取功能---大数据之Nifi工作笔记0038
查看>>
NIFI从MySql中离线读取数据再导入到MySql中_无分页功能_02_转换数据_分割数据_提取JSON数据_替换拼接SQL_添加分页---大数据之Nifi工作笔记0037
查看>>
NIFI从PostGresql中离线读取数据再导入到MySql中_带有数据分页获取功能_不带分页不能用_NIFI资料太少了---大数据之Nifi工作笔记0039
查看>>
nifi使用过程-常见问题-以及入门总结---大数据之Nifi工作笔记0012
查看>>
NIFI分页获取Mysql数据_导入到Hbase中_并可通过phoenix客户端查询_含金量很高的一篇_搞了好久_实际操作05---大数据之Nifi工作笔记0045
查看>>
NIFI同步MySql数据_到SqlServer_错误_驱动程序无法通过使用安全套接字层(SSL)加密与SQL Server_Navicat连接SqlServer---大数据之Nifi工作笔记0047
查看>>
Nifi同步过程中报错create_time字段找不到_实际目标表和源表中没有这个字段---大数据之Nifi工作笔记0066
查看>>
NIFI大数据进阶_FlowFile拓扑_对FlowFile内容和属性的修改删除添加_介绍和描述_以及实际操作---大数据之Nifi工作笔记0023
查看>>
NIFI大数据进阶_Json内容转换为Hive支持的文本格式_操作方法说明_01_EvaluteJsonPath处理器---大数据之Nifi工作笔记0031
查看>>
NIFI大数据进阶_Kafka使用相关说明_实际操作Kafka消费者处理器_来消费kafka数据---大数据之Nifi工作笔记0037
查看>>
NIFI大数据进阶_Kafka使用相关说明_实际操作Kafka生产者---大数据之Nifi工作笔记0036
查看>>
NIFI大数据进阶_NIFI的模板和组的使用-介绍和实际操作_创建组_嵌套组_模板创建下载_导入---大数据之Nifi工作笔记0022
查看>>
NIFI大数据进阶_NIFI监控功能实际操作_Summary查看系统和处理器运行情况_viewDataProvenance查看_---大数据之Nifi工作笔记0026
查看>>
NIFI大数据进阶_NIFI监控的强大功能介绍_处理器面板_进程组面板_summary监控_data_provenance事件源---大数据之Nifi工作笔记0025
查看>>
NIFI大数据进阶_NIFI集群知识点_认识NIFI集群以及集群的组成部分---大数据之Nifi工作笔记0014
查看>>
NIFI大数据进阶_NIFI集群知识点_集群的断开_重连_退役_卸载_总结---大数据之Nifi工作笔记0018
查看>>