用AI追热点,自动化编辑新闻,路透社已经这么做了 | 附论文
2017-12-03 00:00
621 查看
李杉 编译自 MIT技术评论
量子位 出品 | 公众号 QbitAI
“互联网的出现和随后的信息爆炸导致记者越来越难以准确、迅速地获取新闻。”路透社的研发团队本周在arXiv的一篇论文的开场白中如此写道。
对于路透社来说,假新闻的出现导致这个问题变得更加尖锐,因为这些假新闻扭曲了人们对事件的感知。
然而,美联社等新闻机构已经开始使用自动化的新闻写作服务。他们会采用标准的模式,例如,在报道财经新闻和体育比赛结果时,直接将数据粘贴到预先编写的模板中:“X公司第三季度实现利润Y万美元,超出华尔街预期……”
因此,其他新闻机构也面临压力,必须启用自动化新闻制作技术。今天,路透社阐述了它是如何在时间发生后第一时间完全通过自动化技术识别突发新闻的。
刘小沫(XIaomo Liu,音译)他的在路透社研发部门及阿里巴巴的同事表示,这套新系统运行良好。事实上,它有可能彻底改变新闻行业。但这也引发了人们的担忧,他们担心这样一套系统可能被心怀恶意的人控制。
这个新系统被称为路透社追踪器(Reuters Tracer)。它使用Twitter作为一种全球传感器,记录新闻事件的发生。系统之后使用各种类型的数据挖掘和机器学习来挑选出最相关的事件,确定它们的主题,排列它们的优先级,写出标题和摘要。之后,这些新闻就会发布在该公司的全球新闻专线上。
流程的第一步是吸收Twitter的数据流。追踪器每天查看大约1200万条推文,占总数的2%。其中一半是随机抽样,另外一半来自路透社记者的Twitter帐号列表,包括其他新闻机构的帐号、重要的公司、有影响力的个人等。
下一步是确定新闻事件发生的时间。追踪器这样做的前提假设是:如果几个人同时开始谈论这件事,这个事件就已经发生。因此它使用聚类算法来寻找这些对话。
当然,这些聚类包括垃圾信息、广告、普通聊天等。只有一部分涉及有新闻价值的事件。所以下一个步是对事件进行分类和排序。追踪器使用许多算法来完成这项工作。
第一个算法负责确定对话主题。之后将此与路透社团队从31个官方新闻帐号收集的推文进行对比,包括@CNN、@BBCBreaking和@nytimes,以及@BreakingNews等新闻聚合器。
在这个阶段,这套算法还会使用一个包含城市和地理位置的关键词数据库来判断事件发生的地点。
一旦一段谈话或谣言被认为可能是新闻,关键就是要确认它的真实性。为了确定这一点,追踪器需要找出对话中提到的最早的推文和它所指向的网站,以此来寻找来源。然后,它会查询了一个数据库,其中列出了已知的虚假新闻制作者,如《National Report》,或者讽刺新闻网站《The Onion》
最后,该系统会写出标题和摘要,并在整个路透社中分发新闻。
路透社的团队表示,在试验过程中,该系统运行良好。他们说:“追踪器能够在新闻探测和传播上实现有竞争力的准确度和时效性。”
他们有统计数据来支持这一点。该系统每天处理1200万条推文,大约80%的都是噪音。剩下的大约会归入6000个聚类,系统将其视作不同类型的新闻事件。这都是由13个运行10个不同算法的服务器完成的。
相比之下,路透社在世界各地雇佣了大约2500名新闻记者,他们每天都使用包括Twitter在内的各种来源制作大约3000条新闻提示。其中大约有250条是新闻故事。
路透社将追踪器识别的新闻与BBC和CNN等机构新闻的信息流中出现的新闻进行对比。刘小沫和他的同事说:“结果显示,追踪器可以用2%的Twitter数据覆盖70%的新闻报道。”
这套系统的运行速度很快。该团队举了一个例子:2017年10月,拉斯维加斯枪击案导致58人死亡。有目击者在凌晨1点22分报告了这一事件,触发了一个追踪器聚类。
然而,这个聚类不符合系统给事件制定的标准,因而直到凌晨1点39分才被包含到信息流中。“路透社在凌晨1点49分报道了此事。”刘小沫和他的同事说。
这是一项有趣的工作,但也引发了许多问题,特别是关于系统的易用性。不难想象,心怀不轨的人会设计专门的Twitter消息来欺骗追踪器。
不过,这套系统是否比现有的系统更容易欺骗,恐怕还很难判断。毕竟,人类记者也经常被各种假消息欺骗。
此外,人类在新闻行业仍要扮演自己的角色。未来的新闻肯定会越来越自动化,人类如何融入其中仍然无法确定。
论文地址:
https://arxiv.org/abs/1711.04068
— 完 —
活动报名
加入社群
量子位AI社群11群开始招募啦,欢迎对AI感兴趣的同学,加小助手微信qbitbot4入群;
此外,量子位专业细分群(自动驾驶、CV、NLP、机器学习等)正在招募,面向正在从事相关领域的工程师及研究人员。
进群请加小助手微信号qbitbot4,并务必备注相应群的关键词~通过审核后我们将邀请进群。(专业群审核较严,敬请谅解)
诚挚招聘
量子位正在招募编辑/记者,工作地点在北京中关村。期待有才气、有热情的同学加入我们!相关细节,请在量子位公众号(QbitAI)对话界面,回复“招聘”两个字。
量子位 QbitAI · 头条号签约作者
վ'ᴗ' ի 追踪AI技术和产品新动态
相关文章推荐
- Google正资助一个由AI机器人编辑的新闻网站
- AI将取代记者?路透社推出AI新闻助手 近期入驻全球新闻编辑室
- 不会做特征工程的 AI 研究员不是好数据科学家!上篇 - 连续数据的处理方法 本文作者:s5248 编辑:杨晓凡 2018-01-19 11:32 导语:即便现代机器学习模型已经很先进了,也别
- 【每日新闻】三星电子市值跌至全球第18位,落后中国阿里腾讯 | 中国AI领袖人物吴甘沙:无人驾驶技术距离我们已经不再遥远
- [原]每日头条(200709)——自有新视角:一条热点新闻、一项业界动态、一个另类点子……,关注我们的社会、关注我们的行业、关注我们的思想
- (转)NYU教授给写AI新闻的记者们写了一封推心置腹的信,你也应该读读
- 热点新闻算法
- node.js 获取csdn首页热点新闻
- 关于scrapy新闻爬虫,对新闻网页内容进行编辑的问题
- 微软、阿里用阅读理解证明,文字的事儿人类已经不如 AI 了
- XML数据查询技术已经成为现今的研究热点
- 热点新闻滚动特效的js代码
- 蹭着 Java 热点出生的 JavaScript 已经 22 岁了!
- 中国社会热点新闻十年回顾
- ThinkPHP自动化为已经上传的图片添加「 响应式」水印(文件夹遍历部分)
- Solaris 11的自动化安装(AI server)的搭建
- Fielding的论文已经翻译完成
- 自动化新闻写作机器人:会不会导致记者失业
- AI地铁已经来了,智慧城市还会远吗?
- jQuery图片热点链接添加编辑插件