亚原子科技

雅虎公布海量数据:为吸引人工智能专家

位置:首页 > 新闻动态 > 行业新闻 > 正文 发布日期:2016-01-17

1月15号,据《华尔街日报》报道,雅虎将面向大学公布13.5TB的雅虎用户行为数据。



周四,雅虎宣布,公司将公布最大规模的互联网行为数据,数据涉及浏览雅虎体育、雅虎财经、雅虎新闻、雅虎地产和其他版块的2000万匿名用户。雅虎仅面向大学机构公布数据,这些数据将让研究人员切实了解大量用户的互联网行为方式。

在科技公司争相延揽人工智能领域顶尖人才之际,雅虎公司在多年的增长乏力,人才流失严重之后做出了惊人之举,希望吸引人工智能这一高速增长而竞争激烈领域的研究人员。当前,科技公司竞相加强与学术界的联系,特别是在人工智能领域。谷歌和Facebook都招募了这方面的高素质人才。

人工智能,又称为机器学习和机器深度学习,是指通过训练机器挖掘海量数据,让这些机器应答复杂问题或做出预测。

雅虎此举正值科技公司争相与学术界加‍‍强合作之时,而科技公司尤为关注人工智能领域。人工智能涉及机器学习和深度学习技术,这类技术可训练机器挖掘海量数据,旨在回答复杂问题或预测用户行为。

卡内基梅隆大学(Carnegie Mellon University)计算机科学院院长摩尔(Andrew Moore)也对此举做出了解释称,“无论拥有多少人才,老板还想要更多;这些大型科技公司总是感觉没有足够人才去做其想做的事情”。

海量数据是机器学习的必备要素。利用这些数据,电脑可分析复杂的模式,大型互联网公司都会严格控制此类数据。雅虎此次公布的数据体积为‍‍‍‍‍13.5 TB,相当于美国国会图书馆数据体积的2/3。


加州大学圣地亚哥分校电子与计算机系教授格特·兰克利(Gert Lanckriet)表示:“公司外部人士难以获得数据。”
 
专家认为,雅虎数据的规模使其极具价值。相较针对少量数据设计的算法,针对海量数据设计的算法具有本质区别。雅虎的数据可以让研究人员开发大型算法,这种算法尤其适合企业。

卡内基梅隆大学去年与雅虎公司签署了1000万美元的五年期合作协议,将根据用户数据开发个性化应用。面对如此庞大的数据量,多到可能需要存储在大学系统之外。

此外,还有人们一直担心的隐私问题,梅森表示:“自从2006年AOL遭遇隐私灾难,科技公司一直害怕公布数据。”

而雅虎的数据仅包括城市、性别、年龄等基本人口统计信息,以及用户与雅虎网站相关的交互信息。雅虎移除了来自人口稀少地区的用户信息等敏感。雅虎实验室首席研究科学家贝泽·耶茨(Ricardo Baeza-Yates) 表示,这次公布的数据集能够有效地防止个人追踪用户。

182 9825 5678