第41章 神秘备忘录(3 / 4)

加入书签

权宝雅平复了一下内心的纠结,展颜问道:“那我最近有什么要做的么?天天跟着满叔打理公司,安排艺人,也挺无聊的。看你们貌似都有大动作了……”

“你这边,如果想做的话,事情多了去了――叮铛网的用户分类算法,其实你和高老师、周老师这些懂音乐的人,都可以去帮忙做数据标识。不求你完成多少工作量,至少是涨涨见识,知道这门生意是怎么运作的。

如果还有空,我给你个电影剧本你揣摩熟悉一下,可能今年,可能明年,就会有动作。赚钱的电影,对于我来说,《不能说的秘密》已经是人生最后一部了,剩下的都是教好莱坞同行做人的。”

按说听到有电影时,权宝雅是应该兴奋的,然而顾诚前面提到的那项工作,立刻让她怂了下来,因为她完全没有上过理科生的大学课程,对于“数据标识”这种工作天生就有一种畏惧。

“数据标识是个什么鬼?好像和音乐人不对口吧……”

顾诚解释道:“很对口,数据标识不是让算法工程师来干的,正是要各行各业的懂行的艺术家来干的――我举个例子好了,我经营了好几年的某点,目前在张一鸣的改造下,加入了一个‘看过本书的人还喜欢xxx’的功能,今年刚做好的。

但是我去看了,那个功能目前简直就是一坨s。只会做那些‘因为你看过《xx终结者》所以猜你也喜欢《xxxx》’这样的推送――这几本书是同一个智商级上的东西么?

之所以这样,是因为目前的数据标识维度太简陋,只能靠书是都市/玄幻,又乃至下面某个细分品类‘商战/官场/言情’去划分作品归类,然后再靠‘热血/兵王/腹黑/无敌/废柴’这些标签来划分风格。但实际上一来这些标签太简陋,二来写手写书很容易风格上文不对题,所以同类类型、标签,而且点击率也很高的作品,不一定喜欢看前一本书的人就会同时喜欢看后一本书。

这就是算法没有真正读懂作品导致的,算法只是在按照‘用户点击大数据’的规律来归类。而淘宝上还有不少刷-榜狗在制造虚假数据,对于我们的大数据归类就更难了。这时候,就必须要有懂行的编辑或者音乐人,对算法的推送进行一次次的人工修正,判断算法哪些地方要调整,然后给算法工程师下任务:或者是丰富更多标签、或者是优化算法折叠、或者是加强真正的机器能力。

更麻烦的是,这背后涉及到千百万写手、歌手、演员、导演的切身利益和曝光率。在人工修正的时候难免有人主官夹带私货,

↑返回顶部↑

书页/目录

相关阅读: