第三十七章 苏飞的菠萝(2 / 3)
前的论文成果。为什么这么久都没有新的模型单元诞生,究其原因,一个是技术上太难突破了,第二个原因就是劣币驱逐良币。
即便是在学术领域,劣币驱逐良币也是一个很常见的事情,简单来说就是,大家都发现构造一个模型单元太难了,但是用现有的模型单元去堆叠出一个新的模型结构就简单很多,那既然如此,为何要死磕前者呢。
例如一个商城只有苹果、香蕉、桃子三种水果,现在要贩卖水果拼盘,最具有经济效益,也就是贩卖的最好的拼盘是3苹果2香蕉1桃子,这种组合就是一个模型结构,然后过了一年,有位大佬发现,1苹果1香蕉1桃子能产出更高的经济效益,于是,这个模型大受欢迎,这位大佬便荣登顶会。
当然,这只是一个很简单的例子,真正的模型构造必定比贩卖水果拼盘要难很多,需要大量数学理论来佐证,但本质上其实与水果拼盘没什么不同。
苏飞此前的elmo模型所做的工作本质上也是水果拼盘,只不过他的拼盘领先了一个时代,能超越目前最好的模型10个性能百分点,大大提高了准确率还减少了算力消耗。
但是,如今整个学术界渐渐的,都开始拼水果拼盘,所有人都在现有的苹果、香蕉、桃子里选择,开始自由组合,对不同的任务和实验拼出解决这个问题的最优模型。
而很少有人会去往这个拼盘里创造一个新的水果,毕竟吃力不讨好。
但既然选择了做学术界的清流,苏飞就想要成为创造新水果的人,他想要往这个水果拼盘里引入菠萝,至于为什么称之为菠萝,嗯……因为他最爱吃菠萝。
而他与大多数人写论文的方式相反,对苏飞来说,再难的技术问题都不是问题,他怀疑只要有足够的灵感激发卡,他甚至可以突破号称永远的三十年的“核聚变”技术。
于他而言,最重要的就是idea或者说一个正确的思路。
注意力机制毫无疑问就是一个很好的idea。近年无论图领域还是自然语言处理领域,对注意力机制这块动刀子的人可不少,但至今为止,注意力机制更像是在其他的模型单元上起到一个基础运算,或者说锦上添花的作用。
苏飞不认为注意力机制的作用仅限于此,不止苏飞不这么认为,世界上几乎所有相关领域学者都不认为注意力机制仅限于此,然而令人遗憾的是,还没有人能真正发挥注意力机制的作用。
苏飞在学习《认知神经科学》后,认为这是一个很好的机会。
↑返回顶部↑