P之前基本是每个任务单独设计模型,再单独训练,很依赖大量标注数据,不同任务之间的技术栈并不通用,也就是导致研发进展很缓慢。
通用模型意味着只用Transformer就能快速适配不同的任务。
以前是很多模型干不同方向的活,现在是用一个Transformer做不同方向的活,意义自然完全不同,如果能够继续推动,许多设想中的场面都可能会实现。
陆奇不用吴恩达多解释就知道这种判断的意义,但他的第一反应是十分怀疑:「通用模型?Transformer?这个判断是怎麽得出来的?」
「我们基於Transformer做了一个模型,用它去做NLP的能力测试,它在GLUE的9个任务里已经有5个达到S0TA,这还只是我们的初步尝试。」吴恩达说道,「另外,它在机器阅读理解的2个任务里也拿到了高分。」
GLUE是目前业内公认的NLP通用能力评测,包含9个不同类型的语言理解任务,而机器阅读理解也是NLP领域最受关注的任务之一。
吴恩达拿出了平板,展示具体的模型处理效果,过去需要不同模型的任务在基於Transformer的模型测试里拿到5项最优,剩下4项也接近最优。
在机器阅读理解的2个任务里,模型的F1值拿到89分,超越了人类平均水平的87.9
分。
吴恩达时刻注意着陆奇的视线和浏览,等到他看到机器阅读理解这部分,不轻不重的说了句:「这是大模型在机器阅读领域第一次超过人类在通用数据集的表现。」
陆奇沉默了。
俞兴这时提到一个关键的问题:「这还是他们在很短时间里的成果,从去年到现在,从机器翻译领域转到NLP领域,也就不到4个月的时间。」
「这4个月,这11个任务里大部分的提升幅度已经相当於业内过去三到五年的总和。」
「啧,就这个情况,时间再多点,恐怕11个任务都能达到S0TA。」
全球业内数年的提升在过去四个月时间里被基於Transformer的模型做到了。
这些正是吴恩达发起联名信的底气,他有信心可以进一步推动新模型的发展,至於到底能不能成为NLP通用大模型,谨慎的说,需要进一步验证。
从感性与直觉来看,吴恩达认为就是这个了。
陆奇翻来覆去的看着平板上的测试展示,
…。。本站若有图片广告属于第三方接入,非本站所为,广告内容与本站无关,不代表本站立场,请谨慎阅读。
Copyright © 2020 二零小说 All Rights Reserved.kk