资料

  • 课程主页:https://speech.ee.ntu.edu.tw/~hylee/ml/2023-spring.php
  • Github:https://github.com/Fafa-DL/Lhy_Machine_Learning
  • B站课程:https://space.bilibili.com/253734135/channel/collectiondetail?sid=2014800

一、大模型顿悟时刻(大模型什么时候开始表现良好)

顿悟概念:Emergent Ability(涌动现象),即模型的正确率并不随着模型大小的增加同步上升,而是当模型大到达某一个量时,才开始上升。
在这里插入图片描述

论文:Emergent Abilities of Large Language Models

原理解释:以解方程式为例,小模型就不会做所以答案错误;中模型会列过程但不会解,也错误;大模型才能解出答案,做出正确回答
在这里插入图片描述
量化自信程度(什么时候顿悟)

疑问:

  1. 有没有案例模型越大表现越差?有(这种现象大多数时产生原因都是因为这类任务本身设计了能够迷惑模型的因素,即“陷阱”,半大不大的模型会因为被陷阱困扰反而得出比最小模型纯瞎猜还要差的结果;当模型变得足够大时,陷阱就会被识破,能得到正确结果,基本上是一种一知半解反而吃亏的道理。)
    在这里插入图片描述

二、到底要多少資料才夠(数据集多大合适)

  1. 数据集越大越好吗?

论文:When Do You Need Billions of Words of Pretraining Data?

在这里插入图片描述
LM回答问题需要具备两种能力:结论是在世界认识方面的能力提升需要更大量的资料

  • 语言知识(蓝色):文法与用词的能力;
  • 世界认识(绿色):常识与规则,对世界的理解;
    上面的图中可以看到,只需要1B的训练数据的模型就基本上可以完全具备语言知识,而需要30B+的训练数据,模型才能具备常识。
  1. 资料预处理的重要性
    在这里插入图片描述
  2. 同样算力情况下如何抉择?

论文:Training Compute-Optimal Large Language Models

在这里插入图片描述

不同算力形成的曲线都是U形的,也就是说模型越小和越大都不能带来最好的结果。简单说:学而不思则罔(小模型大数据),思而不学则殆(大模型小数据)。学就好比是看训练资料,思就好比是模型的参数,二者要平衡性能才能最优
案例:Chinchilla (小模型、大資料) vs. Gopher (大模型、小資料)
结论:建议模型和数据量要对应的增加或减少

三、另闢蹊徑 KNNLM

论文:https://arxiv.org/abs/1911.00172

  1. 典型LM流程(以transformer为例):
    在这里插入图片描述

  2. KNN LM原理:
    在这里插入图片描述
    1)将训练资料training context全部input,得到representation以及对应的target
    2)计算得到的representation与其他representation的distance(相似度or距离,越小越近)
    3)把距离最近的k个向量取出,查看这k个向量原本对应的target; 再将距离通过normalization转换成概率分布
    4)最后进行aggregation归纳统计,得到最后的概率分布,就是模型输出的概率

  3. KNN的缺点:太费时间,现场计算distances

这一部分的内容建议大家还是看看老师的原版视频,课程基本以论文为基础,用一些论文的实验结果佐证,跟着老师会比较直观感受到这些结论的由来!

我的总结就是:

  1. 模型是训练到一定程度爆发式提升,在这之前基本属于摸索积累阶段!
  2. 模型大小和数据集大小要有相关性,即模型大小要和数据集大小相辅相成,避免”学而不思,思而不学现象“;
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐