1、12*3*(768*(768/12)+768/12)=1771776
2、 温度参数会将模型更新的重点,聚焦到有难度的负例,并对它们做相应的惩罚,难度越大,也即是与h i h_ih i距离越近,则分配到的惩罚越多。这其实也比较好理解,我们将 sim(h_i,h_j^+)/r相当于同比例放大了负样本的logist值,如果r足够小,那么那些sim(h_i,h_j^+)越靠近1的负样本,其放大后会占主导(负样本间绝对差距在变大)。
3、12*(2362368+1536+4722432+1536)=85054464
4、一方面,其包含场景中既有对象,包括建筑和摆件等的基础层级信息
5、BERT前馈层使用了什么激活函数?相关优缺点?
6、三种mask:字层面、短语层面、实体层面(引入外部知识,模型可获得更可靠的语言表示)
7、 为什么比较大的输入会使得softmax的梯度变得很小?
8、为什么inputs embedding要加入positional encoding?
9、Transformer如何并行化的?解码器端可以做并行化吗?
10、 从 GPT-4 发布后的狂欢,其实是应用上的狂欢,无论 HuggingGPT、AutoGPT、Generative Agent 本质上是一种“玩法”的挖掘。
11、Transformer是如何处理可变长度数据的?
12、GPT会根据输入的每个字生成回答,还是根据一整句话再回答?
13、 除了最早期,最成熟的 Jasper 这样围绕短文本生成领域的应用,还没有看到太颠覆性的大模型应用
14、在计算注意力分数的时候如何对padding做mask操作?
15、infoNCE loss 如何去理解,和CE loss有什么区别?
16、2 自编码语言模型(Autoencoder Language Model)
17、 维度与点积大小的关系是怎么样的,为什么使用维度的根号来放缩?
18、对比学习损失中温度参数的作用?
19、强化学习(RL)在ChatGPT中的作用?
20、 这种 Demo 级的产品展现了创意,但是我们知道 Demo 离最终落地还有非常多要解决的问题,这些问题哪些是可控的只需要堆时间,哪些是不可控的需要基座模型升级目前还看不清楚。
21、如何去理解对比学习,它和度量学习的差别是什么?
22、Encoder-Decoder
23、一般而言的mask是对token级别的mask,比如说BERT MLM中的mask,batch训练时对padding位的mask等。
24、23837184+85054464+590592=109482240。
25、3 Finetuning GLM
26、Bert后浪评价?(皮一下)
27、08-15 15:57
28、参数量 层数 词向量长度 117M(GPT-1) 12 768 345M 24 1024 762M 36 1280 1542M 48 1600
29、Transformer中warm-up和LayerNorm的重要性?
30、Mask attention 是什么意思?
31、大概讲一下Transformer的Encoder模块?
32、③引入transformer-XL:
33、12*3*(768*(768/12)+768/12)+768*768+768=2362368
34、SimCSE无监督模式下的具体实现流程是怎样的,标签生成和loss计算如何实现?
35、ChatGPT的基本训练流程
36、对比学习的infoNCE loss 中的温度常数的作用是什么?
37、1 自回归语言模型(Autoregressive Language Model)
38、2维的编码技术,来表示跨间和跨内信息
39、简单描述一下wordpiece model和字节对编码?