首页句子回归原始的句子(39条)回归原始的句子(39条)

回归原始的句子(39条)


1、12*3*(768*(768/12)+768/12)=1771776

2、 温度参数会将模型更新的重点,聚焦到有难度的负例,并对它们做相应的惩罚,难度越大,也即是与h i h_ih i距离越近,则分配到的惩罚越多。这其实也比较好理解,我们将 sim(h_i,h_j^+)/r相当于同比例放大了负样本的logist值,如果r足够小,那么那些sim(h_i,h_j^+)越靠近1的负样本,其放大后会占主导(负样本间绝对差距在变大)。

3、12*(2362368+1536+4722432+1536)=85054464

4、一方面,其包含场景中既有对象,包括建筑和摆件等的基础层级信息

5、BERT前馈层使用了什么激活函数?相关优缺点?

6、三种mask:字层面、短语层面、实体层面(引入外部知识,模型可获得更可靠的语言表示)

7、 为什么比较大的输入会使得softmax的梯度变得很小?

8、为什么inputs embedding要加入positional encoding?

9、Transformer如何并行化的?解码器端可以做并行化吗?

10、 从 GPT-4 发布后的狂欢,其实是应用上的狂欢,无论 HuggingGPT、AutoGPT、Generative Agent 本质上是一种“玩法”的挖掘。

11、Transformer是如何处理可变长度数据的?

12、GPT会根据输入的每个字生成回答,还是根据一整句话再回答?

13、 除了最早期,最成熟的 Jasper 这样围绕短文本生成领域的应用,还没有看到太颠覆性的大模型应用

14、在计算注意力分数的时候如何对padding做mask操作?

15、infoNCE loss 如何去理解,和CE loss有什么区别?

16、2 自编码语言模型(Autoencoder Language Model)

17、 维度与点积大小的关系是怎么样的,为什么使用维度的根号来放缩?

18、对比学习损失中温度参数的作用?

19、强化学习(RL)在ChatGPT中的作用?

20、 这种 Demo 级的产品展现了创意,但是我们知道 Demo 离最终落地还有非常多要解决的问题,这些问题哪些是可控的只需要堆时间,哪些是不可控的需要基座模型升级目前还看不清楚。

21、如何去理解对比学习,它和度量学习的差别是什么?

22、Encoder-Decoder

23、一般而言的mask是对token级别的mask,比如说BERT MLM中的mask,batch训练时对padding位的mask等。

24、23837184+85054464+590592=109482240。

25、3 Finetuning GLM

26、Bert后浪评价?(皮一下)

27、08-15 15:57

28、参数量 层数 词向量长度 117M(GPT-1) 12 768 345M 24 1024 762M 36 1280 1542M 48 1600

29、Transformer中warm-up和LayerNorm的重要性?

30、Mask attention 是什么意思?

31、大概讲一下Transformer的Encoder模块?

32、③引入transformer-XL:

33、12*3*(768*(768/12)+768/12)+768*768+768=2362368

34、SimCSE无监督模式下的具体实现流程是怎样的,标签生成和loss计算如何实现?

35、ChatGPT的基本训练流程

36、对比学习的infoNCE loss 中的温度常数的作用是什么?

37、1 自回归语言模型(Autoregressive Language Model)

38、2维的编码技术,来表示跨间和跨内信息

39、简单描述一下wordpiece model和字节对编码?