宋彦斌
07-19 · 灏綝网络商学院
大语言模型的注意力机制
大语言模型利用了语言数据总是一个线性序列的特性。每个信息单元都以某种方式与同一语言序列中较早的数据相关联。模型会读取大量句子,学习其中包含的信息的抽象表征,然后基于这些信息生成关于信息走向的预测。模型的挑战主要在于设计一个算法,该算法能够“知道去哪里寻找”给定句子中的关键信息。哪些词是关键词?句子中最重要的元素是什么?它们之间是如何相互关联的?在人工智能领域,这个概念通常被称为“注意力”。当大语言模型接收和处理一个句子时,它会构建一个内部表示,我们可以将其形象地称为“注意力地图”。首先,模型会将句子中的常见字母和其他符号组合视为一系列的“标记”,这些标记类似于语言中的音节,但实际上它们是模型为了更好地处理信息而识别出的常见的字母和符号组合块。人类以词语为单位来理解句子,但模型在处理信息时并不遵循我们的词语边界。相反,它会创建一个新的常见标记列表,并基于这些标记在海量文档中识别出语言模式。在注意力地图中,每个标记都与之前的标记有一定的关联。对于给定的输入句子,这种关联的强度反映了标记在句子中的重要性。因此,大语言模型学会了在理解句子时识别并关注那些关键的词。 语言为起点,现已拓展为一整个生机勃勃的生成式人工智能领域。除了语言生成,这些模型在训练过程中还意外获得了众多其他功能,如创作音乐、设计游戏、下棋以及解决高级数学问题等。新的工具能够根据简短的文字描述生成令人惊叹的图像,这些图像的真实感和说服力令人难以置信。与朋友们一起学习分享网络财商智慧,助人助己,共同踏入好客时代开启全新的自由生活……
发布于 河北
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn