大白话讲解 AI 词元、微调与幻觉

在单位很多朋友每天都用 AI,但是对 AI 的一些基础的概念,还有的一些运转逻辑是搞不清楚的,那这期视频我将会用简单大白话的方式,而且是笔杆子能够听得懂的方式给大家普及一下。最近两到三年 AI 发展过程中已经成熟的一些 好的概念,一些好的逻辑。首先第一个就是 TOKEN,中文名字叫做词源,也是最近才翻译过来的。那这个东西有啥用呢?它是一个计量单位,比如说你让 > 来源:李行舟-材料星创始人抖音原作 在单位很多朋友每天都用 AI,但是对 AI 的一些基础的概念,还有的一些运转逻辑是搞不清楚的,那这期视频我将会用简单大白话的方式,而且是笔杆子能够听得懂的方式给大家普及一下。最近两到三年 AI 发展过程中已经成熟的一些 好的概念,一些好的逻辑。首先第一个就是 TOKEN,中文名字叫做词源,也是最近才翻译过来的。那这个东西有啥用呢?它是一个计量单位,比如说你让 AI 写2,000字,那这个时候你会发现它不太听话,它就是给你写到2,300字,给你写到1,800字。为什么呢?因为 TOKEN 是 AI 大模型的计量字。 数的单位,但是对我们 写材料来说,我们看的是字数,那么字数和 TOKEN 之间它不是一个对应的关系,而且对于不同的模型来说,它的 TOKEN 跟字数的比例是不一样的。比如说你对 AI 下一个指令,那这个时候大模型会把你的指令处理成数字,然后输入给大模型,把你输入的内容转化为大模型能够处理的内容。然后大模型处理完成之后,再把这个内容转化为你能够听得懂的内容,这个就叫 TOKEN。举个例子,你要写一个工作总结,那这个时候分词器会把工作总结这四个字变成数字上的代码和序号,然后交给大模型来处理。 你比如说在材料性里面你让他写8,000字,那这个时候他消耗的 TOKEN 肯定比你写2,000字 消耗的 TOKEN 要大得多,这也是为什么我们在做产品的过程中,它的成本是比较高的。因为你写一篇文章,你可能需要十几轮对话,它需要的 TOKEN 消耗是非常快的。这是第一个概念叫做 TOKEN,中文名字叫做词源,那么第二个叫做大模型的微调,比如说你在用材料性的时候,1234号模型是微调…