ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

收藏必看!揭秘大模型如何将文字变成数字:小白也能懂的LLM第一课

收藏必看!揭秘大模型如何将文字变成数字:小白也能懂的LLM第一课 前言你有没有想过——当你说“今天天气真好”AI 读到的不是“天”“气”“真”“好”这四个字而是一串数字[1243, 892, 501, 733]它看不见文字听不到声音它只认识数字。那问题来了人类的语言是怎么变成这些数字的这不是魔法也不是玄学。这是大语言模型LLM最基础、也最精妙的第一步文本编码Tokenization。今天我们就来彻底拆解LLM 是如何把“文字”变成“数字”并让它们在神经网络里“跑起来”的。 第一步文字 ≠ 数字但机器只认数字计算机的底层只有0和1。哪怕你发一条微信、写一篇论文最终都会被转成二进制——但LLM的输入不是“二进制”而是整数序列。为什么因为直接把“天”“气”映射成数字比如“天”1“气”2会带来灾难性问题文字数字问题天1与“地”2但“天地”≠“天”“地”地2“天气”123但“三”3 → 语义错乱三3模型会误以为“天气”“三”所以LLM不能用“字典映射”。它需要一种既能保留语义又能处理无限词汇的编码方式。这就是——分词Tokenization。 第二步分词的智慧 —— BPE把词“切碎”再重组LLM 用的不是“一个字一个编号”也不是“一个词一个编号”而是Byte-Pair EncodingBPE——一种“聪明的切碎术”。✅ 举个例子假设我们有以下语料lowlowestnewerwiderwideBPE 的工作流程初始化把每个词拆成字符统计字符对频次“low” → l, o, w,“lowest” → l, o, w, e, s, t, 表示词尾找最常出现的字符对→ “o” “w” 出现2次→ 合并成新符号ow更新词表“low” → l, ow,“lowest” → l, ow, e, s, t,继续找下一轮“e” “s” 出现1次合并为es→ “lowest” → l, ow, es, t,重复直到达到目标词表大小比如50,000个Token最终你的词表可能长这样Token含义l字母 low字母组合 “ow”es字母组合 “es”t字母 t词尾new新词er后缀 “er”wide完整词wider完整词✅ 你会发现“wider” “wide” “er”“lowest” “low” “est” “ow” “es” “t”语义单元被拆解、复用效率极高 第三步把句子变成数字序列 —— Tokenizer 的魔法现在我们输入一句话“The capital of France is Paris.”Tokenizer 会这样处理分词Tokenize“The” →[452]“ capital” →[123]注意空格是token的一部分“ of” →[78]“ France” →[912]“ is” →[201]“ Paris.” →[678]“.” 与 “Paris” 合并最终输出[452, 123, 78, 912, 201, 678]这就是LLM真正“看到”的输入——一串整数没有字母没有标点只有编号。 你可以把Tokenizer想象成一个“翻译官”把中文/英文 → 翻译成“AI语言”而AI语言就是这50,000个Token组成的“词典”。 第四步数字如何“变成语义”—— Embedding层登场数字本身没有意义。但LLM有一个神奇的层叫Embedding Layer词嵌入层。它的作用是给每一个Token分配一个高维向量比如4096维这个向量编码了这个词的语义、语法、上下文关系。假设Token[452] “The” → 嵌入向量E[452] [0.23, -1.12, 0.87, ..., 0.51]共4096个数Token[123] “capital” →E[123] [0.41, 0.98, -0.33, ..., 0.19]那么输入序列[452, 123, 78, 912, 201, 678]就变成了一个6×4096的矩阵[ [0.23, -1.12, 0.87, ...], ← The [0.41, 0.98, -0.33, ...], ← capital [0.11, 0.05, 1.22, ...], ← of [0.67, -0.45, 0.77, ...], ← France [0.33, 0.21, -0.91, ...], ← is [0.89, 0.14, 0.55, ...] ← Paris.]这个矩阵就是LLM的“输入世界”。✅ 这个向量不是随便给的而是通过训练学出来的。“capital”和“city”的向量会很接近“France”和“Germany”会靠近欧洲区域“is”和“was”会靠近动词区域。语义藏在向量的几何空间里。这就是为什么“king - man woman ≈ queen”不是巧合而是向量空间的线性关系。⚙️ 第五步数字开始“运算”——从Embedding到Transformer现在LLM拿到了一个6×4096的数字矩阵。接下来它做的就是用数学运算不断重构这些数字。每一层Transformer都会做矩阵乘法Q X Wq计算查询向量点积相似度scores Q K.T哪个词和当前词最相关Softmax把分数变成概率注意力权重加权求和output attention_weights V融合上下文残差连接 归一化让信号稳定传递前馈网络x → W1 → GELU → W2非线性变换每一步都是纯数学运算矩阵乘法指数函数加法、除法、激活函数没有“理解”没有“意识”只有数字在高维空间里跳舞。但奇妙的是——当这些数字被反复变换、叠加、融合后输出的最后一个向量恰好能预测下一个最可能的Token输入“The capital of France is” →输出[0.01, 0.02, ..., 0.85, ..., 0.001]最大值在Token[678] “Paris.”→ 所以AI说“Paris.” 真实演示用Python模拟一次Tokenization Embedding# 伪代码模拟LLM的前两步tokenizer {The: 452, capital: 123, of: 78, France: 912, is: 201, Paris.: 678}# 输入文本text The capital of France is Paris.# Step 1: Tokenizetokens [452, 123, 78, 912, 201, 678]# Step 2: Embedding (简化版)embedding_dim 4embedding_table {452: [0.23, -1.12, 0.87, 0.51],123: [0.41, 0.98, -0.33, 0.19],78: [0.11, 0.05, 1.22, 0.44],912: [0.67, -0.45, 0.77, -0.21],201: [0.33, 0.21, -0.91, 0.66],678: [0.89, 0.14, 0.55, 0.88]}# 转换成矩阵x [embedding_table[t] for t in tokens]print(输入序列的嵌入向量6×4)for row in x:print(row)# 输出# [0.23, -1.12, 0.87, 0.51]# [0.41, 0.98, -0.33, 0.19]# [0.11, 0.05, 1.22, 0.44]# [0.67, -0.45, 0.77, -0.21]# [0.33, 0.21, -0.91, 0.66]# [0.89, 0.14, 0.55, 0.88] 你看到的不是文字而是6个4维的数字向量它们承载了“首都”“国家”“系动词”等语义关系。AI就是靠这些数字推理世界的。 为什么这如此重要很多人以为LLM“懂语言”其实它只是把文字 → 切成Token分词把Token → 映射成向量Embedding把向量 → 用数学变换不断融合Transformer把最终向量 → 映射回Token输出层选概率最高的 → 输出文字它没有“理解”“意思”“意图”但它完美模拟了语言的统计规律。就像一个精通围棋的AI它不理解“胜负”“艺术”但它知道哪一步赢的概率最高。✅ 总结LLM的“语言翻译器”三步曲步骤输入输出关键技术1. 分词“The capital of France is Paris.”[452, 123, 78, 912, 201, 678]BPEByte-Pair Encoding2. 嵌入Token序列6×4096 的数字矩阵学习型词嵌入Learned Embedding3. 运算数字矩阵更高阶的数字矩阵TransformerAttention FFN LLM 不认识“字”✅ LLM 只认识“编号” 它的“语言”是数学的语言 最后一句AI的“语言”是你看不见的宇宙你看到的“对话”是AI输出的文字。你没看到的是数万维空间里数十亿个数字的精密舞蹈。每一个字的背后是成千上万次矩阵乘法是数万亿参数的协同演化是人类用数学为语言建模的壮举。下一次当你对AI说“帮我写一首诗”请记住它听到的不是诗意是一串编号和一串在高维空间里悄悄旋转的向量。动手实验建议用 Hugging Face 的transformers试试from transformers import AutoTokenizertokenizer AutoTokenizer.from_pretrained(meta-llama/Llama-2-7b-chat-hf)print(tokenizer.encode(Hello, world!))# 输出[1, 15043, 11, 13]你看到的就是LLM眼中的“世界”。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表