视频课程 人工智能

从NLP到大语言模型:构建经得起追问的底层理解 (英文课程中文字幕)

¥5.00 已售 0
✓ 自动发货 ✓ 永久有效 ✓ 售后保障

资源介绍

视频数量:30个 总时长:2小时55分 课程介绍: 从NLP到大语言模型:构建经得起追问的底层理解 你有没有过这样的时刻:和大语言模型的API打了一段时间交道之后,突然发现自己其实并不清楚它内部到底在做什么。输出每次跑都不一样,检索结果莫名其妙地不相关,提示词改了十几个版本效果还是不理想,而你根本说不上来到底是哪里出了问题。当有人问你"为什么不直接微调?"或者"为什么不加一个RAG?"的时候,你能给出的理由只有"感觉上效果更好"——这种回答在会议上撑不过两分钟。 这门课就是给走到这一步的人准备的。它假设你已经会调用API,现在要补的是API下面那一层理解。课程叫《从NLP到大语言模型:构建经得起追问的底层理解》,由OfferLab的Ada主讲,一共九个模块,三十个视频,总时长不到三小时。它不是那种泛泛而谈的科普课,有自己的节奏和野心:从最基础的文本表示一路走到大模型的生产实践,把这条路上每一个关键概念都掰开揉碎讲清楚,而且几乎每一讲都配有可运行的实验代码。 第一部分是文本作为数据。你要面对的第一个问题是:为什么"理解"文字这么难?课程会带你梳理自然语言处理的任务全景图,从分类、序列标注到生成,让你对NLP到底在做什么有个全局认识。然后从最朴素的词袋模型和TF-IDF讲起。这些方法看起来老掉牙,但它们是后续所有方案的参照系——你得先知道零号方案长什么样,才能理解后来的方法到底改进了什么。第一个实验就用真实评论数据搭一个情感分析基线,亲手跑一遍你才知道,老办法在很多场景下其实够用。 第二部分是词嵌入。从稀疏的词频统计跳到稠密的语义向量,这个跨越是理解现代NLP的关键一步。课程会带你走过word2vec那一段历史,理解"词的语义由它的上下文决定"这个分布式假设是怎么变成向量空间里的几何关系的。然后用嵌入向量做搜索和聚类实验,你会发现语义层面的"相似"和字面意义上的"相似"完全是两回事。 第三部分是这个课程的重头戏:注意力机制和Transformer。Ada会先画一个朴素的注意力头,然后告诉你它有四个缺陷——只能计算一种关系、不管词元到达的先后顺序、不使用非线性激活因此堆叠毫无意义、无法加深否则信号衰减。Transformer块就是针对这四个问题一个一个的修补:多头注意力、前馈网络、残差连接、位置编码。Ada特别强调一个多数讲解都会搞错的事实:八个注意力头的参数量和单个头一样多,模型维度是固定预算,多头只是在重新分配它。你还会学到为什么说"某个头负责指代消解"是事后描述而不是设计意图,因为头的功能分化是训练中自发出现的,无法事先指定。讲完Transformer块之后,课程对比了BERT、GPT和T5三个家族的架构差异,理清"编码器-解码器"这条主线上各个模型各自适合什么任务。 第四部分讲大语言模型是怎么造出来的。从预训练的目标函数、数据规模和算力投入讲起,然后把GPT这条线看作一连串赌注——每一代模型的设计选择都是在押注某个方向,押对了就留下来,押错了下一代就改。指令微调和RLHF部分讲清楚模型是怎么从"只会续写文本"变成"能听懂人话"的。最后扫一眼开源模型生态,Llama、Mistral、Qwen这些选择各自适合什么场景,不只是给你一份清单,而是讲清楚什么时候该用哪个。 第五部分是实战:怎么把大语言模型用好。采样策略背后的随机性是怎么回事,温度参数和top-p到底在控什么;提示工程讲的是"经得起生产环境考验"的写法,不是demo里漂亮、线上就崩那种;结构化输出和工具调用是当前Agent应用的地基,函数调用背后到底发生了什么;最后讲上下文窗口、成本和延迟的权衡,这三者在生产环境里永远是互相拉扯的。 第六部分专门讲检索增强生成(RAG)。为什么需要RAG——知识的时效性和事实的"接地"问题。然后是分块策略、嵌入选择和检索质量。Ada会直说:检索质量差是大多数RAG系统失败的首要原因,生成模型往往是被冤枉的那一个。这部分配了一个完整实验,拿自己的文档搭一套RAG系统跑起来。 第七部分是微调。先讲清楚什么时候不该微调——很多时候提示工程或RAG就够了,盲目微调既贵又容易过拟合,性价比远不如先优化前面的环节。然后讲LoRA的机制和那些需要调节的超参数,同样有配套实验让你亲手微调一个小模型。 第八部分是评估和失败模式。幻觉、谄媚倾向、以及其他系统性的失败模式,这些不是个别bug而是模型的统计本质决定的。你会学到怎么搭黄金测试集、怎么用大模型当评委、怎么建一个回归测试脚手架,把这些失败赶在用户之前发现。安全相关的基础也会涉及,包括提示注入和数据泄露的基本概念。 第九部分收官。课程会让你在同一个任务上分别跑一遍经典方法和LLM方法,做一个真正的对比测量,而不是凭印象选边站。最后一讲聊怎么在这个领域保持学习而不被信息淹没——新论文、新模型、新框架每周都在出,比起追新更重要的,是建立一套能持续吸收新东西的方法论。 配套资料很齐全:每讲都有PDF讲义,实验有starter和solution两套notebook,还有真实数据集可以直接用。如果你已经会调API但总觉得自己缺一块底层理解,这门课值得认真看一遍。