




资源介绍
视频数量:62个
总时长:5小时31分
课程介绍:
大语言模型攻击实战:从越狱到红队演练的系统训练
想象这样一个场景:你的公司上线了一款 AI 客服助手,它能读取用户订单、调取退换货政策、查询促销信息。开发者觉得一切都在掌控之中——直到有一天,一个用户发来一张截图,截图里藏着精心编写的指令。几秒之后,那位"用户"拿到了本不该流出的内部升级脚本。
这不是科幻。这是间接提示注入的典型场景,也是这门课要带你深入理解的核心问题:当一个语言模型同时处理来自可信系统的指令和来自不可信用户的文本时,它根本无法区分两者。一切只是一个扁平的令牌流,没有权限边界。这个事实,是所有攻击的根本起点。
这门课有 62 段视频,总时长五个半小时出头,分成十个章节,外加一项顶石 CTF。它不教你念咒语,也不堆砌花哨的技巧清单,而是把攻击者的完整思维链从零搭建起来。每讲都有对应的实验沙箱、测验和作业,学完不是停留在"听说过",而是真正能动手做出来。
一、地基与交战规则。
前七讲把后续所有攻击都要用到的底层逻辑摆到桌面上。你会看到威胁模型如何建立:哪些文本是不可信的,模型的指令在哪个环节与用户输入交汇,为什么看似严密的安全对齐其实只是一层概率屏障。课程会逐层讲清楚注入、越狱、数据外泄这三件最容易混淆的事之间的差别,还会专门花一节课讲攻击者的伦理——授权、范围、披露——因为红队行为一旦越界就不再是演练。这一章的最后一讲带你在本地搭建好实验沙箱,并捕获一份基线输出,后面所有的对照实验都靠这份基线来衡量变化。
二、直接越狱:让模型脱轨的几种手法。
这一章是离用户最近的战场。你会看到角色扮演越狱是怎么利用"一致性压力"绕过限制的——模型刚刚承诺了扮演一个没有规则的角色,下一秒它就很难再开口拒绝。指令覆盖与上下文重置告诉你如何把模型的注意力从系统提示上拉开;拒绝抑制与前缀注入则更加精准,它不打意图,而是打第一个输出标记,通过钉死"好的"两个字,把那条通往拒绝的跑道直接拆掉。假设性场景、翻译绕过、对立模式、负载拆分、上下文干扰……这一章把这些主流手法逐个拆开,并在实验室里让你亲手把它们叠加起来,看防线是怎么一层一层被压垮的。
三、混淆与编码绕过。
当过滤器挡在前面,手法层面的技巧就经常不够用了。这一章把战场转移到输入与输出的过滤层。你会学到 Base64、ROT13、十六进制、字符替换、同形异义字这些基础编码手段为什么能骗过基于关键词的过滤器;分词器本身的怪癖如何被用来走私令牌;低资源语言为什么能让安全策略失效;零宽空格、双向控制字符、不可见标签这些 Unicode 小花招怎样把一段有害指令藏在一段无害文本的缝隙里。实验环节会给你一个真实的审核过滤器,让你用多层编码叠加的方式突破它。
四、间接提示注入:最危险的攻击面。
这是防御者最容易忽视、也是攻击者性价比最高的一章。直接攻击要求攻击者本人坐在对话框里,而间接注入只需要把毒种进模型会去读取的任何地方——一张网页、一封邮件、一份 PDF、一段知识库文档。RAG 系统的检索增强模块尤其脆弱:你只需要让一段文本恰好匹配某个高频查询,就能把它喂进模型的上下文窗口。课程会带你完成一次完整的间接注入实验,把一段载荷种进助手会读取的文档,让它在不知情的情况下执行。
五、攻击集成应用与智能体。
从第五章开始才真正进入"造成实际影响"的阶段。当模型可以调用工具、执行函数、读取文件、甚至访问外部服务,它的攻击面就从一段文本扩展成了一整条执行链路。你会学到工具调用的劫持方式,跨插件与多智能体之间的注入传递,如何通过持久化记忆让一次注入长期生效,以及借助工具能力实现的 SSRF、代码执行、文件读取。实验环节会把这些动作串成一条完整的数据外泄路径。
六、多模态注入。
模型不只读文字,也看图、听声音、解析扫描件。这一章把攻击面扩展到视觉与听觉通道:图像中嵌入的指令、专门设计的对抗性图片、音频与 OCR 管线中的载荷,以及借助多模态通道完成的数据外泄。实验会让你亲手构造一张"说谎的截图",让模型把它当成事实来执行。
七、高级与自动化攻击。
手工技巧讲到这里已经铺满,接下来是规模化。你会看到自动化越狱框架 Crescendo、Many-Shot 的长上下文策略、基于梯度的对抗后缀 GCG、可在不同模型间迁移的载荷、用一个语言模型去攻击另一个语言模型的 PAIR 与 TAP,以及模糊测试与变异流水线。实验环节带你搭一个完整的自动化红队循环,统计攻击成功率。
八、案例研究与侦察。
实战之前先看战场。这一章盘点近年公开披露的真实事件、OWASP LLM Top 10 框架、事件分类法,系统提示词的提取与目标应用的指纹识别。实验让你亲手把一个应用的系统提示抽出来并画出它的攻击面。
九、防御与对应的绕过。
只知道攻击还不够,防御者会反弹。课程会带你过一遍常见的护栏、分类器、内容审核模块、Spotlighting、分隔符、指令层级、沙箱、最小权限工具、人工兜底环节、检测与日志系统——然后告诉你每一道防线对应的绕过思路。最后的实验是去攻击一套"硬化过"的 Copilot,把前面的所有积累用一次。
十、顶石红队演练。
课程最后的 CTF 是真正的压轴。你会拿到一份真实的演练委托书、明确的授权范围、一个名为 Nimbus 的 Copilot 沙箱,以及一位虚构的客户联系人 Maya。任务是从侦察开始,绘制攻击面,串联利用链,最终形成一份可提交的专业红队报告。这份报告就是你能带走的能力证明。
这门课适合谁?它不是给刚入门的安全爱好者的速成课,也不是给完全不懂代码的读者的科普读物。如果你在做应用安全、做红队、做大模型应用的开发或测试,或者你是安全研究员、对抗机器学习方向的从业者,这里会有大量能直接落到工作里的方法。它也适合那些已经看过几篇博客、玩过几次手工越狱、想系统补齐方法论的人。
学完之后你会带走六样具体的能力:能从架构层面解释为什么 LLM 无法区分指令与数据;能写出能稳定绕开拒绝的直接越狱;能把载荷种进网页、邮件和文档完成间接注入;能劫持工具调用并完成真实的数据外泄;能跑自动化攻击并量化成功率;能在一次完整的授权演练里从头到尾交付一份可用的红队报告。
五个半小时出头,62 段视频,十个章节,一个顶石。这门课不是要教你"如何骗过 AI",而是要让你站在攻击者的视角,把模型的边界摸透,再带着这些理解回到防御者的位置去加固它。