




资源介绍
视频数量:13个
总时长:2小时13分
课程介绍:
Claude认证开发者:从原型到可上线的生产级智能体
凌晨三点,手机弹出一条告警——一个客户工单等着回复,终端前没人盯着,智能体得自己处理。它会怎么做?自信地甩出一个听起来对、实际是错的答案,还是停下来先核实再说?这两个时刻之间的距离,就是这门课要解决的事。
市面上讲AI智能体的教程不少,但多数停在"能跑起来"那一步。原型通过几个测试用例,开发者满心欢喜往上一放,现实紧接着就来打脸——回复莫名其妙、token费像水一样淌、安全漏洞冒出来时已经晚了。这门课从第一讲到最后一讲,只回答一个问题:怎么把一个智能体从"看起来在工作"变成"可以放心交给它干活"。
课程共13讲,总时长2小时13分钟,分成五个版块,从零搭建一个真实的智能体,再一步步把它送上线。
一、基础搭建:跨越原型与生产的鸿沟
前三讲解决"从哪起步"。第一讲直接点出原型和生产环境之间那道容易被忽略的鸿沟——测试里表现良好的智能体,碰到真实客户请求照样翻车。第二讲分享了一段亲身经历:作者用一个晚上搭出一个智能体,结果它有一半时间在胡说八道。第三讲给出了一个改进方向:不动模型本身,只靠四个工具的设计,让表现从56分提到68分。这一版块的重点不是框架选型,而是建立一种意识——智能体的可靠性,很大程度上取决于工具的设计。
二、度量一切:用数据替代直觉
中间四讲是课程最硬核的部分,主题是怎么度量。智能体跟传统软件最大的区别在于行为有随机性,单次跑通说明不了什么。第四讲提了个尖锐的问题:同一个智能体跑出28分和56分,你信哪个?答案藏在测试集的搭建方式和评估方法里。第五讲讲了个细节决定成败的故事——一个缺失的文件让智能体在隐私问题上扯了谎,而日志里什么异常都没有。第六讲聚焦记忆系统:你的智能体是真记住了用户偏好,还是只是看着像记住了?第七讲试了一种常见的架构优化——子智能体,结果准确率没变,成本反而翻了一倍。这一组讲的不是某个具体指标怎么算,而是一整套可重复、可信的评估体系应该长什么样。
三、加固防线:成本与安全
第八和第九讲对准生产环境最揪心的两个问题:成本和安全。第八讲测试了三种成本控制策略,结果没有一种稳定胜过基线——这件事逼着作者重新审视"成本守门员"到底应该怎么设计。第九讲是一场自我攻防实验,作者从八个方向试图击穿自己的智能体,结果它一个都没倒。这两讲传达的思路一致:安全不是事后补丁写出来的,是在设计阶段就得主动去试探、去验证。
四、上线运行与可观测性
第十讲到第十二讲进入真实部署。第十讲的核心问题是部署形态——自托管跑SDK自己掌控一切,还是交给托管运行时?两种各有代价,这一讲帮你做清醒的选择。第十一讲通过一张70秒才返回的工单,展示了可观测性的必要性:运行变慢的时候,你必须看清楚时间花在哪,否则就是盲飞。第十二讲揭示了一种隐蔽故障——智能体的"安全守卫"实际上在静默地什么都不做,这种沉默的失败比崩溃更可怕,因为你根本不会察觉。
五、整体架构收官
最后一讲把前面所有模块整合起来,回顾评估关卡、成本守门员、权限钩子、记忆系统、可观测性这些部件是怎么协同运转的。
这门课适合已经会写TypeScript、能在终端敲命令的人。如果你做过智能体原型,但对怎么把它变成一个靠谱、可维护、可上线的系统感到迷茫,这门课会帮你把那些模糊的直觉变成具体的工程方法。学完之后,对于"这个智能体能不能用"这个问题,你不再凭感觉回答,而是有一套流程去测它、限制它、观察它,直到你可以真正信任它。