
从提示词到模型部署:这套免费 Colab 笔记本把 AI 工程师技能栈讲透了
calmrocks 开源的 AI Engineer Notebooks:一套框架无关的 Colab 笔记本,从提示词、结构化输出、RAG、Agent 循环,到微调、安全、LLMOps、模型部署,完整覆盖 AI 工程师技能栈,全程跑在免费 Groq API 上,还带练习和求职用的 capstone 项目。
原文来源:GitHub - calmrocks/ai-engineer-notebooks — 一套框架无关、跑在免费 API 上的 Colab 学习笔记本,覆盖从提示词到模型部署的完整 AI 工程师技能栈,每个笔记本都自带练习。
学 AI 工程最头疼的问题不是资料少,而是资料太"飘":教程讲概念讲得头头是道,自己动手的时候要么被框架抽象挡住、要么被 API 账单劝退。calmrocks 开源的这套 AI Engineer Notebooks,针对的就是这个问题——它是一套框架无关(framework-free)的 Colab 笔记本,用裸 API 从零搭起一个又一个能跑的系统,并且全程跑在免费的 Groq API 上,一分钱不花。
这套笔记本讲什么
项目共 13 个章节、几十个 notebook,按学习路径从上到下排好,每个 notebook 自包含(自己装依赖、从 Colab secrets 读 API key),结尾都带练习。内容覆盖了 AI 工程师岗位的核心技能栈:
入门与模型 API(00-01):环境与成本卫生(API key 管理、spend guard、模型选择),然后是 prompting 基础——清晰指令、few-shot、输出格式规范、逐步推理,每个技巧都配了"能让指标动起来"的演示。接着是工程上最实用的三件套:结构化输出(稳定拿到 JSON)、工具调用(function calling 全流程含错误路径)、流式输出。最后是上下文与缓存:上下文窗口预算、prompt caching、批量 vs 实时定价。
评测先行(02、04):项目把 evals 当作贯穿始终的主线。第 02 节先教你用 golden set 和指标量化模型输出——"先测量再调优"这个习惯,要在你还没开始调任何东西之前养成。第 04 节进阶:构建 golden set、用 LLM 当裁判(含裁判自己的失败模式)、把回归评测接成 CI——改了一个 prompt 或模型之后,自动发现质量回退。
RAG(03):从"什么是 RAG"开始(15 行代码的可用 demo,讲清楚 retrieve → augment → generate 循环,以及 RAG 为什么不等于 embedding),到 embedding 选择与向量检索的坑、关键词+向量混合检索与重排序、真实脏语料上的切块策略,最后专门有一节讲"RAG 为什么失败"——坏答案的瓶颈通常出在检索质量而不是生成。
Agent(05):最硬核的一节。用纯 API 调用从零写一个能工作的 agent 循环(不靠任何框架),然后是工具设计(怎么设计模型真正用得好的工具)、护栏与预算(停止条件、成本/延迟预算、什么时候管线比 agent 更合适)、MCP 概念、Skills 与渐进式披露(SKILL.md 模式,按需加载的上下文预算优化),最后是 harness 工程——围绕模型调用的脚手架:上下文组装与压缩、工具结果整形、验证循环。
模型适配(06):什么时候该改权重、什么时候该改输入。fine-tune vs RAG vs prompt 的选型逻辑、LoRA/QLoRA 是什么、成本多少,还带一个可选的"免费 GPU 上真跑 LoRA 微调"附录。
安全与运维(07-08):提示词注入与信任边界(直接/间接注入、输出处理、PII、过度授权,按 OWASP LLM Top 10 逐个过一遍,先让攻击失败再防御),然后是 LLMOps:每次调用的 tracing、成本/延迟/错误指标、漂移检测,重试退避、超时、fallback 模型、熔断,最后用 MLflow 走一遍实验跟踪与模型注册。
部署与系统设计(09-10):serving 框架选型(vLLM、TGI、Triton、TensorRT-LLM 各自优化什么、怎么映射到你一直调的裸 API),推理性能的底层杠杆(continuous batching、KV cache、量化、吞吐 vs 延迟取舍,含部署规模的估算公式),以及一个完整的 ML 系统设计面试题演练:QPS/VRAM/延迟/成本估算、副本扩缩、排队、缓存、SLA 取舍。
客户工程与毕业项目(11-12):第 11 节讲 FDE 的差异化能力——把模糊的客户需求变成可评估的系统(需求发现、一页纸 scope、演示纪律)。第 12 节是三个完整案例:客服助手从构建到上线再到"生产事故"调试(一个索引过期导致的真实质量回归)、合同提取的"管线 vs agent"对比(用准确率和 token 成本证明步骤已知时管线更优)、红队鲁棒性 benchmark(PAIR 攻击循环)。最后是 capstone:一个能放上简历的真实项目,带 serving 组件和 eval 报告。
—— 广告 ——
三个值得注意的设计
框架无关是刻意的。 整个系列用裸 API 讲原理,不教 LangChain、不教 LlamaIndex。这样学到的不是某个框架的 API 记忆,而是底层机制——等你真去用框架时,理解的是"它在替你做什么"。第 05 节的 agent 循环就是纯 API 写的,MCP 和 Skills 都以"概念 + 它如何映射到裸工具循环"的方式讲。
免费 API 让门槛归零。 全部跑在 Groq 的免费层上,涉及需要 GPU 的主题(serving 框架、LoRA 微调)用"概念先行 + 可选 Colab GPU 附录"的方式处理。打开 Colab 就能跑,没有账单焦虑。
Evals 是脊柱不是章节。 评测不是学完才补的,第 02 节就开始教,之后每个 section 都回扣——RAG 用 golden set 衡量、Agent 用回归评测守护、capstone 以 eval 报告交付。这个"先测量再构建"的习惯,比任何单个知识点都值钱。
怎么开始用
打开项目仓库,从 00-setup/00-environment.ipynb 开始(每个 notebook 标题旁边都有 Open in Colab 按钮)。准备一个免费的 Groq API key,在 Colab 的 secrets 里配好,按顺序往下刷就行。每个 notebook 结尾的练习建议认真做——这个系列的设计意图就是"看完 ≠ 学会,做完才算"。
适合谁
正在准备 AI 工程师 / FDE 面试的人,这套就是按面试考察点组织的;想系统补 LLM 工程基础的开发者,哪怕只刷 01、03、05 三节也能建立完整心智模型;以及团队里需要从"会调 API"升级到"能交付系统"的工程师。
不合适的:完全零编程基础的人(默认你会 Python);以及只想"速成一个 demo"的人——这里没有捷径,但每一步都通向真正能交付的东西。
© 2026 四月
原文链接:https://www.aprilzz.com/tutorials/ai-engineer-notebooks-colab
相关文章
让 AI Agent 直接读你的网站:Accept: text/markdown 内容协商实战教程
手把手教你把网站变成 AI Agent 友好:用 Accept: text/markdown 内容协商,让 Claude Code、Cursor 等工具直接读到干净的 Markdown。含 Caddy、Nginx、Next.js、Cloudflare 配置和验证方法。
在 Mac 上搭建本地编程 Agent:llama.cpp + Gemma 4 + MTP 投机解码完整指南
断网也能用的编程 Agent:用 llama.cpp 在 Mac 上跑 Gemma 4 26B,配合 MTP 投机解码把生成速度从 58 提到 72 token/s,再接上支持图片输入的 Pi 终端 Agent。
2026 生产级 AI Agent 构建指南:从用例到监控的 8 个步骤
从用例选择到原型再到评估框架,完整的生产级 AI Agent 构建指南——8 个可操作的步骤,带代码示例和真实项目经验