# AI 工程师笔记本：在 Colab 上免费、无需框架即可使用 RAG/智能体/评估工具

- 来源：Hacker News 热门（buzzing.cc 中文翻译）
- 作者：calmrocks
- 发布时间：2026-08-28 16:36
- AIHOT 分数：75
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmtcpvj9e04cpro645lmugnew
- 原文链接：https://github.com/calmrocks/ai-engineer-notebooks

## 精选理由

裸 API 写一遍 agent 循环和 RAG，比直接套 LangChain 更能理解框架在封装什么，对于 AI 工程师面试中讲清系统设计和取舍有直接帮助。

## AI 摘要

一套可运行的 Colab 笔记本，面向 AI 工程师与 FDE 技能栈，用原始 API 而非框架构建基于基础模型的系统，覆盖提示词、RAG、评估、智能体、微调与服务化。全部在免费 Groq API 上运行，无需信用卡；LoRA 微调和自托管服务提供概念讲解及可选的 Colab-GPU 附录。包含三个端到端案例研究，且全程兼容 OpenAI API，模式可直接迁移。

## 正文

AI 工程师笔记本

以你实际面试时会遇到的方式学习应用型大语言模型技术栈：不依赖框架、使用免费 API，从提示词编写一路覆盖到模型服务、微调，以及红队基准测试。

面向 AI 工程师 / 前线部署工程师（FDE）技能集的可运行 Colab 笔记本。你使用原始 API（而非框架）在基础模型之上构建可运行的系统（模型 API、RAG、评估、智能体、模型适配、服务部署）。

这套内容的独特之处

刻意不依赖框架。你先从原始 API 调用入手编写智能体循环、RAG 和评估逻辑，这样你在使用 LangChain/LlamaIndex 之前就能理解它们实际做了什么（并且能判断何时不该用）。模式是持久的，而封装层不断更迭。

评估是主线。“先测量再调优”的理念在早期就被植入，并在每个章节中反复出现。正是这个习惯，区分了交付过系统的工程师和只搭过演示的人。

端到端免费运行。所有内容都运行在免费的 Groq API 上（无需信用卡）。Groq 无法承载的两个主题——LoRA 微调（06）和自托管服务（09）——以概念讲解为主，并附有可选的、隔离的 Colab-GPU 附录，这些附录已在真实的 Colab T4 上验证通过。

真实案例研究，而非玩具演示。三个端到端案例研究展示了技能在真实约束下的综合运用：一个在生产环境中调试的客服助手、一场流水线 vs 智能体的成本对决，以及一个红队鲁棒性基准测试。

全程兼容 OpenAI 接口，因此每个模式都能直接迁移到 OpenAI，并且（稍作修改后）也能迁移到 Anthropic。只需更换 base URL，技能即可沿用。

作为《计划：转型为前线部署工程师 / AI 工程师》的实操配套内容而构建。该计划解释了学什么以及为什么学；这些笔记本则是你实际动手运行的地方。

适合谁

正在转向 AI 工程师、FDE、应用 AI 或解决方案工程师（AI）岗位的后端或全栈工程师。头衔不同，工作内容大体相同。你能交付生产级代码；你想在此基础上掌握应用模型层。

学习顺序

从上到下依次学习。每个笔记本都是独立的（自行安装依赖、从 Colab secrets 读取 API 密钥），并以练习结尾。

00 — 环境准备

笔记本 你将学到什么

环境与成本管理 通过 Colab secrets 管理 API keys、设置消费上限、选择模型

01 — 模型 API

Notebook 你将学到什么

提示词基础 清晰的指令、少样本示例、输出格式规范、逐步推理：这是成本最低的杠杆，每一项都展示了如何让指标数字发生变化

结构化输出 从模型中获取可靠的 JSON 输出，以及它在哪些环节会失效

工具调用 端到端的函数/工具调用，包括错误路径处理

流式输出 流式响应，以及 UI 对它们的需求

上下文与缓存 上下文窗口预算、提示词缓存、批量与实时定价对比

02 — 评估 I：衡量输出

Notebook 你将学到什么

衡量输出 针对第 01 节任务的黄金集与指标；在构建任何需要调优的东西之前，先养成"先测量再调优"的习惯。评估是主线；它会在之后每一节中反复出现

03 — RAG

Notebook 你将学到什么

什么是 RAG？ 检索 → 增强 → 生成的循环，为什么 RAG 优于普通 LLM，以及为什么 RAG 不等同于嵌入向量，附带一个 15 行的可运行演示

嵌入向量与检索 嵌入向量选择、向量搜索、相似度陷阱。先把检索跑通

混合检索与重排序 关键词 + 向量混合检索、重排序器，以及各自在什么场景下值得付出成本

分块 在真实杂乱语料上的分块策略，等你能够用检索效果来评判它们之后，再回头审视

RAG 为什么会失败 诊断错误答案：瓶颈通常是检索质量，而不是生成质量

04 — 评估 II：差异化优势

Notebook 你将学到什么

黄金集 为第 03 节的 RAG 系统构建黄金集

LLM 作为裁判 裁判提示词、与人类判断的一致性，以及裁判自身的失败模式

回归评估 评估作为 CI：当你修改提示词或更换模型时，捕捉质量回退

05 — 智能体

Notebook 你将学到什么

从零构建智能体循环 用原始 API 调用实现一个可运行的智能体循环，不依赖任何框架

工具设计 设计模型真正能用得好的工具

护栏与预算 停止条件、成本/延迟预算，以及什么时候流水线比智能体更合适

MCP 与工具生态 概念：Model Context Protocol 标准化了什么，它如何映射到原始工具循环，以及什么时候该使用它

技能与渐进式披露 概念：将可复用的专业知识打包，供智能体按需加载。SKILL.md 模式、上下文预算的收益，以及 Tools/MCP/Skills 三者如何构成一个完整故事

驾驭工程（Harness engineering） 综合：围绕调用的脚手架——上下文组装与压缩、工具结果整形、验证循环。为本章节此前逐块讲授的内容给出统一命名

06 —— 适配模型

Notebook 你将学到什么

微调 vs RAG vs 提示词 何时改变模型权重 vs 改变模型输入；LoRA/QLoRA 是什么及其成本；你在会议室里会遇到的那场争论，外加一个可选的、在免费 GPU 上进行的真实 LoRA 微调实验

07 —— 安全

Notebook 你将学到什么

提示词注入与信任边界 直接与间接提示词注入、输出处理、PII、过度自主性。OWASP LLM Top 10 风险，先现场演示失败，再演示如何防御

08 —— 运维

Notebook 你将学到什么

可观测性与 LLMOps 追踪每一次调用、安全的提示词日志记录、成本/延迟/错误指标、漂移检测，以及“观测→评估”反馈闭环

可靠性与降级方案 带退避的重试、超时、备用模型、输出验证、熔断器、优雅降级

实验追踪与模型注册 端到端使用 MLflow：从第 04 节的评估框架中记录运行/参数/指标，注册并版本化管理模型，按阶段提升——这套工具把“我跑了一次评估”变成可追踪、可复现的工作流

09 —— 服务部署与推理性能

在免费 Groq API 无法运行该主题的地方（这些框架需要 GPU），Notebook 采用概念优先的方式教学，并将可选的 Colab-GPU 附录单独隔离，与第 06 节 LoRA 附录的模式相同。

Notebook 你将学到什么

服务部署框架 AI 工程师真正会在其中做选择的服务部署技术栈（vLLM、TGI、Triton、TensorRT-LLM）：各自优化什么、如何映射到你一直在调用的原始 API、何时该选哪一个

推理性能 吞吐量与延迟背后的杠杆：连续批处理、KV cache、量化，以及吞吐量 vs 延迟的权衡，附上用于估算部署规模的粗略计算

10 —— ML 系统设计与性能

Notebook 你将学到什么

设计一个推理服务 概念：机器学习系统设计面试，端到端走一遍：QPS/VRAM/延迟/成本估算、副本扩缩容、队列、缓存，以及 SLA 权衡，基于一个真实的 LLM 服务提示词场景。

11 — 客户工艺（FDE 的差异化优势）

笔记本 你将学到什么

范围界定与发现 把模糊的客户需求变成一个范围明确、可评估的系统：发现性问题、一页纸的范围界定文档、演示纪律：大多数工程师拿不出证据的客户场景面试轮次。

12 — 案例研究与毕业设计

在这里，各项技能汇聚成项目。先是一个案例研究（一个真实场景端到端走完、可运行），然后是毕业设计：你自己构建并部署的代码仓库。（章节概览。）

笔记本 你将学到什么

案例研究 A — 客服助手 一个场景从范围界定 → 构建 → 部署 → 生产环境调试：一个模糊的需求变成一个已部署、已评估的 RAG+智能体助手，然后出现一个真实的质量回退（语料库迁移后索引过期），由你来诊断和修复。一条从构建到调试的主线，贯穿第 02–11 节。

案例研究 B — 合同抽取：流水线 vs 智能体 面试官最爱的判断力考验：把同一个抽取任务分别用智能体和流水线实现，然后用准确率 + token 成本证明：当步骤已知时，流水线胜出。

案例研究 C — 红队鲁棒性基准测试 一种不同类型的系统：一个评估模型而非服务模型的测试框架：一个攻击者→目标→裁判（PAIR）循环，用来衡量攻击成功率，把智能体循环、LLM 裁判、安全性和评估组合在一起。

毕业设计：写进简历的部署项目简报，一个包含服务组件和评估报告的真实代码仓库。案例研究是为了学习；毕业设计是为了求职。

约定

使用原始模型 API，不用框架。模式是持久的；封装层会频繁更替。

在 RAG 和评估部分共享同一个语料库（data/），这样评估衡量的就是你实际构建的检索。

自包含笔记本。第一个单元格负责安装，第二个单元格调用 `from aien import setup; client, MODEL = setup()` 从 Colab 密钥（或本地环境变量）加载你的密钥。笔记本之间没有隐藏状态。`aien` 是本仓库中那个极简的共享设置包（只需一处即可修改凭据加载方式），由第一个单元格自动安装。

每个笔记本都以练习结尾。继续往下学之前，先把它们做完。

环境配置

在 console.groq.com 获取一个免费 API 密钥，无需信用卡。

在 Colab 中：点击左侧边栏的密钥图标 → 将 `GROQ_API_KEY` 添加为密钥，并开启笔记本访问权限。

通过徽章打开任意笔记本，然后从上到下依次运行。

如果想在本地运行：`pip install -r requirements.txt && pip install -e .`（第二条命令会安装 `aien` 设置辅助包），然后 `export GROQ_API_KEY=...`，再用 Jupyter 打开。
