AI 工程师笔记本:在 Colab 上免费、无需框架即可使用 RAG/智能体/评估工具

Hacker News 热门(buzzing.cc 中文翻译)·2026-08-28 16:36·27分钟前·calmrocks
AI 导读

一套可运行的 Colab 笔记本,面向 AI 工程师与 FDE 技能栈,用原始 API 而非框架构建基于基础模型的系统,覆盖提示词、RAG、评估、智能体、微调与服务化。全部在免费 Groq API 上运行,无需信用卡;LoRA 微调和自托管服务提供概念讲解及可选的 Colab-GPU 附录。包含三个端到端案例研究,且全程兼容 OpenAI API,模式可直接迁移。

Hacker News 热门(buzzing.cc 中文翻译)
精选
75AI 编辑部评分,满分 100

AI 工程师笔记本:在 Colab 上免费、无需框架即可使用 RAG/智能体/评估工具

2026-08-28 16:36· 27分钟前· calmrocks
AI 导读

一套可运行的 Colab 笔记本,面向 AI 工程师与 FDE 技能栈,用原始 API 而非框架构建基于基础模型的系统,覆盖提示词、RAG、评估、智能体、微调与服务化。全部在免费 Groq API 上运行,无需信用卡;LoRA 微调和自托管服务提供概念讲解及可选的 Colab-GPU 附录。包含三个端到端案例研究,且全程兼容 OpenAI API,模式可直接迁移。

推荐理由

裸 API 写一遍 agent 循环和 RAG,比直接套 LangChain 更能理解框架在封装什么,对于 AI 工程师面试中讲清系统设计和取舍有直接帮助。

正文 · AI 翻译

AI 工程师笔记本

License: MIT Open In Colab GitHub stars

以你实际面试时会遇到的方式学习应用型大语言模型技术栈:不依赖框架、使用免费 API,从提示词编写一路覆盖到模型服务、微调,以及红队基准测试。

面向 AI 工程师 / 前线部署工程师(FDE)技能集的可运行 Colab 笔记本。你使用原始 API(而非框架)在基础模型之上构建可运行的系统(模型 API、RAG、评估、智能体、模型适配、服务部署)。

这套内容的独特之处

  • 刻意不依赖框架。你先从原始 API 调用入手编写智能体循环、RAG 和评估逻辑,这样你在使用 LangChain/LlamaIndex 之前就能理解它们实际做了什么(并且能判断何时不该用)。模式是持久的,而封装层不断更迭。
  • 评估是主线。“先测量再调优”的理念在早期就被植入,并在每个章节中反复出现。正是这个习惯,区分了交付过系统的工程师和只搭过演示的人。
  • 端到端免费运行。所有内容都运行在免费的 Groq API 上(无需信用卡)。Groq 无法承载的两个主题——LoRA 微调(06)和自托管服务(09)——以概念讲解为主,并附有可选的、隔离的 Colab-GPU 附录,这些附录已在真实的 Colab T4 上验证通过。
  • 真实案例研究,而非玩具演示。三个端到端案例研究展示了技能在真实约束下的综合运用:一个在生产环境中调试的客服助手、一场流水线 vs 智能体的成本对决,以及一个红队鲁棒性基准测试。
  • 全程兼容 OpenAI 接口,因此每个模式都能直接迁移到 OpenAI,并且(稍作修改后)也能迁移到 Anthropic。只需更换 base URL,技能即可沿用。

作为《计划:转型为前线部署工程师 / AI 工程师》的实操配套内容而构建。该计划解释了学什么以及为什么学;这些笔记本则是你实际动手运行的地方。

适合谁

正在转向 AI 工程师、FDE、应用 AI 或解决方案工程师(AI)岗位的后端或全栈工程师。头衔不同,工作内容大体相同。你能交付生产级代码;你想在此基础上掌握应用模型层。

学习顺序

从上到下依次学习。每个笔记本都是独立的(自行安装依赖、从 Colab secrets 读取 API 密钥),并以练习结尾。

00 — 环境准备

笔记本 你将学到什么
环境与成本管理Open In Colab 通过 Colab secrets 管理 API keys、设置消费上限、选择模型

01 — 模型 API

Notebook 你将学到什么
提示词基础Open In Colab 清晰的指令、少样本示例、输出格式规范、逐步推理:这是成本最低的杠杆,每一项都展示了如何让指标数字发生变化
结构化输出Open In Colab 从模型中获取可靠的 JSON 输出,以及它在哪些环节会失效
工具调用Open In Colab 端到端的函数/工具调用,包括错误路径处理
流式输出Open In Colab 流式响应,以及 UI 对它们的需求
上下文与缓存Open In Colab 上下文窗口预算、提示词缓存、批量与实时定价对比

02 — 评估 I:衡量输出

Notebook 你将学到什么
衡量输出Open In Colab 针对第 01 节任务的黄金集与指标;在构建任何需要调优的东西之前,先养成"先测量再调优"的习惯。评估是主线;它会在之后每一节中反复出现

03 — RAG

Notebook 你将学到什么
什么是 RAG?Open In Colab 检索 → 增强 → 生成的循环,为什么 RAG 优于普通 LLM,以及为什么 RAG 不等同于嵌入向量,附带一个 15 行的可运行演示
嵌入向量与检索Open In Colab 嵌入向量选择、向量搜索、相似度陷阱。先把检索跑通
混合检索与重排序Open In Colab 关键词 + 向量混合检索、重排序器,以及各自在什么场景下值得付出成本
分块Open In Colab 在真实杂乱语料上的分块策略,等你能够用检索效果来评判它们之后,再回头审视
RAG 为什么会失败Open In Colab 诊断错误答案:瓶颈通常是检索质量,而不是生成质量

04 — 评估 II:差异化优势

Notebook 你将学到什么
黄金集Open In Colab 为第 03 节的 RAG 系统构建黄金集
LLM 作为裁判Open In Colab 裁判提示词、与人类判断的一致性,以及裁判自身的失败模式
回归评估Open In Colab 评估作为 CI:当你修改提示词或更换模型时,捕捉质量回退

05 — 智能体

Notebook 你将学到什么
从零构建智能体循环Open In Colab 用原始 API 调用实现一个可运行的智能体循环,不依赖任何框架
工具设计Open In Colab 设计模型真正能用得好的工具
护栏与预算Open In Colab 停止条件、成本/延迟预算,以及什么时候流水线比智能体更合适
MCP 与工具生态Open In Colab 概念:Model Context Protocol 标准化了什么,它如何映射到原始工具循环,以及什么时候该使用它
技能与渐进式披露Open In Colab 概念:将可复用的专业知识打包,供智能体按需加载。SKILL.md 模式、上下文预算的收益,以及 Tools/MCP/Skills 三者如何构成一个完整故事
驾驭工程(Harness engineering)Open In Colab 综合:围绕调用的脚手架——上下文组装与压缩、工具结果整形、验证循环。为本章节此前逐块讲授的内容给出统一命名

06 —— 适配模型

Notebook 你将学到什么
微调 vs RAG vs 提示词Open In Colab 何时改变模型权重 vs 改变模型输入;LoRA/QLoRA 是什么及其成本;你在会议室里会遇到的那场争论,外加一个可选的、在免费 GPU 上进行的真实 LoRA 微调实验

07 —— 安全

Notebook 你将学到什么
提示词注入与信任边界Open In Colab 直接与间接提示词注入、输出处理、PII、过度自主性。OWASP LLM Top 10 风险,先现场演示失败,再演示如何防御

08 —— 运维

Notebook 你将学到什么
可观测性与 LLMOpsOpen In Colab 追踪每一次调用、安全的提示词日志记录、成本/延迟/错误指标、漂移检测,以及“观测→评估”反馈闭环
可靠性与降级方案Open In Colab 带退避的重试、超时、备用模型、输出验证、熔断器、优雅降级
实验追踪与模型注册Open In Colab 端到端使用 MLflow:从第 04 节的评估框架中记录运行/参数/指标,注册并版本化管理模型,按阶段提升——这套工具把“我跑了一次评估”变成可追踪、可复现的工作流

09 —— 服务部署与推理性能

在免费 Groq API 无法运行该主题的地方(这些框架需要 GPU),Notebook 采用概念优先的方式教学,并将可选的 Colab-GPU 附录单独隔离,与第 06 节 LoRA 附录的模式相同。

Notebook 你将学到什么
服务部署框架Open In Colab AI 工程师真正会在其中做选择的服务部署技术栈(vLLM、TGI、Triton、TensorRT-LLM):各自优化什么、如何映射到你一直在调用的原始 API、何时该选哪一个
推理性能Open In Colab 吞吐量与延迟背后的杠杆:连续批处理、KV cache、量化,以及吞吐量 vs 延迟的权衡,附上用于估算部署规模的粗略计算

10 —— ML 系统设计与性能

Notebook 你将学到什么
设计一个推理服务Open In Colab 概念:机器学习系统设计面试,端到端走一遍:QPS/VRAM/延迟/成本估算、副本扩缩容、队列、缓存,以及 SLA 权衡,基于一个真实的 LLM 服务提示词场景。

11 — 客户工艺(FDE 的差异化优势)

笔记本 你将学到什么
范围界定与发现Open In Colab 把模糊的客户需求变成一个范围明确、可评估的系统:发现性问题、一页纸的范围界定文档、演示纪律:大多数工程师拿不出证据的客户场景面试轮次。

12 — 案例研究与毕业设计

在这里,各项技能汇聚成项目。先是一个案例研究(一个真实场景端到端走完、可运行),然后是毕业设计:你自己构建并部署的代码仓库。(章节概览。)

笔记本 你将学到什么
案例研究 A — 客服助手Open In Colab 一个场景从范围界定 → 构建 → 部署 → 生产环境调试:一个模糊的需求变成一个已部署、已评估的 RAG+智能体助手,然后出现一个真实的质量回退(语料库迁移后索引过期),由你来诊断和修复。一条从构建到调试的主线,贯穿第 02–11 节。
案例研究 B — 合同抽取:流水线 vs 智能体Open In Colab 面试官最爱的判断力考验:把同一个抽取任务分别用智能体和流水线实现,然后用准确率 + token 成本证明:当步骤已知时,流水线胜出。
案例研究 C — 红队鲁棒性基准测试Open In Colab 一种不同类型的系统:一个评估模型而非服务模型的测试框架:一个攻击者→目标→裁判(PAIR)循环,用来衡量攻击成功率,把智能体循环、LLM 裁判、安全性和评估组合在一起。

毕业设计:写进简历的部署项目简报,一个包含服务组件和评估报告的真实代码仓库。案例研究是为了学习;毕业设计是为了求职。

约定

  • 使用原始模型 API,不用框架。模式是持久的;封装层会频繁更替。
  • 在 RAG 和评估部分共享同一个语料库(data/),这样评估衡量的就是你实际构建的检索。
  • 自包含笔记本。第一个单元格负责安装,第二个单元格调用 `from aien import setup; client, MODEL = setup()` 从 Colab 密钥(或本地环境变量)加载你的密钥。笔记本之间没有隐藏状态。`aien` 是本仓库中那个极简的共享设置包(只需一处即可修改凭据加载方式),由第一个单元格自动安装。
  • 每个笔记本都以练习结尾。继续往下学之前,先把它们做完。

环境配置

  1. 在 console.groq.com 获取一个免费 API 密钥,无需信用卡。
  2. 在 Colab 中:点击左侧边栏的密钥图标 → 将 `GROQ_API_KEY` 添加为密钥,并开启笔记本访问权限。
  3. 通过徽章打开任意笔记本,然后从上到下依次运行。

如果想在本地运行:`pip install -r requirements.txt && pip install -e .`(第二条命令会安装 `aien` 设置辅助包),然后 `export GROQ_API_KEY=...`,再用 Jupyter 打开。

来源:Hacker News 热门(buzzing.cc 中文翻译)· github.com