Topic · 主题全部主题 →

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

2,380条收录
356条精选

精选归档 · 第 14 页

261280 条 · 共 356

5月14日

星期四 · 1 条
02:31
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 62/100
在 Windows 上构建安全有效的沙箱以启用 Codex

OpenAI 为 Windows 平台上的 Codex 构建了一个安全沙箱环境。该沙箱通过严格控制文件访问权限和实施网络限制,确保了代码生成与执行过程的安全性。这一举措使得基于 Codex 的编码助手能够以高效且受控的方式运行,在提供强大编程辅助功能的同时,有效隔离了潜在风险,保障了用户系统的安全。


推荐理由:OpenAI 首度公开 Codex 在 Windows 上的沙箱细节,控制文件访问和网络限制的架构设计讲得很实在,做自主编程代理安全的值得一读。

5月13日

星期三 · 4 条
07:09
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 63/100
财务团队如何使用 Codex

财务团队能够利用 Codex,基于实际工作输入构建管理层报告、报告包、差异桥接、模型检查和规划场景。该工具将自然语言指令转化为代码,自动化处理财务数据整合、差异分析和模型验证等复杂任务,从而提升报告生成效率与准确性,并支持快速创建多版本规划场景。


推荐理由:金融团队终于有了一个正经的 AI 用例,用 Codex 自动生成 MBR、差异桥接和规划场景,比手工拉 Excel 高效太多了,做财务分析的建议点开看看。
02:54
Claude:Blog(网页)精选
AI 评分 58/100
Anthropic 网络安全团队如何利用 Claude Code 构建威胁检测平台

Anthropic 检测平台工程团队技术负责人 Jackie Bow 运用 Claude Code 开发了 CLUE 威胁检测与响应平台。该平台通过自然语言界面连接内部系统,包含 CLUE Triage 自动初筛警报,整合上下文信息分配处置建议;以及 CLUE Investigate 支持分析师用自然语言查询日志,由 Claude 自动生成并执行查询,将数小时的人工分析缩短至几分钟。团队在一天内完成概念验证,一周内交付实现,显著提升了安全运营效率。


推荐理由:我一直好奇大模型公司自己怎么用 AI 做安全,这篇挖出了 Anthropic 内部 CLUE 平台的构建细节——从一天出原型到每周省下 234 人天,数据比很多 PR 稿扎实。
01:05
Google Developers Blog(RSS)精选
AI 评分 73/100
使用ADK构建可暂停、恢复且永不丢失上下文的长时运行AI智能体

本文探讨了如何从无状态聊天机器人升级为生产级AI智能体,以管理长达数天或数周的企业工作流程(如HR入职)。通过引入Agent Development Kit(ADK),其架构核心采用持久状态机和持久化会话存储,确保智能体在“空闲时间”或服务器重启时永不丢失上下文。系统利用事件驱动的Webhook和多智能体委托机制,实现在暂停期间“休眠”,并在唤醒后以高推理准确性恢复复杂任务,从而构建出具备韧性和可靠性的长时运行智能体系统。


推荐理由:Google 官方手把手教你把无状态 chatbot 升级成能跨天跨周的持久化 agent,状态机和持久会话是两个关键切入点,做过生产环境 agent 的都懂这东西有多刚需。

5月12日

星期二 · 3 条
23:53
GitHub Blog精选
AI 评分 58/100
Dungeons & Desktops: 使用 GitHub Copilot CLI 构建一款程序化生成的 Roguelike 游戏

一位 GitHub 员工利用 GitHub Copilot CLI 开发了一款扩展程序,能够将任何代码库转换成一个独特的 Roguelike 风格地下城。该工具通过 AI 辅助的代码生成,实现了程序化关卡创建,展示了 Copilot CLI 在创意编码和游戏原型开发中的实际应用潜力。项目核心是自动解析代码结构并生成对应的可探索地下城布局。


推荐理由:用 GitHub Copilot CLI 把代码库变成 roguelike 地牢,玩法挺有脑洞,做 Copilot 扩展的开发者可以看一眼思路。
07:43
Hugging Face:Blog(RSS)精选
AI 评分 58/100
在AWS上进行基础模型训练与推理的核心构建模块

本文面向使用开源框架的机器学习工程师,阐述了AWS如何为大规模基础模型的全生命周期提供核心基础设施。其核心是三大紧密集成的组件:配备多代NVIDIA GPU(如H100、H200及新一代Blackwell B200/B300)的大显存加速计算实例;用于集体通信的高带宽、低延迟网络(节点内NVLink与节点间EFA);以及可扩展的分布式存储。这些基础设施与Slurm/Kubernetes等资源编排系统、PyTorch/JAX等ML框架协同,共同支撑预训练、后训练和推理工作负载,并可通过Prometheus/Grafana实现全栈可观测性。


推荐理由:这篇把AWS上训大模型的全套基础设施串了一遍,从GPU选型到网络存储再到Slurm/K8s编排,是做云端大规模训练的工程师的必读参考。
03:52
Simon Willison 博客精选
AI 评分 80/100
在脚本的shebang行中使用LLM

本文介绍了一种创新方法,将LLM工具直接嵌入脚本的shebang行中执行指令。通过LLM的fragments模式,shebang行可执行简单任务,如生成SVG图像;使用-T选项能调用外部工具(如llm_time)创作包含当前时间的俳句;更复杂的是运行YAML模板,其中定义了Python函数作为工具进行数学计算,示例中演示了计算2344乘以5252加134的过程,并通过调试输出展示了分步结果,最终得到12,310,822。这展现了LLM作为脚本解释器的强大扩展性,能够支持从内容生成到数据查询的多样化任务。


推荐理由:Simon 这个 shebang 技巧让 LLM 直接变成脚本解释器,虽然是极客玩法,但对常写自动化脚本的开发者来说可以直接抄走,创意很妙。

5月10日

星期日 · 2 条
22:33
阿绎 AYi@AYi_AInotes精选
AI 评分 80/100
教育科技门槛一夜归零:AI助力单人低成本开发3D教学应用holy shit,The barrier to educational technology has vanished overnight.这回教育科技的门槛,一夜之间归零了, why?来往下看,最后附上了任何人都可以做的零代码工作流教程 💻• 2020年:做一个同等质量的3D教育App,需要3D建模师×2 + UI设计师×1 + 生物学家×1 + 前端工程师×3 + 产品经理×1,耗时6个月,成本80万美元。• 2026年:一个懂生物的普通人,用GPT Images 2 + Gemini 3.1 Pro,48小时,成本不到10美元。没有团队,没有融资,没有技术门槛, 你甚至都不需要会3D建模,不需要会写React,不需要懂Three.js。你只需要懂生物学,知道什么是对学生重要的。AI会帮你把所有的技术活全部干完。damn,这简直就是生产关系的效率革命, 以前教育科技是大公司和亿万富翁的游戏。 现在,任何一个老师,任何一个父母,任何一个对某个领域有热情的人,都能做出比教科书好100倍的教学工具。过去只有伊顿公学和哈佛附中才有虚拟实验室, 现在,任何一个能上网的家庭,花10美元就能给自己的孩子做一个专属的。 教育不平等,第一次有了被反向拉平的可能!可1:1复制的零代码工作流,任何人都能做,老规矩评论区自取👇AI工具GPT Images 2和Gemini 3.1 Pro的出现,彻底颠覆了教育应用的开发模式。过去需多人团队、数月时间和高昂成本才能完成的3D教育应用,如今一个具备领域知识(如生物学)的普通人,仅用约48小时和不到10美元即可实现。这消除了对编程、3D建模等技术能力的依赖,使教师、家长等个体也能独立创造高质量互动教学工具。此举有望推动过去仅属于精英机构的教学资源(如虚拟实验室)普及,为缩小教育不平等提供了新的技术路径。

Dilum Sanjaya: Fun interactive science app ideas | Part 3 Played around with generating 3D biological structures and made an app to exp...


推荐理由:阿易这视频展示了 GPT Images 2 和 Gemini 3.1 Pro 的组合,48 小时从想法到可交互 3D 教学 App,零代码工作流直接可以抄,教育技术门槛真的归零了,做内容的别错过。
01:29

5月9日

星期六 · 2 条
03:43
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 63/100
在OpenAI安全运行Codex

OpenAI通过沙盒隔离、人工审批流程、严格网络策略与原生代理遥测四层防护机制,确保Codex代码生成模型的安全运行。沙盒环境完全隔离执行代码,所有生产请求需经人工审核批准,网络策略限制外部依赖访问,实时遥测系统监控代理行为异常。该安全框架使企业能够合规采用AI编程助手,在保障代码安全性的同时维持开发效率。


推荐理由:OpenAI 公开了内部安全运行 Codex 的完整流程,从沙箱隔离到审批策略,企业落地 AI 编码的可以直接拿去抄作业。

5月8日

星期五 · 5 条
16:23
Hugging Face:Blog(RSS)精选
AI 评分 58/100
MedQA:基于AMD ROCm与LoRA微调Qwen3-1.7B的临床问答模型

该项目使用AMD Instinct MI300X(192 GB HBM3显存)和ROCm,通过LoRA微调Qwen3-1.7B模型实现医学问答。训练仅用2000条MedMCQA样本,约5分钟完成,仅更新约220万参数(占模型总参数的0.1443%),全程采用fp16精度,无需量化。HuggingFace生态(Transformers、PEFT、TRL、Accelerate)在ROCm上无缝运行,无需修改代码即可直接替代CUDA。模型已上传至HuggingFace Hub并提供在线Demo。


推荐理由:一个月前的教程了,但如果你是 AMD 党想跑医疗微调,这篇把坑都踩完了,代码直接能复现,LoRA 适配器也挂在 Hub 上,拿来就能用。
08:06
Rohan Paul@rohanpaul_ai精选
AI 评分 78/100
atomic.chat为LLaMA.cpp引入多令牌预测技术,显著加速本地模型推理atomic[.]chat just made Gemma 4 26B faster inside LLaMA.cpp.making token generation about 40% faster in its MacBook Pro M5 Max test.Great news for local llms, because LLaMA.cpp and GGUF sit close to the local AI user base, where support often spreads into desktop apps, coding agents, and private on-device assistants.MTP (maltai token prediction) is like a smaller assistant drafting the next few words, while the main model checks whether those words are acceptable. If the draft is correct, the system accepts several tokens quickly. If the draft is wrong, the system rejects the wrong part and falls back to normal generation.atomic.chat通过为LLaMA.cpp引入多令牌预测技术,大幅提升了本地大型语言模型的推理效率。该技术利用小型辅助模型预先生成后续令牌草案,由主模型进行验证。在MacBook Pro M5 Max上测试时,使Gemma 4 26B模型的令牌生成速度加快约40%,整体运行速度提升1.5倍。这项优化进一步巩固了LLaMA.cpp和GGUF格式在本地AI生态中的核心地位,为桌面应用、编程助手和私有设备助手等场景提供了更高效的部署方案。

atomic.chat: Multi-Token Prediction (MTP) for LLaMA.cpp! Running Gemma4 local model 1.5x faster. We patched LLaMA.cpp. Quantized Gemm...


推荐理由:在笔记本上把 Gemma 26B 的生成速度拉高 40% 是个真实的体验提升,atomic.chat 把 MTP 带入 LLaMA.cpp 生态,本地 AI 玩家可以直接拿去用。
07:30
GitHub Blog精选
AI 评分 72/100
提升 GitHub Agentic Workflows 的 Token 使用效率

GitHub 发现运行于每个拉取请求的智能体工作流会累积高昂的 API 成本。团队通过监测自身生产工作流,定位了效率低下的环节,并构建了专门的智能体进行优化。这一举措旨在显著降低由大语言模型调用产生的 Token 消耗与相关费用,直接提升了工作流的经济性与运行效率。


推荐理由:GitHub 把自己生产环境的 agentic workflow 扒了一遍,从 token 消耗里找浪费,再让 agent 自动修。不是 paper,是真踩过的坑,做 Copilot 集成的团队可以抄作业。
03:30
GitHub Blog精选
AI 评分 79/100
Agent pull requests 无处不在:如何审查它们

这份指南提供了审查由AI代理生成的pull requests的实用方法,重点包括审查时应关注的代码变更点、问题常见隐藏位置(如逻辑错误或安全漏洞),以及如何在代码合并前捕捉技术债务。它通过具体步骤帮助开发者系统评估自动化提交,确保代码质量,避免缺陷流入生产环境。指南强调主动审查策略,以应对AI代理在软件开发中日益普及的趋势。


推荐理由:AI代理生成的PR越来越多,审查它们不再是可选项。这篇官方指南从发现隐患到控制技术债务,给出了马上能用的检查清单,每个用Copilot的开发者都该看。

5月7日

星期四 · 2 条
05:30
GitHub Blog精选
AI 评分 56/100
Validating agentic behavior when "correct" isn't deterministic

GitHub 探讨如何为 Copilot 编码智能体构建“信任层”。文章提出,在“正确”答案非确定性的场景下,可通过领域分析来验证智能体的自主行为,避免使用脆弱的脚本或黑盒判断。该方法旨在提升 AI 编码助手的可靠性与透明度,确保其行为符合预期标准。


推荐理由:做coding agent最头疼的就是如何验证产出质量,GitHub这篇把他们的内部方法论开源了,用dominance分析替代脆弱的脚本,对正在折腾AI编程工具的团队是实打实的参考,值得逐帧学习。
03:22
Hugging Face:Blog(RSS)精选
AI 评分 65/100
vLLM V0 到 V1:在线强化学习中优先确保后端行为正确性

为确保 vLLM 从 0.8.5 到 0.18.1 的重大重写后,在线强化学习训练结果与 V0 参考运行一致,团队优先修复后端行为而非调整 RL 目标。关键修复包括:将日志概率模式设为 processed_logprobs 以匹配采样器分布;禁用 V1 特有的前缀缓存和异步调度等运行时默认值;调整权重更新路径以匹配 V0 的缓存保留行为;并确保 rollout 后端使用 fp32 精度的 lm_head 进行最终投影。这些措施消除了策略比率均值偏差,使 V1 在 KL 散度、熵等指标上与 V0 达成一致。


推荐理由:vLLM V1迁移时踩的四个坑全在这里,从logprob语义到fp32投影头,修完才调RL目标,做在线RL的团队可以直接抄这份配置清单。

5月6日

星期三 · 1 条
18:16
阿绎 AYi@AYi_AInotes精选
AI 评分 79/100
这个创造了Claude Code的男人Boris Cherny大神,完整公开了自己的工作流,并直播演示了一半的编码工作在手机上完成🤪这个创造了Claude Code的男人Boris Cherny大神,完整公开了自己的工作流,并直播演示了一半的编码工作在手机上完成🤪不是回消息,是同时跑5到10个Claude实例, 用手机启动任务,去喝咖啡,回来代码写好了🤣他刚公开了自己的完整工作流,看完之后我发现, 核心就三件事,但每一件都跟大多数人的直觉相反:第一,永远选最贵最聪明的模型 听着像烧钱,实际上反过来,聪明模型一次想清楚,笨模型来回试错烧掉的token远超差价。 他的原话:"计划做得好,代码自然好。"第二,整个团队维护一个纯文本知识库 不是Notion,不是花哨的文档系统,就是一个txt文件。Claude每犯一次错,记一笔,每周更新好几次,这个文件就是团队的长期记忆,Claude不会在同一个地方摔倒两次。第三,永远让Claude看到自己代码的运行结果 能跑代码,能看浏览器渲染, 他的比喻很准:"你让一个画家蒙着眼睛画画, 画完不让他看,然后怪他画得丑?"他的清晨流程:醒来,手机上启动三个任务, 该干嘛干嘛,晚点回来检查。规划模式起步 → 敲定计划 → 自动接受修改 → 完成多个Claude实例,一个周密计划,一个共享知识库,没了。Boris Cherny公开其高效AI编码工作流,核心基于三点反直觉原则:1. 坚持使用最昂贵、最聪明的模型(如Claude),因其能一次性清晰规划,避免笨模型反复试错消耗更多token;2. 团队仅维护一个纯文本知识库文件,记录Claude的每次错误并每周更新,形成长期记忆;3. 始终让Claude查看自身代码的运行结果(包括执行和渲染)。其工作模式是在手机上并行启动多个Claude实例,基于规划模式制定方案后自动执行修改,从而高效完成任务。

推荐理由:Boris Cherny 的 Claude Code 工作流是「反直觉但真能省钱省时间」的实操手册,三条原则每一条都可以抄进团队规范,看完立刻能上线。