GitHub 介绍四款 Agent Apps,帮助用户在 SDLC 全流程中完成功能的范围界定、安全加固、逐步推出与发布,全程无需离开 GitHub。文章展示了这些智能体应用如何将软件交付工作流直接嵌入平台。
GitHub 介绍四款 Agent Apps,帮助用户在 SDLC 全流程中完成功能的范围界定、安全加固、逐步推出与发布,全程无需离开 GitHub。文章展示了这些智能体应用如何将软件交付工作流直接嵌入平台。
GitHub Secure Open Source Fund 第四期 50 个开源项目结合 AI 辅助工作流、维护者经验、GitHub 安全工具、专家指导与资金支持,系统性提升项目安全性。该计划展示了开源生态在 AI 时代应对安全挑战的实践路径,为维护者提供了可复用的安全加固模式。
GitHub Copilot 应用发布入门指南,教用户写出第一条提示词,并学会选择合适的上下文与模型,从而自信地开启首个任务。该指南面向 Copilot 应用的新手用户,帮助其快速上手提示词编写。
AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从“不可用”转变为“可用但不符合路线图”。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的“人类探测器”。
GitHub Universe 活动将聚焦智能体如何把开发者角色从单纯写代码转向掌控代码周边的整个交付系统。活动邀请开发者共同交流、学习新技能并探索下一步方向。
GitHub 推出 Copilot SDK for Java,企业 Java 开发者可通过注解和虚拟线程等惯用 Java 代码直接驱动 GitHub Copilot。该 SDK 将 Copilot 能力嵌入 Java 开发流程,支持以原生方式集成 AI 编程助手功能。
GitHub Copilot 应用中的斜杠命令可帮助管理会话、导航项目和自定义 Copilot 工作流。与 CLI 版不同,应用版命令更侧重工作流,如 /plan 用于编码前规划、/spar 用于挑战方案假设、/autopilot 用于自动执行实现。/clear 和 /model 在 CLI 和应用中均可用。
GitHub 恶意软件公告不再局限于 npm,现已将 OpenSSF 的恶意软件包数据接入 Advisory Database。该管道以“偏执”方式构建,确保数据安全与可靠性,扩展了漏洞检测覆盖面。
GitHub 法务团队的非工程师成员(律师、项目经理、业务人员)用 Copilot CLI 构建了内部工具。产品法律顾问 Ngandu Kasuku 创建了合同起草工具 terms-ai,将审查和起草时间缩短约一半;在线安全法律顾问 Jesse Geraci 构建了法律工作流桌面应用,涵盖合同审查、NDA 分类、风险评估等。工具核心指令以纯语言 Markdown 编写,便于非技术人员定制。
GitHub 介绍用堆叠式 Pull Request(stacked PR)解决 AI 编码智能体生成巨型代码难以审查的问题。通过将 1,000+ 行的大 diff 按数据、API、接线、UI 拆成 L1-L4 四个独立分层,每层可分配不同审查者。
GitHub 为代码搜索引擎 Blackbird 优化大小写折叠性能,该引擎索引超 1.8 亿个仓库、480TB 源码。团队发现移除提前退出分支比保留优化更快,最终在 Apple M4 上实现超 45 GiB/s 吞吐,接近内存带宽。结果已开源为 Rust crate casefold,仅实现简单(1 对 1)折叠,与 ripgrep 等工具保持一致。
GitHub Copilot 应用推出堆叠会话功能,允许用户在同一个仓库中创建一系列相互承接的任务,每个会话可基于前一个会话的成果继续工作。作者通过一个十余年历史的个人项目演示了该功能:先使用 Plan 模式制定前端现代化计划,再通过堆叠会话将 React-Bootstrap 替换工作拆分为独立会话,并自动为每个会话创建对应的拉取请求,避免范围蔓延。
月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。
另有 14 家信源报道X:Kimi.ai (@Kimi_Moonshot)LMSYS:Blog(Chatbot Arena 团队)IT之家(RSS)The Decoder:AI News(RSS)X:阿易 AI Notes (@AYi_AInotes)公众号:数字生命卡兹克X:Rohan Paul (@rohanpaul_ai)X:Artificial Analysis (@ArtificialAnlys)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:AK (@_akhaliq)HuggingFace Daily Papers(社区热门论文)X:Elvis Saravia (@omarsar0, DAIR.AI)X:Kim (@kimmonismus)The Verge:AI(RSS)GitHub Copilot 推出“Harness”工作流,让开发者通过单一 AI 工具完成从原型设计、规划、实现到代码审查的完整软件开发流程,无需追逐多种新 AI 工具。该工作流强调实用性与集成性,旨在减少工具切换带来的效率损耗。
GitHub Copilot 推出一个实用工作流,让开发者用单一工具完成软件原型设计、规划、实现与代码审查,无需追逐每款新 AI 工具。该工作流将 Copilot 的聊天、内联代码补全、代码审查与 GitHub Actions 集成,覆盖从需求到部署的完整闭环。
GitHub Copilot app 将 AI 编码工具升级为多 Agent 会话工作区,支持同时管理多个任务线程而不丢失进度。用户可为每个会话绑定项目上下文,通过 /create-canvas 命令在浏览器 Canvas 中预览 UI 并直接点选修改,还能启用 Agent Merge 自动处理 PR 审查反馈和合并冲突。
Google Cloud 推出官方 Agent Skills 开源指令集,旨在让 AI 编码智能体安全、高效地执行多步骤云操作。该仓库基于 agentskills.io 开放标准,目前收录 70 多项技能,涵盖安全审计、无服务器部署、BigQuery 优化等 8 个类别。技能采用渐进式披露模型,通过验证工作流、安全门控和上下文感知机制,防止智能体盲目执行破坏性命令。
小红书引擎架构团队在OSDI 2026提出HELMSMAN,一个面向全闪存服务器的高性能向量近似最近邻搜索系统。该系统通过聚类式索引、定制化存储栈和分层学习式搜索剪枝,用约40台全闪存服务器承载了过去约35,000 CPU Core和约350 TB DRAM的负载,硬件成本节省超过90%。
同一事件,精选展示《小红书引擎架构团队 OSDI 2026 新成果:HELMSMAN 重塑大规模向量检索基础设施》GitHub Copilot 现已按公布的 API 费率对使用量计费。与直接调用模型 API 相比,用户支付的额外费用覆盖了编码工作流、策略管理和工具集成等周边服务。
小红书技术团队开源 BigMac,一种针对多模态大模型训练的依赖安全嵌套流水线新范式。它以 LLM 流水线为主干,在不打乱执行顺序的前提下嵌入编码器和生成器计算,相比基线实现 1.08x-1.9x 加速,同时保持激活显存有界。BigMac 已作为 dots 多模态模型训练的核心组件投入生产。
另有 1 家信源报道公众号:小红书技术(dots.llm)GitHub Copilot 在应用中推出 canvases 扩展,这是一种共享交互式界面,开发者和 AI 智能体可在其中实时协作。用户通过 /create-canvas 指令创建画布,Copilot 可动态更新内容,用户则通过点击、编辑等操作与同一工作区交互。示例包括快速分类 Issue、生成交互式代码库关系图、管理会话工作树、优化提示词质量以及跨平台搜索知识联系人。
2026世界人工智能大会青年优秀论文奖揭晓,清华大学助理教授姚远获“青年优秀论文奖”,博士后钱忱获“提名奖”。姚远端侧多模态论文获谷歌学术引用超1300次,MiniCPM-V落地吉利银河、三星Galaxy AI等场景;钱忱的ChatDev获超3万GitHub星标。
小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
工程师对小型功能请求的决策成本已超过代码实现成本。AI 智能体可在会议预热时间内生成首个补丁,将抽象的“是否在范围内”争论转化为可审查的具体产物。关键区分在于:代码生成便宜不等于维护便宜,只有人类能自信审查并承担长期责任的变更才算低成本。
全球首个面向具身智能的强化学习开源框架RLinf发布v0.3版本,升级为一站式开发平台,首次打通数据采集、SFT、RL、模型评测及真机部署全链路。百度智能云当天完成适配,成为国内首家支持该版本的云厂商,开发者可通过百度百舸平台一键应用最新能力。
HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。
Claude Code v2.1.210 为折叠的工具摘要行添加实时运行计时器,避免长时间工具调用显示为卡顿。新增对 Write、NotebookEdit 和 Glob 路径权限规则的启动警告,建议改用 Edit 或 Read。修复了 worktree 子智能体对主仓库执行 git 变更命令、ultracode 关键词在非人类输入中误触发等多项问题。
LMSYS 与 SGLang 团队针对智谱 GLM-5.2 NVFP4 模型在 Grace Blackwell 硬件上推出多项优化。运行时方面,Spec V2 重叠调度消除 GPU 气泡,端到端 TPS 提升 11%;IndexShare MTP 在 draft 步骤间复用 DSA indexer 的 top-k,长上下文下 draft 步骤成本降低约 1.9 倍。内核方面,TopK-V2 将 TopK 视为选择问题,80K ISL 下平均延迟从 40.7 µs 降至 17.5 µs(2.33× 加速),1M ISL 下从 372.1 µs 降至 36.6 µs(10.17× 加速)。优化后 8×B300 单 batch 解码吞吐超过 500 TPS。
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。
腾讯混元开源端到端 OCR 大模型 HyOCR-1.5,仅 1B 参数覆盖 8 种以上 text-centric 任务,在 OmniDocBench v1.6 上以 94.74 分居端到端第一。
vLLM 是一个面向 LLM 推理与服务的快速易用库,由 UC Berkeley Sky Computing Lab 发起,现由来自 2000 多名贡献者的社区维护。它通过 PagedAttention、连续批处理、前缀缓存及 FP8/INT4 等多种量化技术实现高吞吐,支持 200+ Hugging Face 模型架构,并提供 OpenAI 兼容 API 及多硬件后端。
蚂蚁集团开源 AKernel(Agent Kernel),一个将整个数据中心视为 AI 智能体可编程扩展的分布式内核。它通过统一 Python SDK 实现计算、网络和存储的编程控制,支持单机、私有 K8s 及多云(阿里云、华为云)一键部署,冷启动仅需 40 毫秒。AKernel 代码由 AI 大量贡献,并内置基于 OpenTelemetry 的全栈可观测性。
GitHub 在 Copilot 代码审查中尝试用 Copilot CLI 的共享代码探索工具(grep、glob、view)替换原有专用工具,结果导致审查成本上升、有效评论数量下降。分析 trace 发现,问题不在工具本身,而在于指令让智能体像通用编程助手一样大范围浏览仓库,而非像审查者一样从 diff 出发进行定向搜索。重写指令后,审查平均成本降低约 20%,同时保持相同审查质量。
小红书提出 PIPO 架构,通过输入侧压缩器将两个 token 折叠为一个 latent,输出侧 MTP head 将隐藏状态展开为额外 token,实现输入长度减半、每步输出翻倍。基于 Qwen3.5-4B/9B backbone,在 AIME 2025 等基准上最高带来 +7.15 pass@4 提升。部署测评中,TTFT 加速约 1.23×,TPOT 加速约 1.86×。训练采用 SFT 和 On-Policy Distillation 两阶段,将 verifier 校验能力蒸馏进轻量 confidence head。
美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。
LangChain 与 NVIDIA 推出 NemoClaw Deep Agents Blueprint,结合 Deep Agents Code、Nemotron 3 Ultra 和 OpenShell,用于构建开放且可治理的企业级 AI 智能体。该蓝图旨在为企业提供可控的智能体部署方案,整合了 NVIDIA 的推理优化与 LangChain 的智能体编排能力。
GitHub Copilot agentic harness 在多个基准测试中取得强劲结果,token 效率处于领先水平,同时支持在超过20种模型间灵活选择。
GitHub 加入一个联盟,呼吁对 California AI Transparency Act 进行针对性修订,以解决该法案与开源许可之间的冲突,并与国际透明度框架保持一致,同时保留其监管意图。
一项评估显示,GitHub Copilot agentic harness 在多个基准测试中取得强劲结果,同时具备领先的 token 效率,并保持灵活选择超过 20 个模型的能力。该 harness 可跨不同模型和任务进行部署,兼顾性能与效率。
标注分歧可源于操作失败、政策模糊或价值多元。Annotator Policy Models(APMs)是一种可解释模型,仅从标注行为学习标注者内在的安全策略,无需额外负担。验证表明模型准确率超过80%,能忠实预测反事实编辑并恢复已知差异。将APMs应用于LLM和人类标注者,可揭示不同标注者对安全指令解释的差异(政策模糊)以及不同人口群体在安全优先级上的系统性差异(价值多元),支持更具针对性、透明和包容的安全策略设计。