内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

精选

7月26日 · 周日
最新精选
全部模型产品行业论文技巧
标签「开源/仓库」清除

7月24日周五

17:54Hacker News 热门(buzzing.cc 中文翻译)79Claude-thermos:保持 Claude 会话缓存热度,避免重新编码费用Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。推荐理由:一个小工具解决了一个被忽视的成本黑洞,Claude Code 的缓存过期,作者自己测了 185 个会话,省下 22% 费用,对于把 Claude 当开发助手的团队来说是个必装工具。

7月23日周四

13:53Hacker News 热门(buzzing.cc 中文翻译)70Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。推荐理由:把置信度探针塞进 Gemma 4 E2B,让模型自己判断该不该求助大模型,仅路由 15-35% 的查询就能持平 Flash-Lite,对离线/隐私优先的端侧产品是个省成本的新思路。
03:23Hacker News 热门(buzzing.cc 中文翻译)76GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace TokenizersGigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。推荐理由:GigaToken 把分词速度直接拉到 GB/s 级别,对处理大规模文本的团队是实打实的效率提升,数据集预处理不再是瓶颈。
02:22Microsoft Research73微软 MagenticLite 模型全面开源MagenticLite 的模型现已完全开源。 此前在 Microsoft Foundry 上提供的 MagenticBrain 和 Fara 1.5,现已在 Hugging Face 上开放权重。 该应用、测试工具以及堆栈中的每个模型现已全部开放。推荐理由:微软把这些模型全开源了,从 Foundry 搬到 Hugging Face,对不想被平台锁定的开发者是个好信号,但模型能力本身不算顶尖,更偏生态布局。

7月22日周三

18:10公众号:小红书技术(dots.llm)62小红书开源 BigMac:多模态大模型训练新范式小红书技术团队开源 BigMac,一种针对多模态大模型训练的依赖安全嵌套流水线新范式。它以 LLM 流水线为主干,在不打乱执行顺序的前提下嵌入编码器和生成器计算,相比基线实现 1.08x-1.9x 加速,同时保持激活显存有界。BigMac 已作为 dots 多模态模型训练的核心组件投入生产。推荐理由:过去多模态训练要么废显存要么慢到崩溃,BigMac 用“嵌套流水线”破掉了这个帕累托前沿,做多模态大模型且被训练效率卡住的团队值得动手试一下。
02:22OpenCode56Laguna S 2.1 免费开源上线 OpenCodeLaguna S 2.1 现已在 OpenCode 上免费提供 1M 上下文窗口 · 完全开源 Poolside 迄今为止最强大的模型推荐理由:OpenCode 免费上了 Poolside 的最强模型,1M 上下文且完全开源,对写长代码的开发者是实打实的顺手工具,可以省一笔算力开销。

7月21日周二

19:10公众号:小红书技术(dots.llm)81小红书 dots 模型获 IMO 2026 满分金牌小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。推荐理由:IMO满分金牌这个里程碑,背后是模型递归自我批判能力的突破。不依赖形式化验证就能给出优雅证明,这对数学推理研究是个真信号,做推理方向的值得细读。
02:08Cursor Blog64Cursor 测试新型 AI 智能体集群:规划者+执行者分工,4小时通过80% SQL测试Cursor 测试了新型 AI 智能体集群,将任务分解为规划者(使用最强模型)和执行者(使用快速廉价模型)。使用 Grok 4.5 时,新集群在 4 小时内通过了 80% 的 SQL 测试套件,而旧集群在第二小时前失败。该系统已用于构建浏览器、修复漏洞和生成数十亿 token 合成训练数据。推荐理由:Cursor首次公开agent swarm的内部架构和协调失败模式,把835页规格文档变成可运行的SQLite数据库并开源,对做AI编程工具的团队和agent架构师来说,这些细节是金矿。

7月20日周一

20:49Hacker News 热门(buzzing.cc 中文翻译)70LoRA Speedrun 公开排行榜:6分05秒微调Qwen2.5-1.5B达GSM8K 61.1%准确率LoRA Speedrun项目推出公开排行榜,在固定硬件(单张L40S)上比拼Qwen2.5-1.5B的微调运行时间。当前纪录由@Saivineeth147以6分05秒保持,采用序列打包与仅完成损失掩码技术,相比基线11分57秒提速约2倍且准确率更高(61.1%)。项目提供免费Modal沙箱验证,任何提交需经3次独立复现确认。推荐理由:LoRA 微调领域的 nanoGPT speedrun,在固定硬件和任务上比墙钟时间,公开透明且可复现,做微调的开发者可以下场试试。
16:10公众号:小红书技术(dots.llm)68小红书与北大开源 UltraEP:面向大规模 MoE 训推的实时负载均衡方案小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;推理 prefill 吞吐相比 SGLang 提升 1.56 倍。推荐理由:MoE 训练推理的负载不均是个老痛点,UltraEP 用实时复制热专家的方式把 GPU 利用率拉到 94% 的理想线,代码和论文都开源了,做大规模分布式训练的团队可以直接参考。
15:48IT之家(RSS)70上海科学智能研究院开放科学多模态基础模型"神珍"上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。

7月19日周日

11:06Hacker News 热门(buzzing.cc 中文翻译)78transcribe.cpp 发布:基于 ggml 的跨平台语音转录库,支持 16 个 ASR 模型族transcribe.cpp v0.1.0 发布,一个基于 ggml 的语音转录库,支持 16 个 ASR 模型族(60+ 模型),并通过 Vulkan、Metal、CUDA 和 TinyBLAS 实现 GPU 加速。推荐理由:本地语音转录一直缺一个好用的跨平台引擎,transcribe.cpp 不仅支持 60+ 模型、跑在 GPU 上,还带了 Python/JS/Rust/Swift 绑定,想把语音功能嵌进应用的开发者可以直接拿来用。

7月17日周五

17:50公众号:通义实验室(千问)74首届"小有可为"大赛乡村教育一等奖作品"智绘科普"技术拆解首届“小有可为”大赛乡村教育赛道一等奖作品“智绘科普”采用 Qwen3.5-397B-A17B 大语言模型与 Manim 动画引擎,通过多Agent分阶段协作与自动修复机制,将知识主题转化为可控、可编辑的教学动画。系统包含规划、草稿、实现、审查、合成五个阶段,渲染失败时可自动提取日志并修复,该工程范式可迁移至其他赛道。推荐理由:这是官方出品的实战教程,拆解了一套多Agent协作+门控+自修复的工程流水线,技术思路通用,做AI应用的可以直接抄作业。

7月16日周四

08:45Simon Willison 博客72xAI 开源 Grok CLI 代码库中发现 Mermaid 转 Unicode 框图工具xAI 开源的 Grok CLI 编码智能体代码库中包含一个用 Rust 编写的 Mermaid 图表示例终端渲染器 `xai-grok-markdown/src/mermaid.rs`。开发者通过 Claude Code for web (Fable 5) 将其编译为 WebAssembly,实现在浏览器中运行该工具。推荐理由:Simon 从 Grok 源码里扒出终端 Mermaid 渲染器,用 Wasm 带到浏览器,生成 Unicode 图,开发者画流程图的轻量选择。
07:04Hacker News 热门(buzzing.cc 中文翻译)76开源编程智能体内存方案发布,通过 SSH 同步一个面向编程 AI 智能体的开源内存项目在 GitHub 发布,支持通过 SSH 同步记忆数据。该项目允许智能体跨会话保留上下文,无需依赖特定云服务,用户可自托管。代码已开源,便于开发者集成与定制。推荐理由:给Claude Code、Cursor这些编程代理加了个可同步的持久内存,通过SSH就能跨机器共享上下文,做多机协作开发的可以试试。
02:09Thinking Machines70Thinking Machines 发布多模态模型 Inkling今天,我们推出 Inkling。 Inkling 能高效地对文本、图像和音频模态进行推理。我们将提供完整权重。 https://thinkingmachines.ai/news/introducing-inkling/ 即日起可在 Tinker 上进行微调。在 Inkling Playground 中试用。🧵推荐理由:多模态推理终于有了开放权重的选项,Inkling不是最强的,但可能是最方便你上手微调的。想试试多模态Agent的,今天就能在Playground玩。

7月15日周三

10:10公众号:卡尔的AI沃茨71开源 LLM TODO Skill"阿福":用 Claude Code 和 Codex 实现知识管理到排期自动化作者基于 API 版 Fable5 和 Codex 开发了开源 TODO Skill“阿福”,用于将收件箱中的待办资料自动转为 Markdown 任务卡,识别信息不完整项(如视频链接需通过 yt-dlp 和本地 Whisper 提取字幕),并支持批量排期、AI 分组合并、拖拽调整周视图及同步到 Mac 日历或飞书日历。项目已开源在 GitHub,安装仅需一条命令。推荐理由:卡尔把三年知识管理教训封装成一个能自动扫描、合并排期的 TODO Skill,如果你也被碎片信息淹没,这个工具比任何大纲都实用。
00:37Hacker News:AI 热帖73Juggler:一款开源 GUI 编程智能体,由 JUCE 创建者开发Juggler 是一款开源 GUI 编程智能体,提供可视化工作台,支持可检查的工具调用、分支线程和可编辑上下文。会话以树状结构组织,而非线性聊天记录,用户可创建子线程、回溯、比较和编辑。所有关键信息以 Finder 风格 Miller 列展示。Juggler 支持本地、远程或同时运行,桌面应用与浏览器可连接同一会话。模型支持包括 Claude Code、OpenAI、Gemini、Ollama、OpenRouter、Z.AI、Deepseek 等。后端使用 Go 和 Wails,UI 为 HTML/JS。推荐理由:我觉得 Juggler 把 AI 编码的交互从聊天记录变成了可编辑的树,这下能细致管理多个修改分支了,而且完全开源,做软件的值得试一下。

7月14日周二

08:00HuggingFace Daily Papers(社区热门论文)74Boogu-Image-0.1 发布:开源统一多模态理解与生成模型,训练成本仅约 40 万美元Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。推荐理由:开源多模态模型终于有一个能打闭源系统的了,40万美元训练成本刷到接近GPT-Image-2的水平,想自己部署图像生成和编辑产品的开发者可以认真看看。

7月13日周一

20:02The Decoder:AI News(RSS)70德国AI协会发布开源模型Soofi S,在英语和德语基准测试中领先德国AI协会协调的研究联盟发布开源大语言模型Soofi S 30B-A3B。该模型总参数量316亿,每个token仅激活约32亿参数,采用Mamba-2与标准注意力层混合的MoE架构。模型完全在德国电信慕尼黑工业AI云上训练,训练数据中德语占比从第一阶段的7.2%提升至第二阶段的15.3%。在基准测试中,Soofi S在所有完全开源模型中取得英语和德语综合最高分,超越OLMo 3 32B和Apertus 70B。在HumanEval上得分73.8%,MBPP得分70.2,德语版MBPP得分84.2。上下文窗口支持最高100万token,在4万token长度下,生成吞吐量约为同规模稠密模型的8倍。模型权重已开源。推荐理由:德国联盟用 Mamba-Transformer 混合架构做出一个 30B 开源模型,德语基准横扫,长上下文推理吞吐八倍于同级密集模型,想做德语 AI 的可以认真看了。

7月12日周日

22:23Hacker News 热门(buzzing.cc 中文翻译)74Mindwalk:在代码库 3D 地图上回放编码代理会话Mindwalk 是一款可视化工具,可将 Claude Code 和 Codex 的会话日志在代码库的 3D 地图上回放。它将仓库绘制成夜间地图,代理搜索、读取和编辑过的文件会发光,未触及区域保持黑暗,让用户一眼看清代理对任务的理解范围。单个 Go 二进制文件即可运行,所有会话数据完全本地处理,不会离开机器。支持树状图/地形图两种视图,文件触达状态分为未访问、已查看、已读取、已编辑四种颜色标记。播放界面包含错误率、文件修改量等摩擦信号面板,以及上下文压缩、子代理启动、用户交互等时间轴标记。支持键盘快捷键控制播放速度、跳转编辑点或错误点。推荐理由:这个工具把编码代理的会话回放做成 3D 代码地图,一眼就能看出代理探索了哪些文件、在哪里改动最多。如果你是 Claude Code 或 Codex 用户,这是目前最直观地理解代理「脑子里在想什么」的方式。
10:53Hacker News 热门(buzzing.cc 中文翻译)77Mesh LLM:在 iroh 上进行分布式人工智能计算Mesh LLM 是一个开源项目,能将用户多台机器上的 GPU 和内存池化,对外暴露兼容 OpenAI 的 API。它通过 iroh 网络库实现点对点连接,无需中央服务器。请求可在本地 GPU 运行、路由到已加载模型的节点,或将大模型按层分区(内部称“Skippy”)流水线式拆分到多台机器。系统内置 40 多个模型,从 5 亿参数到 235B MoE 巨模型均可支持。软件体积约 18 MB,启动后以 `localhost:9337/v1` 提供服务。推荐理由:Mesh LLM 把多台机器的 GPU 拼成一个推理集群,让大模型在自建网络上运行。对想省钱且需隐私的开发者来说,这是一个值得尝试的实用工具。

7月11日周六

20:37蚂蚁 inclusionAI:GitHub 新仓库65蚂蚁集团开源 AKernel:面向 AI 智能体的可编程数据中心基础设施蚂蚁集团开源 AKernel(Agent Kernel),一个将整个数据中心视为 AI 智能体可编程扩展的分布式内核。它通过统一 Python SDK 实现计算、网络和存储的编程控制,支持单机、私有 K8s 及多云(阿里云、华为云)一键部署,冷启动仅需 40 毫秒。AKernel 代码由 AI 大量贡献,并内置基于 OpenTelemetry 的全栈可观测性。推荐理由:蚂蚁把数据中心变成 Agent 的可编程扩展,对于需要大规模弹性编排 Agent 的团队来说,比用 Kubernetes 手写 YAML 直接得多,不过目前严重依赖阿里云和华为云,通用性还差一截。
20:35蚂蚁 inclusionAI:GitHub 新仓库60蚂蚁 inclusionAI 开源沙箱生命周期服务 sandboxd蚂蚁集团 inclusionAI 在 GitHub 开源 sandboxd,这是 AKernel 使用的 Linux 沙箱生命周期服务,通过 gRPC API 管理沙箱资源,当前基于 gVisor 运行沙箱,并计划近期开源 Kata Containers 支持。推荐理由:蚂蚁把 AKernel 用的沙箱生命周期管理开源了,对需要安全执行代码的 AI 推理/评测场景有参考价值,但仅限底层基础设施人员,非目标受众不必深究。
16:17MarkTechPost(RSS)74蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。推荐理由:具身智能领域第一个从零预训练的因果视频-动作模型,将世界状态和动作统一在一个隐空间,异步推理优化到 225Hz,做机器人的值得仔细研究。

7月10日周五

06:21Hacker News 热门(buzzing.cc 中文翻译)75微软发布Flint:面向AI智能体的可视化语言微软研究院推出Flint,一种可视化中间语言,让AI智能体通过简洁的人类可编辑spec自动生成美观图表。用户只需提供数据、语义类型和图表类型,Flint编译器即可推导坐标轴、配色、布局等底层参数。支持46种图表类型,可渲染到Vega-Lite、ECharts和Chart.js三个后端。项目通过npm安装(TypeScript/JavaScript),并提供MCP服务器用于智能体工作流集成。采用弹性布局模型自动优化图表尺寸与间距,已开源。推荐理由:微软这个 Flint 用语义类型代替了低层图表参数,是给 AI 代理装上了一双会画图的手,开发者现在就能装 MCP server 跑起来,做数据可视化代理的不用再跟 Vega-Lite 的细节搏斗了。

7月9日周四

22:15OpenBMB71TeXada:基于MiniCPM的本地数学Agent发布社区开发者基于MiniCPM5-1B和MiniCPM-V 4.6构建了本地优先的数学智能体TeXada。该Agent支持自然语言直接转LaTeX、手写/图像公式OCR转可编辑LaTeX、LaTeX补全与错误修复等核心功能。所有推理在本地完成,无需依赖云服务,保障隐私安全,适用于学生、研究人员和开发者随时随地处理数学表达式。已开源至GitHub,并提供HuggingFace模型下载。推荐理由:社区开发者用 MiniCPM 轻量模型做的本地数学助手,LaTeX 输入变得像聊天一样自然,是个小而美的端侧实用案例。
15:16IT之家(RSS)72蚂蚁灵波开源全球首个面向具身智能的MoE视频基模LingBot-Video蚂蚁灵波科技正式开源LingBot-Video,这是全球首个基于MoE架构、面向具身智能的视频生成基础模型。总参数30B,推理时仅激活约3B,效率较同规模Dense架构提升约3倍。模型引入7万小时VLA、VLN、Ego等机器人数据,并通过多维强化学习奖励系统对齐物理合理性与任务完成度。在RBench上总分0.620,超越Wan2.6等模型;在Physics-IQ Verified评测中排名第一。可用于机器人动作预测、仿真数据生成等方向。推荐理由:蚂蚁灵波开源了首个面向具身智能的视频基模,用MoE控制推理成本,对机器人仿真和世界模型研究是个真工具,做具身的可以跑起来了。

7月8日周三

20:14Berryxia.AI76在校研究生Kunkun开源管理相互调用Skill的方法在校研究生Kunkun开源了一套管理大量互相调用Skill的方法。核心方案包括:1)搭建HTML后台,按运行模式(手动/自动)、链路位置、专业领域三类标签筛选Skill;2)将连环调用的Skill绘制成Mermaid流程图,根据debug、新功能、合PR、改设计等阶段定位对应技能组;3)仿照Matt的ask Matt技能开发“ask me”技能,将调用决策浓缩成上下文喂给模型。该方法避免将所有调用交给模型自行判断,保持工程复杂场景下的人机对齐与可控性。项目已开源至GitHub。推荐理由:这套方法把 Skill 管理的索引、流程和决策浓缩打包,是当前最落地的实践之一,尤其适合被 agent 调用链搞晕的开发者。一个在校生能做出这样清晰的开源方案,值得直接拿去用。
10:18HuggingFace Daily Papers(社区热门论文)73AlayaWorld:长程可玩视频世界生成AlayaWorld 是一个全栈开源框架,用于构建交互式生成世界。该框架支持开放式实时交互,用户可自由导航并执行战斗、施法、召唤怪物等多种动作。AlayaWorld 将数据准备、模型架构、训练、推理加速和部署统一在模块化可扩展的架构中,并发布了可复现流程、参考实现、评估工具和完整文档,为生成世界模型的未来研究与实时应用奠定基础。推荐理由:AlayaWorld 把生成世界从 demo 变成了可交互的全栈开源框架,放出了完整 pipeline,对做游戏和具身智能的团队来说是一套可以立刻跑起来的工具链,值得落地尝试。
04:51Krea66Krea 2 身份保留功能上线Krea 2 的身份保留功能已发布,配套模型和 ComfyUI 节点也已上线。🔥推荐理由:Krea 2的ID保持终于被社区做出来了,附带ComfyUI节点,想稳定控制角色一致性的人可以立刻用起来。
00:53MarkTechPost(RSS)70Liquid AI 开源 Antidoom:基于最终 Token 偏好优化的推理模型死循环修复方法Liquid AI 开源了 Antidoom,一种基于 Final Token Preference Optimization (FTPO) 的针对性修复方法,用于减少推理模型中的 doom loop(死循环)问题。该方法定位循环开始的第一个 token,训练模型选择连贯替代项,而不改变整体输出分布。在 LFM2.5-2.6B 上,硬数学和编程任务中的循环率从 10.2% 降至 1.4%;Qwen3.5-4B 上从 22.9% 降至 1%。整套流程可在数小时内完成,全部代码和数据集(LiquidAI/antidoom-mix-v1.0)已开源。推荐理由:Antidoom 用一次训练就修复了小型推理模型常见的 doom loop,LFM2.5 和 Qwen3.5 的循环率从两位数掉到 1%,代码和数据全开源,自己训模型时可以直接加这一环。

7月7日周二

12:19蚂蚁 inclusionAI:GitHub 新仓库72蚂蚁 inclusionAI 开源多智能体协作基础设施 Avernet V0.1蚂蚁 inclusionAI 开源的多智能体协作基础设施 Avernet V0.1 正式发布。该项目聚焦 Agent 注册、发现、邀请等协作层问题,不替代 Agent 自身推理能力。通过群组、会话和共享上下文构建多方共识,支持自由聊天、领导-跟随等协作模式,并利用协作反馈形成观察、评估到复用、优化的自动进化闭环。支持 OpenClaw、自定义 Agent、第三方 Agent 引擎及现有 bot 平台等异构生态,提供 Docker 与本地两种快速部署路径。推荐理由:蚂蚁开源的Avernet把多agent协作的发现、连接、共识和可追踪执行做成基础设施,做agent应用的团队可以拿来即用,虽早期但方向对。
07:10Hacker News 热门(buzzing.cc 中文翻译)75OfficeCLI:为AI智能体设计的开源Office套件OfficeCLI是全球首个专为AI智能体设计的开源Office套件,以单二进制文件运行,无需安装Office或任何依赖。它内置HTML渲染引擎,可将.docx/.xlsx/.pptx转换为HTML或PNG,形成“渲染→查看→修复”的视觉闭环,使AI代理能自主创建、读取和修改Word、Excel、PowerPoint文档。支持公式、图表、条件格式、RTL布局、修订追踪、表格、数据透视表等复杂功能。提供CLI命令和基于自然语言的桌面应用AionUi,并可一键安装到Claude Code、Cursor、Windsurf、GitHub Copilot等AI编码工具中。推荐理由:我觉得这个工具把 AI 代理操作 Office 的最后一公里走通了,特别是内置渲染引擎让代理能‘看见’文档布局,而不是盲猜 DOM,对自动化报表和批处理文档的团队很有价值。

7月6日周一

22:08向阳乔木75免费开源API中转站监测网站tokhub.me上线作者与姚老师合作开发中转站评测网站tokhub.me,通过真实充值调用API进行模型监控,区别于单纯速度评测。代码完全开源,支持一键Docker部署,还可作为公司内部Token和网关管理系统,省去繁杂的API Key和Base URL管理。开源代码见Github评论区。推荐理由:向阳乔木开源的这个中转站监测工具,直接解决了我选 API 服务时最头疼的稳定性问题,自掏腰包用真实调用做监控,比纯速度评测有意义得多。

7月5日周日

23:53Hacker News 热门(buzzing.cc 中文翻译)73Anthropic Claude Design 反向工程提示词开源更新Anthropic 旗下 Claude Design 的反向工程系统提示词在 GitHub 以 MIT 许可证开源,包含 20 章提示词和 14 项技能,覆盖内容纪律、美学、无障碍(WCAG、语义 HTML、键盘导航)、交互状态、系统思维等。近日针对 Fable 5/Opus 4.7+ 系列校准,新增自主决策条款:小决定直接执行记录而不询问。项目支持 Claude Code/Claude.ai 及 Codex 两种变体。推荐理由:把LLM变成设计协作者的完整提示词库,拒绝AI低质设计。产品人和创业者拿来就能用,14个技能覆盖从构思到审查的全流程。
16:19MarkTechPost(RSS)72LlamaIndex 发布 legal-kb:基于 Index v2 的智能体检索参考应用LlamaIndex 发布 legal-kb,一个基于 Index v2(LlamaParse Platform)的法律文档知识库参考应用。采用 Retrieval Harness 模式,赋予 Agent 四个文件系统风格工具:retrieve(混合语义检索,支持 rerank 和引用)、findFiles(精确/模糊文件名搜索)、readFile(带偏移量的原始内容读取)和 grepFile(正则匹配并返回字符位置)。Agent 需先调用 findFiles 确定文件清单,再依次使用其他工具定位内容。底层基于 Vercel AI SDK 6 的 ToolLoopAgent,可选用 OpenAI 或 Anthropic 模型,支持用户自带 API key。项目以 TanStack Start web app 形式运行,上传文件自动解析索引,同一文件名重复上传可产生版本,检索时通过版本元数据字段过滤。推荐理由:LlamaIndex 把 RAG 从一次搜索变成了‘先找文件、再搜、再读、再 grep’的多步循环,对做合同审查、尽调的团队来说是个可抄的模板。

7月4日周六

03:44Hacker News 热门(buzzing.cc 中文翻译)83pxpipe:通过图像化压缩输入token降低Claude Code成本pxpipe是一个本地代理,将系统提示、工具文档和历史记录等密集文本渲染为PNG图像,利用图像token成本取决于像素尺寸的特性压缩输入token。在Fable 5模型上,约25k文本token压缩为约2.7k图像token,端到端账单降低59–70%。SWE-bench Lite 10个实例全部通过,成本从$54降至$27;SWE-bench Pro 19对测试中18对判定一致,单次请求成本降低约60%。该方法有损(精确ID等需保持文本),默认仅处理`claude-fable-5`请求,可通过`PXPIPE_MODELS`变量控制。推荐理由:pxpipe 通过把大量上下文渲染成图像来降低 token 开销,实测能削减 60-70% 的账单,对重度使用 Claude Code 的开发者很诱人,但它有损,精确值可能读错,适合容错高的编码场景。

7月3日周五

23:19Mistral AI:News(网页)66Leanstral 1.5:人人可用的证明丰富性Mistral AI 今日发布 Leanstral 1.5,一款 Apache-2.0 许可的开源形式化验证模型,119B 总参数仅 6B 活跃。在 miniF2F 上达 100% 饱和,PutnamBench 解决 587/672 题,FATE-H(87%)和 FATE-X(34%)创 SOTA。训练经历 mid-training、SFT 和基于 CISPO 的强化学习。具备智能体式证明能力,在 57 个开源仓库中发现 5 个未知 bug。模型已通过 HuggingFace 和免费 API 开放使用。推荐理由:Leanstral 1.5饱和miniF2F基准,成本仅为同类模型1/75,并自动发现5个真实代码bug,表明AI形式验证开始实用化。虽然受众窄,但对代码正确性有执念的开发者必看。
13:14Hacker News 热门(buzzing.cc 中文翻译)81claude-real-video ─ 让任何大语言模型(LLM)都能观看视频claude-real-video 是一个开源工具,让大语言模型基于视频画面而非字幕进行理解。它通过场景变化检测提取关键帧、滑动窗口去重并转录音频,生成干净的本地文件夹供模型读取。支持 YouTube 链接或本地文件,依赖 ffmpeg 和 Whisper,通过 pip 安装。全部处理在本地完成,不上传云端。推荐理由:这个工具把视频喂给 LLM 的过程从「固定采样 + 上传云」变成了「场景感知 + 本地去重」,大幅节省 token 且避免隐私泄露,用 Whisper 转录也更完整。是让任何 LLM 真正「看」视频的实用方案。
精选
2026年7月26日星期日 · AI 自动挑选的高价值内容
全部模型产品行业论文技巧

7月24日

星期五 · 1 条
17:54
Hacker News 热门(buzzing.cc 中文翻译)精选
79
Claude-thermos:保持 Claude 会话缓存热度,避免重新编码费用

Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。

GitHub开源/仓库编码部署/工程

推荐理由:一个小工具解决了一个被忽视的成本黑洞,Claude Code 的缓存过期,作者自己测了 185 个会话,省下 22% 费用,对于把 Claude 当开发助手的团队来说是个必装工具。

7月23日

星期四 · 3 条
13:53
Hacker News 热门(buzzing.cc 中文翻译)精选
70
Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。

开源/仓库推理模型发布端侧

推荐理由:把置信度探针塞进 Gemma 4 E2B,让模型自己判断该不该求助大模型,仅路由 15-35% 的查询就能持平 Flash-Lite,对离线/隐私优先的端侧产品是个省成本的新思路。
03:23
Hacker News 热门(buzzing.cc 中文翻译)精选
76
GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace Tokenizers

GigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。

GitHub产品更新开源/仓库数据/训练

推荐理由:GigaToken 把分词速度直接拉到 GB/s 级别,对处理大规模文本的团队是实打实的效率提升,数据集预处理不再是瓶颈。
02:22
Microsoft Research@MSFTResearch精选
73
MagenticLite 的模型现已完全开源。 此前在 Microsoft Foundry 上提供的 MagenticBrain 和 Fara 1.5,现已在 Hugging Face 上开放权重。 该应用、测试工具以及堆栈中的每个模型现已全部开放。
Hugging FaceMicrosoft开源/仓库开源生态

推荐理由:微软把这些模型全开源了,从 Foundry 搬到 Hugging Face,对不想被平台锁定的开发者是个好信号,但模型能力本身不算顶尖,更偏生态布局。

7月22日

星期三 · 2 条
18:10
公众号:小红书技术(dots.llm)精选
62
小红书开源 BigMac:多模态大模型训练新范式

小红书技术团队开源 BigMac,一种针对多模态大模型训练的依赖安全嵌套流水线新范式。它以 LLM 流水线为主干,在不打乱执行顺序的前提下嵌入编码器和生成器计算,相比基线实现 1.08x-1.9x 加速,同时保持激活显存有界。BigMac 已作为 dots 多模态模型训练的核心组件投入生产。

arXivGitHub多模态开源/仓库

推荐理由:过去多模态训练要么废显存要么慢到崩溃,BigMac 用“嵌套流水线”破掉了这个帕累托前沿,做多模态大模型且被训练效率卡住的团队值得动手试一下。
02:22
OpenCode@opencode精选
56
Laguna S 2.1 现已在 OpenCode 上免费提供 1M 上下文窗口 · 完全开源 Poolside 迄今为止最强大的模型
产品更新开源/仓库编码
另有 3 家信源报道The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:OpenRouter (@OpenRouter)
推荐理由:OpenCode 免费上了 Poolside 的最强模型,1M 上下文且完全开源,对写长代码的开发者是实打实的顺手工具,可以省一笔算力开销。

7月21日

星期二 · 2 条
19:10
公众号:小红书技术(dots.llm)精选
81
小红书 dots 模型获 IMO 2026 满分金牌

小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。

开源/仓库推理模型发布
另有 4 家信源报道X:歸藏 (@op7418)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)X:小互 (@xiaohu)
推荐理由:IMO满分金牌这个里程碑,背后是模型递归自我批判能力的突破。不依赖形式化验证就能给出优雅证明,这对数学推理研究是个真信号,做推理方向的值得细读。
02:08
Cursor Blog精选
64
Cursor 测试新型 AI 智能体集群:规划者+执行者分工,4小时通过80% SQL测试

Cursor 测试了新型 AI 智能体集群,将任务分解为规划者(使用最强模型)和执行者(使用快速廉价模型)。使用 Grok 4.5 时,新集群在 4 小时内通过了 80% 的 SQL 测试套件,而旧集群在第二小时前失败。该系统已用于构建浏览器、修复漏洞和生成数十亿 token 合成训练数据。

智能体开源/仓库编码

推荐理由:Cursor首次公开agent swarm的内部架构和协调失败模式,把835页规格文档变成可运行的SQLite数据库并开源,对做AI编程工具的团队和agent架构师来说,这些细节是金矿。

7月20日

星期一 · 3 条
20:49
Hacker News 热门(buzzing.cc 中文翻译)精选
70
LoRA Speedrun 公开排行榜:6分05秒微调Qwen2.5-1.5B达GSM8K 61.1%准确率

LoRA Speedrun项目推出公开排行榜,在固定硬件(单张L40S)上比拼Qwen2.5-1.5B的微调运行时间。当前纪录由@Saivineeth147以6分05秒保持,采用序列打包与仅完成损失掩码技术,相比基线11分57秒提速约2倍且准确率更高(61.1%)。项目提供免费Modal沙箱验证,任何提交需经3次独立复现确认。

GitHub开源/仓库数据/训练

推荐理由:LoRA 微调领域的 nanoGPT speedrun,在固定硬件和任务上比墙钟时间,公开透明且可复现,做微调的开发者可以下场试试。
16:10
公众号:小红书技术(dots.llm)精选
68
小红书与北大开源 UltraEP:面向大规模 MoE 训推的实时负载均衡方案

小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;推理 prefill 吞吐相比 SGLang 提升 1.56 倍。

arXivGitHub开源/仓库部署/工程

推荐理由:MoE 训练推理的负载不均是个老痛点,UltraEP 用实时复制热专家的方式把 GPU 利用率拉到 94% 的理想线,代码和论文都开源了,做大规模分布式训练的团队可以直接参考。
15:48
IT之家(RSS)精选
70
上海科学智能研究院开放科学多模态基础模型"神珍"

上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。

GitHubHugging Face多模态开源/仓库

推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。

7月19日

星期日 · 1 条
11:06
Hacker News 热门(buzzing.cc 中文翻译)精选
78
transcribe.cpp 发布:基于 ggml 的跨平台语音转录库,支持 16 个 ASR 模型族

transcribe.cpp v0.1.0 发布,一个基于 ggml 的语音转录库,支持 16 个 ASR 模型族(60+ 模型),并通过 Vulkan、Metal、CUDA 和 TinyBLAS 实现 GPU 加速。

开源/仓库语音部署/工程

推荐理由:本地语音转录一直缺一个好用的跨平台引擎,transcribe.cpp 不仅支持 60+ 模型、跑在 GPU 上,还带了 Python/JS/Rust/Swift 绑定,想把语音功能嵌进应用的开发者可以直接拿来用。

7月17日

星期五 · 1 条
17:50
公众号:通义实验室(千问)精选
74
首届"小有可为"大赛乡村教育一等奖作品"智绘科普"技术拆解

首届“小有可为”大赛乡村教育赛道一等奖作品“智绘科普”采用 Qwen3.5-397B-A17B 大语言模型与 Manim 动画引擎,通过多Agent分阶段协作与自动修复机制,将知识主题转化为可控、可编辑的教学动画。系统包含规划、草稿、实现、审查、合成五个阶段,渲染失败时可自动提取日志并修复,该工程范式可迁移至其他赛道。

智能体开源/仓库教程/实践编码

推荐理由:这是官方出品的实战教程,拆解了一套多Agent协作+门控+自修复的工程流水线,技术思路通用,做AI应用的可以直接抄作业。

7月16日

星期四 · 3 条
08:45
Simon Willison 博客精选
72
xAI 开源 Grok CLI 代码库中发现 Mermaid 转 Unicode 框图工具

xAI 开源的 Grok CLI 编码智能体代码库中包含一个用 Rust 编写的 Mermaid 图表示例终端渲染器 xai-grok-markdown/src/mermaid.rs。开发者通过 Claude Code for web (Fable 5) 将其编译为 WebAssembly,实现在浏览器中运行该工具。

开源/仓库教程/实践

推荐理由:Simon 从 Grok 源码里扒出终端 Mermaid 渲染器,用 Wasm 带到浏览器,生成 Unicode 图,开发者画流程图的轻量选择。
07:04
Hacker News 热门(buzzing.cc 中文翻译)精选
76
开源编程智能体内存方案发布,通过 SSH 同步

一个面向编程 AI 智能体的开源内存项目在 GitHub 发布,支持通过 SSH 同步记忆数据。该项目允许智能体跨会话保留上下文,无需依赖特定云服务,用户可自托管。代码已开源,便于开发者集成与定制。

智能体GitHub开源/仓库编码

推荐理由:给Claude Code、Cursor这些编程代理加了个可同步的持久内存,通过SSH就能跨机器共享上下文,做多机协作开发的可以试试。
02:09
Thinking Machines@thinkymachines精选
70
今天,我们推出 Inkling。 Inkling 能高效地对文本、图像和音频模态进行推理。我们将提供完整权重。 https://thinkingmachines.ai/news/introducing-inkling/ 即日起可在 Tinker 上进行微调。在 Inkling Playground 中试用。🧵
多模态开源/仓库推理模型发布
另有 10 家信源报道X:歸藏 (@op7418)X:Testing Catalog (@testingcatalog)X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)X:Rohan Paul (@rohanpaul_ai)X:邵猛 (@shao__meng)IT之家(RSS)TechCrunch:AI(RSS)The Decoder:AI News(RSS)
推荐理由:多模态推理终于有了开放权重的选项,Inkling不是最强的,但可能是最方便你上手微调的。想试试多模态Agent的,今天就能在Playground玩。

7月15日

星期三 · 2 条
10:10
公众号:卡尔的AI沃茨精选
71
开源 LLM TODO Skill"阿福":用 Claude Code 和 Codex 实现知识管理到排期自动化

作者基于 API 版 Fable5 和 Codex 开发了开源 TODO Skill“阿福”,用于将收件箱中的待办资料自动转为 Markdown 任务卡,识别信息不完整项(如视频链接需通过 yt-dlp 和本地 Whisper 提取字幕),并支持批量排期、AI 分组合并、拖拽调整周视图及同步到 Mac 日历或飞书日历。项目已开源在 GitHub,安装仅需一条命令。

智能体开源/仓库教程/实践

推荐理由:卡尔把三年知识管理教训封装成一个能自动扫描、合并排期的 TODO Skill,如果你也被碎片信息淹没,这个工具比任何大纲都实用。
00:37
Hacker News:AI 热帖精选
73
Juggler:一款开源 GUI 编程智能体,由 JUCE 创建者开发

Juggler 是一款开源 GUI 编程智能体,提供可视化工作台,支持可检查的工具调用、分支线程和可编辑上下文。会话以树状结构组织,而非线性聊天记录,用户可创建子线程、回溯、比较和编辑。所有关键信息以 Finder 风格 Miller 列展示。Juggler 支持本地、远程或同时运行,桌面应用与浏览器可连接同一会话。模型支持包括 Claude Code、OpenAI、Gemini、Ollama、OpenRouter、Z.AI、Deepseek 等。后端使用 Go 和 Wails,UI 为 HTML/JS。

智能体GitHub产品更新开源/仓库

推荐理由:我觉得 Juggler 把 AI 编码的交互从聊天记录变成了可编辑的树,这下能细致管理多个修改分支了,而且完全开源,做软件的值得试一下。

7月14日

星期二 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
74
Boogu-Image-0.1 发布:开源统一多模态理解与生成模型,训练成本仅约 40 万美元

Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。

图像生成多模态开源/仓库模型发布

推荐理由:开源多模态模型终于有一个能打闭源系统的了,40万美元训练成本刷到接近GPT-Image-2的水平,想自己部署图像生成和编辑产品的开发者可以认真看看。

7月13日

星期一 · 1 条
20:02
The Decoder:AI News(RSS)精选
70
德国AI协会发布开源模型Soofi S,在英语和德语基准测试中领先

德国AI协会协调的研究联盟发布开源大语言模型Soofi S 30B-A3B。该模型总参数量316亿,每个token仅激活约32亿参数,采用Mamba-2与标准注意力层混合的MoE架构。模型完全在德国电信慕尼黑工业AI云上训练,训练数据中德语占比从第一阶段的7.2%提升至第二阶段的15.3%。在基准测试中,Soofi S在所有完全开源模型中取得英语和德语综合最高分,超越OLMo 3 32B和Apertus 70B。在HumanEval上得分73.8%,MBPP得分70.2,德语版MBPP得分84.2。上下文窗口支持最高100万token,在4万token长度下,生成吞吐量约为同规模稠密模型的8倍。模型权重已开源。

开源/仓库模型发布编码
另有 4 家信源报道HuggingFace Daily Papers(社区热门论文)X:阿易 AI Notes (@AYi_AInotes)MarkTechPost(RSS)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:德国联盟用 Mamba-Transformer 混合架构做出一个 30B 开源模型,德语基准横扫,长上下文推理吞吐八倍于同级密集模型,想做德语 AI 的可以认真看了。

7月12日

星期日 · 2 条
22:23
Hacker News 热门(buzzing.cc 中文翻译)精选
74
Mindwalk:在代码库 3D 地图上回放编码代理会话

Mindwalk 是一款可视化工具,可将 Claude Code 和 Codex 的会话日志在代码库的 3D 地图上回放。它将仓库绘制成夜间地图,代理搜索、读取和编辑过的文件会发光,未触及区域保持黑暗,让用户一眼看清代理对任务的理解范围。单个 Go 二进制文件即可运行,所有会话数据完全本地处理,不会离开机器。支持树状图/地形图两种视图,文件触达状态分为未访问、已查看、已读取、已编辑四种颜色标记。播放界面包含错误率、文件修改量等摩擦信号面板,以及上下文压缩、子代理启动、用户交互等时间轴标记。支持键盘快捷键控制播放速度、跳转编辑点或错误点。

智能体GitHub开源/仓库编码

推荐理由:这个工具把编码代理的会话回放做成 3D 代码地图,一眼就能看出代理探索了哪些文件、在哪里改动最多。如果你是 Claude Code 或 Codex 用户,这是目前最直观地理解代理「脑子里在想什么」的方式。
10:53
Hacker News 热门(buzzing.cc 中文翻译)精选
77
Mesh LLM:在 iroh 上进行分布式人工智能计算

Mesh LLM 是一个开源项目,能将用户多台机器上的 GPU 和内存池化,对外暴露兼容 OpenAI 的 API。它通过 iroh 网络库实现点对点连接,无需中央服务器。请求可在本地 GPU 运行、路由到已加载模型的节点,或将大模型按层分区(内部称“Skippy”)流水线式拆分到多台机器。系统内置 40 多个模型,从 5 亿参数到 235B MoE 巨模型均可支持。软件体积约 18 MB,启动后以 localhost:9337/v1 提供服务。

开源/仓库部署/工程

推荐理由:Mesh LLM 把多台机器的 GPU 拼成一个推理集群,让大模型在自建网络上运行。对想省钱且需隐私的开发者来说,这是一个值得尝试的实用工具。

7月11日

星期六 · 3 条
20:37
蚂蚁 inclusionAI:GitHub 新仓库精选
65
蚂蚁集团开源 AKernel:面向 AI 智能体的可编程数据中心基础设施

蚂蚁集团开源 AKernel(Agent Kernel),一个将整个数据中心视为 AI 智能体可编程扩展的分布式内核。它通过统一 Python SDK 实现计算、网络和存储的编程控制,支持单机、私有 K8s 及多云(阿里云、华为云)一键部署,冷启动仅需 40 毫秒。AKernel 代码由 AI 大量贡献,并内置基于 OpenTelemetry 的全栈可观测性。

智能体GitHub开源/仓库部署/工程

推荐理由:蚂蚁把数据中心变成 Agent 的可编程扩展,对于需要大规模弹性编排 Agent 的团队来说,比用 Kubernetes 手写 YAML 直接得多,不过目前严重依赖阿里云和华为云,通用性还差一截。
20:35
蚂蚁 inclusionAI:GitHub 新仓库精选
60
蚂蚁 inclusionAI 开源沙箱生命周期服务 sandboxd

蚂蚁集团 inclusionAI 在 GitHub 开源 sandboxd,这是 AKernel 使用的 Linux 沙箱生命周期服务,通过 gRPC API 管理沙箱资源,当前基于 gVisor 运行沙箱,并计划近期开源 Kata Containers 支持。

开源/仓库部署/工程

推荐理由:蚂蚁把 AKernel 用的沙箱生命周期管理开源了,对需要安全执行代码的 AI 推理/评测场景有参考价值,但仅限底层基础设施人员,非目标受众不必深究。
16:17
MarkTechPost(RSS)精选
74
蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型

蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。

具身智能多模态开源/仓库模型发布
另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)
推荐理由:具身智能领域第一个从零预训练的因果视频-动作模型,将世界状态和动作统一在一个隐空间,异步推理优化到 225Hz,做机器人的值得仔细研究。

7月10日

星期五 · 1 条
06:21
Hacker News 热门(buzzing.cc 中文翻译)精选
75
微软发布Flint:面向AI智能体的可视化语言

微软研究院推出Flint,一种可视化中间语言,让AI智能体通过简洁的人类可编辑spec自动生成美观图表。用户只需提供数据、语义类型和图表类型,Flint编译器即可推导坐标轴、配色、布局等底层参数。支持46种图表类型,可渲染到Vega-Lite、ECharts和Chart.js三个后端。项目通过npm安装(TypeScript/JavaScript),并提供MCP服务器用于智能体工作流集成。采用弹性布局模型自动优化图表尺寸与间距,已开源。

智能体Microsoft开源/仓库
另有 1 家信源报道IT之家(RSS)
推荐理由:微软这个 Flint 用语义类型代替了低层图表参数,是给 AI 代理装上了一双会画图的手,开发者现在就能装 MCP server 跑起来,做数据可视化代理的不用再跟 Vega-Lite 的细节搏斗了。

7月9日

星期四 · 2 条
22:15
OpenBMB@OpenBMB精选
71
TeXada:基于MiniCPM的本地数学Agent发布

社区开发者基于MiniCPM5-1B和MiniCPM-V 4.6构建了本地优先的数学智能体TeXada。该Agent支持自然语言直接转LaTeX、手写/图像公式OCR转可编辑LaTeX、LaTeX补全与错误修复等核心功能。所有推理在本地完成,无需依赖云服务,保障隐私安全,适用于学生、研究人员和开发者随时随地处理数学表达式。已开源至GitHub,并提供HuggingFace模型下载。

智能体GitHub开源/仓库端侧

推荐理由:社区开发者用 MiniCPM 轻量模型做的本地数学助手,LaTeX 输入变得像聊天一样自然,是个小而美的端侧实用案例。
15:16
IT之家(RSS)精选
72
蚂蚁灵波开源全球首个面向具身智能的MoE视频基模LingBot-Video

蚂蚁灵波科技正式开源LingBot-Video,这是全球首个基于MoE架构、面向具身智能的视频生成基础模型。总参数30B,推理时仅激活约3B,效率较同规模Dense架构提升约3倍。模型引入7万小时VLA、VLN、Ego等机器人数据,并通过多维强化学习奖励系统对齐物理合理性与任务完成度。在RBench上总分0.620,超越Wan2.6等模型;在Physics-IQ Verified评测中排名第一。可用于机器人动作预测、仿真数据生成等方向。

具身智能开源/仓库模型发布

推荐理由:蚂蚁灵波开源了首个面向具身智能的视频基模,用MoE控制推理成本,对机器人仿真和世界模型研究是个真工具,做具身的可以跑起来了。

7月8日

星期三 · 4 条
20:14
Berryxia.AI@berryxia精选
76
在校研究生Kunkun开源管理相互调用Skill的方法

在校研究生Kunkun开源了一套管理大量互相调用Skill的方法。核心方案包括:1)搭建HTML后台,按运行模式(手动/自动)、链路位置、专业领域三类标签筛选Skill;2)将连环调用的Skill绘制成Mermaid流程图,根据debug、新功能、合PR、改设计等阶段定位对应技能组;3)仿照Matt的ask Matt技能开发“ask me”技能,将调用决策浓缩成上下文喂给模型。该方法避免将所有调用交给模型自行判断,保持工程复杂场景下的人机对齐与可控性。项目已开源至GitHub。

KunKun折腾手记: 分享一下我现在随着 skill 越来越多、并且互相之间都有调用关系的情况下,是如何去管理 skill 并且去协调这些 skill 的使用的。 首先,我会建一个 HTML,它主要分为两块: 第一块是类似后台的索引块。在索引块这边,你可以通过标...

智能体GitHubMCP/工具开源/仓库

推荐理由:这套方法把 Skill 管理的索引、流程和决策浓缩打包,是当前最落地的实践之一,尤其适合被 agent 调用链搞晕的开发者。一个在校生能做出这样清晰的开源方案,值得直接拿去用。
10:18
HuggingFace Daily Papers(社区热门论文)精选
73
AlayaWorld:长程可玩视频世界生成

AlayaWorld 是一个全栈开源框架,用于构建交互式生成世界。该框架支持开放式实时交互,用户可自由导航并执行战斗、施法、召唤怪物等多种动作。AlayaWorld 将数据准备、模型架构、训练、推理加速和部署统一在模块化可扩展的架构中,并发布了可复现流程、参考实现、评估工具和完整文档,为生成世界模型的未来研究与实时应用奠定基础。

arXiv具身智能开源/仓库视频

推荐理由:AlayaWorld 把生成世界从 demo 变成了可交互的全栈开源框架,放出了完整 pipeline,对做游戏和具身智能的团队来说是一套可以立刻跑起来的工具链,值得落地尝试。
04:51
Krea@krea_ai精选
66
Krea 2 的身份保留功能已发布,配套模型和 ComfyUI 节点也已上线。🔥

Brie Wensleydale🧀🐭: 这才是我渴望的那种身份保留型功能。 我明天要出门旅行,所以没法测试它。我很好奇它在风格化角色上的表现如何...... https://huggingface.co/conradlocke/krea2-identity-edit https:...

图像生成开源/仓库开源生态

推荐理由:Krea 2的ID保持终于被社区做出来了,附带ComfyUI节点,想稳定控制角色一致性的人可以立刻用起来。
00:53
MarkTechPost(RSS)精选
70
Liquid AI 开源 Antidoom:基于最终 Token 偏好优化的推理模型死循环修复方法

Liquid AI 开源了 Antidoom,一种基于 Final Token Preference Optimization (FTPO) 的针对性修复方法,用于减少推理模型中的 doom loop(死循环)问题。该方法定位循环开始的第一个 token,训练模型选择连贯替代项,而不改变整体输出分布。在 LFM2.5-2.6B 上,硬数学和编程任务中的循环率从 10.2% 降至 1.4%;Qwen3.5-4B 上从 22.9% 降至 1%。整套流程可在数小时内完成,全部代码和数据集(LiquidAI/antidoom-mix-v1.0)已开源。

开源/仓库推理

推荐理由:Antidoom 用一次训练就修复了小型推理模型常见的 doom loop,LFM2.5 和 Qwen3.5 的循环率从两位数掉到 1%,代码和数据全开源,自己训模型时可以直接加这一环。

7月7日

星期二 · 2 条
12:19
蚂蚁 inclusionAI:GitHub 新仓库精选
72
蚂蚁 inclusionAI 开源多智能体协作基础设施 Avernet V0.1

蚂蚁 inclusionAI 开源的多智能体协作基础设施 Avernet V0.1 正式发布。该项目聚焦 Agent 注册、发现、邀请等协作层问题,不替代 Agent 自身推理能力。通过群组、会话和共享上下文构建多方共识,支持自由聊天、领导-跟随等协作模式,并利用协作反馈形成观察、评估到复用、优化的自动进化闭环。支持 OpenClaw、自定义 Agent、第三方 Agent 引擎及现有 bot 平台等异构生态,提供 Docker 与本地两种快速部署路径。

智能体开源/仓库部署/工程

推荐理由:蚂蚁开源的Avernet把多agent协作的发现、连接、共识和可追踪执行做成基础设施,做agent应用的团队可以拿来即用,虽早期但方向对。
07:10
Hacker News 热门(buzzing.cc 中文翻译)精选
75
OfficeCLI:为AI智能体设计的开源Office套件

OfficeCLI是全球首个专为AI智能体设计的开源Office套件,以单二进制文件运行,无需安装Office或任何依赖。它内置HTML渲染引擎,可将.docx/.xlsx/.pptx转换为HTML或PNG,形成“渲染→查看→修复”的视觉闭环,使AI代理能自主创建、读取和修改Word、Excel、PowerPoint文档。支持公式、图表、条件格式、RTL布局、修订追踪、表格、数据透视表等复杂功能。提供CLI命令和基于自然语言的桌面应用AionUi,并可一键安装到Claude Code、Cursor、Windsurf、GitHub Copilot等AI编码工具中。

智能体MCP/工具开源/仓库

推荐理由:我觉得这个工具把 AI 代理操作 Office 的最后一公里走通了,特别是内置渲染引擎让代理能‘看见’文档布局,而不是盲猜 DOM,对自动化报表和批处理文档的团队很有价值。

7月6日

星期一 · 1 条
22:08
向阳乔木@vista8精选
75
免费开源API中转站监测网站tokhub.me上线

作者与姚老师合作开发中转站评测网站tokhub.me,通过真实充值调用API进行模型监控,区别于单纯速度评测。代码完全开源,支持一键Docker部署,还可作为公司内部Token和网关管理系统,省去繁杂的API Key和Base URL管理。开源代码见Github评论区。

GitHub开源/仓库开源生态

推荐理由:向阳乔木开源的这个中转站监测工具,直接解决了我选 API 服务时最头疼的稳定性问题,自掏腰包用真实调用做监控,比纯速度评测有意义得多。

7月5日

星期日 · 2 条
23:53
Hacker News 热门(buzzing.cc 中文翻译)精选
73
Anthropic Claude Design 反向工程提示词开源更新

Anthropic 旗下 Claude Design 的反向工程系统提示词在 GitHub 以 MIT 许可证开源,包含 20 章提示词和 14 项技能,覆盖内容纪律、美学、无障碍(WCAG、语义 HTML、键盘导航)、交互状态、系统思维等。近日针对 Fable 5/Opus 4.7+ 系列校准,新增自主决策条款:小决定直接执行记录而不询问。项目支持 Claude Code/Claude.ai 及 Codex 两种变体。

GitHub开源/仓库开源生态

推荐理由:把LLM变成设计协作者的完整提示词库,拒绝AI低质设计。产品人和创业者拿来就能用,14个技能覆盖从构思到审查的全流程。
16:19
MarkTechPost(RSS)精选
72
LlamaIndex 发布 legal-kb:基于 Index v2 的智能体检索参考应用

LlamaIndex 发布 legal-kb,一个基于 Index v2(LlamaParse Platform)的法律文档知识库参考应用。采用 Retrieval Harness 模式,赋予 Agent 四个文件系统风格工具:retrieve(混合语义检索,支持 rerank 和引用)、findFiles(精确/模糊文件名搜索)、readFile(带偏移量的原始内容读取)和 grepFile(正则匹配并返回字符位置)。Agent 需先调用 findFiles 确定文件清单,再依次使用其他工具定位内容。底层基于 Vercel AI SDK 6 的 ToolLoopAgent,可选用 OpenAI 或 Anthropic 模型,支持用户自带 API key。项目以 TanStack Start web app 形式运行,上传文件自动解析索引,同一文件名重复上传可产生版本,检索时通过版本元数据字段过滤。

智能体GitHub检索增强开源/仓库

推荐理由:LlamaIndex 把 RAG 从一次搜索变成了‘先找文件、再搜、再读、再 grep’的多步循环,对做合同审查、尽调的团队来说是个可抄的模板。

7月4日

星期六 · 1 条
03:44
Hacker News 热门(buzzing.cc 中文翻译)精选
83
pxpipe:通过图像化压缩输入token降低Claude Code成本

pxpipe是一个本地代理,将系统提示、工具文档和历史记录等密集文本渲染为PNG图像,利用图像token成本取决于像素尺寸的特性压缩输入token。在Fable 5模型上,约25k文本token压缩为约2.7k图像token,端到端账单降低59–70%。SWE-bench Lite 10个实例全部通过,成本从$54降至$27;SWE-bench Pro 19对测试中18对判定一致,单次请求成本降低约60%。该方法有损(精确ID等需保持文本),默认仅处理claude-fable-5请求,可通过PXPIPE_MODELS变量控制。

GitHub开源/仓库编码

推荐理由:pxpipe 通过把大量上下文渲染成图像来降低 token 开销,实测能削减 60-70% 的账单,对重度使用 Claude Code 的开发者很诱人,但它有损,精确值可能读错,适合容错高的编码场景。

7月3日

星期五 · 2 条
23:19
Mistral AI:News(网页)精选
66
Leanstral 1.5:人人可用的证明丰富性

Mistral AI 今日发布 Leanstral 1.5,一款 Apache-2.0 许可的开源形式化验证模型,119B 总参数仅 6B 活跃。在 miniF2F 上达 100% 饱和,PutnamBench 解决 587/672 题,FATE-H(87%)和 FATE-X(34%)创 SOTA。训练经历 mid-training、SFT 和基于 CISPO 的强化学习。具备智能体式证明能力,在 57 个开源仓库中发现 5 个未知 bug。模型已通过 HuggingFace 和免费 API 开放使用。

Hugging Face开源/仓库推理模型发布
另有 1 家信源报道Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:Leanstral 1.5饱和miniF2F基准,成本仅为同类模型1/75,并自动发现5个真实代码bug,表明AI形式验证开始实用化。虽然受众窄,但对代码正确性有执念的开发者必看。
13:14
Hacker News 热门(buzzing.cc 中文翻译)精选
81
claude-real-video ─ 让任何大语言模型(LLM)都能观看视频

claude-real-video 是一个开源工具,让大语言模型基于视频画面而非字幕进行理解。它通过场景变化检测提取关键帧、滑动窗口去重并转录音频,生成干净的本地文件夹供模型读取。支持 YouTube 链接或本地文件,依赖 ffmpeg 和 Whisper,通过 pip 安装。全部处理在本地完成,不上传云端。

多模态开源/仓库教程/实践

推荐理由:这个工具把视频喂给 LLM 的过程从「固定采样 + 上传云」变成了「场景感知 + 本地去重」,大幅节省 token 且避免隐私泄露,用 Whisper 转录也更完整。是让任何 LLM 真正「看」视频的实用方案。