Meet OpenJarvis:一个本地优先的设备端个人AI智能体框架,支持工具、记忆与学习

MarkTechPost(RSS)·2026-06-04 14:23·82天前·Asif Razzaq
AI 导读

Stanford 研究人员发布 OpenJarvis,一个完全在设备端运行推理、智能体、记忆与学习的开源框架。它将个人 AI 系统分解为五个可组合原语:Intelligence、Engine、Agents、Tools & Memory 和 Learning。该框架与最佳云端模型的性能差距在 3.2 points 以内,边际 API 成本降低约 800 倍。

MarkTechPost(RSS)
精选
71AI 编辑部评分,满分 100

Meet OpenJarvis:一个本地优先的设备端个人AI智能体框架,支持工具、记忆与学习

2026-06-04 14:23· 82天前· Asif Razzaq
AI 导读

Stanford 研究人员发布 OpenJarvis,一个完全在设备端运行推理、智能体、记忆与学习的开源框架。它将个人 AI 系统分解为五个可组合原语:Intelligence、Engine、Agents、Tools & Memory 和 Learning。该框架与最佳云端模型的性能差距在 3.2 points 以内,边际 API 成本降低约 800 倍。

推荐理由

斯坦福这个框架把云端模型能力拉到本地,成本降了800倍,所有想做离线个人助理的开发者该试试看,开源实现比PPT有说服力。

正文 · AI 翻译

斯坦福大学和 Lambda Labs 的研究人员发表了 OpenJarvis 的研究论文,这是一个完全在设备端运行推理、智能体、记忆和学习的开源框架。

通过 OpenJarvis 配置的开源权重模型,在研究的基准测试协议下,平均性能与最佳云端模型相差不到 3.2 个百分点,而每次查询的边际 API 成本约为云端模型的 1/800,延迟约为云端模型的 1/4。这项研究工作建立在研究团队早先的《每瓦特智能》研究基础之上,该研究报告指出,本地模型已能以交互式延迟处理 88.7% 的单轮对话和推理查询,且从 2023 年到 2025 年,智能效率提升了 5.3 倍。

模型概览与访问

OpenJarvis 并非单一模型。它是一个框架,可将任何受支持的模型与可配置的智能体栈组合使用,并在来自四个模型家族的 11 个本地模型上进行了评估。

属性
许可证Apache 2.0
框架发布2026 年 3 月 12 日
论文arXiv:2605.17172(发布于 2026 年 5 月 16 日)
代码仓库github.com/open-jarvis/OpenJarvis
星标 / 复刻~5.4k / ~1.2k(2026 年 6 月)
编程语言Python(约 83%)、Rust(约 9%)、TypeScript(约 7%)
已评估模型来自 4 个模型家族的 11 个本地模型:Qwen3.5、Gemma4、Nemotron、Granite
云端基线模型Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro
支持的推理引擎Ollama、vLLM、SGLang、llama.cpp、Apple Foundation Models、Exo(以及其他)
上下文窗口取决于模型
安装单条命令;宽带环境下约 3 分钟
硬件已在 7 个平台上测试,从 Mac Mini M4 到 NVIDIA DGX Spark

架构:五个基本组件与一份配置规范

OpenJarvis 将个人 AI 系统分解为五个类型化的基本组件,通过一个称为配置规范的声明式配置对象进行组合。

  • 智能——模型、权重、生成参数和量化格式。
  • 引擎——推理运行时(Ollama、vLLM、SGLang 等)、批处理、KV 缓存设置和硬件路径。
  • 智能体——推理循环(ReAct 或 CodeAct)、系统提示词、工具使用策略和轮次限制。
  • 工具与记忆——外部接口、检索后端、25 个以上数据连接器和 32 个以上消息通道,支持原生 MCP 和可互换的记忆后端。
  • 学习——即根据追踪记录更新规格的优化器。该插槽可接受 LoRA、DSPy、GEPA 或大语言模型引导的规格搜索。

每个原语均可独立替换,一份规格会将全部五个原语序列化到一个 TOML 文件中。两份规格可以共享相同的智能体和工具配置,仅模型和引擎不同,因此同一行为无需重写提示词即可在 Mac Mini 和工作站上运行。

大语言模型引导的规格搜索是第二项贡献。这是一种本地-云端协作:前沿云端模型在搜索时充当教师,读取追踪记录、诊断故障集群,并在智能、引擎、智能体和工具与记忆四个维度提出修改建议。仅当修改能改善目标故障集群且不会在其他地方造成显著退化时,该修改才会被接受——研究团队称之为"门控"(默认容忍度 1%)。优化后的规格在推理时完全在设备端运行,零云端调用。教师模型仅在搜索时使用;按每天 100 次查询计算,六个月后分摊的教师成本降至每次查询不到 0.001 美元。

先前的工作(GEPA、DSPy、LoRA)一次只优化一个原语,而仅靠提示词优化器只能弥补云端-本地差距中约 5 个百分点的性能损失。大语言模型引导的规格搜索能弥补 13-32 个百分点,因为它联合跨原语进行修改,优化成本比单原语基线低 7-11 倍。四原语移动空间贡献了 5.5-16.5 个百分点,而大语言模型提议器在相同移动空间下,相比进化搜索平均额外贡献约 10 个百分点。

https://arxiv.org/pdf/2605.17172v1

能力与性能

OpenJarvis 在涵盖 508 个任务的 8 个基准上进行了评估:工具调用(ToolCall-15)、智能体工作流(PinchBench)、编程(LiveCodeBench)、客户服务(τ-Bench V2、τ²-Bench Telecom)、通用助手(GAIA)以及深度研究(LiveResearchBench、DeepResearchBench)。

替换测试:在现有框架(OpenClaw、Hermes Agent)中将预期的云端模型替换为 Qwen3.5-9B,准确率下降 25-39 个百分点。在 OpenJarvis 规格下使用相同模型,残余下降缩小至 5.6-16.5 个百分点——恢复了 56-77% 的可移植性损失。

精度前沿:最佳单机本地模型 Qwen3.5-122B 的平均精度达到 80.3%,而 Claude Opus 4.6 为 83.5%——差距为 3.2 个百分点。在 8 项基准测试中,本地模型在 4 项上达到或超越了云端水平:ToolCall-15、PinchBench、LiveCodeBench 和 τ-Bench V2。

成本与延迟:本地配置构成了精度-效率前沿。Qwen3.5-122B 以每次查询约千分之一美分的成本实现了 80.3% 的精度,而 Claude Opus 4.6 每次查询成本为 0.009 美元——边际 API 成本优势约为 800 倍。在智能体工作负载上,端到端延迟降低了约 4 倍,不过论文指出,单次提示词可能更有利于云端服务。

搜索增益:LLM 引导的规范搜索将 Qwen3.5-9B 学生模型在 PinchBench 上的表现提升至 100%,在 LiveCodeBench 上提升至 83%,在 LiveResearchBench 上提升至 91%。在完整的八项基准测试套件中,每个学生模型的平均增益范围为 13.1 到 31.5 个百分点。作者报告称,这些增益通过了其稳健性检验(奖励权重变体、搜索种子方差和随机重启)。

如何使用

安装只需一条命令。在 macOS、Linux 或 WSL2 上:

curl -fsSL https://open-jarvis.github.io/OpenJarvis/install.sh | bash

Windows 用户运行等效的 PowerShell 脚本(irm … | iex)。安装程序会在宽带环境下约三分钟内配置好 uv、Python 虚拟环境、Ollama 和一个入门模型。桌面 GUI 以 .dmg、.exe、.deb、.rpm 或 .AppImage 格式从发布页面提供。

安装完成后,jarvis 会启动一个聊天会话。入门预设涵盖了常见工作流程:

jarvis init --preset morning-digest-mac    # daily briefing with TTS
jarvis init --preset deep-research         # multi-hop research with citations
jarvis init --preset code-assistant        # agent with code execution and shell access
jarvis init --preset scheduled-monitor     # stateful agent on a schedule

该框架内置了八个智能体,支持三种执行模式——按需、定时和持续。它连接 25 个以上的数据源(Gmail、日历、iMessage、Notion、Obsidian、Slack、GitHub 等),并通过 32 个以上的消息渠道(WhatsApp、Telegram、Discord、iMessage、Signal 等)暴露智能体。

技能可以从外部目录导入——约 150 个来自 Hermes Agent,约 13,700 个社区技能来自 OpenClaw——所有这些都遵循 agentskills.io 规范。`jarvis optimize skills --policy dspy` 命令可根据本地追踪历史对其进行优化。

Marktechpost 的可视化讲解

OpenJarvis · 斯坦福大学

斯坦福大学 · Hazy Research + Scaling Intelligence Lab

OpenJarvis

一个开源、本地优先的个人 AI 智能体框架,其推理、智能体、记忆和学习功能完全在设备端运行。

与最佳云端方案差距在 3.2 个百分点以内

边际 API 成本降低约 800 倍

延迟降低约 4 倍

Apache 2.0 许可 • arXiv:2605.17172 • 框架于 2026 年 3 月 12 日发布

它是什么

在你的硬件上运行的个人 AI

大多数“个人”AI 仍然将每一次查询都通过云端 API 路由。OpenJarvis 将本地优先作为默认方式,仅在必要时调用云端——这基于该团队在“每瓦特智能”研究中的发现,即本地模型已能处理 88.7% 的单轮查询。

许可协议

Apache 2.0

代码仓库

github.com/open-jarvis/OpenJarvis

模型

11 个本地模型 · 4 个系列

Qwen3.5、Gemma4、Nemotron、Granite

推理引擎

Ollama、vLLM、SGLang、llama.cpp、Apple FM、Exo

架构

五个原语,一份规范

个人 AI 系统被分解为五个类型化、可独立替换的原语,通过一份声明式规范组合而成,该规范序列化为可移植的 TOML 格式。

  • 智能——模型、权重、生成参数、量化
  • 引擎——推理运行时、批处理、KV 缓存、硬件路径
  • 智能体——推理循环(ReAct 或 CodeAct)、提示词、工具策略
  • 工具与记忆——25 个以上连接器、32 个以上通道、原生 MCP
  • 学习——优化器插槽:LoRA、DSPy、GEPA 或规范搜索

关键方法

大语言模型引导的规范搜索

一个前沿云端模型在搜索时充当教师角色:它读取轨迹、诊断失败集群,并提出跨原语的编辑建议。一个门控机制仅接受不会导致性能倒退的编辑。优化后的规范随后完全在设备端运行——推理时零云端调用。

13 到 32 个百分点

的云端-本地差距被弥合

与单原语基线相比,优化成本更低

四原语移动空间增加了 5.5 到 16.5 个百分点;在相同移动空间下,大语言模型提议者比进化搜索高出约 10 个百分点。

性能

接近云端,成本远低

3.2 个百分点

差距:Qwen3.5-122B 80.3% 对比 Claude Opus 4.6 83.5%

本地模型达到或超越云端模型的基准测试数量

  • 在 ToolCall-15、PinchBench、LiveCodeBench、τ-Bench V2 上达到或超越云端水平
  • 边际 API 成本降低约 800 倍;延迟降低约 4 倍(论文协议下)
  • 交换测试:在规范下,25 到 39 个百分点的下降缩小至 5.6 到 16.5 个百分点(恢复了 56% 到 77%)

开发者体验

从零开始,数分钟内构建一个智能体

一条命令即可配置 uv、Python 虚拟环境、Ollama 以及一个入门模型(宽带环境下约需 3 分钟):

curl -fsSL https://open-jarvis.github.io/OpenJarvis/install.sh | bash
  • 8 个内置智能体,支持按需、定时和持续三种运行模式
  • 25 个以上数据连接器 · 32 个以上消息通道
  • 通过 agentskills.io 获取技能:来自 Hermes Agent 约 150 个,来自 OpenClaw 约 13,700 个

核心结论

一个研究平台与一个生产基础

OpenJarvis 以约 3.2 个百分点的精度损失——该差距主要集中在推理和研究密集型任务上——换取了显著的成本、延迟和隐私优势。推理、智能体状态和记忆默认全部在设备端运行;云端教师模型为可选且受控。

注意事项:结果取每种配置下 5 次运行的平均值,使用 GPT-5-mini 作为评判模型,且仅在单台机器上运行。采用 Apache 2.0 许可证并持续维护——按作者的说法,这是“秉承 PyTorch 精神”为本地 AI 构建的。

为机器学习工程师解读 AI 研究与开发者工具——

marktechpost.com

关键要点

  • OpenJarvis 将推理、智能体、记忆和学习完全在设备端运行,与最佳云端模型的差距控制在 3.2 个百分点以内,而边际 API 成本降低约 800 倍,延迟降低约 4 倍。
  • 一种类型化的“规范”将技术栈分解为五个可替换的原语——智能(Intelligence)、引擎(Engine)、智能体(Agents)、工具与记忆(Tools & Memory)以及学习(Learning)——并序列化为可移植的 TOML 格式。
  • 大语言模型引导的规范搜索使用前沿云端模型作为搜索时的教师,以 7 至 11 倍更低的优化成本弥补云端与本地之间 13 至 32 个百分点的差距,随后在本地运行且无需任何云端调用。
  • 在 8 项基准测试中的 4 项(ToolCall-15、PinchBench、LiveCodeBench、τ-Bench V2)上,本地规范的表现达到或超越了云端;其余差距主要集中在推理和研究密集型任务上。

来源:MarkTechPost(RSS)· marktechpost.com