# Meet OpenJarvis：一个本地优先的设备端个人AI智能体框架，支持工具、记忆与学习

- 来源：MarkTechPost（RSS）
- 作者：Asif Razzaq
- 发布时间：2026-06-04 14:23
- AIHOT 分数：71
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmpz4ztc400a8slkpncco9ljl
- 原文链接：https://www.marktechpost.com/2026/06/03/meet-openjarvis-a-local-first-framework-for-on-device-personal-ai-agents-with-tools-memory-and-learning

## 精选理由

斯坦福这个框架把云端模型能力拉到本地，成本降了800倍，所有想做离线个人助理的开发者该试试看，开源实现比PPT有说服力。

## AI 摘要

Stanford 研究人员发布 OpenJarvis，一个完全在设备端运行推理、智能体、记忆与学习的开源框架。它将个人 AI 系统分解为五个可组合原语：Intelligence、Engine、Agents、Tools & Memory 和 Learning。该框架与最佳云端模型的性能差距在 3.2 points 以内，边际 API 成本降低约 800 倍。

## 正文

斯坦福大学和 Lambda Labs 的研究人员发表了 OpenJarvis 的研究论文，这是一个完全在设备端运行推理、智能体、记忆和学习的开源框架。

通过 OpenJarvis 配置的开源权重模型，在研究的基准测试协议下，平均性能与最佳云端模型相差不到 3.2 个百分点，而每次查询的边际 API 成本约为云端模型的 1/800，延迟约为云端模型的 1/4。这项研究工作建立在研究团队早先的《每瓦特智能》研究基础之上，该研究报告指出，本地模型已能以交互式延迟处理 88.7% 的单轮对话和推理查询，且从 2023 年到 2025 年，智能效率提升了 5.3 倍。

模型概览与访问

OpenJarvis 并非单一模型。它是一个框架，可将任何受支持的模型与可配置的智能体栈组合使用，并在来自四个模型家族的 11 个本地模型上进行了评估。

属性值

许可证Apache 2.0

框架发布2026 年 3 月 12 日

论文arXiv:2605.17172（发布于 2026 年 5 月 16 日）

代码仓库github.com/open-jarvis/OpenJarvis

星标 / 复刻~5.4k / ~1.2k（2026 年 6 月）

编程语言Python（约 83%）、Rust（约 9%）、TypeScript（约 7%）

已评估模型来自 4 个模型家族的 11 个本地模型：Qwen3.5、Gemma4、Nemotron、Granite

云端基线模型Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro

支持的推理引擎Ollama、vLLM、SGLang、llama.cpp、Apple Foundation Models、Exo（以及其他）

上下文窗口取决于模型

安装单条命令；宽带环境下约 3 分钟

硬件已在 7 个平台上测试，从 Mac Mini M4 到 NVIDIA DGX Spark

架构：五个基本组件与一份配置规范

OpenJarvis 将个人 AI 系统分解为五个类型化的基本组件，通过一个称为配置规范的声明式配置对象进行组合。

智能——模型、权重、生成参数和量化格式。

引擎——推理运行时（Ollama、vLLM、SGLang 等）、批处理、KV 缓存设置和硬件路径。

智能体——推理循环（ReAct 或 CodeAct）、系统提示词、工具使用策略和轮次限制。

工具与记忆——外部接口、检索后端、25 个以上数据连接器和 32 个以上消息通道，支持原生 MCP 和可互换的记忆后端。

学习——即根据追踪记录更新规格的优化器。该插槽可接受 LoRA、DSPy、GEPA 或大语言模型引导的规格搜索。

每个原语均可独立替换，一份规格会将全部五个原语序列化到一个 TOML 文件中。两份规格可以共享相同的智能体和工具配置，仅模型和引擎不同，因此同一行为无需重写提示词即可在 Mac Mini 和工作站上运行。

大语言模型引导的规格搜索是第二项贡献。这是一种本地-云端协作：前沿云端模型在搜索时充当教师，读取追踪记录、诊断故障集群，并在智能、引擎、智能体和工具与记忆四个维度提出修改建议。仅当修改能改善目标故障集群且不会在其他地方造成显著退化时，该修改才会被接受——研究团队称之为"门控"（默认容忍度 1%）。优化后的规格在推理时完全在设备端运行，零云端调用。教师模型仅在搜索时使用；按每天 100 次查询计算，六个月后分摊的教师成本降至每次查询不到 0.001 美元。

先前的工作（GEPA、DSPy、LoRA）一次只优化一个原语，而仅靠提示词优化器只能弥补云端-本地差距中约 5 个百分点的性能损失。大语言模型引导的规格搜索能弥补 13-32 个百分点，因为它联合跨原语进行修改，优化成本比单原语基线低 7-11 倍。四原语移动空间贡献了 5.5-16.5 个百分点，而大语言模型提议器在相同移动空间下，相比进化搜索平均额外贡献约 10 个百分点。

https://arxiv.org/pdf/2605.17172v1

能力与性能

OpenJarvis 在涵盖 508 个任务的 8 个基准上进行了评估：工具调用（ToolCall-15）、智能体工作流（PinchBench）、编程（LiveCodeBench）、客户服务（τ-Bench V2、τ²-Bench Telecom）、通用助手（GAIA）以及深度研究（LiveResearchBench、DeepResearchBench）。

替换测试：在现有框架（OpenClaw、Hermes Agent）中将预期的云端模型替换为 Qwen3.5-9B，准确率下降 25-39 个百分点。在 OpenJarvis 规格下使用相同模型，残余下降缩小至 5.6-16.5 个百分点——恢复了 56-77% 的可移植性损失。

精度前沿：最佳单机本地模型 Qwen3.5-122B 的平均精度达到 80.3%，而 Claude Opus 4.6 为 83.5%——差距为 3.2 个百分点。在 8 项基准测试中，本地模型在 4 项上达到或超越了云端水平：ToolCall-15、PinchBench、LiveCodeBench 和 τ-Bench V2。

成本与延迟：本地配置构成了精度-效率前沿。Qwen3.5-122B 以每次查询约千分之一美分的成本实现了 80.3% 的精度，而 Claude Opus 4.6 每次查询成本为 0.009 美元——边际 API 成本优势约为 800 倍。在智能体工作负载上，端到端延迟降低了约 4 倍，不过论文指出，单次提示词可能更有利于云端服务。

搜索增益：LLM 引导的规范搜索将 Qwen3.5-9B 学生模型在 PinchBench 上的表现提升至 100%，在 LiveCodeBench 上提升至 83%，在 LiveResearchBench 上提升至 91%。在完整的八项基准测试套件中，每个学生模型的平均增益范围为 13.1 到 31.5 个百分点。作者报告称，这些增益通过了其稳健性检验（奖励权重变体、搜索种子方差和随机重启）。

如何使用

安装只需一条命令。在 macOS、Linux 或 WSL2 上：

curl -fsSL https://open-jarvis.github.io/OpenJarvis/install.sh | bash

Windows 用户运行等效的 PowerShell 脚本（irm … | iex）。安装程序会在宽带环境下约三分钟内配置好 uv、Python 虚拟环境、Ollama 和一个入门模型。桌面 GUI 以 .dmg、.exe、.deb、.rpm 或 .AppImage 格式从发布页面提供。

安装完成后，jarvis 会启动一个聊天会话。入门预设涵盖了常见工作流程：

jarvis init --preset morning-digest-mac # daily briefing with TTS jarvis init --preset deep-research # multi-hop research with citations jarvis init --preset code-assistant # agent with code execution and shell access jarvis init --preset scheduled-monitor # stateful agent on a schedule

该框架内置了八个智能体，支持三种执行模式——按需、定时和持续。它连接 25 个以上的数据源（Gmail、日历、iMessage、Notion、Obsidian、Slack、GitHub 等），并通过 32 个以上的消息渠道（WhatsApp、Telegram、Discord、iMessage、Signal 等）暴露智能体。

技能可以从外部目录导入——约 150 个来自 Hermes Agent，约 13,700 个社区技能来自 OpenClaw——所有这些都遵循 agentskills.io 规范。`jarvis optimize skills --policy dspy` 命令可根据本地追踪历史对其进行优化。

Marktechpost 的可视化讲解

OpenJarvis · 斯坦福大学

斯坦福大学 · Hazy Research + Scaling Intelligence Lab

OpenJarvis

一个开源、本地优先的个人 AI 智能体框架，其推理、智能体、记忆和学习功能完全在设备端运行。

与最佳云端方案差距在 3.2 个百分点以内

边际 API 成本降低约 800 倍

延迟降低约 4 倍

Apache 2.0 许可 • arXiv:2605.17172 • 框架于 2026 年 3 月 12 日发布

它是什么

在你的硬件上运行的个人 AI

大多数“个人”AI 仍然将每一次查询都通过云端 API 路由。OpenJarvis 将本地优先作为默认方式，仅在必要时调用云端——这基于该团队在“每瓦特智能”研究中的发现，即本地模型已能处理 88.7% 的单轮查询。

许可协议

Apache 2.0

代码仓库

github.com/open-jarvis/OpenJarvis

模型

11 个本地模型 · 4 个系列

Qwen3.5、Gemma4、Nemotron、Granite

推理引擎

Ollama、vLLM、SGLang、llama.cpp、Apple FM、Exo

架构

五个原语，一份规范

个人 AI 系统被分解为五个类型化、可独立替换的原语，通过一份声明式规范组合而成，该规范序列化为可移植的 TOML 格式。

智能——模型、权重、生成参数、量化

引擎——推理运行时、批处理、KV 缓存、硬件路径

智能体——推理循环（ReAct 或 CodeAct）、提示词、工具策略

工具与记忆——25 个以上连接器、32 个以上通道、原生 MCP

学习——优化器插槽：LoRA、DSPy、GEPA 或规范搜索

关键方法

大语言模型引导的规范搜索

一个前沿云端模型在搜索时充当教师角色：它读取轨迹、诊断失败集群，并提出跨原语的编辑建议。一个门控机制仅接受不会导致性能倒退的编辑。优化后的规范随后完全在设备端运行——推理时零云端调用。

13 到 32 个百分点

的云端-本地差距被弥合

与单原语基线相比，优化成本更低

四原语移动空间增加了 5.5 到 16.5 个百分点；在相同移动空间下，大语言模型提议者比进化搜索高出约 10 个百分点。

性能

接近云端，成本远低

3.2 个百分点

差距：Qwen3.5-122B 80.3% 对比 Claude Opus 4.6 83.5%

本地模型达到或超越云端模型的基准测试数量

在 ToolCall-15、PinchBench、LiveCodeBench、τ-Bench V2 上达到或超越云端水平

边际 API 成本降低约 800 倍；延迟降低约 4 倍（论文协议下）

交换测试：在规范下，25 到 39 个百分点的下降缩小至 5.6 到 16.5 个百分点（恢复了 56% 到 77%）

开发者体验

从零开始，数分钟内构建一个智能体

一条命令即可配置 uv、Python 虚拟环境、Ollama 以及一个入门模型（宽带环境下约需 3 分钟）：

curl -fsSL https://open-jarvis.github.io/OpenJarvis/install.sh | bash

8 个内置智能体，支持按需、定时和持续三种运行模式

25 个以上数据连接器 · 32 个以上消息通道

通过 agentskills.io 获取技能：来自 Hermes Agent 约 150 个，来自 OpenClaw 约 13,700 个

核心结论

一个研究平台与一个生产基础

OpenJarvis 以约 3.2 个百分点的精度损失——该差距主要集中在推理和研究密集型任务上——换取了显著的成本、延迟和隐私优势。推理、智能体状态和记忆默认全部在设备端运行；云端教师模型为可选且受控。

注意事项：结果取每种配置下 5 次运行的平均值，使用 GPT-5-mini 作为评判模型，且仅在单台机器上运行。采用 Apache 2.0 许可证并持续维护——按作者的说法，这是“秉承 PyTorch 精神”为本地 AI 构建的。

为机器学习工程师解读 AI 研究与开发者工具——

marktechpost.com

关键要点

OpenJarvis 将推理、智能体、记忆和学习完全在设备端运行，与最佳云端模型的差距控制在 3.2 个百分点以内，而边际 API 成本降低约 800 倍，延迟降低约 4 倍。

一种类型化的“规范”将技术栈分解为五个可替换的原语——智能（Intelligence）、引擎（Engine）、智能体（Agents）、工具与记忆（Tools & Memory）以及学习（Learning）——并序列化为可移植的 TOML 格式。

大语言模型引导的规范搜索使用前沿云端模型作为搜索时的教师，以 7 至 11 倍更低的优化成本弥补云端与本地之间 13 至 32 个百分点的差距，随后在本地运行且无需任何云端调用。

在 8 项基准测试中的 4 项（ToolCall-15、PinchBench、LiveCodeBench、τ-Bench V2）上，本地规范的表现达到或超越了云端；其余差距主要集中在推理和研究密集型任务上。
