# 阶跃星辰发布新一代实时语音大模型 StepAudio 2.5 Realtime，支持情绪感知与人设自定义

- 来源：IT之家（RSS）
- 发布时间：2026-05-09 09:56
- AIHOT 分数：66
- AIHOT 链接：https://aihot.virxact.com/items/cmoxq77ht03sgsllhed9lb2pp
- 原文链接：https://www.ithome.com/0/948/051.htm

## AI 摘要

阶跃星辰发布新一代实时语音大模型StepAudio 2.5 Realtime，现已全量上线。该模型能感知语调、语速等“副语言”信息以识别用户情绪，动态调整回应以提升对话真实感。开发者可通过API精细定制AI角色的性格、背景等，其能力基于超万个原生人设生成的百万级特征矩阵训练，并针对角色一致性进行了强化。模型在对话能力上强调智商与情商的双重提升，可应对从闲聊到专业面试等多种场景。据2026年4月评测，其主观对话体验与语音问答基准得分均领先于同期竞品。

## 正文

IT之家 5 月 9 日消息，阶跃星辰昨晚发布了新一代实时语音大模型 StepAudio 2.5 Realtime，目前已全量上线，开发者可通过阶跃星辰开放平台接入使用。

该模型定位于打造更具“活人感”的 AI 对话体验，重点围绕副语言感知、人设自定义与对话能力三个方向进行技术升级。

IT之家从官方获悉，StepAudio 2.5 Realtime 的核心突破在于其对“副语言”信息的处理能力。所谓副语言，指的是语调、语速、停顿乃至一声叹息或轻笑等文字以外的表达方式，这些细节恰恰是人类情感传递的主要载体。模型通过对这些元素的解读，可以感知对话者的情绪状态与潜在意图，比如从低沉的声线中察觉疲惫，或是从急促的语气里识别出烦躁情绪，并据此动态调整回应的语气与策略，旨在降低交互的生硬感，使其更像与真人交谈。

在人设灵活性方面，StepAudio 2.5 Realtime 将定义权完全交给用户。开发者可以通过 API，从性格特质、背景经历、个人好恶到语言习惯与对话边界，对 AI 角色进行精细化调节。这一能力的背后，是模型基于超过 10,000 个高质量原生人设，通过算法裂变生成的百万级人设特征矩阵，并结合海量真实场景对话语料训练而来。针对深度角色扮演中常见的“人设崩塌”痛点，开发团队进行了专门的 RLHF（基于人类反馈的强化学习）对齐优化。据官方介绍，即使在极端情境的压力测试下，模型依然能保持高度稳定、可信的角色一致性。同时，该模型也内置了 5 个预设人设供用户直接选择体验。

在整体对话能力上，该模型强调智商与情商的双重跃升。除了深度理解复杂语义、应对抛梗接梗等交流场景，模型还能灵活调用多领域知识以提供更深度的对话体验，在应用中既可扮演提供情绪价值的聊天搭子，也能模拟专业 HR 进行面试等严肃场景。

根据官方发布的 2026 年 4 月评测数据，该模型在五个测试维度中均位列第一。其中最能反映真实体验的主观评测（手机 App 真人对话打分）得分 80.41，高于 GPT-Realtime-1.5 的 68.01 和 Gemini Live 的 67.16；语音问答基准得分为 79.80，约为 GPT-Realtime-1.5 的 1.5 倍。