内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
原文
宝玉@dotey
61
2026-07-19 14:48· 2天前
跳到正文
AI 摘要

OpenMOSS 开源的 MOSS-Transcribe-Diarize-0.9B 模型,可将长音频一次性转换为带精确时间戳和说话人标注的结构化文本,无需专门的发言人识别模型。其转录速度比 qwen3-asr-0.6b 慢,不支持标点符号,自定义 Prompt 与热词功能也未生效。项目已在 GitHub 开源。

今天给 BaoCut 集成了 OpenMOSS 开源的 MOSS-Transcribe-Diarize-0.9B,能够一次性将长音频转换为结构化、带说话人标注的转写结果。

它有点好就是不需要专门的发言人识别模型,直接输出带精确时间戳、发言人的时间对齐文本。

转录速度比 qwen3-asr-0.6b 要慢些,不支持标点符号,似乎自定义 Prompt 与热词没有起作用。

项目地址:https://github.com/OpenMOSS/MOSS-Transcribe-Diarize/blob/main/README_zh.md

宝玉最早我做字幕翻译的时候,语音转文字是用的 Whisper,但是 Whisper 有几个问题: 一个问题是时间戳不准,时间戳不准拆分的就是就可能字幕和语音对不上,很影响效果,需要人工去从头到尾校对一遍 一个问题是中英文混排支持不好,中文其实支持也不算太好,所以中文的转录就效果很差 一个问题是不直接支持识别发言人 虽然这些...
开源生态教程/实践语音
宝玉@dotey · X
61导出 Markdown
2026-07-19 14:48·2天前
在 X 看原推· x.com
AI 摘要

OpenMOSS 开源的 MOSS-Transcribe-Diarize-0.9B 模型,可将长音频一次性转换为带精确时间戳和说话人标注的结构化文本,无需专门的发言人识别模型。其转录速度比 qwen3-asr-0.6b 慢,不支持标点符号,自定义 Prompt 与热词功能也未生效。项目已在 GitHub 开源。

今天给 BaoCut 集成了 OpenMOSS 开源的 MOSS-Transcribe-Diarize-0.9B,能够一次性将长音频转换为结构化、带说话人标注的转写结果。

它有点好就是不需要专门的发言人识别模型,直接输出带精确时间戳、发言人的时间对齐文本。

转录速度比 qwen3-asr-0.6b 要慢些,不支持标点符号,似乎自定义 Prompt 与热词没有起作用。

项目地址:https://github.com/OpenMOSS/MOSS-Transcribe-Diarize/blob/main/README_zh.md

在 X 查看原推
导出 Markdown
宝玉最早我做字幕翻译的时候,语音转文字是用的 Whisper,但是 Whisper 有几个问题: 一个问题是时间戳不准,时间戳不准拆分的就是就可能字幕和语音对不上,很影响效果,需要人工去从头到尾校对一遍 一个问题是中英文混排支持不好,中文其实支持也不算太好,所以中文的转录就效果很差 一个问题是不直接支持识别发言人 虽然这些...
开源生态教程/实践语音
在 X 查看原推x.com