内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态模型 · 29 条
来源全部一手资讯X
类型模型
全部模型产品行业论文教程观点
标签「GitHub」清除

8月20日周四

18:24IT之家(RSS)72精选阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕

8月12日周三

13:13IT之家(RSS)66微软推出 MAI-Code-1.1-Flash 编程模型:更好、更快,价格降至 1/4
01:46Mustafa Suleyman44微软AI新代码模型上线GitHub Copilot

8月5日周三

16:08IT之家(RSS)67小米具身基座模型 Xiaomi-Robotics-1 正式开源

8月4日周二

23:07SenseTime58同事件商汤 SenseNova U1 开源:统一推理与图像生成同一事件,精选展示《商汤 SenseNova U1 开源:统一推理与图像生成》

8月3日周一

11:31Nathan Lambert59同事件阿里发布 Qwen3.8-Max,下周开源权重同一事件,精选展示《Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数》

7月29日周三

04:57DogeDesigner51Grok 4.5 登陆 GitHub Copilot

7月28日周二

13:25Hacker News 热门(buzzing.cc 中文翻译)71精选FeyNoBg 发布:开源自动背景去除模型,在四项基准上达到 SOTA
12:00公众号:月之暗面(Kimi)85精选Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放
03:54The Decoder:AI News(RSS)68Moonshot AI 开源 Kimi K3 模型权重与基础设施,称每单位算力智能度提升 2.5 倍
00:58AYi59月之暗面K3全栈开源,2.8T参数模型逼近闭源

7月20日周一

15:48IT之家(RSS)70精选上海科学智能研究院开放科学多模态基础模型"神珍"

7月14日周二

09:05SenseTime74精选商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型

7月13日周一

19:20公众号:腾讯混元76精选腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍
19:13公众号:腾讯混元78精选腾讯混元开源 HyOCR-1.5:1B 端到端 OCR 大模型推理提速 6.37 倍

7月11日周六

21:53Chubby♨️69蚂蚁集团开源LingBot-World 2.0:14B世界模型实现60分钟无衰减实时交互

7月10日周五

13:00MarkTechPost(RSS)58蚂蚁集团 Robbyant 发布 LingBot-World-Infinity:开源因果世界模型
12:01公众号:龙猫LongCat(美团)74精选美团 LongCat-2.0 正式开源,同步开放国产卡推理代码

7月6日周一

15:20公众号:腾讯混元70精选腾讯混元 Hy3 正式发布:智能体与产品体验显著提升

6月29日周一

23:57SenseTime35商汤 SenseNova-U1-8B-MoT 可生成高质量信息图

6月24日周三

03:21Hao AI Lab73精选FastWan-QAD:单卡5090上1.8秒生成5秒视频

6月23日周二

19:10IT之家(RSS)72精选网易有道发布 Confucius4-TTS:14 语种跨语种无口音语音克隆开源模型
13:13HuggingFace Daily Papers(社区热门论文)55UniverSat: 分辨率和模态无关的Transformer用于地球观测

6月5日周五

13:27公众号:京东JoyAI72精选京东开源JoyAI-Echo长音视频生成框架

6月3日周三

22:39SenseTime73精选商汤开源SenseNova U1:视觉理解推理生成一体模型

6月1日周一

23:34SenseTime67精选SenseNova新模型解决AI图表生成难题

5月11日周一

18:39SenseTime72精选SenseNova U1图像生成模型登陆ComfyUI平台

5月7日周四

18:16IT之家(RSS)69小米开源 OmniVoice 多语言语音克隆 TTS,号称一个模型搞定 600 余种语言

2月12日周四

18:22公众号:小红书技术(dots.llm)50小红书发布 FireRed-Image-Edit:图像编辑新 SOTA
共 29 条,没有更多了
全部 AI 动态
2026年8月25日星期二 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
模型 · 标签「GitHub」 · 29 条清除

8月20日

星期四 · 1 条
18:24
IT之家(RSS)精选
AI 评分 72/100
阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕

阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。

智能体arXivGitHub多模态

推荐理由:它把 GUI 智能体评测从模拟分数推向真实手机操作,自建 MobileWorld-Real 基准和百台真机环境,使落地型团队能按真机成功率而非仅看模拟榜单做选型。

8月12日

星期三 · 2 条
13:13
IT之家(RSS)
AI 评分 66/100
微软推出 MAI-Code-1.1-Flash 编程模型:更好、更快,价格降至 1/4

微软发布升级版编程模型 MAI-Code-1.1-Flash,在 Terminal-Bench 2.1 测试中表现提升 22%,.NET 相关任务提升 15%,Token 生成速度提升 25%,完成相同任务所需 Token 减少 25%。

GitHubMicrosoft模型发布编码
另有 1 家信源报道The Decoder:AI News(RSS)
01:46
Mustafa Suleyman@mustafasuleyman
AI 评分 44/100
我们最新的代码模型比6月发布的模型效率提升25%,质量更高,成本仅为四分之一。现已上线GitHub Copilot--欢迎试用。
GitHubMicrosoft模型发布编码

8月5日

星期三 · 1 条
16:08
IT之家(RSS)
AI 评分 67/100
小米具身基座模型 Xiaomi-Robotics-1 正式开源

小米技术宣布具身基座模型 Xiaomi-Robotics-1 正式开源。该模型基于超过 10 万小时 UMI 数据进行预训练,并使用超过 1 万小时跨本体数据进行后训练。本次开源覆盖从真机后训练到模型部署的完整流程,并提供相关 Benchmark 的评测代码。

GitHub具身智能模型发布

8月4日

星期二 · 1 条
23:07
SenseTime@SenseTime_AI同事件
AI 评分 58/100
商汤 SenseNova U1 开源:统一推理与图像生成

商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步构建图文内容,如生成六步画龙教程。模型已上线 SenseNova Studio 与 HuggingFace。

GitHubHugging Face图像生成多模态
同一事件,精选展示《商汤 SenseNova U1 开源:统一推理与图像生成》

8月3日

星期一 · 1 条
11:31
Nathan Lambert@natolambert同事件
AI 评分 59/100
阿里发布旗舰模型 Qwen3.8-Max,2.4T 参数,主打自主编码与多模态智能,下周开源其权重并同步开源 Qwen3.8-27B。定价为输入 $2.0/M tokens、输出 $6.0/M tokens、隐式缓存 $0.25/M tokens。

Qwen: 📢Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qw...

GitHub多模态模型发布编码
同一事件,精选展示《Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数》

7月29日

星期三 · 1 条
04:57
DogeDesigner@cb_doge
AI 评分 51/100
BREAKING: Grok 4.5 现已登陆 GitHub Copilot专为快速智能体编码和复杂多步骤工作流打造,提供高达 50 万 token 的上下文窗口、图像支持及可调节推理深度。现已覆盖 VS Code、Copilot CLI、JetBrains、Xcode 等平台。
GitHubxAI推理模型发布
另有 1 家信源报道IT之家(RSS)

7月28日

星期二 · 4 条
13:25
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
FeyNoBg 发布:开源自动背景去除模型,在四项基准上达到 SOTA

Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。

GitHubHugging Face开源生态数据/训练

推荐理由:FeyNoBg 在多个背景去除基准上达到或接近最佳,还开源了训练库,做图像处理的产品可以直接集成,是个实在的工具发布。
12:00
公众号:月之暗面(Kimi)精选
AI 评分 85/100
Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。

GitHubHugging Face多模态开源生态
另有 13 家信源报道IT之家(RSS)X:Kimi.ai (@Kimi_Moonshot)LMSYS:Blog(Chatbot Arena 团队)HuggingFace Daily Papers(社区热门论文)公众号:数字生命卡兹克X:阿易 AI Notes (@AYi_AInotes)X:Elvis Saravia (@omarsar0, DAIR.AI)The Verge:AI(RSS)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:Artificial Analysis (@ArtificialAnlys)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)X:AK (@_akhaliq)
推荐理由:Kimi K3 的完全开放是一个明确信号,月之暗面把最核心的模型权重和技术细节全部公开,国内开发者从此有了媲美国际顶尖开源的底座。虽然部署门槛不低,但开放本身推动了生态发展。
03:54
The Decoder:AI News(RSS)
AI 评分 68/100
Moonshot AI 开源 Kimi K3 模型权重与基础设施,称每单位算力智能度提升 2.5 倍

Moonshot AI 发布了 Kimi K3 的模型权重与技术报告,并在 Hugging Face 上开源了高性能注意力内核、MoE 通信库等基础设施组件。新架构声称每单位算力的智能度提升 2.5 倍。该模型在基准测试中接近 Fable 5 和 GPT-5.6 Sol 等西方前沿模型,但英国网络研究所的独立测试显示其网络能力和数学技能仍落后于前沿模型。

GitHub开源生态模型发布
另有 13 家信源报道IT之家(RSS)X:Kimi.ai (@Kimi_Moonshot)LMSYS:Blog(Chatbot Arena 团队)HuggingFace Daily Papers(社区热门论文)公众号:数字生命卡兹克X:阿易 AI Notes (@AYi_AInotes)X:Elvis Saravia (@omarsar0, DAIR.AI)The Verge:AI(RSS)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:Artificial Analysis (@ArtificialAnlys)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)X:AK (@_akhaliq)
00:58
AYi@AYi_AInotes
AI 评分 59/100
月之暗面K3全栈开源,2.8T参数模型逼近闭源

月之暗面开源Kimi K3,一个2.8T总参数、104B激活参数的MoE模型,原生支持100万token上下文窗口。新架构KDA和AttnRes使单位算力智能密度提升2.5倍,长上下文解码速度提升6倍。除模型权重外,还开源了高性能推理内核FlashKDA、MoE通信库及Agent训练环境AgentENV,将开源模型能力门槛抬至闭源旗舰水平。

Kimi.ai: Releasing the model weights and technical report of Kimi K3. Kimi K3 is our most capable model: a 2.8T MoE model with na...

GitHubHugging Face开源生态推理
另有 13 家信源报道IT之家(RSS)X:Kimi.ai (@Kimi_Moonshot)LMSYS:Blog(Chatbot Arena 团队)HuggingFace Daily Papers(社区热门论文)公众号:数字生命卡兹克X:阿易 AI Notes (@AYi_AInotes)X:Elvis Saravia (@omarsar0, DAIR.AI)The Verge:AI(RSS)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:Artificial Analysis (@ArtificialAnlys)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)X:AK (@_akhaliq)

7月20日

星期一 · 1 条
15:48
IT之家(RSS)精选
AI 评分 70/100
上海科学智能研究院开放科学多模态基础模型"神珍"

上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。

GitHubHugging Face多模态开源/仓库

推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。

7月14日

星期二 · 1 条
09:05
SenseTime@SenseTime_AI精选
AI 评分 74/100
商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型

商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。

arXivGitHub多模态开源生态
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。

7月13日

星期一 · 2 条
19:20
公众号:腾讯混元精选
AI 评分 76/100
腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍

腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。

arXivGitHub多模态开源生态

推荐理由:我觉得这是近期最实在的OCR开源,1B参数覆盖多任务、推理加速6倍,还支持llama.cpp本地部署,做文档解析的同学可以直接上车。
19:13
公众号:腾讯混元精选
AI 评分 78/100
腾讯混元开源 HyOCR-1.5:1B 端到端 OCR 大模型推理提速 6.37 倍

腾讯混元开源端到端 OCR 大模型 HyOCR-1.5,仅 1B 参数覆盖 8 种以上 text-centric 任务,在 OmniDocBench v1.6 上以 94.74 分居端到端第一。

GitHub多模态推理模型发布

推荐理由:轻量端到端OCR的实用化一步,投机解码让长文档生成加速可落地,智能体数据闭环提示了用短板驱动自进化的可复用路径。

7月11日

星期六 · 1 条
21:53
Chubby♨️@kimmonismus
AI 评分 69/100
蚂蚁集团开源LingBot-World 2.0:14B世界模型实现60分钟无衰减实时交互

蚂蚁集团旗下具身AI公司Robbyant开源LingBot-World 2.0,这是一个因果世界模型,支持720p/60fps实时探索。关键突破在于长时间一致性:在20个场景中连续运行60分钟无可见退化。模型采用智能体循环架构,由VLM提议事件、导演智能体持续生成新任务,支持移动、战斗、按需天气及多人共享世界。已发布14B模型权重与代码,论文还描述了可在单消费级GPU部署的1.3B版本。

GitHub具身智能多模态开源生态

7月10日

星期五 · 2 条
13:00
MarkTechPost(RSS)
AI 评分 58/100
蚂蚁集团 Robbyant 发布 LingBot-World-Infinity:开源因果世界模型

蚂蚁集团具身智能团队 Robbyant 发布 LingBot-World-Infinity(LingBot-World 2.0),一个因果视频生成模型,可作为交互式世界模拟器运行。该模型通过 MoBA 注意力机制和 DMD 自 rollout 训练,解决长程漂移和交互延迟问题。模型采用因果分解架构,每帧仅依赖过去帧和当前动作输入。团队同时发布 14B 参数开源 checkpoint,采用 CC BY-NC-SA 4.0 许可。公开推理脚本在 8 张 GPU 上运行 480×832 分辨率;部署版流式输出可达 60 fps,经 TensorRT 引擎编译。

智能体GitHub具身智能模型发布
12:01
公众号:龙猫LongCat(美团)精选
AI 评分 74/100
美团 LongCat-2.0 正式开源,同步开放国产卡推理代码

美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。

GitHub开源生态推理模型发布

推荐理由:国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。

7月6日

星期一 · 1 条
15:20
公众号:腾讯混元精选
AI 评分 70/100
腾讯混元 Hy3 正式发布:智能体与产品体验显著提升

腾讯混元发布 Hy3,在推理、智能体、长上下文等任务上显著进步,比肩 2~5 倍参数规模旗舰模型。内部盲测均分 2.67/4,优于 GLM5.1(2.51/4)。幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,多轮问题率降至 7.9%,MRCR 从 42.9% 升至 75.1%。任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。API 价格为输入 1 元、输出 4 元(每百万 tokens),命中缓存 0.25 元。已以 Apache 2.0 协议在 GitHub、HuggingFace 等平台开源。

智能体GitHubHugging Face开源生态
另有 1 家信源报道X:腾讯混元 (@TencentHunyuan)
推荐理由:腾讯混元 Hy3 不堆参数,靠 agent 能力和产品实测说话,幻觉率减半、多轮问题率大降,开源+降价让开发者能直接上手,是国内大模型里少见的产品导向发布。

6月29日

星期一 · 1 条
23:57
SenseTime@SenseTime_AI
AI 评分 35/100
商汤 SenseNova-U1-8B-MoT 可生成高质量信息图

商汤推出 SenseNova-U1-8B-MoT-Infographic 模型,能够生成工作室级别的高密度信息图,此前这类工作流程缓慢且昂贵。YouTuber CAPITAL R 制作了演示视频,模型已在 HuggingFace 上线,GitHub 页面展示示例图片,并开放 Discord 社区。

GitHubHugging Face图像生成模型发布

6月24日

星期三 · 1 条
03:21
Hao AI Lab@haoailab精选
AI 评分 73/100
FastWan-QAD:单卡5090上1.8秒生成5秒视频

Sky Computing Lab 发布 FastWan-QAD 视频生成模型系列,基于 FastVideo 的量化感知蒸馏(QAD)方案训练。在单张 NVIDIA GeForce RTX 5090 上,端到端生成一段 5 秒 480P 视频仅需 1.8 秒。模型、代码及博客已开源。

GitHubHugging Face模型发布端侧

推荐理由:单张 RTX 5090 上 1.8 秒生成 5 秒视频,把消费级延迟压到了‘即时生成’的临界点,做短视频和互动应用的开发者可以认真把这个模型放进技术栈。

6月23日

星期二 · 2 条
19:10
IT之家(RSS)精选
AI 评分 72/100
网易有道发布 Confucius4-TTS:14 语种跨语种无口音语音克隆开源模型

网易有道推出“子曰 4.0”TTS 引擎 Confucius4-TTS,声称是业内首个支持 14 种语言跨语种无口音、且无需参考文本即可完成语音克隆的开源模型。用户仅需 3 秒音频即可实现零样本音色克隆,克隆音色与原声相似度超 85%,任务准确度达 97%。模型支持中文、英语等 14 种语言,首创音频 Prompt 情感克隆迁移。底层采用 GPT 式语义大模型、SSL 预训练特征与 ECAPA-TDNN 说话人编码器、Flow Matching 框架。已全量开源(Apache 协议),提供 54GB 资源包供本地部署。

GitHub模型发布语音

推荐理由:网易有道把语音克隆的门槛压到了 3 秒,跨 14 种语言还能保持无口音,而且全量开源、商用无限制,对多语种配音和短剧出海是直接可用的工具。
13:13
HuggingFace Daily Papers(社区热门论文)
AI 评分 55/100
UniverSat: 分辨率和模态无关的Transformer用于地球观测

UniverSat是一种基于Vision Transformer的骨干网络,采用通用补丁编码器(Universal Patch Encoder),将来自任意空间、光谱和时间分辨率以及光学和非光学传感器的补丁映射到共享嵌入空间,使用共享权重。这使得单个模型能够在异构多模态数据集上通过自监督训练,生成鲁棒的传感器无关空间特征。在GeoBench、PANGEABench和SpectralEarth等标准地球观测基准的分类和分割任务中,取得了强劲结果。代码和模型已开源。

GitHub多模态数据/训练模型发布

6月5日

星期五 · 1 条
13:27
公众号:京东JoyAI精选
AI 评分 72/100
京东开源JoyAI-Echo长音视频生成框架

6月3日,京东开源JoyAI-Echo框架,解决长视频生成中角色身份崩坏、音色突变和生成缓慢三大难题。该框架通过跨模态音视频记忆库保持5分钟内角色外观与音色一致,记忆驱动后训练结合DMD技术带来约7.5倍推理加速。新增Director Agent支持自然语言对话式局部修订,无需重跑整条视频。配套轻量化实时超分模块,支持736×1280→1152×1920及1472×2560两档分辨率。评测集显示,语音内容准确率0.8646,用户偏好多项领先。代码与权重已开源至GitHub。

GitHub多模态模型发布

推荐理由:长视频生成一直被角色崩塌和龟速生成卡死,JoyAI-Echo 开源给出了角色一致性方案和 7.5 倍加速,Director Agent 对话式编辑的思路很先进,做 AI 视频的朋友可以直接去 GitHub 开跑。

6月3日

星期三 · 1 条
22:39
SenseTime@SenseTime_AI精选
AI 评分 73/100
商汤开源SenseNova U1:视觉理解推理生成一体模型

商汤(SenseTime)开源SenseNova U1模型,宣称实现“看、思考、创作”一体——从一张普通运动鞋图片直接生成营销视觉效果。该模型代表了架构上的范式转变。用户可通过SenseNova Studio、HuggingFace和GitHub尝试使用。

GitHubHugging Face图像生成多模态
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:商汤把理解、推理、创作塞进一个模型,而且直接开源,做视觉营销的可以不用再拼凑工具链了。

6月1日

星期一 · 1 条
23:34
SenseTime@SenseTime_AI精选
AI 评分 67/100
SenseNova新模型解决AI图表生成难题

大多数AI模型在生成图表时存在数值错误(如负值显示为正)、柱状图位置偏移、元素关系混乱等问题。SenseNova-U1-8B-MoT-Infographic(SenseNova-U1)专为解决此类图表生成问题而设计,能够生成准确的图表,并支持实时调整设计和布局。项目在Hugging Face提供了模型,并在GitHub展示了效果案例。

GitHubHugging Face图像生成模型发布
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:大部分AI生成的图表都有标注错误或比例失调,商汤这个模型专攻信息图准确性,对常做图表的产品人和分析师来说值得一试。

5月11日

星期一 · 1 条
18:39
SenseTime@SenseTime_AI精选
AI 评分 72/100
SenseNova U1图像生成模型登陆ComfyUI平台

SenseNova U1图像生成模型现已在ComfyUI上可运行,并获得包括REBEL AI在内的评测者高度认可。REBEL AI发布的实践教程展示了该模型的部署工作流,并对其图像生成能力进行了真实场景测试。模型支持8步快速推理,生成速度极快,应用场景涵盖人像、超现实艺术、文字标志和生物设计等。相关资源已在Hugging Face、GitHub和Discord平台开放。

GitHubHugging Face图像生成模型发布

推荐理由:商汤把新模型U1的ComfyUI部署流程完整放出,还有实测视频,想在自己机器上跑国产图像模型的开发者可以直接抄作业了。

5月7日

星期四 · 1 条
18:16
IT之家(RSS)
AI 评分 69/100
小米开源 OmniVoice 多语言语音克隆 TTS,号称一个模型搞定 600 余种语言

小米AI实验室开源多语言语音克隆TTS模型OmniVoice,覆盖600余种语言。该模型采用极简双向Transformer架构,无需复杂结构即可实现文本到语音的直接转换。其语音合成质量超越同类主流模型,训练速度可达一天10万小时。关键设计包括全码本随机掩蔽策略和引入大语言模型预训练参数,显著提升训练效率与语音可懂度。测试显示,在多种语言中其相似度与可懂度超越多款商用系统,并对低资源小语种也能实现高质量合成。模型还支持自定义音色、带噪音频适配等实用功能。

arXivGitHub多模态开源生态

2月12日

星期四 · 1 条
18:22
公众号:小红书技术(dots.llm)
AI 评分 50/100
小红书发布 FireRed-Image-Edit:图像编辑新 SOTA

小红书基础模型 FireRed-Image-Edit 在 GitHub 上正式亮相,该模型专注于图像编辑任务,并达到新的最佳性能(新 SOTA)。

GitHub图像生成开源/仓库模型发布
共 29 条,没有更多了