Backflip AI 发布第二代 CAD 生成模型,可将 3D 扫描和网格文件转换为完全可编辑的参数化 CAD 模型,耗时从数小时缩短至几分钟。与仅生成三角面网格的早期模型不同,该模型能生成拉伸、旋转等实际 CAD 操作,结果易于修改。工具以 Autodesk Fusion 插件形式运行,前四次重建免费,付费计划每月 20 美元起。
Backflip AI 发布第二代 CAD 生成模型,可将 3D 扫描和网格文件转换为完全可编辑的参数化 CAD 模型,耗时从数小时缩短至几分钟。与仅生成三角面网格的早期模型不同,该模型能生成拉伸、旋转等实际 CAD 操作,结果易于修改。工具以 Autodesk Fusion 插件形式运行,前四次重建免费,付费计划每月 20 美元起。
苹果官网 Mac 简体中文使用手册新增《在 Mac 上配合 Apple 智能使用千问》支持文档,明确 Apple 智能可配合阿里巴巴千问模型工作。千问扩展适用于 macOS 26.6 或更高版本,需中国大陆 Apple 账户及机型,支持写作工具与 Siri,用户需登录千问账户使用。
微信正在灰度测试朋友圈“AI 帮写”与“AI 点评”两项新能力,基于原生 AI 助手“小微”实现,目前小范围内测中。用户在朋友圈编辑页点击“AI 帮写”后会跳转至小微对话界面,小微可识别正在编辑的文字和配图,按指令生成“简洁”“调侃”“文艺”三种风格候选文案。当前灰测版本中,最终发布可能仍需用户手动确认。
MiniMax H3 技术团队在 Reddit AMA 和 ComfyUI 直播中回应开发者提问:模型不使用 MSA,稀疏注意力策略更接近 MoBA,默认仅对视频 token 做 3D sparsification,近期将发布保守版本。
本教程演示如何用 NVIDIA NeMo Retriever 构建多模态 RAG 流水线:先以 PDFium 离线提取 PDF 文本,再通过托管 NIM 端点检测页面元素、抽取表格/图表/信息图并生成稠密向量存入 LanceDB。随后实现稠密检索、视觉-语言重排序、元数据过滤搜索及带内联引用的 grounded 生成,并用 recall-at-k 评估检索质量。
📂 GPT-Live supports Files and Projects! You can now attach files and ask questions about them, or use GPT-Live in Proje...
KVAE 系列 tokenizer 覆盖音频、图像与视频,专为后续文本条件生成设计。其中 KVAE-Audio 为连续全频带 48 kHz tokenizer,具备 50 Hz 潜空间与 64 通道;KVAE-3D 提供 4x16x16 与 4x8x8 两种因果视频压缩方案;KVAE-2D 图像模型实现 8 倍压缩与 32 通道。
Suno 正面临使用受版权保护材料训练的指控,德国法院近期裁定其未经许可使用受版权保护歌曲进行训练,且美国合理使用原则不适用于此案。为此,Suno 推出新下载政策以限制批量分发,并强调其“原创创作”训练策略,包括从训练元数据中剔除艺术家姓名,以及与 Audible Magic 等第三方合作检查上传内容。
Databricks 发布 FILE 原生列类型,用于在 Lakehouse 中直接存储和管理多模态数据。该类型将文件作为一等公民纳入表结构,支持图像、音频、视频等非结构化数据与结构化数据统一处理,简化了多模态数据管线的构建与查询。
Paige 与微软联合打造的 PRISM2 通过感知器编码器联合训练组织切片与病理报告中的临床对话,将每张切片的数千个切片嵌入聚合为单一表征,进而生成回答诊断问题的文本,而非仅对像素分类。该模型训练数据涵盖 230 万张全切片图像。
MIT 研究人员与合作者发现,医疗领域的 AI 可解释性工具效果因使用者而异。在皮肤病诊断中,非专家借助 AI 辅助提升了准确率,但提升主要源于对模型的依赖;初级保健医生则表现出不同的使用模式。
SkyProduction天工短剧工作台正式接入Seedance 2.5,720P低至0.4元/秒、480P低至0.3元/秒,支持单段最长30秒视频直出、50个参考素材及10余种语言。同期推出“短剧出海转绘”功能,可将中文短剧快速本土化为欧美市场内容;三部通过该工作台创作的AI短剧已上线DramaWave,单部营收均达200万美元级别。
面壁智能开发者 @_Andresio 在 #BuildSmall 黑客松中打造 PAREIDOLIA,用 MiniCPM-V 4.5 识别物体特征并生成个性,结合 VoxCPM2 无需参考音频即可设计独特角色声音,让日常物品“活”成共享虚拟动物园中的角色。该项目展示了视觉与语音模型融合的趣味 AI 交互新形态。
Qwen 3.8 Max is actually impressive Sent a sky pic to it along with Claude Opus 5, Kimi K3, and GPT 5.6 Sol, and asked t...
EffectLearner 提出一种语义推理增强的视频物体移除框架,结合基于 VLM 的 Object-Effect Reasoner 与基于 DiT 的 Video Eraser,通过结构化效果分析提示词提取效果感知上下文,并引入运动感知掩码引导与运动一致性监督。
影石 Insta360 今日为 GO Ultra 拇指相机上线 AI 语音助手,中国大陆接入阿里千问大模型,中国港澳台及海外使用 Google Gemini,翻译结果可通过机身扬声器播报。该助手以影石自研为核心,端侧完成声纹识别与意图判断,云端承担问答、模式切换等任务,集成面对面互译、拍图问答、语音问答三项能力,支持“Hey Kira”或长按拍摄键唤醒。
PaDoc 将预测布局视为共享页面表示上的分支结构,使布局流与区域内容分支并行推进,将解码深度降至最长布局-内容路径。在 OmniDocBench Full 上,PaDoc 取得 Overall 布局 F1 91.1,端到端解析器中 Overall 得分 94.24,Text Edit 0.038,Formula CDM 95.59。
ChronoVision 提出多模态框架,通过监督微调中的 Reconstructive Visual Head 预测最终变换状态的潜在表征,并借助 ROI Attention Locating 模块聚焦关键视觉证据,后训练阶段采用带隐式过程对齐的强化学习。在 Vbvr-VQA 上取得 74.8% 域内和 71.6% 域外准确率,在 IntPhys2 上达到 55.0%。
彭博社报道,OpenAI 首款消费设备是一款冰球大小的无屏 AI 音箱,定价 300-400 美元,计划 2027 年发布。设备采用环形设计,内置电池、麦克风、摄像头及灯光运动部件,以灯光和动作作为交互界面,并通过摄像头感知周围视觉环境、随时间学习用户偏好。该音箱是 OpenAI 设备家族首款产品,最终目标是取代智能手机的硬件。
MiniMax H3 is now available on GMI Cloud the #1 open model in Video Arena: across both Text-to-Video and Image-to-Video ...
Suno 宣布将实施新的水印技术和下载政策,以限制垃圾 AI 曲目传播并提高透明度。CEO Mikey Shulman 在博客中表示,新水印和指纹识别技术符合“新兴行业标准”,并计划与分发平台合作打击欺诈和滥用。去年与华纳音乐集团和解后,Suno 曾宣布下载将仅限付费订阅用户,并设置每月下载上限。
Adobe 将旗下创意软件插件引入 ChatGPT,用户安装后可直接在对话中调用 Photoshop、Premiere、Lightroom、Illustrator 等 70 多款工具。在提示词中输入“@Adobe”加具体任务即可操作,插件与 Codex 及 Work 套件配合效果最佳。不登录 Creative Cloud 也能用基本功能,登录后可保存进度并调用 Firefly 生成式 AI 模型。
阿里云推出万相3.0(Wan3.0)公开测试版,主打“简单输入、智能创作”,支持原生30秒视频生成与真实感渲染。其Omni-Reference能力扩展至文档、表格、幻灯片、网页等多模态输入。API价格按分辨率计费:480p $0.05/秒、720p $0.10/秒、1080p $0.20/秒,完整API访问即将推出。
另有 3 家信源报道IT之家(RSS)X:阿里云 / Alibaba Cloud (@alibaba_cloud)公众号:千问APP(阿里)NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。
面壁智能 OpenBMB 在 #BuildSmall 黑客松推出 AMNESIAC,一款反向图灵测试交互游戏:玩家需说服 AI 审讯官 A.M.N. 自己是人类。该游戏由 MiniCPM-o 4.5 驱动实时对话与推理,VoxCPM 生成审讯官语音,并结合摄像头面部表情、脉搏信号与响应计时进行多模态审讯。项目已开源至 HuggingFace。
字节跳动年中全员会上,CEO梁汝波公开承认大语言模型与海外领先差距被拉大,但明确继续自研、接受短期落后,并驳斥“因外部压力才自研”是瞎猜,称是为打牢技术地基。豆包被升格为公司级“主干”,飞书产品团队并入豆包,GTM与火山引擎整合成立“创造力服务平台”。会上披露飞书新增客户超九成同步采购AI产品,内部AI Token半年增长超十倍。
另有 2 家信源报道IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)Black Forest Labs 正式上线 FLUX 3 视频生成模型,单次生成最长 20 秒视频并附带原生音频,支持原生 1080p 分辨率及文生视频、图生视频、视频生视频、多镜头串联等功能。
另有 2 家信源报道X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)