I'm impressed with the new Grok Image model and editing features! Screenshotted a few items from the Gap website and gen...
I'm impressed with the new Grok Image model and editing features! Screenshotted a few items from the Gap website and gen...
你只需将鼠标悬停在 Grok Imagine 中的任意特定片段上,就能立即对其进行编辑。
另有 1 家信源报道X:cb_doge (@cb_doge)Grok Imagine's image editing literally blows my mind I just edited this entire image from scratch using Grok Imagine and...
老马真的是频频放大招啊, @SpaceXAI xAI在文本生成图像这块闷声干了票大的, Grok Imagine Image 2.0 Low版,直接从文生图竞技场第14名跳到第2名🥇 1320分!!! 更离谱的是分项: 艺术第2,肖像第2,文字渲染第2,卡通动漫第2,照片级电影感第2,产品品牌商业设计第3。 图像编辑竞技场也第2,1439分。 注意,这还仅仅是Low版啊兄弟们, 目前仅在app内可用,API还没开放。 从14到2,这就不是普通迭代了,简直就是跃迁
Announcing Imagine Image 2.0, our next generation image model with precision editing, crisp text rendering, improved fac...
Grok announced Image 2.0. It's the second-best image model in the world! SpaceX is really catching up. Now only slightly...
Announcing Imagine Image 2.0, our next generation image model with precision editing, crisp text rendering, improved fac...
Announcing Imagine Image 2.0, our next generation image model with precision editing, crisp text rendering, improved fac...
Exciting news: Grok Imagine Image 2.0 (Low) by @SpaceXAI has landed in the Text-to-Image Arena at #2 (1320 pts)! This re...
马斯克旗下 SpaceXAI 今日发布 Imagine Image 2.0 模型,已作为全新质量模式在 Grok.com 网页版及 iOS、安卓应用上线。该模型更遵循指令,能规划文字排版、保持多部分画面一致,并新增魔棒、分割、背景移除、多参考图编辑(最多 5 张)及智能调整尺寸等编辑工具。
Announcing Imagine Image 2.0, our next generation image model with precision editing, crisp text rendering, improved fac...
Artificial Analysis 更新文生图竞技场,按 10 类真实用例与 9 项能力评测模型,覆盖营销、电商、UI/UX 设计等场景。GPT Image 2 在所有用例和能力榜单均列第一;Nano Banana 2 以 $67/千图成为性价比之选,MAI-Image-2.5 是电商领域最佳廉价选项,Nano Banana Pro 则在真人电影领域表现突出。
火山引擎正式上线 Seedance 2.5 API,将单次视频生成时长从15秒提升至30秒,并支持最高50个全模态素材参考。模型在指令遵循、长叙事、真人感及声画质感上大幅提升,能稳定保持多角色外形与场景关系,兼容十余种语言。
另有 1 家信源报道公众号:数字生命卡兹克艺术家 David Revoy 发文讲述网友识别出其作品为 AI 生成后的经历。他观察到,一旦作品被打上 AI 标签,观众的评价和互动方式会发生显著变化,甚至影响对作品本身的解读。文章探讨了 AI 生成内容在艺术社区中引发的信任与认知问题。
阿里云今日宣布全新一代视频生成模型 Wan3.0 开启公测,单次可生成 30 秒视频,并首次支持 doc、xls、ppt、pdf、md 等文档格式输入,号称“万物皆可生视频”。
另有 2 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)公众号:千问APP(阿里)美国祖父母正流行用 AI 平台制作以孙辈为主角的个性化童书,却引发孩子父母强烈反感,甚至导致家庭矛盾。Imagitime、StoryWonderBook 和 Childbook.ai 等平台只需用户提供孩子信息即可生成故事,但家长担忧儿童照片和身份信息被 AI 平台滥用。麦考瑞大学研究员徐道之指出,AI 童书缺乏幽默感和戏剧张力,孩子对这类“专属故事”反应冷淡。
so uhhh muse spark 1.2 is doing things i've never seen other models do
Poly-OPD 通过像素桥与冻结 DINOv2 空间监督,将异构多教师的互补能力整合进单一紧凑的流匹配学生模型。将 FLUX.1-dev 和 Z-Image 蒸馏至 2.5B 的 SD3.5-Medium 学生模型后,GenEval 从 67.3 提升至 73.3,超越两个更大的教师模型,DrawBench HPSv3 从 9.34 提升至 11.35。
ToolArtist 通过后训练统一多模态模型,将推理、外部工具调用与原生图像生成整合于单一智能体策略中。其采用监督微调配合搜索与图像生成工具,并引入 RAD-GRPO 强化学习算法,以意图与质量奖励联合优化。实验表明,全流程智能体控制方案持续优于固定流程或部分控制方案,训练数据与基础设施已开源。
UniWorld-View 提出统一框架,将显式 3D 引导与生成式扩散建模结合,实现单目输入下可控的大基线新视图合成。其遮挡感知点云渲染策略可解决可见性歧义,为扩散合成提供精确先验,在极端相机运动下仍能生成高保真视图,并支持输出多视图视频用于动态 3DGS 重建。WorldScore 基准与零样本 NVS 基准实验验证了其在可控性、几何一致性与视觉保真度上的有效性。
Chime 执行制片人 Shayla Love 透露,团队用 Runway 将原本需约 30 万美元、涉及 80 多名真实会员的电视广告尾卡制作压缩至 3 万美元以内,且几乎无制作开销。Runway 的定制工作流将质量参差的 UGC 照片转化为稳定、达到电视播出标准的动态画面。团队还计划用 Runway 制作概念故事板,以加速广告审批流程。
研究发现扩散 Transformer(DiT)图像生成流程中,预训练 ViT 编码器和 DiT 去噪器均会产生离群 token,尤其在中间层,且简单掩蔽高范数 token 无法改善性能,问题与局部 patch 语义损坏相关。为此提出 Dual-Stage Registers(DSR)干预方法,在 ImageNet 和文生图任务上持续减少离群伪影并提升生成质量。
通义千问推出 Qwen-Image-3.0-Pro 图像生成模型,支持最多 4.5k token 输入和图文混排,可一次生成报纸、分镜、菜单等复杂版式。模型能精确渲染小至 10px 的文字,原生支持 12 种语言和 20+ 字体,并模拟网页、游戏、直播等主流界面。API 定价为 1K 图像输入 $0.003、1K 图像输出 $0.04。
另有 2 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)X:阿里云 / Alibaba Cloud (@alibaba_cloud)阿里云转发@WonderStudiosX的演示,展示其用HappyHorse 1.1和Wan2.7将单一创意演化为完整故事宇宙的生成效果。该作品通过阿里云Model Studio和Qwen Cloud提供API,用户可基于此构建自己的生成式AI故事。
One story, a hundred directions. Built with HappyHorse 1.1 + Wan2.7. Start building with the API on @alibaba_cloud Model...
阿里云正式发布 Qwen-Image-3.0,支持 4.5K-token 提示词、复杂布局、10px 级文字、完整 LaTeX 页面及 12 种语言内容生成。该模型适用于 PPT、UI 设计、广告、建筑、游戏及短剧等场景,并以极具竞争力的定价提供更丰富的图像创作能力。
另有 1 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)