内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

精选

7月26日 · 周日
最新精选
全部模型产品行业论文技巧
标签「图像生成」清除

7月25日周六

06:22Midjourney:Updates(RSS)73Midjourney V8.2 发布:专注美学提升与个性化理解Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。推荐理由:Midjourney V8.2 把审美和个性化放到了C位,不再追分辨率,这对重度用户是实在的体验升级,建议立刻用老 profile 试试新模型。

7月22日周三

21:00公众号:卡尔的AI沃茨71实测Qwen-Image-3.0:19大场景挑战GPT Image2,中文长文本与多图融合表现亮眼Qwen-Image-3.0上线,支持最高4.5k token输入、12种语言、20多种字体,以及多图融合、图中图和图片编辑。实测显示,其在中文长文本生成、多语言混合排版、UI设计、多图融合与图片编辑等19个场景中均能稳定输出,文字不崩且信息对应准确,图片质量已能与GPT Image2媲美。该模型在国内可直接使用,速度快且价格不贵。推荐理由:Qwen-Image-3.0 的实测效果在中文文字稳定性和多图融合上可以和 GPT Image2 掰手腕,看完这些案例,你会意识到国产图像模型已经能务实替代一部分工作流了。

7月21日周二

14:22Qwen:Blog Retrieval(API)77通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为"实"通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。推荐理由:我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。

7月14日周二

08:00HuggingFace Daily Papers(社区热门论文)74Boogu-Image-0.1 发布:开源统一多模态理解与生成模型,训练成本仅约 40 万美元Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。推荐理由:开源多模态模型终于有一个能打闭源系统的了,40万美元训练成本刷到接近GPT-Image-2的水平,想自己部署图像生成和编辑产品的开发者可以认真看看。

7月13日周一

18:29歸藏(guizang.ai)75Seedream 5.0 Pro 测评:图像编辑门槛爆降字节跳动发布 Seedream 5.0 Pro,图像质量与提示词理解追平 GPT-Image 2.0,综合能力仅次于后者。核心亮点是“可编辑”交互:用户可在图上打点、画框、涂鸦,提示词中直接 @ 标记,实现精准局部编辑(如换沙发、改墙面颜色),其他区域不变。实测案例涵盖家装改造(一次替换六件家具)、商品图制作(键盘爆炸拆解图、标注卖点)、海报排版(框定位置生成文字)等场景,支持色卡配色和 SKU 换色。火山引擎已全量上线 API,即梦、豆包、Lumina 可体验。推荐理由:归藏实地测了 Seedream 5.0 Pro,真正杀招是图像编辑,把选区做进提示词,家装、电商、海报案例都给了可复制的实操步骤。这是字节图像生成追平甚至在某些场景反超的节点,做内容或电商的值得马上试。

7月11日周六

08:10The Verge:AI(RSS)76Meta 关闭 Instagram 用户可基于公开账户生成 AI 深度伪造图片的功能在遭到强烈反对后,Meta 关闭了本周早些时候推出的一项 Instagram 功能。该功能允许用户通过 @ 提及公开 Instagram 账户,基于其内容生成 AI 图片,且无需账户所有者许可。Meta 在关于其新 Muse Image AI 模型的博客文章更新中表示,其初衷是提供有用的创意工具并给予用户认可,但用户反馈表明该功能可能被滥用。推荐理由:Meta 在舆论压力下火速撤回刚发布的 AI 深度伪造功能,这次公关折返跑比功能本身更有信息量,平台对隐私反弹的优先级已经高于技术落地,但默认 opt-out 的根本矛盾还在。

7月10日周五

15:31Elon Musk68Elon Musk 转发用户称赞 Grok Build 的反馈Elon Musk 转发用户 @0x0funky 对 Grok Build 的称赞。该用户称 Grok Build 是目前唯一集大成的 coding agentic workflow,内建图像生成和图片生视频功能,生图速度快且品质不输 Codex。Agent 可直接完成图像与视频生成,无需额外串接 MCP 或外部服务。用户结合 Agent Sprite Forge 工具,利用 Grok Build 的视频生成能力,先产出 6 秒角色动作视频再反编译为 game sprite,大幅减少对齐问题,制作 2D 横版游戏耗时不到 30 分钟,而此前用 Codex 需 1-2 小时且品质更优。推荐理由:这个 Grok Build 加 Agent Sprite Forge 的工作流把做 2D 游戏的时间压到了 30 分钟,之前要 1-2 小时,而且品质更好,独立游戏开发者可以直接抄作业。

7月9日周四

06:22Runway69Seedream 5.0 Pro 登陆 Runway,支持14种语言Seedream 5.0 Pro 现已登陆 Runway。可通过提示词或参考图生成高细节图像,图像内文字清晰可读,支持多达14种语言。立即点击下方链接尝试。推荐理由:Seedream 5.0 Pro 的集成让 Runway 的图像生成多了一个强力选择,14 种语言的可读文字生成是实用亮点,做多语言海报的设计师可以试试。

7月8日周三

21:22字节 Seed:Research Feed(网页内嵌数据)78Seedream 5.0 Pro 发布:不止"生成",更懂"设计"字节 Seed 今日发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面升级。四大核心突破:复杂信息可视化,可生成高密度信息图;交互式精准编辑,支持点选、圈选、草图渲染、色彩与材质替换、图层分离及多图融合,实现像素级编辑;真实的影像与人像质感,还原光影、材质与皮肤肌理;原生多语种输入与生成,支持十余种语言及本地化视觉特征。已陆续在豆包、即梦、火山方舟等平台上线。推荐理由:字节这次发布的 Seedream 5.0 Pro 把图像生成从「画得好看」推进到「能输出信息图、能精准编辑」的实用设计工具,尤其复杂信息图和交互编辑是当前竞品明显短板,做设计的值得立刻试试。
04:51Krea66Krea 2 身份保留功能上线Krea 2 的身份保留功能已发布,配套模型和 ComfyUI 节点也已上线。🔥推荐理由:Krea 2的ID保持终于被社区做出来了,附带ComfyUI节点,想稳定控制角色一致性的人可以立刻用起来。
03:58AI at Meta75Meta Superintelligence Labs 推出 Muse Image 和 Muse VideoMeta Superintelligence Labs 发布首个媒体生成模型 Muse Image 和 Muse Video。Muse Image 是目前最先进的图像生成模型,能精确遵循指令、精准编辑、多参考构图,并利用 Instagram 社交上下文。它还具备智能体工具使用能力并集成 Muse Spark。用户可通过 Meta AI 应用、网页、Instagram Stories 和 WhatsApp 试用,初始限于部分国家。Muse Video 基于相同预训练基础,实现高视觉保真度并原生支持音频。推荐理由:Meta 超级智能实验室的首个媒体生成模型,把图像生成跟 Instagram 社交语境结合听起来很实用,但细节还少,期待后续实测。

7月6日周一

01:53Hacker News 热门(buzzing.cc 中文翻译)70三周前,我不小心创办了一家小公司一位父亲为患有自闭症的非语言儿子开发了一款沟通应用,在言语治疗室的等候区展示时,所有非语言儿童的母亲看到后都忍不住流泪,言语治疗师也啜泣了五分钟。他意外发现产品市场匹配,决定腾出时间让更多孩子能用上,即使这意味着几周睡眠不足。应用本身是专为理解语言困难的儿童设计的,与传统的AAC设备不同——后者主要面向身体障碍但语言理解正常的成人。推荐理由:这篇文章读来会让人看天花板,一位父亲用 AI 图像和声音克隆为儿子创造了沟通工具,意外找到了产品市场契合。它比任何融资新闻都更让我相信,AI 的真正价值在于解决那些被忽视的具体问题。

7月3日周五

20:32歸藏(guizang.ai)75藏师傅PPT与Pencil结合使用技巧用户将藏师傅的AI生成PPT导入Pencil设计软件,可在Pencil中一次性浏览所有页面并手动调整AI常见的排版问题,如元素重叠、对齐不准、字体错误。Pencil提供比PPT更强的编辑能力(对齐、嵌套、打组),支持导出网页和编辑文件,也可导出PNG后直接放入PPT演示。这种工作流昨天经朋友分享验证,大幅提升AI生成内容的可编辑性。推荐理由:藏师傅的 PPT Skill 结合 Pencil,提供了一个比 PPT 软件本身更灵活的编辑路径,对于频繁出提案的人算是一个值得试的小技巧,但 AI 排版仍需手动微调。
11:34HuggingFace Daily Papers(社区热门论文)74表示分布匹配(RDM)用于一步视觉生成表示分布匹配(RDM)通过匹配冻结预训练编码器下的生成与参考特征分布来训练一步图像生成器。三个发现:经典MMD正确估计后成为可扩展目标;生成批次大小最优超过2048;单一表示可被欺骗,需匹配平衡编码器组合并采用独立于训练损失的SW_r14评估。改进的iRDM在ImageNet上以SW_r14 1.30达一步生成SOTA,PickScore在71.2%样本上偏好iRDM。该方法将四步FLUX.2后训练为一步生成器,在GenEval(0.826对0.794)和PickScore(22.76对22.58)上超越原版,仅需90 H200 GPU小时。推荐理由:这篇论文把MMD重新变成了一流的一步生成目标,用多编码器匹配防止作弊,并把FLUX.2四步模型浓缩成一步,性能不降反升,90 GPU小时就能复现,做视觉生成的人应该仔细看。

7月1日周三

01:29Apple:Newsroom(RSS)66Apple Creator Studio 更新:更智能、更快速、更互联Apple Creator Studio 推出多项 AI 增强更新。Final Cut Pro 新增 on-device AI 驱动的 Generate Captions(自动转录音频生成字幕)和 Edit Detection(自动检测剪辑点)。Mac 版加入 Auto Mask(自动识别皮肤、天空等主体)、增强的 Match Color 和 Advanced Trimming。支持将帧发送至 Pixelmator Pro 编辑,并在 Keynote、Pages、Numbers 中直接调用 Pixelmator Pro 修改图片。Logic Pro 新增 Grammy 制作人制作的 Producer Project 及 Chord ID 改进。订阅价 $12.99/月或 $129/年,新用户免费试用一个月,教育用户 $2.99/月。推荐理由:Final Cut Pro 的自动字幕和遮罩是实打实的工作流提升,Pixelmator Pro 的深度整合也让设计更顺畅,虽然没有颠覆性突破,但创意工作者今天就能用上。
00:08Google DeepMind:Blog(RSS)70Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni FlashGoogle DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为 Nano Banana 系列速度最快、成本最低的图像模型,文本到图像输出仅需 4 秒,每 1K 分辨率图像成本 $0.034,已上线 Google AI Studio、Gemini API 及消费者产品(AI Mode in Search、Gemini app 等)。同时推出 Gemini Omni Flash(gemini-omni-flash-preview),支持高画质视频生成与对话式编辑,视频输出定价 $0.10/秒,面向开发者开放 API。推荐理由:Nano Banana 2 Lite 把图像生成拉到 4 秒延迟和 0.034 美元单价,很适合高频草稿流,Omni Flash 首次对开发者开放视频生成和对话编辑,两个模型串起来的快速迭代工作流是这次最实用的更新。

6月26日周五

09:27小互81小互开源个人IP配图技能"小互IP Studio",含31个原创角色博主小互开源个人IP配图技能“小互IP Studio”,包含31个原创角色(15个手绘线稿角色+16个谐音梗meme形象)及一套配图方法论。该Agent可自动读取文章、规划配图类型(情绪图/示意图/四格漫画)、生成并自查返工。默认画风为手绘线稿淡彩,另备5种皮肤(3D盲盒、黑白线稿等)可切换。安装仅需Python3,支持Claude Code、Codex等工具,需自备OpenAI兼容的图像API key(默认GPT-image-2);也可只输出提示词手动生图。推荐理由:小互开源了一整套AI配图skill和31个原创角色,把“读文-定图-生图-自查”的流程装进一个命令,自媒体人装上就能用,省去调提示词的痛苦。
03:12Midjourney67Midjourney 预览 V8.2 并加速草稿模式Midjourney 带来两项更新。一是加入 `--preview` 参数可提前体验 V8.2 的美学与个性化效果;二是此前在 V8.1 推出的大批量草稿模式(生成 24 张低分辨率图,价格仅为标准 4 张的一半,点击 "Vary" 可升级为全分辨率)现在支持搭配 `--sref random` 使用,探索风格空间的速度比之前快 24 倍。推荐理由:新草稿模式让批量探索风格变得便宜又快速,配上 sref random 更是把试错效率拉满,设计师能直接用到工作流里。V8.2 预览只是小彩蛋,但暗示美学调校还在进化。
02:57Midjourney:Updates(RSS)62Midjourney V8.1 草稿模式新增随机风格功能Midjourney V8.1 的草稿模式(draft mode)添加了随机风格功能。用户在提示词中加入 `--sref random` 即可一键生成 24 张不同风格的图片。开启草稿模式可通过点击提示栏的 ⚡ 图标或添加 `--draft` 参数。推荐理由:Midjourney 在 V8.1 草稿模式加了随机风格,一键出 24 种草图,对找灵感的创作者算顺手小升级,但改变不了核心创作流程,只适合深度用户尝鲜。

6月24日周三

19:31OpenRouter:Announcements(RSS)73OpenRouter推出统一图像APIOpenRouter推出统一图像API,整合Google、OpenAI、Black Forest Labs、Recraft、ByteDance、Sourceful、Microsoft、xAI等30+模型。新API提供标准化请求格式,通过`/api/v1/images/models`端点返回每个模型的分辨率、宽高比、输出数量、输入参考图数量、种子等能力描述;通过`/api/v1/images/models/{id}/endpoints`端点获取具体服务商的定价与参数支持(如Seedream 4.5每张$0.04、FLUX.2 Pro每百万像素$0.03、GPT-5.4 Image 2按token计费)。OpenAI的GPT 5系列图像模型支持SSE流式预览,启用`"stream": true`即可边生成边返回预览。新图像模型将仅添加至专用API,建议现有用户切换。推荐理由:OpenRouter 把 30+ 图像模型收进一个 API,参数自动发现和流式预览让频繁切换模型的开发者省去不少适配麻烦,尤其对 Agent 工作流很友好。
01:37Krea71Krea 2 技术报告正式发布我们的技术报告已发布。 深入解析创建 Krea 2 所用的数据、架构及训练技巧。 https://www.krea.ai/blog/krea-2-technical-report推荐理由:Krea 2 开源了两个图像模型权重,一个未蒸馏适合微调,一个快速蒸馏版覆盖多样审美。对于做图像生成应用和模型融合的团队,这次开放权重比很多大厂都实在。

6月21日周日

13:00公众号:腾讯元宝64腾讯元宝父亲节活动:上传照片生成与年轻爸爸的合影腾讯元宝推出父亲节主题活动,用户可选择爸爸年轻时照片与自己的照片,输入提示词(如“帮我生成一张和爸爸的合影,将图2的我融合到图1爸爸的照片中,我想穿越回__年前,和他一起_____;保留爸爸照片的背景、动作及五官;人物姿态自然协调,整体光线与色调保持一致”),元宝即可生成合影。活动旨在让用户“回到过去”看到爸爸的青春模样。推荐理由:元宝的父亲节营销,但合影生成指令写得具体可复现,比普通AI写真教程更接地气,父亲节想整活的可以直接抄作业。

6月18日周四

19:47Hacker News 热门(buzzing.cc 中文翻译)79ChatGPT 图像生成器可被绕过滤镜生成暴力和色情内容Mindgard 红队研究发现,ChatGPT 的图像生成器可通过简单提示词轻易绕过内容过滤器,在未直接请求的情况下自动生成性暴力、血腥谋杀等露骨图像。一个热门的“恢复照片”提示词因输入模糊而绕过输入过滤器,结果如同俄罗斯轮盘赌;进一步添加虚假图像 ID 和“不做审查”指令后,模型持续生成高度性化女性图像,甚至出现被捆绑殴打的尸体,并自动赋予惊悚标题。研究指出,OpenAI 此前声称修复的裸体问题仍未解决,暴露了 AI 工具广泛可及性与不足内容过滤的现实风险。推荐理由:这是自 ChatGPT 图片功能上线以来最严重的安全漏洞曝光,Mindgard 用简单句子就绕过所有 filter 直接生成极端暴力色情图片,OpenAI 的回应和处理令人失望,暴露了训练数据治理的根本问题。
15:54向阳乔木79免费开源乔木画布:AI生图+抠图,一键部署Vercel乔木画布推出免费开源在线图像编辑器,可一键部署Vercel为网站,功能类似简化版PS。支持Seedream和GPT-image-2生图、图片模板存储分享、一键抠图、2万图标和常见Emoji,甚至能绘制PRD。随时创建3:4/16:9/21:9等不同尺寸画布。原计划高级功能收费,庆祝端午节现全免费开源。在线体验:https://ps.qiaomu.ai/,GitHub见评论区。推荐理由:这个开源画布把AI生图和简易设计工具打包,一键部署Vercel,对偶尔做图的产品人和开发者很友好,全免费开源的诚意值得点开收藏。
09:45Midjourney71深入解析 Midjourney Scanner 技术内幕我们全新“Midjourney Scanner”的技术深潜。推荐理由:Midjourney 官方放出 Scanner 的技术深度解读,我觉得它把传统扫描和生成式 AI 结合的方式挺有启发,不只是一个滤镜,而是重构了图像输入流程,做图像产品的值得认真看看。
01:35Midjourney71Midjourney V8.1 发布大批次草稿模式我们发布了 V8.1 的新大批次草稿模式。该新模式可让你生成 24 张低分辨率图像,价格仅为标准分辨率四图 Midjourney 任务的一半。当你喜欢某张图像时,只需按下 "Vary" 即可获得全分辨率的新版本。尽情享受吧!推荐理由:Midjourney 这个批量草稿模式把试错成本砍半,对高频出图的设计师是个实在的提速,但不算能力升级,更像效率补丁。

6月17日周三

06:13Midjourney:Updates(RSS)66Midjourney V8.1 推出 Draft mode 草稿模式与新功能预览Midjourney V8.1 的 Draft mode 草稿模式每次生成24张低分辨率低质量图片。用户可对任意图片点击 "Vary",将其渲染为全质量、全分辨率版本。草稿任务消耗的快速小时数减半。推荐理由:这是我最近看到最实用的 Midjourney 更新,草稿模式半价生成 24 张低质量图,快速筛选后再渲染,直接降低试错成本。

6月16日周二

02:33TechCrunch:AI(RSS)71Meta 在 Facebook 上线"AI Mode",基于平台公开信息合成答案Meta 宣布在 Facebook 推出“AI Mode”搜索功能,利用 Meta AI 从公开帖子(含群组和 Reels)提取信息并合成答案,用户可用自然语言提问获得摘要。同时新增视频拼贴剪辑、过渡效果及 AI 照片预设(可更换服装、发型和配饰),体育迷可在 Stories 中点击“AI Edit”虚拟穿上队服。这些更新延续了此前动态头像、Marketplace 自动回复和创作者 AI 助手的部署节奏。此外,Meta 近期启动了 Facebook、Instagram 和 WhatsApp 的全球订阅计划(每月 3.99 美元起),更多 AI 订阅层级正在规划中。推荐理由:Facebook 的 AI 模式把社交搜索变成问答,想法不新但执行够快,对普通用户吸引力大,只是答案来自群聊,可靠性是个坑。配套的 AI 照片编辑也让玩梗更方便,Meta 在拼命给 Facebook 塞 AI 留住用户。

6月12日周五

11:54小互75小互开源公众号自动排版技能组合小互(@xiaohu)升级了公众号排版技能组合,实现一句话完成排版、封面生成并一键发送到公众号草稿箱。该工具已开源,提供20种主题颜色可选,可自动分析内容进行排版,支持非Markdown文件。用户只需在Claude Code、Codex或OpenClaw中提供文章链接或文档位置,即可获得可视化预览界面进行选择,全程无需手动操作。推荐理由:小互把公众号排版全流程做成一个开源技能,一句话就能从内容生成到草稿箱,做公众号的可以直接用,这种自动化程度很少见。
01:20Logan Kilpatrick81Gemini Omni Flash 视频任务达 SOTAGemini Omni Flash 在图像到视频、文本到视频和视频编辑方面达到了 SATA : ) 很高兴很快能将这一能力通过 API 提供给开发者!推荐理由:视频生成正式进入全模态一体时代,Gemini Omni Flash 把图生视频、文生视频和剪辑整合在一个模型里,API 很快上线,做视频工具的可以提前琢磨对手在哪了。

6月11日周四

23:07Krea73Krea 2 推出生成式滑块控制图像属性推出生成式滑块。 现在您可以控制使用 Krea 2 生成的任何图像的强度、复杂度和运动。 你希望看到哪些新控制?👇推荐理由:Krea 2 终于加上了控制强度、复杂度和运动轨迹的滑块,以前调参靠抽卡,现在能精准控制了,做图的人应该会喜欢。
12:10Midjourney:Updates(RSS)64Midjourney V8.1 已成为默认模型Midjourney 已将默认模型从 V7 升级为 V8.1。V8.1 在智能性、连贯性、对详细提示的遵循度以及文本渲染效果上均有提升,HD 模式也已支持。推荐理由:虽然V8.1不是大版本,但设为默认后所有用户自动升级,尤其是文本和复杂提示词的理解增强,做设计的朋友值得重新测试一下关键词。
08:11Orange AI76在写完这篇文章后 我把配图过程蒸馏成了一个「橙线插画」Skill 免费开源 安装地址: https://github.com/orange2ai/orange-line-illustration 【引用 @oran_ge】:http://x.com/i/article/2064857003743391744推荐理由:橘子把自己写文章时的插画流程封装成了免费Skill,一次安装,以后配图风格统一还不用动脑子,做内容的人值得收藏。

6月10日周三

23:41ChatGPT69ChatGPT 推头发变国旗颜色功能Go #MessiMode 上传一张你的照片并尝试这个提示词:“将我的头发变成本国国旗的颜色,但要看起来自然。如果没有提供国家或图片,请询问。”推荐理由:一个官方给出的趣味 prompt,让你把头发染成国旗色,虽然不是什么大更新,但胜在简单好玩,普通人也能立刻上手玩一下。
12:56HuggingFace Daily Papers(社区热门论文)73Flow-DPPO: 面向流匹配模型的散度近端策略优化针对流匹配模型中在线强化学习比率裁剪策略约束不当的问题,Flow-DPPO 提出用散度近端约束替代。关键洞察是流模型每步策略为高斯分布,可精确计算新旧策略间的 KL 散度。Flow-DPPO 采用非对称散度掩码,仅在梯度更新偏离信任区域且超阈值时阻止更新。实验表明,Flow-DPPO 获得更高奖励,KL 近端效率更优,缓解了灾难性遗忘,促进多目标均衡,并能在比率裁剪失效时支持稳定的多轮训练。代码已开源。推荐理由:用 KL 散度代替比值裁剪来解决流匹配 RL 训练的不稳定,理论简洁,代码已开源,做图像/视频生成优化的同学可以跑一下。
01:08Fei-Fei Li78World Labs与Lore合作打造互动体验创意和想象力无与伦比!非常感谢@theworldlabs能与@withloreco的优秀人才合作,将他们不可思议的想法转化为用户可以享受的互动体验!🤩推荐理由:World Labs把生成式空间智能做成了可走进的浏览器世界,不是看视频而是和历史伟人互动,技术想象力和产品落地都够惊艳,做虚拟世界和交互叙事的人值得直接点进去体验。

6月9日周二

08:00HuggingFace Daily Papers(社区热门论文)82i1:面向强文生图模型的简单且完全开源配方i1 是一个 3B 参数的文本到图像扩散模型,仅使用公开数据集训练。在 GenEval、DPG、PRISM、CVTG-2K 和 LongText 五个基准上,i1 性能与领先模型相当,平均比最佳现有完全开源模型高 29.5 个百分点。研究基于 300 余项控制实验(超 700K TPU v6e 小时),发现等权重混合 curated 数据集是强默认配置、更大文本编码器适配器以极少参数提升性能。i1 的检查点、训练与推理代码及数据处理流程已全部开源。推荐理由:i1 是第一个用全公开数据、完全开源代码/权重/数据管线打造的 3B 模型,直接把全开放模型的性能拉到可与闭源竞争,对做文生图研究的同行是个扎实起点。
03:09TechCrunch:AI(RSS)73苹果刚刚教会你的iPhone补全句子、完善照片和简化工作流程Apple为Safari、Shortcuts和Password应用添加了AI驱动的新功能,让iPhone能够自动补全句子、完善照片和简化工作流程。推荐理由:WWDC 2026 的 Apple Intelligence 更新不是颠覆性突破,但 Safari 标签管理、跨应用上下文和 Shortcuts 的 AI 创建让 AI 真正渗透到日常使用中,是所有苹果用户都该看看的实用升级。
00:08Runway79Runway Aleph 2.0 编辑模型:一键适配任意视频格式一个视频,现在可以为每个信息流和格式制作。上传你现有的视频,选择你想要的宽高比,然后观看我们的编辑模型 Aleph 2.0,填充场景的其余部分,就像你从一开始就这样制作一样。 在我们的桌面 Web 应用上尝试,链接如下。推荐理由:Runway 把视频重构图做成了上传即填充,Aleph 2.0 自动补全不同比例画面,对同时做横竖版内容的人太实用,省掉重新拍摄或手动裁剪的功夫。

6月7日周日

12:00宝玉76对比一下 GPT-5.5 的设计效果和 Opus 4.8 的设计效果宝玉对比了GPT-5.5与Opus 4.8的设计能力,认为Opus 4.8效果远优于GPT-5.5。他使用了基于Cursor浏览器和元素标注的baoyu-design Skill,该Skill通过npx skills add JimLiu/baoyu-design安装,可在本地运行:描述屏幕需求即可生成精良HTML,点击预览中任意元素即可发出修改指令。官方推荐搭配Opus 4.8以获得最佳效果。工具GitHub仓库:https://github.com/JimLiu/baoyu-design。推荐理由:宝玉这个 skill 把 Claude Design 拉到本地,一个 prompt 就能出图对比,GPT-5.5 和 Opus 4.8 的审美差距肉眼可见,做设计的可以直接套。
精选
2026年7月26日星期日 · AI 自动挑选的高价值内容
全部模型产品行业论文技巧

7月25日

星期六 · 1 条
06:22
Midjourney:Updates(RSS)精选
73
Midjourney V8.2 发布:专注美学提升与个性化理解

Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。

图像生成模型发布
另有 1 家信源报道X:Midjourney (@midjourney)
推荐理由:Midjourney V8.2 把审美和个性化放到了C位,不再追分辨率,这对重度用户是实在的体验升级,建议立刻用老 profile 试试新模型。

7月22日

星期三 · 1 条
21:00
公众号:卡尔的AI沃茨精选
71
实测Qwen-Image-3.0:19大场景挑战GPT Image2,中文长文本与多图融合表现亮眼

Qwen-Image-3.0上线,支持最高4.5k token输入、12种语言、20多种字体,以及多图融合、图中图和图片编辑。实测显示,其在中文长文本生成、多语言混合排版、UI设计、多图融合与图片编辑等19个场景中均能稳定输出,文字不崩且信息对应准确,图片质量已能与GPT Image2媲美。该模型在国内可直接使用,速度快且价格不贵。

图像生成多模态评测/基准

推荐理由:Qwen-Image-3.0 的实测效果在中文文字稳定性和多图融合上可以和 GPT Image2 掰手腕,看完这些案例,你会意识到国产图像模型已经能务实替代一部分工作流了。

7月21日

星期二 · 1 条
14:22
Qwen:Blog Retrieval(API)精选
77
通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为"实"

通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。

图像生成多模态模型发布
另有 6 家信源报道Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:swyx (@swyx)X:通义千问 / Qwen (@Alibaba_Qwen)The Decoder:AI News(RSS)X:阿里云 / Alibaba Cloud (@alibaba_cloud)
推荐理由:我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。

7月14日

星期二 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
74
Boogu-Image-0.1 发布:开源统一多模态理解与生成模型,训练成本仅约 40 万美元

Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。

图像生成多模态开源/仓库模型发布

推荐理由:开源多模态模型终于有一个能打闭源系统的了,40万美元训练成本刷到接近GPT-Image-2的水平,想自己部署图像生成和编辑产品的开发者可以认真看看。

7月13日

星期一 · 1 条
18:29
歸藏(guizang.ai)@op7418精选
75
Seedream 5.0 Pro 测评:图像编辑门槛爆降

字节跳动发布 Seedream 5.0 Pro,图像质量与提示词理解追平 GPT-Image 2.0,综合能力仅次于后者。核心亮点是“可编辑”交互:用户可在图上打点、画框、涂鸦,提示词中直接 @ 标记,实现精准局部编辑(如换沙发、改墙面颜色),其他区域不变。实测案例涵盖家装改造(一次替换六件家具)、商品图制作(键盘爆炸拆解图、标注卖点)、海报排版(框定位置生成文字)等场景,支持色卡配色和 SKU 换色。火山引擎已全量上线 API,即梦、豆包、Lumina 可体验。

图像生成评测/基准
另有 1 家信源报道X:歸藏 (@op7418)
推荐理由:归藏实地测了 Seedream 5.0 Pro,真正杀招是图像编辑,把选区做进提示词,家装、电商、海报案例都给了可复制的实操步骤。这是字节图像生成追平甚至在某些场景反超的节点,做内容或电商的值得马上试。

7月11日

星期六 · 1 条
08:10
The Verge:AI(RSS)精选
76
Meta 关闭 Instagram 用户可基于公开账户生成 AI 深度伪造图片的功能

在遭到强烈反对后,Meta 关闭了本周早些时候推出的一项 Instagram 功能。该功能允许用户通过 @ 提及公开 Instagram 账户,基于其内容生成 AI 图片,且无需账户所有者许可。Meta 在关于其新 Muse Image AI 模型的博客文章更新中表示,其初衷是提供有用的创意工具并给予用户认可,但用户反馈表明该功能可能被滥用。

Meta图像生成安全/对齐行业动态
另有 1 家信源报道The Decoder:AI News(RSS)
推荐理由:Meta 在舆论压力下火速撤回刚发布的 AI 深度伪造功能,这次公关折返跑比功能本身更有信息量,平台对隐私反弹的优先级已经高于技术落地,但默认 opt-out 的根本矛盾还在。

7月10日

星期五 · 1 条
15:31
Elon Musk@elonmusk精选
68
Elon Musk 转发用户 @0x0funky 对 Grok Build 的称赞。该用户称 Grok Build 是目前唯一集大成的 coding agentic workflow,内建图像生成和图片生视频功能,生图速度快且品质不输 Codex。Agent 可直接完成图像与视频生成,无需额外串接 MCP 或外部服务。用户结合 Agent Sprite Forge 工具,利用 Grok Build 的视频生成能力,先产出 6 秒角色动作视频再反编译为 game sprite,大幅减少对齐问题,制作 2D 横版游戏耗时不到 30 分钟,而此前用 Codex 需 1-2 小时且品质更优。

0xFunky: Grok Build 真的太疯狂了。 先不管 GPT-5.6 到底有没有发布、好不好用。 先来大力称赞一下 @grok 的 Grok Build,这是目前唯一一个集大成的 coding agentic workflow。 Grok Buil...

智能体xAI图像生成教程/实践

推荐理由:这个 Grok Build 加 Agent Sprite Forge 的工作流把做 2D 游戏的时间压到了 30 分钟,之前要 1-2 小时,而且品质更好,独立游戏开发者可以直接抄作业。

7月9日

星期四 · 1 条
06:22
Runway@runwayml精选
69
Seedream 5.0 Pro 现已登陆 Runway。可通过提示词或参考图生成高细节图像,图像内文字清晰可读,支持多达14种语言。立即点击下方链接尝试。
产品更新图像生成多模态

推荐理由:Seedream 5.0 Pro 的集成让 Runway 的图像生成多了一个强力选择,14 种语言的可读文字生成是实用亮点,做多语言海报的设计师可以试试。

7月8日

星期三 · 3 条
21:22
字节 Seed:Research Feed(网页内嵌数据)精选
78
Seedream 5.0 Pro 发布:不止"生成",更懂"设计"

字节 Seed 今日发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面升级。四大核心突破:复杂信息可视化,可生成高密度信息图;交互式精准编辑,支持点选、圈选、草图渲染、色彩与材质替换、图层分离及多图融合,实现像素级编辑;真实的影像与人像质感,还原光影、材质与皮肤肌理;原生多语种输入与生成,支持十余种语言及本地化视觉特征。已陆续在豆包、即梦、火山方舟等平台上线。

图像生成多模态模型发布
另有 1 家信源报道IT之家(RSS)
推荐理由:字节这次发布的 Seedream 5.0 Pro 把图像生成从「画得好看」推进到「能输出信息图、能精准编辑」的实用设计工具,尤其复杂信息图和交互编辑是当前竞品明显短板,做设计的值得立刻试试。
04:51
Krea@krea_ai精选
66
Krea 2 的身份保留功能已发布,配套模型和 ComfyUI 节点也已上线。🔥

Brie Wensleydale🧀🐭: 这才是我渴望的那种身份保留型功能。 我明天要出门旅行,所以没法测试它。我很好奇它在风格化角色上的表现如何...... https://huggingface.co/conradlocke/krea2-identity-edit https:...

图像生成开源/仓库开源生态

推荐理由:Krea 2的ID保持终于被社区做出来了,附带ComfyUI节点,想稳定控制角色一致性的人可以立刻用起来。
03:58
AI at Meta@AIatMeta精选
75
Meta Superintelligence Labs 推出 Muse Image 和 Muse Video

Meta Superintelligence Labs 发布首个媒体生成模型 Muse Image 和 Muse Video。Muse Image 是目前最先进的图像生成模型,能精确遵循指令、精准编辑、多参考构图,并利用 Instagram 社交上下文。它还具备智能体工具使用能力并集成 Muse Spark。用户可通过 Meta AI 应用、网页、Instagram Stories 和 WhatsApp 试用,初始限于部分国家。Muse Video 基于相同预训练基础,实现高视觉保真度并原生支持音频。

Meta图像生成模型发布视频
另有 6 家信源报道The Verge:AI(RSS)X:AI at Meta (@AIatMeta)The Decoder:AI News(RSS)X:Testing Catalog (@testingcatalog)IT之家(RSS)TechCrunch:AI(RSS)
推荐理由:Meta 超级智能实验室的首个媒体生成模型,把图像生成跟 Instagram 社交语境结合听起来很实用,但细节还少,期待后续实测。

7月6日

星期一 · 1 条
01:53
Hacker News 热门(buzzing.cc 中文翻译)精选
70
三周前,我不小心创办了一家小公司

一位父亲为患有自闭症的非语言儿子开发了一款沟通应用,在言语治疗室的等候区展示时,所有非语言儿童的母亲看到后都忍不住流泪,言语治疗师也啜泣了五分钟。他意外发现产品市场匹配,决定腾出时间让更多孩子能用上,即使这意味着几周睡眠不足。应用本身是专为理解语言困难的儿童设计的,与传统的AAC设备不同——后者主要面向身体障碍但语言理解正常的成人。

图像生成现象/趋势语音

推荐理由:这篇文章读来会让人看天花板,一位父亲用 AI 图像和声音克隆为儿子创造了沟通工具,意外找到了产品市场契合。它比任何融资新闻都更让我相信,AI 的真正价值在于解决那些被忽视的具体问题。

7月3日

星期五 · 2 条
20:32
歸藏(guizang.ai)@op7418精选
75
藏师傅PPT与Pencil结合使用技巧

用户将藏师傅的AI生成PPT导入Pencil设计软件,可在Pencil中一次性浏览所有页面并手动调整AI常见的排版问题,如元素重叠、对齐不准、字体错误。Pencil提供比PPT更强的编辑能力(对齐、嵌套、打组),支持导出网页和编辑文件,也可导出PNG后直接放入PPT演示。这种工作流昨天经朋友分享验证,大幅提升AI生成内容的可编辑性。

歸藏(guizang.ai): http://x.com/i/article/2053655813877870592

图像生成教程/实践

推荐理由:藏师傅的 PPT Skill 结合 Pencil,提供了一个比 PPT 软件本身更灵活的编辑路径,对于频繁出提案的人算是一个值得试的小技巧,但 AI 排版仍需手动微调。
11:34
HuggingFace Daily Papers(社区热门论文)精选
74
表示分布匹配(RDM)用于一步视觉生成

表示分布匹配(RDM)通过匹配冻结预训练编码器下的生成与参考特征分布来训练一步图像生成器。三个发现:经典MMD正确估计后成为可扩展目标;生成批次大小最优超过2048;单一表示可被欺骗,需匹配平衡编码器组合并采用独立于训练损失的SW_r14评估。改进的iRDM在ImageNet上以SW_r14 1.30达一步生成SOTA,PickScore在71.2%样本上偏好iRDM。该方法将四步FLUX.2后训练为一步生成器,在GenEval(0.826对0.794)和PickScore(22.76对22.58)上超越原版,仅需90 H200 GPU小时。

图像生成论文/研究

推荐理由:这篇论文把MMD重新变成了一流的一步生成目标,用多编码器匹配防止作弊,并把FLUX.2四步模型浓缩成一步,性能不降反升,90 GPU小时就能复现,做视觉生成的人应该仔细看。

7月1日

星期三 · 2 条
01:29
Apple:Newsroom(RSS)精选
66
Apple Creator Studio 更新:更智能、更快速、更互联

Apple Creator Studio 推出多项 AI 增强更新。Final Cut Pro 新增 on-device AI 驱动的 Generate Captions(自动转录音频生成字幕)和 Edit Detection(自动检测剪辑点)。Mac 版加入 Auto Mask(自动识别皮肤、天空等主体)、增强的 Match Color 和 Advanced Trimming。支持将帧发送至 Pixelmator Pro 编辑,并在 Keynote、Pages、Numbers 中直接调用 Pixelmator Pro 修改图片。Logic Pro 新增 Grammy 制作人制作的 Producer Project 及 Chord ID 改进。订阅价 $12.99/月或 $129/年,新用户免费试用一个月,教育用户 $2.99/月。

产品更新图像生成语音

推荐理由:Final Cut Pro 的自动字幕和遮罩是实打实的工作流提升,Pixelmator Pro 的深度整合也让设计更顺畅,虽然没有颠覆性突破,但创意工作者今天就能用上。
00:08
Google DeepMind:Blog(RSS)精选
70
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash

Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为 Nano Banana 系列速度最快、成本最低的图像模型,文本到图像输出仅需 4 秒,每 1K 分辨率图像成本 $0.034,已上线 Google AI Studio、Gemini API 及消费者产品(AI Mode in Search、Gemini app 等)。同时推出 Gemini Omni Flash(gemini-omni-flash-preview),支持高画质视频生成与对话式编辑,视频输出定价 $0.10/秒,面向开发者开放 API。

Google图像生成多模态模型发布
另有 3 家信源报道X:Google DeepMind (@GoogleDeepMind)X:Google AI (@GoogleAI)X:Logan Kilpatrick (@OfficialLoganK)
推荐理由:Nano Banana 2 Lite 把图像生成拉到 4 秒延迟和 0.034 美元单价,很适合高频草稿流,Omni Flash 首次对开发者开放视频生成和对话编辑,两个模型串起来的快速迭代工作流是这次最实用的更新。

6月26日

星期五 · 3 条
09:27
小互@xiaohu精选
81
小互开源个人IP配图技能"小互IP Studio",含31个原创角色

博主小互开源个人IP配图技能“小互IP Studio”,包含31个原创角色(15个手绘线稿角色+16个谐音梗meme形象)及一套配图方法论。该Agent可自动读取文章、规划配图类型(情绪图/示意图/四格漫画)、生成并自查返工。默认画风为手绘线稿淡彩,另备5种皮肤(3D盲盒、黑白线稿等)可切换。安装仅需Python3,支持Claude Code、Codex等工具,需自备OpenAI兼容的图像API key(默认GPT-image-2);也可只输出提示词手动生图。

智能体GitHub图像生成开源/仓库

推荐理由:小互开源了一整套AI配图skill和31个原创角色,把“读文-定图-生图-自查”的流程装进一个命令,自媒体人装上就能用,省去调提示词的痛苦。
03:12
Midjourney@midjourney精选
67
Midjourney 带来两项更新。一是加入 `--preview` 参数可提前体验 V8.2 的美学与个性化效果;二是此前在 V8.1 推出的大批量草稿模式(生成 24 张低分辨率图,价格仅为标准 4 张的一半,点击 "Vary" 可升级为全分辨率)现在支持搭配 `--sref random` 使用,探索风格空间的速度比之前快 24 倍。

Midjourney: 我们已为 V8.1 发布了一种全新的大批量草稿模式。这种新模式允许你以标准分辨率 4 图 Midjourney 任务一半的价格,生成 24 张较低分辨率的图像。当你喜欢某张图像时,只需按下"Vary"按钮,即可获得全分辨率的新版本。尽情享受...

产品更新图像生成

推荐理由:新草稿模式让批量探索风格变得便宜又快速,配上 sref random 更是把试错效率拉满,设计师能直接用到工作流里。V8.2 预览只是小彩蛋,但暗示美学调校还在进化。
02:57
Midjourney:Updates(RSS)精选
62
Midjourney V8.1 草稿模式新增随机风格功能

Midjourney V8.1 的草稿模式(draft mode)添加了随机风格功能。用户在提示词中加入 --sref random 即可一键生成 24 张不同风格的图片。开启草稿模式可通过点击提示栏的 ⚡ 图标或添加 --draft 参数。

产品更新图像生成

推荐理由:Midjourney 在 V8.1 草稿模式加了随机风格,一键出 24 种草图,对找灵感的创作者算顺手小升级,但改变不了核心创作流程,只适合深度用户尝鲜。

6月24日

星期三 · 2 条
19:31
OpenRouter:Announcements(RSS)精选
73
OpenRouter推出统一图像API

OpenRouter推出统一图像API,整合Google、OpenAI、Black Forest Labs、Recraft、ByteDance、Sourceful、Microsoft、xAI等30+模型。新API提供标准化请求格式,通过/api/v1/images/models端点返回每个模型的分辨率、宽高比、输出数量、输入参考图数量、种子等能力描述;通过/api/v1/images/models/{id}/endpoints端点获取具体服务商的定价与参数支持(如Seedream 4.5每张$0.04、FLUX.2 Pro每百万像素$0.03、GPT-5.4 Image 2按token计费)。OpenAI的GPT 5系列图像模型支持SSE流式预览,启用"stream": true即可边生成边返回预览。新图像模型将仅添加至专用API,建议现有用户切换。

智能体产品更新图像生成多模态
另有 1 家信源报道X:OpenRouter (@OpenRouter)
推荐理由:OpenRouter 把 30+ 图像模型收进一个 API,参数自动发现和流式预览让频繁切换模型的开发者省去不少适配麻烦,尤其对 Agent 工作流很友好。
01:37
Krea@krea_ai精选
71
我们的技术报告已发布。 深入解析创建 Krea 2 所用的数据、架构及训练技巧。 https://www.krea.ai/blog/krea-2-technical-report

Krea: 今天,我们发布了 Krea 2 的开放权重。 欢迎 Krea 2 Raw 和 Krea 2 Turbo:前者是一个来自中期训练、未经知识蒸馏、旨在用于微调的模型,后者则是具有广泛美学多样性的快速蒸馏版本。 详情如下 👇

图像生成开源生态模型发布
另有 2 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:Krea AI (@krea_ai)
推荐理由:Krea 2 开源了两个图像模型权重,一个未蒸馏适合微调,一个快速蒸馏版覆盖多样审美。对于做图像生成应用和模型融合的团队,这次开放权重比很多大厂都实在。

6月21日

星期日 · 1 条
13:00
公众号:腾讯元宝精选
64
腾讯元宝父亲节活动:上传照片生成与年轻爸爸的合影

腾讯元宝推出父亲节主题活动,用户可选择爸爸年轻时照片与自己的照片,输入提示词(如“帮我生成一张和爸爸的合影,将图2的我融合到图1爸爸的照片中,我想穿越回__年前,和他一起_____;保留爸爸照片的背景、动作及五官;人物姿态自然协调,整体光线与色调保持一致”),元宝即可生成合影。活动旨在让用户“回到过去”看到爸爸的青春模样。

图像生成教程/实践

推荐理由:元宝的父亲节营销,但合影生成指令写得具体可复现,比普通AI写真教程更接地气,父亲节想整活的可以直接抄作业。

6月18日

星期四 · 4 条
19:47
Hacker News 热门(buzzing.cc 中文翻译)精选
79
ChatGPT 图像生成器可被绕过滤镜生成暴力和色情内容

Mindgard 红队研究发现,ChatGPT 的图像生成器可通过简单提示词轻易绕过内容过滤器,在未直接请求的情况下自动生成性暴力、血腥谋杀等露骨图像。一个热门的“恢复照片”提示词因输入模糊而绕过输入过滤器,结果如同俄罗斯轮盘赌;进一步添加虚假图像 ID 和“不做审查”指令后,模型持续生成高度性化女性图像,甚至出现被捆绑殴打的尸体,并自动赋予惊悚标题。研究指出,OpenAI 此前声称修复的裸体问题仍未解决,暴露了 AI 工具广泛可及性与不足内容过滤的现实风险。

OpenAI图像生成安全/对齐

推荐理由:这是自 ChatGPT 图片功能上线以来最严重的安全漏洞曝光,Mindgard 用简单句子就绕过所有 filter 直接生成极端暴力色情图片,OpenAI 的回应和处理令人失望,暴露了训练数据治理的根本问题。
15:54
向阳乔木@vista8精选
79
免费开源乔木画布:AI生图+抠图,一键部署Vercel

乔木画布推出免费开源在线图像编辑器,可一键部署Vercel为网站,功能类似简化版PS。支持Seedream和GPT-image-2生图、图片模板存储分享、一键抠图、2万图标和常见Emoji,甚至能绘制PRD。随时创建3:4/16:9/21:9等不同尺寸画布。原计划高级功能收费,庆祝端午节现全免费开源。在线体验:https://ps.qiaomu.ai/,GitHub见评论区。

OpenAI图像生成开源/仓库开源生态

推荐理由:这个开源画布把AI生图和简易设计工具打包,一键部署Vercel,对偶尔做图的产品人和开发者很友好,全免费开源的诚意值得点开收藏。
09:45
Midjourney@midjourney精选
71
我们全新"Midjourney Scanner"的技术深潜。
产品更新图像生成

推荐理由:Midjourney 官方放出 Scanner 的技术深度解读,我觉得它把传统扫描和生成式 AI 结合的方式挺有启发,不只是一个滤镜,而是重构了图像输入流程,做图像产品的值得认真看看。
01:35
Midjourney@midjourney精选
71
我们发布了 V8.1 的新大批次草稿模式。该新模式可让你生成 24 张低分辨率图像,价格仅为标准分辨率四图 Midjourney 任务的一半。当你喜欢某张图像时,只需按下 "Vary" 即可获得全分辨率的新版本。尽情享受吧!
产品更新图像生成

推荐理由:Midjourney 这个批量草稿模式把试错成本砍半,对高频出图的设计师是个实在的提速,但不算能力升级,更像效率补丁。

6月17日

星期三 · 1 条
06:13
Midjourney:Updates(RSS)精选
66
Midjourney V8.1 推出 Draft mode 草稿模式与新功能预览

Midjourney V8.1 的 Draft mode 草稿模式每次生成24张低分辨率低质量图片。用户可对任意图片点击 "Vary",将其渲染为全质量、全分辨率版本。草稿任务消耗的快速小时数减半。

产品更新图像生成

推荐理由:这是我最近看到最实用的 Midjourney 更新,草稿模式半价生成 24 张低质量图,快速筛选后再渲染,直接降低试错成本。

6月16日

星期二 · 1 条
02:33
TechCrunch:AI(RSS)精选
71
Meta 在 Facebook 上线"AI Mode",基于平台公开信息合成答案

Meta 宣布在 Facebook 推出“AI Mode”搜索功能,利用 Meta AI 从公开帖子(含群组和 Reels)提取信息并合成答案,用户可用自然语言提问获得摘要。同时新增视频拼贴剪辑、过渡效果及 AI 照片预设(可更换服装、发型和配饰),体育迷可在 Stories 中点击“AI Edit”虚拟穿上队服。这些更新延续了此前动态头像、Marketplace 自动回复和创作者 AI 助手的部署节奏。此外,Meta 近期启动了 Facebook、Instagram 和 WhatsApp 的全球订阅计划(每月 3.99 美元起),更多 AI 订阅层级正在规划中。

Meta产品更新图像生成搜索

推荐理由:Facebook 的 AI 模式把社交搜索变成问答,想法不新但执行够快,对普通用户吸引力大,只是答案来自群聊,可靠性是个坑。配套的 AI 照片编辑也让玩梗更方便,Meta 在拼命给 Facebook 塞 AI 留住用户。

6月12日

星期五 · 2 条
11:54
小互@xiaohu精选
75
小互(@xiaohu)升级了公众号排版技能组合,实现一句话完成排版、封面生成并一键发送到公众号草稿箱。该工具已开源,提供20种主题颜色可选,可自动分析内容进行排版,支持非Markdown文件。用户只需在Claude Code、Codex或OpenClaw中提供文章链接或文档位置,即可获得可视化预览界面进行选择,全程无需手动操作。

小互: 一句话搞定公众号排版、封面生成、发布 我做了个技能组合,可以一句话搞定公众号排版、封面生成,和一键发送到公众号草稿箱,你只需点下发布即可。 已经开源了 有20种主题颜色可选 最重要的是它会自动分析你的内容,进行自动排版,不是Markdown...

Anthropic图像生成开源/仓库教程/实践

推荐理由:小互把公众号排版全流程做成一个开源技能,一句话就能从内容生成到草稿箱,做公众号的可以直接用,这种自动化程度很少见。
01:20
Logan Kilpatrick@OfficialLoganK精选
81
Gemini Omni Flash 在图像到视频、文本到视频和视频编辑方面达到了 SATA : ) 很高兴很快能将这一能力通过 API 提供给开发者!
Google图像生成多模态模型发布

推荐理由:视频生成正式进入全模态一体时代,Gemini Omni Flash 把图生视频、文生视频和剪辑整合在一个模型里,API 很快上线,做视频工具的可以提前琢磨对手在哪了。

6月11日

星期四 · 3 条
23:07
Krea@krea_ai精选
73
推出生成式滑块。 现在您可以控制使用 Krea 2 生成的任何图像的强度、复杂度和运动。 你希望看到哪些新控制?👇
产品更新图像生成

推荐理由:Krea 2 终于加上了控制强度、复杂度和运动轨迹的滑块,以前调参靠抽卡,现在能精准控制了,做图的人应该会喜欢。
12:10
Midjourney:Updates(RSS)精选
64
Midjourney V8.1 已成为默认模型

Midjourney 已将默认模型从 V7 升级为 V8.1。V8.1 在智能性、连贯性、对详细提示的遵循度以及文本渲染效果上均有提升,HD 模式也已支持。

图像生成模型发布
另有 1 家信源报道X:Midjourney (@midjourney)
推荐理由:虽然V8.1不是大版本,但设为默认后所有用户自动升级,尤其是文本和复杂提示词的理解增强,做设计的朋友值得重新测试一下关键词。
08:11
Orange AI@oran_ge精选
76
在写完这篇文章后 我把配图过程蒸馏成了一个「橙线插画」Skill 免费开源 安装地址: https://github.com/orange2ai/orange-line-illustration 【引用 @oran_ge】:http://x.com/i/article/2064857003743391744

Orange AI: http://x.com/i/article/2064857003743391744

图像生成开源生态教程/实践

推荐理由:橘子把自己写文章时的插画流程封装成了免费Skill,一次安装,以后配图风格统一还不用动脑子,做内容的人值得收藏。

6月10日

星期三 · 3 条
23:41
ChatGPT@ChatGPTapp精选
69
Go #MessiMode 上传一张你的照片并尝试这个提示词:"将我的头发变成本国国旗的颜色,但要看起来自然。如果没有提供国家或图片,请询问。"
OpenAI图像生成教程/实践

推荐理由:一个官方给出的趣味 prompt,让你把头发染成国旗色,虽然不是什么大更新,但胜在简单好玩,普通人也能立刻上手玩一下。
12:56
HuggingFace Daily Papers(社区热门论文)精选
73
Flow-DPPO: 面向流匹配模型的散度近端策略优化

针对流匹配模型中在线强化学习比率裁剪策略约束不当的问题,Flow-DPPO 提出用散度近端约束替代。关键洞察是流模型每步策略为高斯分布,可精确计算新旧策略间的 KL 散度。Flow-DPPO 采用非对称散度掩码,仅在梯度更新偏离信任区域且超阈值时阻止更新。实验表明,Flow-DPPO 获得更高奖励,KL 近端效率更优,缓解了灾难性遗忘,促进多目标均衡,并能在比率裁剪失效时支持稳定的多轮训练。代码已开源。

图像生成推理视频论文/研究

推荐理由:用 KL 散度代替比值裁剪来解决流匹配 RL 训练的不稳定,理论简洁,代码已开源,做图像/视频生成优化的同学可以跑一下。
01:08
Fei-Fei Li@drfeifei精选
78
创意和想象力无与伦比!非常感谢@theworldlabs能与@withloreco的优秀人才合作,将他们不可思议的想法转化为用户可以享受的互动体验!🤩

World Labs: We turned dreams into worlds. Then filled them with history's greatest minds. Not a video. A world, running directly in ...

产品更新图像生成多模态

推荐理由:World Labs把生成式空间智能做成了可走进的浏览器世界,不是看视频而是和历史伟人互动,技术想象力和产品落地都够惊艳,做虚拟世界和交互叙事的人值得直接点进去体验。

6月9日

星期二 · 3 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
82
i1:面向强文生图模型的简单且完全开源配方

i1 是一个 3B 参数的文本到图像扩散模型,仅使用公开数据集训练。在 GenEval、DPG、PRISM、CVTG-2K 和 LongText 五个基准上,i1 性能与领先模型相当,平均比最佳现有完全开源模型高 29.5 个百分点。研究基于 300 余项控制实验(超 700K TPU v6e 小时),发现等权重混合 curated 数据集是强默认配置、更大文本编码器适配器以极少参数提升性能。i1 的检查点、训练与推理代码及数据处理流程已全部开源。

arXiv图像生成多模态开源生态

推荐理由:i1 是第一个用全公开数据、完全开源代码/权重/数据管线打造的 3B 模型,直接把全开放模型的性能拉到可与闭源竞争,对做文生图研究的同行是个扎实起点。
03:09
TechCrunch:AI(RSS)精选
73
苹果刚刚教会你的iPhone补全句子、完善照片和简化工作流程

Apple为Safari、Shortcuts和Password应用添加了AI驱动的新功能,让iPhone能够自动补全句子、完善照片和简化工作流程。

产品更新图像生成多模态

推荐理由:WWDC 2026 的 Apple Intelligence 更新不是颠覆性突破,但 Safari 标签管理、跨应用上下文和 Shortcuts 的 AI 创建让 AI 真正渗透到日常使用中,是所有苹果用户都该看看的实用升级。
00:08
Runway@runwayml精选
79
一个视频,现在可以为每个信息流和格式制作。上传你现有的视频,选择你想要的宽高比,然后观看我们的编辑模型 Aleph 2.0,填充场景的其余部分,就像你从一开始就这样制作一样。 在我们的桌面 Web 应用上尝试,链接如下。
产品更新图像生成视频
另有 2 家信源报道X:Runway (@runwayml)Runway:News(网页)
推荐理由:Runway 把视频重构图做成了上传即填充,Aleph 2.0 自动补全不同比例画面,对同时做横竖版内容的人太实用,省掉重新拍摄或手动裁剪的功夫。

6月7日

星期日 · 1 条
12:00
宝玉@dotey精选
76
对比一下 GPT-5.5 的设计效果和 Opus 4.8 的设计效果

宝玉对比了GPT-5.5与Opus 4.8的设计能力,认为Opus 4.8效果远优于GPT-5.5。他使用了基于Cursor浏览器和元素标注的baoyu-design Skill,该Skill通过npx skills add JimLiu/baoyu-design安装,可在本地运行:描述屏幕需求即可生成精良HTML,点击预览中任意元素即可发出修改指令。官方推荐搭配Opus 4.8以获得最佳效果。工具GitHub仓库:https://github.com/JimLiu/baoyu-design。

宝玉: Cursor's new browser + element annotation turns it into a design studio. Meet Cursor Design 🎨 - Claude Design, running ...

MCP/工具图像生成教程/实践
另有 1 家信源报道X:宝玉 (@dotey)
推荐理由:宝玉这个 skill 把 Claude Design 拉到本地,一个 prompt 就能出图对比,GPT-5.5 和 Opus 4.8 的审美差距肉眼可见,做设计的可以直接套。