Topic · 主题全部主题 →

图像生成

AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。

1,608条收录
128条精选

精选归档 · 第 6 页

101120 条 · 共 128

5月7日

星期四 · 2 条
08:30
Apple Machine Learning Research(RSS)精选
AI 评分 61/100
Normalizing Flows with Iterative Denoising

研究团队在归一化流(NFs)生成模型领域取得新进展,提出了迭代TARFlow(iTARFlow)。该方法在训练阶段保持完全端到端的基于似然的目标,采样时则采用自回归生成方式。iTARFlow延续了TARFlow在图像建模任务上的优势,使其成为扩散模型等方法的可行替代方案,进一步提升了归一化流生成模型的性能表现。


推荐理由:Normalizing Flows 这个老方法被苹果玩出新花样,iTARFlow 在训练上保留端到端似然,采样却自回归,给做生成模型的人提供了扩散模型之外的第二个靠谱选择。

5月1日

星期五 · 2 条
05:01
Midjourney:Updates(RSS)精选
AI 评分 56/100
V8.1 更新

Midjourney V8.1 版本现已登陆 Discord 平台及其官方网站。本次更新重点提升了图像的清晰度与整体画质,这一改进在风格参考(SREF)和情绪板(Moodboards)功能中效果最为显著,同时所有类型的图像生成质量均有所增强,为用户带来更精细的视觉体验。


推荐理由:Midjourney V8.1 只是个小版本迭代,主要提升锐度和图像质量,用惯了 V8 的可以不急着换,但玩 SREF 和 Moodboard 的值得试一下,细节确实有提升。

4月29日

星期三 · 2 条

4月23日

星期四 · 2 条
21:16
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 79/100
图像生成器是通用视觉学习者

研究表明,图像生成训练能像大语言模型预训练一样,让模型学习到强大、通用的视觉表征。通过将视觉任务的输出参数化为RGB图像,研究团队将感知任务重构为图像生成任务。基于Nano Banana Pro指令微调构建的通用模型Vision Banana,在涉及2D和3D理解的一系列任务上取得了最先进的结果,在分割任务上媲美Segment Anything Model 3,在度量深度估计上超越Depth Anything系列。这些成果通过轻量级指令微调实现,且未损害基础模型的图像生成能力。图像生成预训练正成为一种通用的视觉学习范式,可能成为构建兼顾生成与理解的基础视觉模型的核心路径。


推荐理由:Kaiming He团队证明图像生成器是通用视觉学习者,只用少量指令微调就让Nano Banana Pro在分割和深度估计上超过专用SOTA,且没忘生成本领。CV研究者不读这篇,可能错过一个范式转变。
05:39
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 60/100
ChatGPT Images 2.0 发布

ChatGPT Images 2.0 推出了一个先进的图像生成模型,该模型在文本渲染、多语言支持和视觉推理能力方面均有显著提升。新版模型能够更精准地生成包含文字的图像,并支持多种语言文本输入。其视觉推理功能也得到增强,可更好地理解和执行复杂图像生成指令。此次升级标志着多模态AI生成质量的一次重要进步。

另有 2 家信源报道Hacker News 热门(buzzing.cc 中文翻译)Simon Willison 博客
推荐理由:ChatGPT Images 2.0 把文本渲染和多语言支持拉到了实用级别,对需要快速产出视觉素材的产品人是个实在的提升,只是缺乏效果对比让价值打了折扣。

4月20日

星期一 · 1 条
12:37
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 76/100
Show HN: TRELLIS.2 图像转3D功能已在 Mac Silicon 上运行--无需 Nvidia GPU

TRELLIS.2 图像转3D功能完成 Mac Silicon 适配,无需 Nvidia GPU 即可在苹果芯片上本地运行。开发者开源的移植版本打破了此前对英伟达显卡的硬件依赖。该项目在 Hacker News 发布当日获得 102 个点赞,标志着端侧 AI 3D 生成技术向跨平台部署迈出重要一步。


推荐理由:TRELLIS.2的Mac移植让Apple Silicon用户终于能在本地跑图像转3D,5分钟出带PBR纹理的400K顶点网格,步骤简单,实测性能数据详实,做3D原型和资产的值得一试。

4月17日

星期五 · 1 条
00:13
Google Blog:AI(RSS)精选
AI 评分 71/100
Gemini 应用推出个性化图像创建新功能

Nano Banana 2 现支持结合个人上下文与 Google Photos 数据生成图像,通过分析用户独特的生活场景,创建反映个人经历的个性化视觉内容。该功能已在 Gemini 应用中上线,使 AI 图像生成能够基于真实生活语境,输出更贴合用户个人故事的定制化结果。


推荐理由:Gemini把个人照片和偏好直接揉进图像生成,不用再写长篇提示,对想快速出个人化图片的用户挺实用,可惜目前只对美国部分订阅者开放。

4月15日

星期三 · 2 条
11:04
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 75/100
生成式细化网络 GRN:面向视觉合成的新一代范式

研究团队提出生成式细化网络(GRN),通过分层二值量化(HBQ)突破自回归模型的离散化瓶颈,结合全局细化机制与熵引导采样策略,实现类似人类绘画的渐进式修正与复杂度自适应生成。该模型在ImageNet基准上创下图像重建0.56 rFID与类别条件生成1.81 gFID的新纪录,并成功扩展至文本到图像及视频生成任务。相关模型与代码已全面开源。


推荐理由:GRN 提出了一种全新的视觉合成范式,用近无损分层二进制量化解决了 AR 模型的离散瓶颈,并且自适应步数生成效率很高,关键还把代码和模型都开源了,做图像和视频生成的很值得动手试一下。
04:41
Midjourney:Updates(RSS)精选
AI 评分 72/100
V8.1 Alpha 发布

V8.1 Alpha 版本正式发布,接替此前测试一个月的 V8.0 模型。该版本在视觉风格上回归 V7 的一致性审美,并针对 Moodboards 和 srefs 功能进行优化。此次迭代在保持熟悉交互体验的同时,进一步完善了模型的视觉生成能力。


推荐理由:Midjourney V8.1 把 HD 模式提速 3 倍且变成默认,对设计师意味着每次出图成本骤降,探索速度接近 draft。加上图像提示回归,实用性跨了一大步。

3月4日

星期三 · 1 条
00:50
Hugging Face:Blog(RSS)精选
AI 评分 70/100
PRX 第三部分 -- 24小时内训练一个文本到图像模型!

Photoroom团队在Hugging Face上发布博客,宣布成功在24小时内完成一个文本到图像模型的训练。这一突破将此类模型的典型训练周期从数周大幅缩短至仅一天。实现的关键在于采用了名为PRX的高效训练方法,该方法优化了计算资源分配与数据处理流程。此举显著降低了模型训练的时间与成本门槛,为快速迭代和部署高质量的图像生成AI模型提供了新的可能性。


推荐理由:Photoroom 分享 24h 内训练文生图模型的实战路径,想快速复现的团队可直接参考

2月13日

星期五 · 1 条
00:00
字节 Seed:Research Feed(网页内嵌数据)精选
"思考"更深,生成更准|Seedream 5.0 Lite 发布

字节跳动发布 Seedream 5.0 Lite 图像生成模型,采用多模态统一架构,跨模态理解与推理能力显著提升,Elo 评分超越前代 4.5 版本。模型首次引入实时检索增强能力,可联网获取最新知识,突破训练数据时间限制。内置丰富世界知识库,在信息可视化、视觉推理、复杂多主体生成等场景表现突出,能根据模糊指令精准修图,支持风格迁移与多步逻辑推理。目前已上线即梦 AI、火山方舟体验中心及豆包内测。


推荐理由:字节发布 Seedream 5.0 Lite,支持实时检索与深度推理的图像生成模型。

2月11日

星期三 · 1 条
08:00
蚂蚁百灵:Developer Blog(网页)精选
AI 评分 83/100
感知无界·创造有形:百灵全模态 Ming-flash-omni-2.0 焕新生活想象

百灵全模态大模型Ming-flash-omni-2.0正式发布。该模型基于MoE架构,在视觉、语音、图像等全模态能力上实现代际跃迁,其核心突破在于一个统一模型同时具备了强大的通用泛化能力和特定模态的专家级表现。具体特色包括:视觉百科能精准识别万物并关联知识;语音生成可控制情绪、方言,提供百种音色,并能统一生成语音、音效与背景音乐;图像创作可实现氛围重构、场景合成与智能擦除。技术层面通过亿级数据细粒度感知、知识对齐及超低帧率音频表征等创新实现性能飞跃。模型已在多个平台开源。

另有 1 家信源报道蚂蚁百灵:Developer Blog(网页)
推荐理由:国产全模态模型开源,多模态能力达领先水准,开发者可直接体验或集成。