内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态论文 · 305 条
来源全部一手资讯X
类型论文
全部模型产品行业论文教程观点
标签「图像生成」清除

今天8月25日 周二

02:57Hacker News 热门(buzzing.cc 中文翻译)58逆向工程发现 MS Paint 和"照片"为本地 AI 生成图片添加不可见 GUID 水印

8月21日周五

11:06HuggingFace Daily Papers(社区热门论文)504DAnyone:从随意单目视频重建4D人体
10:06HuggingFace Daily Papers(社区热门论文)51WithEveryone:面向群像生成的统一规划与身份锚定框架

8月19日周三

16:05HuggingFace Daily Papers(社区热门论文)26EditBridge:面向高保真与高效超高清图像编辑的扩散桥接框架
11:05HuggingFace Daily Papers(社区热门论文)56Abra:扩散图像训练的规模化定律研究
11:05HuggingFace Daily Papers(社区热门论文)37GS-Voxel:面向大规模 3DGS 生成的无拟合结构化潜空间框架
11:05HuggingFace Daily Papers(社区热门论文)50面向通用图像生成的能力中心化数据设计:从语料库到协同演进能力

8月18日周二

16:05HuggingFace Daily Papers(社区热门论文)54TRACE-Bench:分解与诊断多参考图像生成
12:05HuggingFace Daily Papers(社区热门论文)53像素空间文生图扩散模型训练实证研究:潜空间到像素空间策略带来 3.18-4.75 倍推理加速
11:05HuggingFace Daily Papers(社区热门论文)36GenRouter:面向智能体图像生成的统一工作流路由框架

8月17日周一

08:00HuggingFace Daily Papers(社区热门论文)56DiSCO:通过分布引导的对比提示优化防御文本到图像生成
08:00HuggingFace Daily Papers(社区热门论文)55PixRestore:基于像素扩散 Transformer 的统一图像修复

8月14日周五

17:02HuggingFace Daily Papers(社区热门论文)53PixSDS:潜在SDS为何产生噪声像素
08:00HuggingFace Daily Papers(社区热门论文)49CPI-Bench:面向真实世界图像编辑的综合、实用与智能基准

8月12日周三

13:58HuggingFace Daily Papers(社区热门论文)44AdvFD:用对抗式弗雷歇距离损失提升视觉生成模型后训练

8月9日周日

08:00HuggingFace Daily Papers(社区热门论文)43UniSpace:统一视觉表示与可扩展多模态建模

8月7日周五

08:00HuggingFace Daily Papers(社区热门论文)54能量引导流匹配(EG-FM)
08:00HuggingFace Daily Papers(社区热门论文)51超越星月夜:面向艺术家风格图像生成的捷径感知控制状态规划框架

8月6日周四

10:55HuggingFace Daily Papers(社区热门论文)52Poly-OPD:面向能力可选流模型的多教师同策略蒸馏框架
10:55HuggingFace Daily Papers(社区热门论文)62ToolArtist:面向智能体图像生成的工具使用统一多模态模型
10:55HuggingFace Daily Papers(社区热门论文)49UniWorld-View:基于视频扩散模型的大基线视图合成
06:52Apple Machine Learning Research(RSS)56驯服扩散 Transformer 中的离群 token:Dual-Stage Registers 干预

8月5日周三

16:05Rohan Paul41文生图提示词越长未必越好,结构化更关键
10:55HuggingFace Daily Papers(社区热门论文)57UniWorld-Design:从像素生成到图层原生设计
09:55HuggingFace Daily Papers(社区热门论文)76精选Any-OPD:面向流匹配模型的异构同策略蒸馏框架

8月4日周二

10:54HuggingFace Daily Papers(社区热门论文)52Roomer:面向3D室内布局合成的反思式对象级模型编辑与修复框架

8月3日周一

08:00HuggingFace Daily Papers(社区热门论文)52对话式图像编辑的后续建议:Qwen App 数据驱动的三阶段框架
08:00HuggingFace Daily Papers(社区热门论文)46InfiniSplat:面向大基线单目视图合成的隐式高斯解码

8月1日周六

08:00HuggingFace Daily Papers(社区热门论文)49Poplar:面向人类中心图像数据集合成的可扩展流水线

7月31日周五

11:52HuggingFace Daily Papers(社区热门论文)46MPIE-Bench:多人物交互编辑的解剖合理性评测基准
08:00HuggingFace Daily Papers(社区热门论文)51冻结像素空间扩散模型可利用自身生成样本进行自引导
08:00HuggingFace Daily Papers(社区热门论文)53视觉生成中文本条件作用的缩放特性研究
08:00HuggingFace Daily Papers(社区热门论文)51多参考图像编辑的评估-验证奖励(EVR)方法

7月28日周二

08:00HuggingFace Daily Papers(社区热门论文)63Meshy T2:基于流匹配的快速原生网格生成

7月24日周五

08:00HuggingFace Daily Papers(社区热门论文)52频谱先验减少扩散模型曝光偏差(Spectral Alignment, SPA)

7月23日周四

08:00HuggingFace Daily Papers(社区热门论文)59Oxygen-TryOn:面向任意品类虚拟试穿的统一基础模型

7月22日周三

12:49HuggingFace Daily Papers(社区热门论文)67文本模板Token是扩散Transformer中的隐式语义寄存器
10:49HuggingFace Daily Papers(社区热门论文)48Appearance Pointers:扩散Transformer的多模态区域控制新方法
10:49HuggingFace Daily Papers(社区热门论文)45Mage-Flow:面向图像生成与编辑的高效原生分辨率基础模型

7月21日周二

10:49HuggingFace Daily Papers(社区热门论文)58DiFA:扩散模型推理时的前向过程对齐方法
已加载 40 条
全部 AI 动态
2026年8月25日星期二 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
论文 · 标签「图像生成」 · 305 条清除

8月25日

星期二 · 1 条
02:57
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 58/100
逆向工程发现 MS Paint 和"照片"为本地 AI 生成图片添加不可见 GUID 水印

逆向工程显示,MS Paint 和“照片”应用会将服务器下发的 GUID 以不可见方式嵌入本地生成的 AI 图像像素中。该水印由服务器签发,用于追踪图片来源,但用户无法直接察觉其存在。

Microsoft图像生成安全/对齐

8月21日

星期五 · 2 条
11:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 50/100
4DAnyone:从随意单目视频重建4D人体

4DAnyone提出从无标定单目视频重建4D人体的框架,通过生成重建级多视角一致视频并提升至4D高斯泼溅(4DGS)。针对现有模型在数十个目标视角下的一致性失效问题,该方法以参考上下文打包(RCP)和目标任务上下文路由(TCR)分别实现O(1)参考复杂度与跨组上下文共享。在DNA-Rendering和DyMVHumans上,4DAnyone在视角视频质量与下游4DGS重建上均优于先前方法。

arXiv图像生成视频论文/研究
10:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
WithEveryone:面向群像生成的统一规划与身份锚定框架

WithEveryone 提出统一框架,支持生成包含至多十个参考身份的群像。其核心目标 Layout-Grounded ID Loss 利用标注人脸区域直接监督目标身份,避免不稳定的嵌入匹配;在身份不相交基准上,目标上下文身份相似度从 GPT-Image-2 的 0.462 提升至 0.499,复制粘贴伪影从 0.169 降至 0.055,身份覆盖率达 97.3%,重复率仅 2.8%。

图像生成论文/研究

8月19日

星期三 · 4 条
16:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 26/100
EditBridge:面向高保真与高效超高清图像编辑的扩散桥接框架

EditBridge 提出一种扩散桥接框架,将超高清编辑视为从低分辨率编辑结果到高分辨率版本的结构化数据转换,并以原始高分辨率图像为条件保留真实细节。其引入先验引导的块状稀疏注意力机制,将跨图像交互限制在空间对齐区域,在 2K 分辨率下实现 3.6–8.4 倍加速,并可在 61 秒内完成 4K 编辑。

arXiv图像生成论文/研究
11:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 56/100
Abra:扩散图像训练的规模化定律研究

Abra 研究团队对文生图扩散模型进行了系统性规模化定律分析,训练计算量横跨三个数量级(10¹⁹ 至 10²² FLOPs),远超此前工作。研究发现扩散模型与语言模型一样可预测,但需要约每参数 200 个图像 token 才能达到计算最优,是 LLM 的 Chinchilla 最优配方的十倍。此外,扩散模型对过度训练具有鲁棒性,且预测性可延伸至生成质量、最优 CFG 设置及训练曲线形状。

图像生成数据/训练论文/研究
11:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 37/100
GS-Voxel:面向大规模 3DGS 生成的无拟合结构化潜空间框架

GS-Voxel 提出一种无拟合结构化潜空间框架,可将预优化的 3DGS 重建确定性转换为稀疏活动体素,无需逐场景优化,并保留所选图元的亚体素位置与渲染属性。其专用因子化 VAE 分别编码体素几何与局部高斯属性,潜空间大小随占用体素数增长而非受固定图元数限制。基于该潜空间训练的影像条件流模型支持重叠感知分块推理,可扩展至卫星影像条件下的航拍大场景生成。

图像生成论文/研究
11:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 50/100
面向通用图像生成的能力中心化数据设计:从语料库到协同演进能力

一项研究提出能力驱动的数据基础设施,将能力专属监督构建与能力对齐的课程调度相结合,通过三个数据引擎分别构建文本-图像 grounding、图像间变换和图像-知识关联的互补关系监督。该框架构建了4.4亿图像T2I语料库、1.2亿编辑对和超2700万图像-实体对,并据此从零训练了3B和6B两种规模的多模态扩散模型,在CPI-Bench上进行了定量评估。

arXiv图像生成数据/训练论文/研究

8月18日

星期二 · 3 条
16:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
TRACE-Bench:分解与诊断多参考图像生成

TRACE-Bench 将多参考图像生成任务形式化为 Anchor、Disentangle、Apply、Compose 四种原子操作,并据此构建约 1,600 个评测案例(覆盖 1–8 个操作槽位,源自 631 个公式模板与约 4,000 张参考图)。对 9 个领先模型的评测显示,主要瓶颈在于解耦与属性绑定而非场景级组合,最佳模型属性保真度得分仅 0.74。

图像生成多模态论文/研究评测/基准
12:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
像素空间文生图扩散模型训练实证研究:潜空间到像素空间策略带来 3.18-4.75 倍推理加速

一项实证研究发现,像素空间扩散模型直接大规模预训练收敛速度远慢于潜空间模型,由此提出“潜空间到像素空间”策略:先在潜空间高效获取生成先验,再在后训练阶段转向像素空间。该策略结合权重初始化、数据构成、预测目标、解码器架构与噪声调度等设计选择,使像素空间模型达到或超越潜空间模型,并实现 3.18 至 4.75 倍的端到端推理加速。

arXiv图像生成数据/训练论文/研究
11:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 36/100
GenRouter:面向智能体图像生成的统一工作流路由框架

GenRouter 提出首个面向智能体图像生成的统一工作流路由框架,将多样化智能体管线标准化为通用原语与可执行模板,并通过需求分析、经验匹配和 Pareto 过滤将异构提示词自适应路由至最优工作流。实验显示,相比重型静态管线,GenRouter 在保持视觉对齐的同时将执行成本降低超 95%、延迟降低 65%,并借助累积经验实现零样本泛化,性能提升且计算开销减半。

智能体图像生成论文/研究

8月17日

星期一 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 56/100
DiSCO:通过分布引导的对比提示优化防御文本到图像生成

DiSCO 提出一种零样本、严格黑盒的防御方法,完全在提示词层面运行,无需模型重训练、微调或访问内部结构。该方法通过束搜索进行分布引导的后缀扩展,并利用目标模型自身生成的图像池进行对比评分和迭代反馈,直至生成安全内容。在 I2P 基准上,DiSCO 在多种红队攻击下分别将未防御和已防御模型的 ASR 降低 37.7% 和 25.13%,同时保持语义保真度。

图像生成安全/对齐论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 55/100
PixRestore:基于像素扩散 Transformer 的统一图像修复

PixRestore 提出一种免 VAE 的像素扩散 Transformer(DiT),用于统一图像修复,无需 T2I 预训练。该方法利用 DINO 分层特征与自适应层路由提供密集条件引导,并通过 DINO 对抗目标将多步模型微调为单步生成器。仅约 50M 参数、单步推理约 44 ms,PixRestore 在扩散类方法中取得最佳修复质量与最高效率。

arXiv图像生成论文/研究

8月14日

星期五 · 2 条
17:02
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
PixSDS:潜在SDS为何产生噪声像素

论文指出潜在SDS在文本生成3D中产生结构色伪影与高频纹理噪声,根因是VAE引发的像素漂移——优化图像沿VAE编码器弱约束方向移动,潜表征干净但图像累积可见伪影。为此提出PixSDS,一种轻量级VAE一致梯度修复方法,通过解码潜在SDS前瞻步骤作为像素空间优化方向,无需重训扩散模型或更换渲染器,在2D优化与文本生成3D实验中显著减少结构伪影并保留语义内容。代码已公开。

图像生成论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
CPI-Bench:面向真实世界图像编辑的综合、实用与智能基准

CPI-Bench 提出一个面向真实世界图像编辑的综合、实用与智能基准,包含三个子集:覆盖多图像编辑的 CPI-General-Bench、聚焦高频真实用户场景的 CPI-Practical-Bench,以及评估高要求推理编辑的 CPI-Intelligent-Bench。

arXiv图像生成论文/研究

8月12日

星期三 · 1 条
13:58
HuggingFace Daily Papers(社区热门论文)
AI 评分 44/100
AdvFD:用对抗式弗雷歇距离损失提升视觉生成模型后训练

AdvFD 提出对抗式弗雷歇距离损失,以解决现有弗雷歇损失因静态预训练特征空间导致的“弗雷歇黑客”问题——目标指标提升但视觉质量下降。该方法引入可学习的对抗表征,并配合真实特征白化稳定最小-最大优化。实验表明,AdvFD 在 JiT 和 pMF 骨干网络及不同模型规模上均能稳定提升一步生成模型的后训练效果。

arXiv图像生成数据/训练论文/研究

8月9日

星期日 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 43/100
UniSpace:统一视觉表示与可扩展多模态建模

UniSpace 提出 Patch Reparameterization,在保留预训练语义 ViT 原有语义通路的同时,新增重建感知的 patch 嵌入,使同一视觉空间兼顾多模态理解与高保真图像重建。

图像生成多模态论文/研究

8月7日

星期五 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
能量引导流匹配(EG-FM)

EG-FM 将流匹配的固定端点替换为热核滤波端点,并依据图像特定能量调度逐步释放高频信号,显式建模由粗到细的生成轨迹,无需改动骨干网络或训练数据。在 ImageNet 256×256 类别条件生成任务上,EG-FM 以更少训练轮次取得更低 FID,200 轮达 1.55、600 轮达 1.45;512×512 分辨率下仅经 40 轮高分辨率适配即获 1.58。

图像生成数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
超越星月夜:面向艺术家风格图像生成的捷径感知控制状态规划框架

Atelier框架将模糊的艺术意图转化为显式控制状态,分离场景锚点、保留/变换决策与风格假设,借助艺术家级知识和局部补丁参考迭代优化,减少模型对艺术家名的套路化响应。配套ArtIntentBench基准覆盖梵高与齐白石的多项评测。在开源与闭源生成器上,Atelier相比提示工程、检索增强及通用智能体基线,显著提升风格保真度并减少捷径替换。

arXiv图像生成多模态论文/研究

8月6日

星期四 · 4 条
10:55
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
Poly-OPD:面向能力可选流模型的多教师同策略蒸馏框架

Poly-OPD 通过像素桥与冻结 DINOv2 空间监督,将异构多教师的互补能力整合进单一紧凑的流匹配学生模型。将 FLUX.1-dev 和 Z-Image 蒸馏至 2.5B 的 SD3.5-Medium 学生模型后,GenEval 从 67.3 提升至 73.3,超越两个更大的教师模型,DrawBench HPSv3 从 9.34 提升至 11.35。

arXiv图像生成数据/训练论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
AI 评分 62/100
ToolArtist:面向智能体图像生成的工具使用统一多模态模型

ToolArtist 通过后训练统一多模态模型,将推理、外部工具调用与原生图像生成整合于单一智能体策略中。其采用监督微调配合搜索与图像生成工具,并引入 RAD-GRPO 强化学习算法,以意图与质量奖励联合优化。实验表明,全流程智能体控制方案持续优于固定流程或部分控制方案,训练数据与基础设施已开源。

智能体arXiv图像生成多模态
10:55
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
UniWorld-View:基于视频扩散模型的大基线视图合成

UniWorld-View 提出统一框架,将显式 3D 引导与生成式扩散建模结合,实现单目输入下可控的大基线新视图合成。其遮挡感知点云渲染策略可解决可见性歧义,为扩散合成提供精确先验,在极端相机运动下仍能生成高保真视图,并支持输出多视图视频用于动态 3DGS 重建。WorldScore 基准与零样本 NVS 基准实验验证了其在可控性、几何一致性与视觉保真度上的有效性。

arXiv图像生成多模态论文/研究
06:52
Apple Machine Learning Research(RSS)
AI 评分 56/100
驯服扩散 Transformer 中的离群 token:Dual-Stage Registers 干预

研究发现扩散 Transformer(DiT)图像生成流程中,预训练 ViT 编码器和 DiT 去噪器均会产生离群 token,尤其在中间层,且简单掩蔽高范数 token 无法改善性能,问题与局部 patch 语义损坏相关。为此提出 Dual-Stage Registers(DSR)干预方法,在 ImageNet 和文生图任务上持续减少离群伪影并提升生成质量。

图像生成数据/训练论文/研究

8月5日

星期三 · 3 条
16:05
Rohan Paul@rohanpaul_ai
AI 评分 41/100
文生图提示词越长未必越好,结构化更关键

论文《Scaling Properties of Text Conditioning in Visual Generation》发现,文生图模型的效果受提示词对场景的暴露清晰度限制,而非长度;跨开源模型,单纯延长自然语言描述最终会使输出劣于最短描述。作者提出用结构化提示词,将场景、物体、边界框、深度、属性和关系分入命名字段,提示词工程应优化视觉变量的显式表达。

arXiv图像生成论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
AI 评分 57/100
UniWorld-Design:从像素生成到图层原生设计

UniWorld-Design 将图像生成从平面像素合成重构为结构化视觉组合,以语义 RGBA 图层作为生成、理解和编辑的原子单元。框架包含两个模型:Text-to-RGBA(T2RGBA)直接从文本生成独立 RGBA 素材,Image-to-Layer(I2L)根据图像、全局指令和逐层提示联合生成有序的完整语义 RGBA 图层。

arXiv图像生成多模态论文/研究
09:55
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 76/100
Any-OPD:面向流匹配模型的异构同策略蒸馏框架

Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。

图像生成数据/训练论文/研究

推荐理由:将异构流匹配蒸馏转化为在独立视觉空间求解固定点,配合噪声级对齐跨过VAE与架构差异,2.5B学生模型在偏好指标上逼近12B教师。

8月4日

星期二 · 1 条
10:54
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
Roomer:面向3D室内布局合成的反思式对象级模型编辑与修复框架

Roomer提出一种反思式修复框架,将室内布局生成中的局部违规(如碰撞、越界、遮挡开口)转化为稀疏的对象级修复问题。它通过RoState编码布局、RoReview绑定违规证据,并由几何条件视觉语言模型规划局部编辑,仅在全场景验证通过后才提交修改。基于67,550个配对修复样本的Roomer-CC数据集训练,实验表明Roomer能在保留有效区域的同时提升物理有效性与可用性,并可迁移至外部生成器。

arXiv具身智能图像生成论文/研究

8月3日

星期一 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
对话式图像编辑的后续建议:Qwen App 数据驱动的三阶段框架

针对图像创作对话中后续编辑建议缺失的问题,研究者从 Qwen App 收集 10 万条真实多轮对话样本,发现其中 80.1% 依赖图像,需多模态推荐。

arXiv图像生成多模态论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 46/100
InfiniSplat:面向大基线单目视图合成的隐式高斯解码

InfiniSplat 提出一种前馈式单图像 3DGS 框架,将像素对齐表示转向表面对齐表示,通过几何引导采样和查询条件隐式解码器预测高斯属性,使高斯布局更贴合场景表面。在多个跨数据集 NVS 评测中,InfiniSplat 达到单图像前馈基线的最优性能,并展示出从 Hypersim 室内合成训练到复杂开放世界场景的零样本泛化能力。

arXiv图像生成论文/研究

8月1日

星期六 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
Poplar:面向人类中心图像数据集合成的可扩展流水线

Poplar 提出 Specify–Render–Inspect 三阶段流水线,用于人类中心图像数据集合成:在常识约束下采样结构化属性并生成摄影提示词,经扩散模型渲染,再由视觉-语言审查剔除缺陷样本。

图像生成数据/训练论文/研究

7月31日

星期五 · 4 条
11:52
HuggingFace Daily Papers(社区热门论文)
AI 评分 46/100
MPIE-Bench:多人物交互编辑的解剖合理性评测基准

MPIE-Bench 是一个包含 2,500 个样本的基准,覆盖 405 个场景、14 类交互和四种接触密度(C0-C3),用于评测多人物交互编辑中的解剖与几何问题。配套的 MPIE-Eval 通过冻结的公开多人物网格重建,从解剖完整性和交互接触几何两个新维度打分。在十个编辑模型上,网格解剖得分最高 0.65、交互得分最高 0.72,而 VLM 清单评分超过 0.95,显示现有评测存在明显饱和。

图像生成论文/研究评测/基准
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
冻结像素空间扩散模型可利用自身生成样本进行自引导

像素空间扩散模型无需重新训练主干,即可利用中间层与最终层预测差异进行自引导采样。研究者提出的Synthetic Self-Guidance(SSG)仅用模型生成样本训练轻量适配器,训练算力不足全模型训练的1%,在ImageNet上使JiT变体FID降低超50,并将JiT-H/16从1.86提升至1.67、PixelREPA-H/16从1.81提升至1.59。

arXivHugging Face图像生成开源/仓库
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
视觉生成中文本条件作用的缩放特性研究

研究发现,视觉生成中扩散损失随提示词中结构化语言量呈规律缩放:与GPG近似线性下降,与ED呈幂律关系。基于此,通过构建含语义与几何标注的结构化提示提升可扩散性,并训练提示器提升可提示性。最终系统在几乎所有组合、推理与世界知识基准上超越开源模型,并在多数评测中匹敌或超过最强闭源模型。

图像生成多模态论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
多参考图像编辑的评估-验证奖励(EVR)方法

针对多参考图像编辑中视觉一致性与和谐性评估难题,研究者提出多维评估-验证奖励(EVR),将评估分解为五个视觉标准,由MLLM评估器生成多个候选假设,验证器基于具体视觉证据逐条接受或拒绝,产生可靠细粒度奖励信号。该方法无需架构改动即可对现成编辑器进行RL微调,实验显示在Qwen-Image-Edit基础上显著提升,一致性与和谐性达到或超越NanoBanana。

arXiv图像生成论文/研究

7月28日

星期二 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 63/100
Meshy T2:基于流匹配的快速原生网格生成

Meshy AI 推出 Meshy T2,一种基于流匹配的网格生成框架,直接面向图像到网格任务,以交互速度生成紧凑、可直接使用的网格。它采用近乎无损的顶点集网格表示(扩展自 SpaceMesh),联合生成顶点和边,使多部件资产自然分解为连通组件,并支持可控面数预算。相比隐式场提取和序列建模方法,Meshy T2 避免了网格过密、局部采样错误传播等问题。

Hugging Face图像生成多模态论文/研究

7月24日

星期五 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
频谱先验减少扩散模型曝光偏差(Spectral Alignment, SPA)

研究提出Spectral Alignment (SPA)方法,通过预计算频谱先验和基于FFT的梯度引导,在推理时校准中间预测的功率谱,以解决扩散模型因训练与推理频谱失配导致的误差累积。该方法仅增加3-4%计算开销,即可在DDPM、ADM、SD2.0、SDXL、SD3.5及FLUX等多种架构上持续提升FID和HPSv3等指标。

arXiv图像生成数据/训练论文/研究

7月23日

星期四 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 59/100
Oxygen-TryOn:面向任意品类虚拟试穿的统一基础模型

Oxygen-TryOn 是一个专为任意品类虚拟试穿设计的统一基础模型,支持多张参考图合成逼真试穿效果。该模型通过 CPT-SFT-RL 三阶段训练,在单件和多件试穿任务中均达到 SOTA,匹配或超越 Nano Banana Pro、GPT-Image-2 等闭源系统及 FLUX.2 等开源模型。

图像生成多模态论文/研究

7月22日

星期三 · 3 条
12:49
HuggingFace Daily Papers(社区热门论文)
AI 评分 67/100
文本模板Token是扩散Transformer中的隐式语义寄存器

南京大学与阿里巴巴团队提出因果可解释性框架,发现扩散Transformer(DiT)中来自聊天模板的结构性token虽不含提示语义,却成为图像到文本的注意力汇聚点,并因果性地维持物体身份,充当隐式语义寄存器。

arXiv图像生成论文/研究部署/工程
10:49
HuggingFace Daily Papers(社区热门论文)
AI 评分 48/100
Appearance Pointers:扩散Transformer的多模态区域控制新方法

研究人员提出Appearance Pointers,一种紧凑型token,通过将文本或图像输入与用户指定的掩码对齐,引导扩散Transformer(DiT)在正确空间位置生成正确外观。该方法由区域对应网络生成token,经空间聚合机制优化,无需从头重新训练基础模型即可实现多区域描述控制。在多项指标上,该单一模型达到或超越了特定模态的现有最优方法。

arXiv图像生成多模态论文/研究
10:49
HuggingFace Daily Papers(社区热门论文)
AI 评分 45/100
Mage-Flow:面向图像生成与编辑的高效原生分辨率基础模型

研究人员推出Mage-Flow,一个40亿参数的高效生成栈,用于文本到图像生成和指令式图像编辑。其核心包括轻量级高保真潜在分词器Mage-VAE和原生分辨率多模态扩散Transformer,通过协同设计将分词成本降低一个数量级以上,端到端训练吞吐量提升约2.5倍。

图像生成开源/仓库论文/研究

7月21日

星期二 · 1 条
10:49
HuggingFace Daily Papers(社区热门论文)
AI 评分 58/100
DiFA:扩散模型推理时的前向过程对齐方法

DiFA提出一种无需训练的推理框架,将扩散模型的数据预测精炼重构为序列状态估计问题,通过聚合历史预测构建前向对齐的时间共识。在CIFAR-10和ImageNet上,DiFA在FID、IS和FD-DINOv2等指标上均取得显著提升。

图像生成推理论文/研究
已加载 40 条