研究团队在归一化流(NFs)生成模型领域取得新进展,提出了迭代TARFlow(iTARFlow)。该方法在训练阶段保持完全端到端的基于似然的目标,采样时则采用自回归生成方式。iTARFlow延续了TARFlow在图像建模任务上的优势,使其成为扩散模型等方法的可行替代方案,进一步提升了归一化流生成模型的性能表现。
图像生成
AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。
精选归档 · 第 6 页
第 101–120 条 · 共 128 条
5月7日
5月6日
5月1日
Midjourney V8.1 版本现已登陆 Discord 平台及其官方网站。本次更新重点提升了图像的清晰度与整体画质,这一改进在风格参考(SREF)和情绪板(Moodboards)功能中效果最为显著,同时所有类型的图像生成质量均有所增强,为用户带来更精细的视觉体验。
This GPT Image 2 prompt is going insanely viral right now. “Redraw the attached image in the most clumsy, scribbly, and ...
4月30日
4月29日
SenseNova U1 is out on Hugging Face https://huggingface.co/collections/sensenova/sensenova-u1
4月27日
I was curious how much the new ChatGPT image model would vary in its outputs given the same detailed prompt to make a ma...
4月23日
研究表明,图像生成训练能像大语言模型预训练一样,让模型学习到强大、通用的视觉表征。通过将视觉任务的输出参数化为RGB图像,研究团队将感知任务重构为图像生成任务。基于Nano Banana Pro指令微调构建的通用模型Vision Banana,在涉及2D和3D理解的一系列任务上取得了最先进的结果,在分割任务上媲美Segment Anything Model 3,在度量深度估计上超越Depth Anything系列。这些成果通过轻量级指令微调实现,且未损害基础模型的图像生成能力。图像生成预训练正成为一种通用的视觉学习范式,可能成为构建兼顾生成与理解的基础视觉模型的核心路径。
ChatGPT Images 2.0 推出了一个先进的图像生成模型,该模型在文本渲染、多语言支持和视觉推理能力方面均有显著提升。新版模型能够更精准地生成包含文字的图像,并支持多种语言文本输入。其视觉推理功能也得到增强,可更好地理解和执行复杂图像生成指令。此次升级标志着多模态AI生成质量的一次重要进步。
另有 2 家信源报道Hacker News 热门(buzzing.cc 中文翻译)Simon Willison 博客4月20日
TRELLIS.2 图像转3D功能完成 Mac Silicon 适配,无需 Nvidia GPU 即可在苹果芯片上本地运行。开发者开源的移植版本打破了此前对英伟达显卡的硬件依赖。该项目在 Hacker News 发布当日获得 102 个点赞,标志着端侧 AI 3D 生成技术向跨平台部署迈出重要一步。
4月17日
Nano Banana 2 现支持结合个人上下文与 Google Photos 数据生成图像,通过分析用户独特的生活场景,创建反映个人经历的个性化视觉内容。该功能已在 Gemini 应用中上线,使 AI 图像生成能够基于真实生活语境,输出更贴合用户个人故事的定制化结果。
4月15日
研究团队提出生成式细化网络(GRN),通过分层二值量化(HBQ)突破自回归模型的离散化瓶颈,结合全局细化机制与熵引导采样策略,实现类似人类绘画的渐进式修正与复杂度自适应生成。该模型在ImageNet基准上创下图像重建0.56 rFID与类别条件生成1.81 gFID的新纪录,并成功扩展至文本到图像及视频生成任务。相关模型与代码已全面开源。
V8.1 Alpha 版本正式发布,接替此前测试一个月的 V8.0 模型。该版本在视觉风格上回归 V7 的一致性审美,并针对 Moodboards 和 srefs 功能进行优化。此次迭代在保持熟悉交互体验的同时,进一步完善了模型的视觉生成能力。
3月20日
Our new image generator MAI-Image-2 is out! Available now on MAI Playground for everything from lifelike realism to deta...
3月4日
Photoroom团队在Hugging Face上发布博客,宣布成功在24小时内完成一个文本到图像模型的训练。这一突破将此类模型的典型训练周期从数周大幅缩短至仅一天。实现的关键在于采用了名为PRX的高效训练方法,该方法优化了计算资源分配与数据处理流程。此举显著降低了模型训练的时间与成本门槛,为快速迭代和部署高质量的图像生成AI模型提供了新的可能性。
2月27日
2月13日
字节跳动发布 Seedream 5.0 Lite 图像生成模型,采用多模态统一架构,跨模态理解与推理能力显著提升,Elo 评分超越前代 4.5 版本。模型首次引入实时检索增强能力,可联网获取最新知识,突破训练数据时间限制。内置丰富世界知识库,在信息可视化、视觉推理、复杂多主体生成等场景表现突出,能根据模糊指令精准修图,支持风格迁移与多步逻辑推理。目前已上线即梦 AI、火山方舟体验中心及豆包内测。
2月11日
百灵全模态大模型Ming-flash-omni-2.0正式发布。该模型基于MoE架构,在视觉、语音、图像等全模态能力上实现代际跃迁,其核心突破在于一个统一模型同时具备了强大的通用泛化能力和特定模态的专家级表现。具体特色包括:视觉百科能精准识别万物并关联知识;语音生成可控制情绪、方言,提供百种音色,并能统一生成语音、音效与背景音乐;图像创作可实现氛围重构、场景合成与智能擦除。技术层面通过亿级数据细粒度感知、知识对齐及超低帧率音频表征等创新实现性能飞跃。模型已在多个平台开源。
另有 1 家信源报道蚂蚁百灵:Developer Blog(网页)