逆向工程显示,MS Paint 和“照片”应用会将服务器下发的 GUID 以不可见方式嵌入本地生成的 AI 图像像素中。该水印由服务器签发,用于追踪图片来源,但用户无法直接察觉其存在。
逆向工程显示,MS Paint 和“照片”应用会将服务器下发的 GUID 以不可见方式嵌入本地生成的 AI 图像像素中。该水印由服务器签发,用于追踪图片来源,但用户无法直接察觉其存在。
《使命召唤:现代战争 4》抢先体验多人测试期间,玩家发现多幅疑似由生成式 AI 创建的游戏内美术作品,引发批评。动视已披露使用生成式 AI 工具帮助制作部分游戏内资产,但尚未确认这些具体作品是否由 AI 生成。玩家反应出现分歧,批评者认为该系列应付费聘请艺术家创作环境细节,也有人担忧 AI 内容在成品资产中愈发明显。
OpenRouter 发布 Visual Image Benchmarks,帮助用户快速评估其提供的全部 39 款图像模型(截至 2026 年 8 月)的实际能力。基准测试用七类挑战性提示词区分模型差异,包括不可能场景、计数、文本、空间关系、否定指令、编辑和一致性,并以网格形式展示结果,支持按价格和生成时间排序。OpenRouter 计划未来将该工具扩展至视频和音频模态。
四川眉山仁寿县警方近日查获一起利用 AI 合成虚假影像骚扰他人的案件,嫌疑人徐某某被依法行政拘留五天。徐某某为达成线下见面目的,用 AI 合成虚假私密照片并通过微信多次发送给小张,频繁骚扰恐吓;受害者保存聊天记录与截图后报警,警方一小时内将其抓获并固定完整证据链。
Midjourney 发布 alpha.midjourney.com 两周内第二轮更新,修复大量 UX 问题并新增文件夹分组功能。用户可在侧边栏将项目整理为可折叠树状分组,支持双击重命名;Upscale、Zoom、Vary 功能回归,Vary 现在遵循用户设置而非静默运行 HD。设置项不再自动重置,站点卡顿、编辑器遮挡、提示词粘贴损坏等问题均已修复。
OpenAI 宣布 GPT-Image-2 现支持生成透明背景的 PNG 格式图像,可用于电商商品页、PPT 插图、贴纸素材等场景。该功能目前仅通过 API 提供,用户需开启 background=transparent 参数启用,官方建议提示词中不要描述背景。
另有 1 家信源报道X:OpenAI Developers (@OpenAIDevs)OpenAI 通过 API 为 GPT-Image-2 预览透明背景支持,用户可生成无背景的 PNG 图片。该功能覆盖电商产品图、PPT 图表、图标贴纸等设计元素及周边商品图四种用例。官方称生成时直接烘焙 alpha 通道优于传统抠图,尤其在透明玻璃或细纤维等复杂区域;用户通过 background=transparent 参数启用,并建议提示词中不描述背景。
商汤科技今日宣布开源轻量级原生统一多模态大模型 SenseNova U1.5 Lite,该模型拥有 8B 参数,原生支持 3-4k 上下文长度和 4K 高分辨率图像输出。模型支持 Bounding Box、Visual Marker 及多图参考等精细视觉控制,在指令遵循与图像编辑保持度上超越同量级模型,文字渲染与复杂布局能力媲美超大规模商业模型。
4DAnyone提出从无标定单目视频重建4D人体的框架,通过生成重建级多视角一致视频并提升至4D高斯泼溅(4DGS)。针对现有模型在数十个目标视角下的一致性失效问题,该方法以参考上下文打包(RCP)和目标任务上下文路由(TCR)分别实现O(1)参考复杂度与跨组上下文共享。在DNA-Rendering和DyMVHumans上,4DAnyone在视角视频质量与下游4DGS重建上均优于先前方法。
WithEveryone 提出统一框架,支持生成包含至多十个参考身份的群像。其核心目标 Layout-Grounded ID Loss 利用标注人脸区域直接监督目标身份,避免不稳定的嵌入匹配;在身份不相交基准上,目标上下文身份相似度从 GPT-Image-2 的 0.462 提升至 0.499,复制粘贴伪影从 0.169 降至 0.055,身份覆盖率达 97.3%,重复率仅 2.8%。
Meta 平台近期为 AI 色情生成工具 Kromix 投放广告,该工具宣称“无限制”,并鼓励用户制作酷似美国女性政客的深度伪造视频,违反 Meta 禁止含色情内容广告的政策。这是 Meta 未能阻止非自愿亲密影像工具广告上架的最新一例。Kromix 自称“AI 图像风格化器”,在苹果 App Store 上架,邀请付费用户上传照片用于“卧室强奸”等场景。
EditBridge 提出一种扩散桥接框架,将超高清编辑视为从低分辨率编辑结果到高分辨率版本的结构化数据转换,并以原始高分辨率图像为条件保留真实细节。其引入先验引导的块状稀疏注意力机制,将跨图像交互限制在空间对齐区域,在 2K 分辨率下实现 3.6–8.4 倍加速,并可在 61 秒内完成 4K 编辑。
一款名为 Kromix 的 App 在 Meta 平台投放 32 则广告,宣称“没有限制”,可生成真实人物(包括知名女性政治人物)的色情“换脸”内容。经 WIRED 联系后,Meta 下架相关广告,苹果将 Kromix 从 App Store 移除。苹果称该应用可能通过初始审核后才加入违规内容,并强调持续打击规避审核的应用。
Abra 研究团队对文生图扩散模型进行了系统性规模化定律分析,训练计算量横跨三个数量级(10¹⁹ 至 10²² FLOPs),远超此前工作。研究发现扩散模型与语言模型一样可预测,但需要约每参数 200 个图像 token 才能达到计算最优,是 LLM 的 Chinchilla 最优配方的十倍。此外,扩散模型对过度训练具有鲁棒性,且预测性可延伸至生成质量、最优 CFG 设置及训练曲线形状。
GS-Voxel 提出一种无拟合结构化潜空间框架,可将预优化的 3DGS 重建确定性转换为稀疏活动体素,无需逐场景优化,并保留所选图元的亚体素位置与渲染属性。其专用因子化 VAE 分别编码体素几何与局部高斯属性,潜空间大小随占用体素数增长而非受固定图元数限制。基于该潜空间训练的影像条件流模型支持重叠感知分块推理,可扩展至卫星影像条件下的航拍大场景生成。
一项研究提出能力驱动的数据基础设施,将能力专属监督构建与能力对齐的课程调度相结合,通过三个数据引擎分别构建文本-图像 grounding、图像间变换和图像-知识关联的互补关系监督。该框架构建了4.4亿图像T2I语料库、1.2亿编辑对和超2700万图像-实体对,并据此从零训练了3B和6B两种规模的多模态扩散模型,在CPI-Bench上进行了定量评估。
罗宾·威廉姆斯的子女扎克、塞尔达和科迪接管其父的 Instagram 账号,将其打造为分享真实照片、视频和回忆的“可信之地”,以对抗对其声音和形象的“猖獗 AI 滥用”。该账号自 2014 年其父去世后一直未更新。此前,塞尔达曾公开反对 AI 生成的父亲形象,并呼吁粉丝停止发送相关视频。
全球设计公司 Populous 高级建筑师 Georgina Myers 介绍团队用 Runway 辅助体育场馆概念设计:过去完整视频需外部渲染团队至少三周,且提交前两周须冻结设计模型;如今 Runway 能生成传达尺度感的完整渲染和航拍图,将视觉制作时间缩短,让设计师把时间还给设计本身。该工具已用于利雅得 MBS 体育场等中东项目,支持 9 种不同活动模式的场景迭代。
TRACE-Bench 将多参考图像生成任务形式化为 Anchor、Disentangle、Apply、Compose 四种原子操作,并据此构建约 1,600 个评测案例(覆盖 1–8 个操作槽位,源自 631 个公式模板与约 4,000 张参考图)。对 9 个领先模型的评测显示,主要瓶颈在于解耦与属性绑定而非场景级组合,最佳模型属性保真度得分仅 0.74。
蚂蚁集团 inclusionAI 开源 ConceptEdit,一个基于概念缩放与密集监督的图像编辑数据生成管线。该管线通过三阶段流程(VLM 生成指令、FLUX 执行编辑、VQA 评估筛选)构建大规模、基于分类法的图像编辑数据集,并提供单概念与多概念两种变体。项目采用 MIT 许可证,支持断点续跑,需 OpenAI 兼容 VLM 端点与本地 FLUX 检查点。
一项实证研究发现,像素空间扩散模型直接大规模预训练收敛速度远慢于潜空间模型,由此提出“潜空间到像素空间”策略:先在潜空间高效获取生成先验,再在后训练阶段转向像素空间。该策略结合权重初始化、数据构成、预测目标、解码器架构与噪声调度等设计选择,使像素空间模型达到或超越潜空间模型,并实现 3.18 至 4.75 倍的端到端推理加速。
GenRouter 提出首个面向智能体图像生成的统一工作流路由框架,将多样化智能体管线标准化为通用原语与可执行模板,并通过需求分析、经验匹配和 Pareto 过滤将异构提示词自适应路由至最优工作流。实验显示,相比重型静态管线,GenRouter 在保持视觉对齐的同时将执行成本降低超 95%、延迟降低 65%,并借助累积经验实现零样本泛化,性能提升且计算开销减半。
OpenRouter 推出专用图像生成 API,通过统一请求格式和单一密钥即可调用多个提供商的图像模型。开发者向 POST /api/v1/images 发送请求,响应中的 data[0].b64_json 包含 base64 编码的图像数据,解码后即可保存为本地文件。教程演示了 Python 和 JavaScript 两种实现,并支持通过 input_references 传入参考图像生成变体。
一位作者用ChatGPT生成图像、Minimax 3和Grok Imagine 1.5生成视频,打造了虚拟女生Janie,并让她参加阿拉巴马大学姐妹会招募。一周内Janie获得1300名粉丝,视频平均观看量达数万次,20条视频中8条被TikTok标记为AI生成,但未影响表现。作者未标注AI身份,认为这违反了TikTok服务条款,但旨在测试平台与观众的识别能力。
字节跳动与美国电影协会(MPA)签署协议,加强 AI 视频与图像生成模型的版权保护。协议涵盖 Seedance 视频生成模型和 Seedream 图像生成模型,二者通过 TikTok、CapCut 和 Dreamina 等应用提供服务。字节表示,新版本 Seedance 和 Seedream 已加入更强的知识产权保护机制,双方将随 AI 发展继续完善版权防护。
另有 1 家信源报道X:X.PIN (@thexpin)DiSCO 提出一种零样本、严格黑盒的防御方法,完全在提示词层面运行,无需模型重训练、微调或访问内部结构。该方法通过束搜索进行分布引导的后缀扩展,并利用目标模型自身生成的图像池进行对比评分和迭代反馈,直至生成安全内容。在 I2P 基准上,DiSCO 在多种红队攻击下分别将未防御和已防御模型的 ASR 降低 37.7% 和 25.13%,同时保持语义保真度。
PixRestore 提出一种免 VAE 的像素扩散 Transformer(DiT),用于统一图像修复,无需 T2I 预训练。该方法利用 DINO 分层特征与自适应层路由提供密集条件引导,并通过 DINO 对抗目标将多步模型微调为单步生成器。仅约 50M 参数、单步推理约 44 ms,PixRestore 在扩散类方法中取得最佳修复质量与最高效率。
一名化名“简·多伊 4 号”的女性加入美国田纳西州三名青少年对 SpaceXAI 的诉讼,指控其继父利用 Grok 将她 11 岁时的一张照片加工成 7000 多张露骨性虐待图像。执法部门查获图像两天后,其继父自杀身亡。原告方指控 SpaceXAI 未采取基础防护措施阻止 Grok 生成含未成年人的真人露骨图像,并正申请将该案列为集体诉讼。
网页项目 Your AI Slop Bores Me 近日上线,交互两端均为真人,一侧提问、另一侧扮演 AI 作答,支持文字或图片回复,扮演方有 150 秒作答时间。平台采用类 token 积分体系,提问消耗积分,回答他人问题可赚取,或每两分钟领取一次免费提问额度。平台还设有 Discord 社群与名人堂,但广告投放较为突兀。
一位化名 Jane Doe 4 的女子加入三名田纳西州青少年对 xAI 的诉讼,指控其继父用 Grok 将她 11 岁时的照片制造成 7,000 多张露骨图像。继父在警方搜查发现图像两天后自杀身亡。诉讼指控 xAI 未采取基本预防措施防止 Grok 生成涉及未成年人的真实人物露骨图像,并寻求集体诉讼资格。
一场面向AI艺术家的征集活动启动,目标是找到100位未来十年最重要的创作者,入选者的作品有机会出现在首届AI艺术大展上。活动未公布具体报名方式、评选标准或展览时间等细节。
论文指出潜在SDS在文本生成3D中产生结构色伪影与高频纹理噪声,根因是VAE引发的像素漂移——优化图像沿VAE编码器弱约束方向移动,潜表征干净但图像累积可见伪影。为此提出PixSDS,一种轻量级VAE一致梯度修复方法,通过解码潜在SDS前瞻步骤作为像素空间优化方向,无需重训扩散模型或更换渲染器,在2D优化与文本生成3D实验中显著减少结构伪影并保留语义内容。代码已公开。
CPI-Bench 提出一个面向真实世界图像编辑的综合、实用与智能基准,包含三个子集:覆盖多图像编辑的 CPI-General-Bench、聚焦高频真实用户场景的 CPI-Practical-Bench,以及评估高要求推理编辑的 CPI-Intelligent-Bench。
8月9日,代号“mona-lisa-1”的图像生成模型现身AI竞技场盲测列表,爆料者称其图片经OpenAI官方验证工具检测到来源信号,被认定为新一代GPT-Image模型。OpenAI尚未正式公告,该模型也未接入ChatGPT、API或Codex。OpenAI指出验证结果不能确认具体模型,尚不能凭来源信号确认其为GPT-Image 2继任型号。
古风AI短片《天宫之约》爆火,播放近7000万、点赞超400万,被外交部发言人毛宁转发,海外平台观看超540万。该片由90后创作者栖光用可灵3.0制作,他看重可灵的画面质感、光影效果、精准提示词响应与生成稳定性。栖光已加入可灵AI创作者计划3.0,该计划设“灵感聚光计划”,提供每月百万现金池、千万级灵感值激励及单项目最高亿级曝光资源。
山东美术馆“童心绘梦——中国美术家协会首届儿童图画书大展”中,一幅名为《把夏天装进书包》的作品被指高度疑似 AI 生成,画作多次出现儿童手指扭曲、疑似六根手指、同一画面三只手等异常。山东美术馆办公室回应称涉事作品“已经撤下来了”。中国美术家协会行风建设与维权处经认定该作品确系 AI 生成,已取消其入展资格。
AdvFD 提出对抗式弗雷歇距离损失,以解决现有弗雷歇损失因静态预训练特征空间导致的“弗雷歇黑客”问题——目标指标提升但视觉质量下降。该方法引入可学习的对抗表征,并配合真实特征白化稳定最小-最大优化。实验表明,AdvFD 在 JiT 和 pMF 骨干网络及不同模型规模上均能稳定提升一步生成模型的后训练效果。
苹果正在开发 iOS 功能“Apple Reference Image”,可在 iPhone 拍摄时嵌入来源元数据,帮助用户证明照片非 AI 伪造。
微软发布新一代自研文生图模型 MAI-Image-2.6,在 Arena 排行榜位列第二,Elo 评分 1336 分,仅次于 OpenAI 的 GPT Image 2(Medium)。相比 2.5 版本,整体评分提升 79 分,文本渲染能力涨幅达 91 分,排名从第十位跃升至第二位。该模型已在 Arena 平台开放体验,计划本周部署至 MAI Playground。
另有 1 家信源报道X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman)