来源:互联网2026-08-12 21:44:09 热度:

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

AI中国网 https://www.cnaiplus.com

导读:过去两年,AI 生成图片、视频的能力不断刷新人们的认知。今天,生成一张图片、一段视频,已经变得很容易。但真正困难的,是另一件事情:让 AI 理解并按照创作者的真实意图完成创作。比如:修改一行文字,同时保留字体、排版和视觉风格。消除图片和视频的冗余元素,但不能看出破绽。自由变换发型、服饰、光线、场景,但要保持人物一致性。修改视频中的局部内容、调整光影效果, ......

过去两年,AI 生成图片、视频的能力不断刷新人们的认知。

今天,生成一张图片、一段视频,已经变得很容易。

但真正困难的,是另一件事情:让 AI 理解并按照创作者的真实意图完成创作。

比如:

修改一行文字,同时保留字体、排版和视觉风格。

消除图片和视频的冗余元素,但不能看出破绽。

自由变换发型、服饰、光线、场景,但要保持人物一致性。

修改视频中的局部内容、调整光影效果,不要影响整体连续性。

让模特试穿试戴,同时准确保留材质、纹理和光泽。

Prompt 的后半句都是为规避模型误差添加的限制,「保持一致、避免失真、不要改变」等等一长串的提示词,是 AI 创作流程中的「惯用套路」。但理想状态下,我们对 AI 的期望是需求能够被理解,并直接执行,而不是先要学习如何正确使用提示词。

AI 在视觉创作能力的进化,实则是视觉理解、空间建模、时序一致性、美学表达等多个方向的持续突破,这很难通过一次模型升级来实现,而是需要围绕视觉技术的长期积累。

过去几年,作为 AI 影像领域的「长期玩家」,美图影像研究院(MT Lab)围绕高频创作场景的真实痛点,持续展开研究。2026 年以来,美图影像研究院(MT Lab)共有 11 篇论文被 ICLR、CVPR、ICML、ECCV、ACM MM 等国际顶会接收,覆盖视频编辑、人像编辑、智能交互、视觉理解等多个方向。

更重要的是,这些研究成果不断通过产品落地,转化为服务真实创作场景的 AI 影像能力。

让 AI 实现更强大的编辑

在专业的创作中,生成其实只是起点,人们往往需要经过多次的尝试和调整,才能不断接近「理想效果」。因此,无论是视频中的背景、光线、人物身材、妆造,还是图片中的文字、服饰配饰,模型都需要同时兼顾一致性、真实性与可控性,这也是 AI 影像从「能生成」迈向「能创作」最关键的能力之一。

在 ICML 2026 上,美图影像研究院(MT Lab)提出了参考帧引导视频编辑统一框架 Multiscale Vision-language features for reference-guided video Editing(MiVE),核心由多层级视觉 - 语言上下文提取、参考帧感知潜空间编码和统一自注意力主干三大部分共同组成。MiVE 旨在以多尺度 VLM 条件与统一多模态融合,解决当前视频编辑在指令理解与空间精度上长期存在的结构性短板。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

论文链接:https://arxiv.org/abs/2605.14664

项目主页:https://mivepaper.github.io/

MiVE 在大幅度运动、复杂遮挡、跨帧风格一致性等高难度场景下,能够保持原视频运动结构,并将参考帧的编辑信息自然扩展至整个视频;在身份特征、细节锐度、色彩一致性保持及新增遮挡区域外观恢复上,MiVE 也表现出更强的稳定性与更高的精细度。

结合 MiVE「改一帧即改全片」的 V2V 编辑工作流,和针对人像场景精细化的创意编辑能力,目前已经实现包括改变发型、变换服装、妆容造型、重新打光、更换背景、天气变换、局部优化等在内的视频编辑能力。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

https://mp.weixin.qq.com/s/e7ZiK1Dc7aGk6WtI_iZI1g

MiVE 在细腻发丝的处理、服饰的贴合度、材质光影层面都拥有良好表现力,能够精准还原对人物、发丝、衣服材质、光线等细节。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

https://mp.weixin.qq.com/s/e7ZiK1Dc7aGk6WtI_iZI1g

例如在视频打光场景中,相比主流模型,MiVE 在人物与环境一致性维度均有较为明显的优势,据悉该能力即将上线美图秀秀 APP 与 Wink APP 的「氛围光」功能。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

https://mp.weixin.qq.com/s/e7ZiK1Dc7aGk6WtI_iZI1g

对光影变化的控制能力同样延伸到了静态图片创作场景,在 ECCV 2026 中,美图影像研究院(MT Lab)提出了一致特征传输重打光新方案 Consistent Feature Transport(CFT)。

由于目前的 AI 重打光方案容易出现光照不稳定、阴影方向错乱,甚至把脸「修成另一个人」的问题,因此换光效作为常见的视频编辑需求,实现难度却很高。

CFT 通过将人像重打光表述为「光照一致的特征传输问题」,在 Rectified Flow 框架上显式学习源图与目标图分布之间的光照变换,并结合大规模人像重打光数据集,实现在复杂光照场景下,人物身份、姿态、背景的超强一致性。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

论文链接:https://arxiv.org/abs/2607.17833

项目主页:https://github.com/Dixin-Lab/CFT

CFT 对光线的方向、角度、强弱具备更强的可控性,可以实现各种不同类型的打光效果。对比主流模型,CFT 在光照效果上有更佳的稳定性和合理性,即使是在复杂的场景下,也表现出高一致性的打光效果。例如在晨光场景中,CFT 能准确区别晨光与夕阳光,呈现更好的整体氛围感和光线真实性。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

结合 CFT 方案,你不需要输入冗长的提示词,就可以玩转各种不同的光线效果。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

全新的「图片打光」功能已经上线美图主打人像修图 Agent 与「学我修图」的全新 AI 产品 Picchi,海外可以通过 AirBrush 与 BeautyPlus 进行使用。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

自去年推出「AI 闪光灯」全球爆火后,美图影像研究院(MT Lab)目前已经研发超过 50 种不同的打光效果,帮助「手残党」拯救废片。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

图像编辑除了修改、增加内容,还有另一项至关重要的能力  消除。无论是日常的拍摄,还是专业的创作,乱入的路人、被遮挡的背景、五花八门的杂物都很常见,「AI 消除」的关键是既要精准消除目标,又要合理补全原本被遮挡的区域,在动态的视频场景中,还必须保证连续帧之间的稳定性。

对此,美图影像研究院(MT Lab)在 ICML 2026 上提出了基于随机桥模型的新框架 BridgeRemoval,首次将「视频目标移除」定义为「视频到视频的翻译任务」,通过构建基于随机桥(VP-SDE Bridge)的直接生成路径,在背景保真度与生成灵活性之间取得更好的平衡,显著提升了视频目标移除的精准度及时序一致性,实现了从 AI 图像消除向 AI 视频消除的拓展。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

论文链接:https://arxiv.org/pdf/2601.12066

项目主页:https://bridgeremoval.github.io/

不同于标准扩散模型从随机高斯噪声起步,BridgeRemoval 采用基于方差保持随机微分方程(VP-SDE)的桥模型,能够选择性地只对被遮罩区域进行变换,并实现对背景内容中未被遮挡区域最大程度的保真。

结合 BridgeRemoval 在目标移除、背景保真度、时序一致性的显著优势,Wink APP 推出了「视频身材美型保护」功能,解决了平常瘦脸、瘦身等视频美型任务中,容易出现的栏杆变弯、背景形变等尴尬问题。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

https://mp.weixin.qq.com/s/e7ZiK1Dc7aGk6WtI_iZI1g

基于 BridgeRemoval 的优势,也为视频消除能力带来了显著提升,相比主流模型的整体性能,缩短了约 80% 的处理时长,且区别于 10 秒的视频处理限制,BridgeRemoval 可以支持无限时长的视频消除。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

https://mp.weixin.qq.com/s/e7ZiK1Dc7aGk6WtI_iZI1g

尤其在文字场景,BridgeRemoval 对各类型文字均表现出极佳的消除效果,即使是特殊的发光字幕也能实现无痕消除。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

https://mp.weixin.qq.com/s/e7ZiK1Dc7aGk6WtI_iZI1g

目前该能力即将上线开拍 APP「智能全消」功能,能够自动识别与消除视频文字,支持最长 5 分钟视频输入,实现画面无损效果,相较主流模型最长 30 秒视频输入及 Token 消耗模式,使用成本更低。

对于图像中的文字,消除以后往往还需要替换成新的内容,这要求模型不仅要生成准确的目标字符,还不能破坏原有字体、排版、颜色与背景纹理。针对字符准确性与视觉风格难以兼顾的问题,美图影像研究院(MT Lab)在 ICML 2026 提出了基于 Self-Prompting 的图像文本编辑方法,实现多语种的「无痕改字」。

区别于依赖图像修补和依赖 OCR 或固定字表的建模方式,该方法通过直接从输入图像中提取风格信息,并结合目标文本生成高保真的字形提示,将两者与原图进行统一建模,无需额外引入专门的风格或字形编码器,就能实现端到端的编辑。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

论文链接:https://arxiv.org/abs/2605.15523

项目主页:https://hongxiii.github.io/mstedit/

借助多模态扩散 Transformer 的上下文学习能力,该方法能够在保持原有字体风格、颜色和纹理的同时,实现跨语言、跨场景的高质量文本替换,为多语言场景文本编辑提供了一种统一且可扩展的解决方案,也为真实复杂环境中的风格一致性编辑奠定了重要基础。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

相较主流模型,美图影像研究院(MT Lab)的无痕改字能力从编辑准确性到风格一致性,都实现了最优表现。尤其在繁体中文、泰语、日语甚至是特殊符号等复杂文字场景中,也展现了极强的稳定性。

目前该能力已通过「无痕改字」上线美图秀秀 PC 端,覆盖汉字、拉丁字母、阿拉伯字母、梵文、西里尔字母在内的全球五大主流文字书写形式,即使是非文字形式的特殊符号也能完成改写。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

回到美图最为擅长的人像领域,造型作为人像的关键一环,难点在于需要同时理解材质、纹理、光照以及人与场景之间的关系。对此,美图影像研究院(MT Lab)在 ECCV 2026 上提出了面向原生 2K 多服饰试衣的新框架 WearWow。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

论文地址:https://arxiv.org/abs/2607.19923

2K 分辨率是目前电商图片用于展示服饰鞋帽细节及质感的标配,但多件服饰鞋帽共同输入时,Virtual Try-On 的试衣方案容易导致显存消耗与耗时均显著增加,且试穿效果不佳。

而扩散模型在高分辨率下易出现纹理退化现象,羊毛、牛仔、针织等特殊材质会有明显的「塑料感」,虽然这些方案基本都已经能够「穿对衣服」,但距离真正商用还有较大的差距。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

对此,WearWow 采用 Adaptive 2D Token Packing(ATP)解决了计算效率问题,实现端到端的多服饰生成,再利用 Multi-dimensional Try-on Reward(MTR)进一步调整模型生成方向。基于对穿戴关系的精准理解,WearWow 将试衣方案从「替换服装」升级为「真实穿戴」,即使是在 2K 高分辨率下,依旧能够保持羊毛、棉麻、粗针织等等服饰材质的真实质感。

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

AI中国网 https://www.cnaiplus.com

本文网址:

欢迎关注微信公众号:人工智能报;合作及投稿请联系:editor@cnaiplus.com

AI中国号...

关注微信公众号,了解最新精彩内容