在日常摄影中,后期处理往往是决定照片最终观感的重要一步。
同样的场景和构图,经过适当的曝光调整、色彩优化、细节增强后,照片的质感和视觉吸引力能够得到显著提升。
然而,对于绝大多数普通用户来说,面对繁杂参数往往不知道应该如何调整,或是难以准确描述自己期望的效果。很多时候,人们只是觉得照片“差点意思”,却说不清究竟哪里出了问题。
如果把AI修图比作请摄影师帮忙处理照片,那么现有大多数图像编辑方法更像是一个“听指令的修图助手”——用户需要明确告诉模型“把天空调蓝一点”、“增加一些对比度”、“去掉雾气”,模型再根据指令完成修改。但现实中,真正困难的往往不是执行修图,而是发现问题并制定合理的优化方案。
研究团队提出了SmartPhotoCrafter,实现“从理解到生成”的自动摄影图像优化,在无需人工指令的情况下,实现低质量图像修复与摄影级调色,维持内容一致性的同时提升图像美学质量。
近年来,基于生成式模型的自动摄影图像编辑(Automatic Photographic Image Editing)逐渐从“指令驱动的局部修图”发展为“无需明确指令的智能美学增强”范式。针对摄影图像优化任务,其对模型的要求不仅包括低层视觉退化的修复(如去雾、去模糊、低照度增强),还希望模型能够自动完成摄影级调色与美学优化,实现从图像理解到审美增强的端到端自动化编辑。然而,现有方法在复杂场景中仍然面临挑战:
第一个问题是审美缺陷感知与结构化推理缺失:现有图像编辑模型大多依赖端到端的条件生成或基于指令的局部调整,非专业用户难以准确提供图像优化指令。同时,若缺乏图像质量进行显式建模的能力,无法系统性回答“图像哪里存在问题、问题来源是什么、应如何修复与优化”。因此模型往往只能学习统计意义上的映射关系,而难以形成类似摄影师的诊断式理解。
第二个问题是图像优化中修复与调色任务的割裂:调色类方法虽然能够在色彩与风格维度进行细粒度控制,但往往缺乏对严重退化图像的修复能力;而以生成式模型能较好实现图像修复,却通常忽视美学一致性与摄影风格表达。现有模型在复杂场景下缺乏同时实现内容保真、结构恢复与美学优化的能力。
针对这些问题,研究团队提出SmartPhotoCrafter,一个面向摄影图像的全自动增强框架,用户只需输入一张照片,无需提供任何修图指令,模型便能先自主分析图像质量,再推理出相应的优化策略,并最终完成针对性的图像编辑。从图像理解、问题诊断、编辑决策到结果生成,整个过程无需人工干预,实现了从“你说我改”到“模型先思考、再修图”的全新范式。如图所示,SmartPhotoCrafter支持以下能力:

SmartPhotoCrafter框架主要包含两个高度协同的模块:Image Critic(图像评论家)和Photographic Artist(摄影艺术家)。前者负责分析和决策,后者负责执行和生成,两者共同构成了一条完整的“审美诊断→编辑决策→图像优化”链路。
SmartPhotoCrafter的核心能力采用一个由浅入深、逐步对齐的三阶段训练策略。
第三阶段强化学习对Image Critic和Photographic Artist进行端到端优化,奖励设计充分考虑从语义理解到属性级精细控制的优化,实现更稳定、更精确的图像增强效果。其中,奖励函数重点强化了属性级别的参数敏感性,将原本难以精确建模的整体图像质量评价,分解为曝光、对比度、饱和度、色温等细粒度可解释属性维度,使模型能够对细微色调变化做出更稳定且可控的响应。这种属性解耦的设计显著增强了优化过程对微小调色差异的感知能力。完整设计如下图所示。

为支撑SmartPhotoCrafter从图像理解到可控生成再到跨模块协同的逐步学习,团队构建了分阶段多任务数据,用以逐步强化模型的理解能力、细粒度可控生成能力以及Critic–Artist的对齐协同能力。

SmartPhotoCrafter在多种图像优化场景下进行测试,充分验证其自动摄影图像优化能力。



SmartPhotoCrafter把“看图理解+修图”合在一起,通过把语义理解和图像生成打通,实现涵盖图像修复和调色任务的自动摄影图像优化,在多种增强场景下都能稳定输出自然好看的修图结果。该模型目前主要集中于修复和色彩类的低层调整,未覆盖复杂的构图级编辑。未来可以在现有基础上,进一步往“理解构图并整体优化”的方向扩展,实现更全面的图像后期优化。
蓝图实验室,主要负责移动影像算法创新,包括图像/视频处理、图像/视频交互、图像/视频增强、多模态理解大模型等方面的技术前沿探索。
致力于不断提升vivo移动影像的算法能力,使用户能够拍摄出更加清晰、美观的照片和视频。同时积极探索增强现实、具身智能等新兴技术领域的应用,努力为用户提供更加丰富和便捷的影像体验。
论文链接:https://arxiv.org/abs/2604.19587
论文主页:https://vivocameraresearch.github.io/smartphotocrafterweb
论文代码:https://github.com/vivoCameraResearch/SmartPhotoCrafter
文章来自于"量子位",作者 "vivo BlueImage Lab"。
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner