
2024年,一张由AI打分的“完美照片”在500px上拿了满分,结果作者自己跳出来说:这图对焦都是虚的。AI照片评测准确吗?这事儿比你想的要有意思得多。
从“像素数毛”到“审美打分”:AI评测这十年
最早的AI照片评测工具,说白了就是干一件事——数噪点。2015年前后,DxOMark这类平台开始用算法分析锐度、动态范围、色彩还原,给手机摄像头跑分。那时候的“评测”跟审美没半毛钱关系,纯粹是实验室数据。
真正的转折发生在2020年。Adobe联合加州大学伯克利分校搞了个项目,用深度学习模型分析Flickr上200万张高赞照片,试图找出“什么构图让人喜欢”。结果模型给出的结论之一:把主体放在正中间,得分最低——这跟几十年来摄影师口口相传的“三分法”完全相反。从那时起,大家才开始认真问:AI照片评测准确吗?它到底在评什么?
AI到底在给照片打什么分?
现在市面上的AI评测工具,比如Everypixel、Blink AI,还有国内的美图AI测评,核心逻辑就三种。
第一种是“技术质量分”。 对焦准不准、噪点多不多、有没有紫边。这个部分AI比人强,肉眼看不出来的色偏,模型一算就出来。2023年DPReview用AI检测佳能R5和索尼A7R5的照片,发现佳能的自动白平衡在弱光下偏绿0.3个单位,很多摄影师看了对比图都直呼“还真是”。
第二种是“构图规范分”。 三分法、引导线、对称性、留白比例。这部分就开始玄了。AI会把一张符合黄金分割的平庸照片打高分,却对一张故意打破规则的纪实作品打低分。马格南图片社有张经典照片——一个孩子在废墟上奔跑,主体几乎贴着画面边缘——AI评分只有47分,但那张照片拿了荷赛奖。
第三种是“社交热度预测分”。 有些工具直接拿Instagram的历史数据训练,预测一张照片能拿多少赞。这已经不是“评测”,而是“迎合”。2024年有团队做过实验:同一张风景照,AI建议加高饱和、提亮暗部、压暗天空,改完确实像小红书爆款,但原图那种阴天的压抑感全没了。
三个真实翻车案例,看完你就有数了
2023年,风光摄影师Thomas Heaton把自己一张获奖作品丢进某AI评测工具,结果拿了62分,评语写着“天空过曝、前景杂乱”。那张照片拍摄于冰岛,前景是故意保留的黑色火山岩纹理,天空的“过曝”其实是极光。AI压根不知道极光长什么样。
更离谱的是人像。2024年初,有摄影师用AI评测一张棚拍肖像,工具给出“眼神光不足、皮肤纹理过多”的建议。按它说的改完,模特皮肤磨得像塑料娃娃,眼神光加得跟动漫角色一样。那套“AI优化图”发到摄影论坛上,被骂了300多楼。

还有一次是黑白照片。AI给一张高反差黑白街拍打了38分,理由竟然是“色彩单一、饱和度不足”。说白了,很多AI评测工具的底层逻辑还是“颜色越鲜艳、对比越强烈、主体越突出就越好”,这套标准放在商业图库可能管用,放在艺术摄影上就是灾难。
为什么AI总在“艺术”上栽跟头?
坦白讲,问题不在算法,在训练数据。目前公开的照片评测模型,训练集大多来自图库网站和社交媒体。图库网站的照片讲究“清晰、明亮、无瑕疵”,社交媒体讲究“抓眼球、高互动”。这两类数据都严重偏向某一种审美风格。
荒木经惟的虚焦、森山大道的粗颗粒、寇德卡的高反差——这些在AI眼里全是缺陷。因为训练数据里几乎没有这类作品,模型根本没见过“故意拍糊”还能被奉为经典的情况。简单来讲,AI不是不懂艺术,它是没见过艺术。
另一个原因是“评测”这个词本身就暧昧。你是要测“这张照片技术上有没有问题”,还是要测“这张照片好不好看”?前者可以量化,后者完全主观。把主观问题塞进客观算法里,结果就是四不像。我们在AI影像质量评估的技术边界里详细拆过这个矛盾。
未来会怎样?我看好的三个方向
第一,分场景评测。以后不会再有一个笼统的“照片评分”,而是“商业图库适用度”“社交媒体传播潜力”“艺术画廊倾向”分开打分。2024年底已经有创业公司在做这个,叫LensScore,目前内测数据还不错。
第二,AI先当“第二意见”,别当裁判。你拍完一张照片,AI告诉你“这张在技术上有什么问题”,但“好不好”你自己决定。这个定位最务实。
第三,多模态模型会带来质变。现在的AI只看像素,以后如果能把拍摄时间、地点、天气、摄影师过往风格都输入进去,评测的准确率会明显提升。Google的Gemini 2.0已经在实验这个方向。
所以回到开头的问题:AI照片评测准确吗?我的答案很明确——技术层面相当准,审美层面相当不准。它更像一个偏科的实习生,数理满分,作文跑题。拿来检查对焦、噪点、紫边,放心用;拿来判断一张照片“值不值得拍”,趁早关掉。
一张照片好不好,最终得由你自己的眼睛说了算。AI可以告诉你焦点在哪,但它没法告诉你,那个虚掉的背景里,有风吹过的声音。
