AI 視覺處理評分 Gemini 3 Pro 獲首名 豆包視覺版躋身全球三甲

權威評測平台 SuperCLUE-VLM 公布 2025 年 12 月多模態視覺語言基準評測總榜。Google Gemini 3 Pro 以 83.64 分大幅領先並奪冠,展現壓倒性優勢。中國陣營表現亦出色,商湯科技 SenseNova V6.5 Pro 以 75.35 分位居第二,字節跳動豆包視覺版則以 73.15 分緊隨其後,成為首款進入全球三甲的中國多模態大模型。

三大維度全面評測視覺能力

SuperCLUE-VLM 從基礎認知、視覺推理及視覺應用 3 個核心維度,評估大模型真實視覺理解能力。基礎認知測試模型識別物件、文本及場景等基本元素能力;視覺推理考核模型理解圖像中的邏輯、因果關係及隱含資訊表現;視覺應用則評估模型完成圖文生成、跨模態問答及工具調用等實際任務表現。

Gemini 3 Pro 各項指標全面領先

榜首 Gemini 3 Pro 在 3 個細項指標中均表現突出。其基礎認知得分 89.01、視覺推理 82.82、視覺應用 79.09,全面領先其他模型。Google 於 12 月初發布 Gemini 3 Pro 時,強調這是該公司最強大的多模態模型,在檔案理解、空間推理、螢幕識別及影片理解等領域均創下領先表現。該模型在複雜視覺推理基準測試 MMMU Pro 及 Video MMMU 上創下新紀錄,並支援高達 256K token 語境視窗,能處理長達 2 小時影片內容。

商湯科技 SenseNova V6.5 Pro 以 75.35 分穩居第二位,顯示中國企業在多模態領域技術實力。字節跳動豆包視覺版在基礎認知環節得分 82.70,甚至超越部分國際競爭對手,僅在視覺推理環節稍顯弱項。字節跳動於今年 9 月發布豆包大模型 1.6-vision,這是豆包家族首款具備工具調用能力的視覺深度思考模型,擁有更強通用多模態理解和推理能力。

百度 ERNIE-5.0-Preview 及阿里巴巴 Qwen3-VL 等中國模型同樣進入前 5 名。Qwen3-VL 是排名榜中首款開源且總分超過 70 分的模型,展現開源社群在多模態領域進步。

國際頂尖模型排名較後

國際頂尖模型在此次評測中表現出乎意料。Anthropic Claude Opus 4.5 得分 71.44,OpenAI GPT-5.2(high) 僅獲 69.16 分,排名相對較後。這反映全球多模態大模型競爭格局正在重塑,技術領先優勢不再絕對集中於少數企業。

排名模型名稱機構總分基礎認知視覺推理視覺應用開 / 閉源
Gemini-3-proGoogle83.6489.0182.8279.09閉源
🥇SenseNova V6.5 Pro-20251215商湯科技75.3581.6674.3170.08閉源
🥈Doubao-seed-1-6-vision-250815字節跳動73.1582.7064.2772.48閉源
🥉ERNIE-5.0-Preview百度72.2182.0570.8663.71閉源
🏅Qwen3-vl-235b-a22b-thinking阿里巴巴71.9579.6671.2664.92開源
Claude-opus-4-5-20251101Anthropic71.4482.0765.8166.43閉源
GPT-5.2(high)OpenAI69.1675.1867.3564.96閉源
4Doubao-seed-1-6-251015字節跳動68.0277.8662.0164.19閉源
4GLM-4.6v智譜 AI67.6881.7460.8360.48開源
5step-3階躍星辰62.9477.1649.8161.87開源
6Qwen3-vl-8b-instruct阿里巴巴61.6474.6652.7757.50開源
7MiniCPM-V4.5面壁智能49.3868.7624.8354.56開源
8InternVL3.5-8B上海 AI Lab47.8964.2124.4954.98開源
Grok-4.1-fast-non-reasoningX.AI45.5763.9623.6249.13閉源

數據來源: SuperCLUE ,2025 年 12 月 29 日。

注:考慮到波動影響,本排行榜將相差 1 分以內的模型視為並列名次。

資料來源: