欧美日韩亚洲视频_国产激情视频一区二区三区欧美 _亚洲欧洲在线免费_亚洲男人天堂古典

您的位置:首頁 >關注 > 正文

給AI"換一身行頭",視頻模型的推理能力竟能大幅提升 天天快報

這項由Google DeepMind主導的研究于2026年7月28日以預印本形式發布,論文編號為arXiv:2607.25537v1,有興趣深入了解的讀者可通過該編號在arXiv平臺查詢完整論文。


(資料圖片僅供參考)

說到提示詞,大多數人腦海中浮現的畫面大概是這樣的:在聊天框里敲入一段精心措辭的文字,然后期待AI給出更好的答案。過去幾年,圍繞如何"好好跟AI說話"的研究已經發展成了一門獨立的學問,甚至有人專門以此謀生。但Google DeepMind的研究團隊最近提出了一個頗為新鮮的問題:如果說文字提示詞可以被精心設計,那么圖片提示詞是不是也可以?

這個問題背后,藏著一個已經悄然發生的技術轉變。過去一年多時間里,一類被稱為"視頻生成模型"的AI系統正在悄然升級為通用的視覺推理工具。這些模型不僅能生成好看的視頻,還能通過"演示"來解決問題——給它一張迷宮的圖片,它能生成一段小球走出迷宮的視頻;給它一道物理題的示意圖,它能用動畫展示球會滾進哪個桶。這類模型接收兩樣東西作為輸入:一段文字說明(描述接下來要發生什么),以及一張圖片(作為視頻的第一幀)。研究者們一直在努力優化前者,卻幾乎從未認真打量過后者。

Google DeepMind的團隊決定填補這個空白。他們將這套方法命名為VIPE,也就是"視覺提示工程"(Visual Prompt Engineering)。核心思路其實并不復雜:在把圖片喂給視頻模型之前,先用圖像編輯模型對這張圖片動動手腳——不改變題目本身,只改變它的視覺呈現方式。一道原本用素描風格畫出的物理題,可以被改造成擺滿實木架子和臺球的逼真場景;一組抽象符號,可以被渲染成立體的3D實物。

結論相當出人意料:僅僅改變圖片的視覺風格,不改任何題目內容,視頻模型的答題正確率就能大幅提升。在某些任務上,這種純粹的"換衣服"操作帶來的性能提升,甚至超過了讓模型反復嘗試同一道題二十次的效果。

一、為什么給AI"換一身行頭"這件事有意義

在正式展開研究細節之前,有必要先理解這件事為什么值得做。

考慮這樣一個場景:你想測試一條魚的游泳速度,但你把它放在了一塊旱地上。測試結果當然很糟糕,但這個糟糕的結果反映的不是魚的真實游泳能力,而是測試環境的不匹配。這個聽起來有些荒唐的比喻,恰恰是Google DeepMind研究團隊在這項工作中的核心發現:視頻生成模型在抽象、草圖風格的圖片上表現糟糕,并不一定意味著它們推理能力差,而可能只是因為它們被放在了"旱地上"。

視頻生成模型是用海量真實世界視頻訓練出來的。它們最熟悉的是真實場景里的光影、質感、物理運動方式。當你給它們一張黑白線條草圖,讓它們預測一個白色圓圈會滾進哪個線條畫的容器里,它們其實是在一種陌生的視覺語言下工作。結果自然不理想。

這個觀察引出了研究的核心假設:如果把草圖變成逼真的照片風格,讓那個白色圓圈變成一顆真實的臺球,讓那些線條變成實木貨架,視頻模型會不會表現得更好?答案是肯定的。

這種現象被研究團隊稱為"現實主義偏好"——視頻模型天然偏好在寫實場景中推理,而這恰恰給視覺提示工程留出了可操作的空間。

二、實驗是怎么做的

研究團隊搭建了一套完整的流水線,分為三個步驟,各司其職。

第一步叫做"構想者"。這個角色的任務是想出如何修改圖片。在自動化實驗中,研究團隊用一個大型語言模型(具體是Gemini 3.1 Pro)來擔任這個角色。它會查看原始圖片,然后用文字描述一種新的視覺風格——比如"把這張草圖變成一個真實的臺球滾落木制貨架的場景"。關鍵約束是:題目的邏輯結構必須完整保留,障礙物的數量、位置、角度都不能變,只有視覺呈現方式可以改。

第二步叫做"編輯者"。它負責按照第一步的指令,真正動手改圖片。研究團隊在實驗中使用了Nano Banana Pro(本質上是Gemini的圖像生成模塊)來完成這個工作。對于同一張圖片,編輯者會生成多個候選版本,默認是五個。

第三步叫做"過濾器",是可選的。當編輯者產出了多個候選圖片后,過濾器負責從中挑出質量最好、與原圖邏輯最吻合的那一個。這個角色同樣由Gemini 3.1 Pro擔任,它會仔細比對編輯前后的圖片,確保題目本身沒有被意外改變。

完成這三步之后,改造好的圖片才被送給視頻模型,視頻模型生成一段演示視頻,最后由一個"裁判"(自動評分模塊)判斷答案是否正確。

整個流程的設計理念是:始終對題目的邏輯內容保持零干擾,只在視覺表現層面做文章。就像把同一道數學題從手寫板書抄到打印稿上——題目沒變,但讀者的閱讀體驗變了。

三、用一道經典物理題檢驗效果

研究團隊選擇的第一個測試場景是一個叫做VPCT的數據集。這個數據集的設定很直觀:屏幕上有一張草圖,一個白色圓圈從頂端出發,沿著幾條斜線(代表障礙物)往下滑落,最終落入底部三個容器之一。題目要求預測圓圈會落入哪個容器。

原始版本完全是抽象的線條畫風格,黑色線條代表障礙物,白色圓圈代表球,沒有任何質感、光影或真實物體的特征。經過視覺提示工程處理后,同樣的場景被渲染成了逼真的照片:白色圓圈變成了紅色臺球,黑色線條變成了實木擱板,整個場景看起來就像一個真實存在的臺球滾落展架的實驗裝置。

研究團隊用多個視頻模型測試了這個改變的效果,結果相當顯著。以開源模型Wan2.2為例,在原始草圖條件下,它的正確率接近隨機猜測水平(隨機猜測三選一的概率是33.3%),英文提示版本的正確率只有32.4%。換成逼真圖片后,同一個模型的正確率穩定地超過了隨機水平,達到40%以上。對于Google自家的Veo 3.1模型,改變更加明顯:原始草圖下正確率是41.3%,換成逼真圖片后直接跳升到59.3%,提升了整整18個百分點。另一個模型Omni Flash則從56.3%上升到67.5%。

為了驗證真正起作用的是"寫實感"而非"立體感",研究團隊還專門做了一組對照實驗:他們制作了一批看起來有立體感但紋理完全不真實(比如棋盤格紋理、熒光色拼接)的圖片。結果幾乎所有模型在這種"假3D"條件下的表現,與原始草圖相比沒有顯著差異。這說明讓模型變聰明的不是3D效果本身,而是真實材質、真實光影帶來的寫實感。

四、讓機器自動找到最好的"視覺外衣"

手動設計一套合適的圖片改造方案是可行的,但這需要人對模型有一定的了解,也比較費時。更理想的情況是讓整個過程自動完成。研究團隊測試了兩種不同的自動化策略。

第一種策略叫做"自由發揮構想"。簡單說,就是讓一個AI(Gemini 3.1 Pro)在沒有任何預設框架的情況下,自由地為每個任務想出新的視覺呈現方案。為了保證多樣性,每次生成新方案時,AI都能看到之前已經提出過的所有方案,從而避免重復。研究團隊對六個不同的視覺推理任務各自生成了20種不同的圖片變體,再用這些變體測試Veo 3.1的表現。

實驗覆蓋的任務包括:上文提到的物理滾球預測(VPCT)、四種不同難度的迷宮求解(從5×5的簡單方格迷宮到形狀不規則的復雜迷宮)、停車場解謎(RushHour,需要移動擋路的車輛讓目標車輛出場)、視覺搜索(在一堆干擾物中找出兩個符合特定顏色和形狀條件的目標)、數字排序(讓數字按從小到大的順序逐一消失),以及連點成線(用線連接顏色相同的兩個圓點)。

在這些任務上,自動生成的視覺變體帶來的錯誤減少率非常可觀。以數字排序任務為例,最好的一個圖片變體讓錯誤率降低了70%。停車場解謎的某些變體讓錯誤率降低了75%。迷宮求解在某些難度級別上也取得了超過40%的錯誤減少率。不同的任務有不同的"最優視覺風格"——停車場解謎在被改造成"陽極氧化鋁金屬拼圖盒"風格時表現最好,而迷宮在被渲染成"街機游戲屏幕截圖"風格(畫面有細微的像素紋理)時效果最佳。

第二種策略叫做"逐步概念編輯"(ACE)。與第一種策略的"整體換風格"不同,這種方法更像是一個外科醫生:每次只改變圖片中的一個元素,比如換掉背景顏色,或者給數字加上邊框,然后觀察效果,再決定下一步改什么。整個探索過程像一棵樹:從原始圖片出發,每一次編輯都是一個分支,效果好的分支繼續延伸,效果差的分支剪掉。

ACE方法還有一個重要特點:它能從實驗結果中總結出規律,形成所謂的"規程",然后用這套規程指導后續的搜索。比如對于數字排序任務,模型總結出了幾條反復奏效的原則:高對比度的深色背景能幫助模型聚焦在前景元素上;給每個數字加上幾何邊框能增強視覺定位;把平面元素改成有質感的3D風格(比如黑板粉筆字)能提升物體在時間維度上的穩定性。研究團隊特別指出,這些有效策略往往需要組合使用才能發揮最大效果,單獨使用任何一個效果都更有限。

相比之下,被反復證明無效甚至有害的操作包括:給物體添加高反光的金屬材質(因為這種材質會在視頻幀之間引入不穩定的光影變化)、過度加粗字體(會讓數字邊界模糊)、以及把顏色調得過于鮮艷飽和(反而會分散模型的注意力)。

兩種策略各有優劣。自由發揮構想更省計算資源,適合快速探索;逐步概念編輯更精細,在某些困難任務上能找到更好的單樣本解決方案。數字排序任務在ACE方法下甚至達到了100%的錯誤減少率。

五、視覺提示工程與其他提升策略的橫向比較

研究團隊不僅測試了視覺提示工程本身的效果,還把它與另外兩種常見的性能提升策略進行了直接比較:反復生成視頻然后投票(也叫"自洽性"方法),以及直接改寫文字提示詞。

先看與反復生成的比較。這種策略的邏輯是:同一道題生成多個答案,然后用多數票決定最終答案,就像讓多個陪審員獨立投票一樣。研究團隊在VPCT任務上讓Veo 3.1反復生成20次并投票,正確率從41.3%上升到50%,提升了大約8.7個百分點。而使用一次視覺提示工程處理過的圖片,僅用單次生成就已經達到59.3%,比20次反復生成還高出將近10個百分點。

更有趣的是,這兩種策略并不互斥,可以疊加使用。在改造過的逼真圖片上再做20次投票,最終正確率達到了68%,比原始草圖加20次投票(50%)高出18個百分點。

從成本角度看,這種比較更加鮮明。生成一段8秒的視頻需要大約3.2美元,而完成一次視覺提示工程(包含5個候選圖片的生成和過濾)只需要大約0.4美元,不到視頻生成費用的八分之一。這意味著在相同的預算下,把錢花在探索更多視覺變體上,比把錢花在生成更多視頻上效率更高。研究數據顯示,對于同等預算,最優策略通常是盡可能多地探索不同的視覺變體,每個變體只生成一次視頻,而不是針對同一個視覺變體反復生成。

再看與文字提示工程的比較。研究團隊用同樣的自動化框架,分別生成了20個圖片變體和20個文字提示變體,在四個任務上進行了直接對比。結論是:兩種策略都有效,但視覺提示工程在多數任務上表現更好。以視覺搜索任務為例,最好的圖片變體讓正確率從4%跳升到62%,而最好的文字變體只能達到12%。數字排序任務上,最好的圖片變體達到76%,最好的文字變體達到86%,這是少數幾個文字策略更優的案例之一。

值得一提的是,研究團隊還嘗試了同時修改圖片和文字的聯合優化,但結果沒有比單獨修改圖片更好。研究者推測,這可能是因為聯合優化增加了搜索難度,生成的方案反而不如專注于單一維度精雕細琢來得有效。

六、視頻模型為什么喜歡真實感

現在回到最根本的問題:為什么視覺提示工程會有效?研究團隊通過一個精心設計的實驗給出了直觀的解釋。

他們創建了一個逐步遞進的視覺改造序列,從一個純粹抽象的合成場景出發,每次只往"真實"方向走一小步。起點是兩個彩色圓點和兩條虛線,代表兩個物體沿各自路徑移動到交匯點。第一步改造:把虛線換成鐵路軌道,但圓點保持不變。第二步:把圓點換成火車車廂模型,但背景仍然是白色。第三步:加上真實的綠色草地背景,整個場景看起來就像一段真實的俯拍鐵路視頻。

在每個階段,研究團隊都讓Veo 3.1生成100段視頻,然后由真人評估員判斷生成的視頻是否"場景連貫"(即物體沒有憑空消失、沒有隨機變形、沒有莫名其妙地改變外觀)。結果沿著這條改造路徑單調遞增:純抽象場景的連貫性得分是0%,加上鐵路軌道后是11%,換上火車車廂后是24%,加上真實草地背景后是59%。每一小步朝真實感邁進,都直接對應著視頻模型生成質量的提升。

這個結果指向一個清晰的機制:在真實場景中,視頻模型"知道"物體應該怎么運動,因為這類場景在訓練數據里出現過無數次,物理規律是隱含在訓練記憶里的。但在抽象場景中,模型沒有足夠的"記憶"可以依賴,只能靠"猜",而猜出來的結果往往是物體隨機出現、消失或變形——這對任何需要追蹤物體狀態的推理任務都是致命的干擾。視覺提示工程的本質,就是把任務從模型陌生的視覺語言翻譯到模型熟悉的視覺語言。

七、這套方法并非對所有AI模型都適用

研究團隊還做了一組補充實驗,測試視覺提示工程是否同樣能提升圖像生成模型的推理能力。他們選用了兩個版本的Nano Banana(Gemini系列的圖像生成模塊),讓這些模型直接從VPCT的圖片預測球會落入哪個桶,答案可以是一張圖片(畫出球落入某個桶的場景),也可以是一段文字(直接說"左邊"、"中間"或"右邊")。

結果出現了一個有趣的分化。對于圖像生成模型,視覺提示工程帶來的提升要么微弱,要么甚至是負面的。Nano Banana Flash在圖像輸出模式下,換用逼真圖片后正確率反而從37%下降到21%。但同一個模型切換到文字輸出模式,在原始草圖上的正確率就達到了58%。

這個結果揭示了一個重要的區別:圖像生成模型在訓練中接觸過各種風格的圖片,包括抽象風格和寫實風格,因此對它們來說抽象草圖并不陌生,視覺提示工程的"翻譯價值"就要小得多。而視頻模型的訓練數據幾乎清一色是真實世界的視頻,抽象草圖對它們而言是真正陌生的領域。視覺提示工程能發揮作用,正是因為它彌補了輸入格式與模型訓練分布之間的那道鴻溝。當那道鴻溝本來就不存在時,VIPE自然也就無用武之地。

此外,研究團隊還發現了一個值得關注的現象:雖然Gemini 3.1 Pro作為純文字視覺問答模型,在VPCT原始數據集上能達到96%的超高正確率,但當研究團隊把桶翻轉過來倒置時,正確率立刻崩潰到4%。更關鍵的是,這個模型能準確識別出桶是倒置的,但仍然會告訴你球會"落入"某個倒置的桶——它理解視覺信息,卻無法把這個信息與物理常識正確結合。這說明當前的視覺語言模型在VPCT上的高分,很可能來自某種視覺統計捷徑,而非真正的物理推理能力。

八、研究者留給整個領域的建議

基于上述發現,研究團隊提出了一個在學術評估層面頗具實踐意義的建議:在用視覺推理基準評測視頻模型時,如果評測集本身是抽象的、非寫實的,那么測出來的成績往往只是模型真實能力的下限,而非真實水平。就像不能用讓魚在陸地上爬行的測試來評估魚的運動能力一樣,用抽象草圖來評估視頻模型的推理能力,本質上是在用錯誤的測試環境得出偏低的結論。

研究團隊建議:只要技術條件允許,評測者應該主動用視覺提示工程把抽象測試場景轉化為寫實場景,然后再測試模型能力。這樣得到的結果才能更真實地反映模型的內在推理潛力。當然,研究團隊也坦承,模型對視覺風格如此敏感本身就是一個需要被修正的問題——理想中的模型應該能夠在任何視覺風格下都表現穩定,不需要用戶幫它"換衣服"才能正常工作。這與早期語言模型對措辭高度敏感的問題如出一轍,當年人們發現"Obama worked as a ___"和"Obama is a ___ by profession"會得到截然不同的填充結果,如今類似的敏感性正在視覺模態上重演。

歸根結底,這項研究想傳遞的信息并不復雜:對于當前的視頻生成模型,你給它看的圖片長什么樣,會極大地影響它能解出多少題。這個發現既是一個可以立即利用的實踐技巧,也是一個提醒——在我們慶祝AI推理能力取得新高分之前,也許應該先問一句:這個高分是在"陸地上"測出來的,還是"水里"測出來的?

Q&A

Q1:視覺提示工程(VIPE)具體是怎么改變圖片的,會不會改變題目本身?

A:VIPE的核心原則是只改視覺風格,不改題目邏輯。舉個例子,原來的物理題里有一個白色圓圈和幾條黑色斜線,VIPE會把圓圈改成真實的紅色臺球,把斜線改成實木貨架,但障礙物的數量、角度、位置完全不變。題目依然是那道題,只是看起來更真實了。整個過程會有一個過濾步驟,由AI(Gemini 3.1 Pro)仔細核查改造前后是否有邏輯變化,確保題目沒有被意外修改。

Q2:視覺提示工程和多次重復生成視頻相比,哪種更劃算?

A:視覺提示工程更劃算。以VPCT物理推理任務為例,生成一段8秒視頻約需3.2美元,而完成一次包含5個候選圖片的視覺提示工程只需約0.4美元,不到視頻生成費用的八分之一。實驗數據顯示,在相同預算下,把錢花在探索更多不同的視覺變體上,比反復生成同一張圖片的視頻效率更高。當然兩種方法也可以疊加使用,效果會進一步提升。

Q3:視頻模型為什么在寫實圖片上表現更好,在草圖上表現更差?

A:視頻模型是用海量真實世界視頻訓練出來的,它的"記憶"里充滿了真實場景里物體的運動規律。當它面對寫實圖片時,能調用這些記憶預測物體怎么動;面對抽象草圖時,它沒有足夠的參考,只能亂猜,結果就是視頻里物體隨機消失、變形,根本沒法正確推理。研究團隊通過實驗證實,每向真實感邁進一小步,模型生成的視頻連貫性就會明顯提升,從0%一路升到59%。

關鍵詞: 視覺 草圖 視頻模型 推理能力

熱門資訊

主站蜘蛛池模板: 欧美日韩在线不卡视频 | 精品国产免费人成电影在线观...| 久久精品国产精品亚洲色婷婷 | 国产精品久久久久久久久久三级| www.欧美日本| 国产在线拍揄自揄视频不卡99| 欧美亚洲国产另类| 日韩中文字幕在线视频| 国产av不卡一区二区| 久久99久久99精品免观看粉嫩| 欧美日韩视频免费| 日本三级久久久| 日韩免费观看视频| 日韩精品大片| 人人妻人人澡人人爽精品欧美一区| 无码人妻精品一区二区蜜桃百度 | 日韩免费精品视频| 亚洲一区不卡在线| 亚洲在线视频福利| 亚洲不卡中文字幕无码| www.xxxx精品| 99精品一级欧美片免费播放| 国产精品青草久久久久福利99| 国产免费一区视频观看免费| 久久精品日韩| 国产亚洲欧美在线视频| 国产一区深夜福利| 国产三区在线视频| 国产精品一区免费观看| 国产精品日韩在线| 国产精品第一视频| 一区二区免费在线观看| 亚洲综合视频1区| 日韩一区国产在线观看| 欧美日韩福利在线观看| 久久精品国产美女| 国产综合av一区二区三区| 国产精品中文字幕在线| 国产精品久久久久久免费观看| 国产精品777| 亚洲成人午夜在线|