失敗案例:同一張照片,為什麼結果差這麼多
這頁的每一組對照都是真的跑出來的,兩邊用完全同一張照片,只差一個設定。 其中一組還推翻了我們自己原本的假設,也一併寫在下面,沒有修飾。
案例一:照片裡沒有人,卻選了人像動作
左右兩邊都是同一張灰貓鵲站在樹枝上的照片(CC0)。左邊選「人像 → 靜靜呼吸」, 右邊選「動物 → 靜靜呼吸」。
左邊那支請看到最後:一張人臉從畫面下方浮出來,愈長愈大,最後佔滿整個畫面, 而那隻鳥還站在他的臉上。右邊同一張照片,鳥就只是安靜地呼吸、動一動。
為什麼會這樣。人像動作送給模型的指令長這樣:
「The person stands still and looks straight ahead. They blink naturally…」。
模型讀到 the person,但畫面裡找不到人。它不會因此放棄,
而是想辦法讓畫面「符合」這句話,於是自己生一個人出來。
我們第一次遇到這件事,是有人上傳一張鳥的照片選了人像動作, 成品前幾格還是鳥,接著一個男人的臉從畫面右邊長出來,對著鏡頭微笑了三秒。 上面那支是後來用授權乾淨的素材重現的,一次就重現成功,不是偶發狀況。
怎麼修。動物組的指令整段不出現 person,全部改用 the animal,
結尾再加一句 No people appear。同一張照片、同一個模型,只是換了主詞,就正常了。
現在上傳時還會做一次人臉偵測,選錯時先提醒你,但你仍然可以堅持照原樣做。
案例二:我們原本以為「原圖太小會壞掉」,實測發現沒有
幾乎每一篇這類工具的教學都會告訴你「原圖要夠清楚」。我們也這樣寫過, 所以決定驗證一次:把林肯 1863 年那張肖像壓到 96 像素寬(大概是一個 App 圖示的大小) 再放大回原尺寸,糊到細節全失,然後跟原始高解析度檔用同一個「微笑點頭」對照。
結果是:幾乎看不出差別。兩邊都笑得自然,五官沒有漂移,也沒有崩壞。 這個模型對輸入解析度的寬容度,比我們原本假設的高很多。 它顯然是先理解「這是一張人臉、五官大概在哪」,再重新生成細節, 而不是逐像素去推。
所以我們把原本寫在教學裡的「原圖太小就會壞掉」改掉了。 真正會讓成品失敗的是語意層面的不符(照片裡沒有人卻選人像動作、畫面裡有兩個主角、 臉被東西擋住),而不是畫質。手機翻拍的老照片、從通訊軟體存下來的小圖, 其實都比想像中能用。
把這一段留在網站上,是因為它比「照片要清楚」這種正確但沒用的建議更有價值。 測過才知道哪些常識是真的。
其他確實會出問題的狀況
畫面慢慢推近
模型的老毛病。反直覺的是,在指令裡寫「不要 zoom」「static shot」會讓它推得更兇。 我們量過背景位移量:不提鏡頭 6.6、寫 static shot 20.6、寫完整鎖鏡頭句子 39.2。 所以現在的指令一個字都不提鏡頭。你遇到的話,換一張構圖鬆一點的照片會改善。
手長歪、多一根手指
「揮手打招呼」最容易發生,因為手在原圖裡根本不存在,是模型憑空生出來的。 大頭照請避開這個動作,用半身照。
兩個人一起抽動
畫面裡有兩個以上的人時,模型不知道要讓誰動,常常整排一起輕微抽動, 或把相鄰兩張臉的特徵混在一起。把主角裁出來再上傳。
臉被擋住
口罩、手、麥克風擋在臉前面時,模型會把遮擋物當成臉的一部分去變形。 這是少數真的救不了的狀況,換一張照片吧。
背景的字扭曲
背景有招牌或文字時,模型會把它們當成紋理一起動。換乾淨背景的照片。
看完整的挑照片教學這些案例的素材全部是公有領域或 CC0 照片,詳細出處列在示範作品頁。 你上傳的照片不會被拿來做任何示範。