怎麼挑照片,才不會做出奇怪的東西
同一套模型,餵不同的照片,成品差距非常大。這頁把我們實際測出來的規律寫下來, 照著挑照片,第一次就能做出能看的成品,不用一直重試。
一、什麼照片效果最好
臉要夠大 —— 但「夠清楚」沒你想的那麼重要
臉在畫面裡最好佔到四分之一高度以上,模型才知道要動的是哪裡。 合照請把主角裁出來單獨上傳。
至於畫質:我們原本也寫「原圖要夠清楚,不然臉會漂移」,後來實際測了一次 —— 把一張肖像壓到 96 像素寬再放大回去,成品跟用原始高解析度檔的幾乎看不出差別 (對照影片在失敗案例頁)。所以手機翻拍的老照片、 從通訊軟體存下來的小圖,其實都比想像中能用。畫質當然是愈好愈好, 但它不是最關鍵的那一項。
正面或四分之三側面
完全的側面(只看得到一隻眼睛)風險最高,模型要「補」出另外半張臉,補出來的常常不像本人。 唯一的例外是「轉頭看過來」這個動作,它本來就是設計給側臉用的。
光線平均,不要一半亮一半暗
逆光、單邊強光、夜拍高 ISO 的雜訊,都會讓模型在動的時候把陰影當成五官的一部分去變形。 室內窗邊的自然光是最穩的。
一張照片只放一個主角
畫面裡有兩個以上的人,模型會不知道要讓誰動,常常兩個人一起抽動,或是把兩張臉的特徵混在一起。
避免這些
- 大面積遮擋:口罩、麥克風、手擋在臉前面 —— 拿掉遮擋物後的臉是模型「編」的
- 厚重的濾鏡或美顏:磨皮過頭的照片沒有皮膚紋理,動起來像蠟像
- 螢幕翻拍、有摩爾紋的照片:紋路會在動態中閃爍
- 已經是動畫或插畫的圖:不是不能做,但動作預設是照真人設計的,插畫的效果會比較呆
二、六個人像動作怎麼選
| 動作 | 幅度 | 最適合 | 風險 |
|---|---|---|---|
| 靜靜呼吸 | 極小 | 任何照片、畫質不好的照片 | 幾乎沒有 |
| 微笑點頭 | 小 | 面無表情的證件照 | 低 |
| 挑眉壞笑 | 小 | 五官清楚的近照 | 眉毛被遮住就看不出來 |
| 轉頭看過來 | 中 | 側臉、四分之三側臉 | 轉過來的那半張臉可能不像 |
| 開懷大笑 | 中 | 原本嘴角就有笑意 | 牙齒可能糊掉 |
| 揮手打招呼 | 大 | 半身照、肩膀以下有空間 | 手可能長歪,大頭照會被手擋住臉 |
不確定的時候一律先跑「靜靜呼吸」。它幾乎不會失敗,看過成品確定臉沒跑掉,再換大動作。
三、照片裡不是人的時候
動作清單分成「人像」和「動物・其他」兩個分頁,這個分別非常重要,不是分類好看而已。
真實案例。我們一開始只有人像動作,有人上傳了一張鳥站在樹枝上的照片,選了「靜靜呼吸」。 成品的前幾格還是鳥,接著一個陌生男人的臉從畫面右邊長出來,鏡頭推近到他臉上,他對著鏡頭微笑了三秒。
原因不是模型壞掉,是我們給了矛盾的指令:照片裡沒有人,但指令寫的是 「The person stands still and looks straight ahead…」。模型不會忽略這個 person, 它會生一個出來。
所以現在動物組的指令整段都不會出現 person 這個字,全部改用 the animal,結尾還加了一句
No people appear。同一張鳥的照片,換成動物組的「東張西望」,就乖乖只有鳥在轉頭。
另外,上傳時系統會做一次人臉偵測。如果你選了人像動作、但照片裡偵測不到人臉, 會先跳出來提醒你改用動物動作 —— 你還是可以選擇照原樣做,只是先讓你知道會發生什麼事。 偵測不準的時候(例如戴帽子的側臉)一律放行,不會擋住你。
四、常見的失敗長什麼樣,怎麼救
臉愈變愈不像本人
先確認畫面裡只有一個主角、臉沒有被擋住 —— 這兩項比解析度重要得多。 都符合的話,改用幅度最小的「靜靜呼吸」,讓模型少猜一點。
畫面慢慢推近(像鏡頭在 zoom)
這是模型的老毛病。有趣的是,在指令裡寫「不要 zoom、鎖死鏡頭、static shot」反而更嚴重—— 我們量過背景位移量:完全不提鏡頭是 6.6,寫 static shot 變成 20.6,寫完整的鎖鏡頭句子飆到 39.2。 所以現在的指令一個字都不提鏡頭。你如果還是遇到推近,換張構圖鬆一點的照片會改善。
手長歪、多一根手指
「揮手打招呼」比較容易發生。手在原圖裡看不到的時候,模型是憑空生一隻手出來。 改用不需要手的動作,或換一張手本來就入鏡的照片。
背景的東西跟著動
背景有樹葉、水面、布料這種本來就會動的東西時,模型會順手讓它們動起來。 這通常是加分的,但如果背景有文字招牌,字可能會扭曲 —— 換張乾淨背景的照片。
循環的接縫看得出來
成品是「正放 + 倒放」接起來的乒乓循環,所以接縫本身一定是連續的,不會有跳格。 但有方向性的動作(揮手、鳴叫)倒放時會有一點「倒帶感」。 在意的話選對稱性高的動作,例如呼吸、眨眼、微笑。
五、關於相框
成品下方可以套金框、木框、銀框或不套框。這個框是網頁用 CSS 疊上去的,不是模型畫的。 我們試過在指令裡描述相框,模型真的會在畫面裡畫一個金框 —— 但畫出來的框會歪、會抖、 四個角對不齊。改成網頁疊圖之後,框永遠是正的,而且你可以隨時換顏色不用重跑。
也因為這樣,你下載的 mp4 裡面不含相框,那是純粹的影片。
六、一份挑照片的檢查清單
- 臉佔畫面高度四分之一以上,看得清楚五官
- 正面或四分之三側面,兩隻眼睛都看得到
- 光線平均,沒有一半臉全黑
- 畫面裡只有一個主角
- 臉上沒有口罩、手、麥克風擋住
- 不是螢幕翻拍、沒有重度美顏
- 解析度不是關鍵,但原始檔一定比截圖好
- 第一次先跑「靜靜呼吸」確認效果