Přeskočit na obsah
Článek

Jak vytvořit AI video: moje workflow krok za krokem

Anita Avdičová

Jak vytvořit AI video, které nepůsobí jako náhodný AI slop? Ukážu vám svoje workflow od prvního konceptu přes obrázky až po finální střih.

AI video storyboard s konzistentní postavou a produktem v různých záběrech

Vytvořit AI video dnes zvládne skoro každý. Pokud ale chcete vědět, jak vytvořit AI video, které nepůsobí jako náhodný AI slop, samotný prompt nestačí.

Čím víc s AI pracuju, tím víc zjišťuju, že generování videa je vlastně jen malá část celého procesu.

Kvalita výsledku podle mě stojí hlavně na tom, co uděláte ještě před samotným generováním.

Moje workflow dnes vypadá takto:

  1. Ujasním si cíl a koncept
  2. Definuju Brand DNA
  3. Hledám reference
  4. Připravím storyboard
  5. Vygeneruju obrázky
  6. Vyberu správný AI video model
  7. Obrázky rozpohybuju
  8. Vybírám nejlepší výsledky
  9. Video sestříhám
  10. Kontroluju, jestli výsledek pořád odpovídá původnímu konceptu

Nejčastěji pracuji principem image to video. Tedy vytvořím obrázky pro jednotlivé scény a teprve potom je rozpohybuju.

Nejdřív řeším, co vlastně chci vytvořit

Nejdřív si potřebuju odpovědět na několik základních otázek:

  • Co má video sdělit?
  • Pro koho je určené?
  • Kde bude použité?
  • Jakou má mít atmosféru?
  • Co má člověk po zhlédnutí udělat nebo si zapamatovat?

AI totiž dokáže vytvořit prakticky cokoliv. To ale neznamená, že automaticky vytvoří něco dobrého.

Čím vágnější zadání jí dám, tím víc začne rozhodovat za mě.

A to nechci.

AI mi má pomoct realizovat nápad. Nemá za mě vymýšlet celý koncept.

U značek si nejdřív definuju Brand DNA

Pokud tvořím obsah pro značku, nestačí mi vědět, jaké má logo a firemní barvy.

Potřebuju znát její svět.

Brand DNA si skládám minimálně z těchto částí:

  • charakter značky
  • hodnoty
  • styl komunikace
  • vizuální styl
  • emoce
  • cílová skupina

Právě tyto prvky tvoří základ toho, jak má značka působit navenek.

Ptám se například:

  • Jak má značka působit?
  • Jaké emoce má vyvolávat?
  • Jaké světlo, barvy a prostředí k ní sedí?
  • Má být vizuálně jemná, odvážná, luxusní, hravá nebo syrová?
  • Co už by naopak bylo úplně mimo její svět?

Čím lépe mám Brand DNA nastavenou na začátku, tím snáz potom držím konzistenci napříč celou tvorbou.

Hledám reference a skládám si vizuální směr

Tady používám hodně Pinterest.

Ne proto, abych našla jeden obrázek a nechala AI vytvořit jeho kopii.

Spíš hledám jednotlivé prvky:

  • světlo
  • barevnost
  • kompozici
  • prostředí
  • styling
  • úhel kamery
  • perspektivu
  • práci s produktem
  • celkovou atmosféru

Reference hledám také u:

  • značek
  • AI tvůrců
  • reklamních kampaní
  • fashion projektů
  • Reels
  • fotografů

Důležité ale je, že reference používám jako inspiraci, ne jako podklad ke kopírování 1:1.

Připravuju storyboard

Jakmile vím, jak má video působit, rozložím si ho na jednotlivé scény.

Místo:

„Chci třicetisekundové video."

si řeknu:

„Potřebuju šest konkrétních scén."

U každé řeším:

  • co v ní bude
  • co se má stát
  • jaký bude typ záběru
  • jaké bude prostředí
  • co bude dělat postava nebo produkt
  • jak se bude pohybovat kamera
  • jak bude scéna navazovat na další

Díky tomu vím, co budu v další fázi generovat.

Nejdřív vytvořím AI obrázky pro jednotlivé scény

Tohle je podle mě nejdůležitější část celého procesu.

Generování videa vždy začíná generováním obrázků.

Pro jednotlivé scény si vytvářím dostatečné množství konzistentních obrázků.

Hlídám hlavně:

  • obličej a identitu postavy
  • vlasy
  • oblečení
  • produkt
  • prostředí
  • světlo
  • barevnost
  • různé potřebné úhly
  • návaznost mezi scénami

Nestačí mi jeden povedený obrázek.

Potřebuju si ověřit, jak bude postava nebo produkt fungovat:

  • zepředu
  • z profilu
  • v detailu
  • v polodetailu
  • v širším záběru
  • z různých úhlů podle storyboardu

Čím lépe mám připravené obrázky, tím méně potom bojuju při generování videa.

Obrázky jsou základ celého videa a jejich generování je složitější než jejich rozpohybování ve videu.

Prompt je důležitý, ale není všechno

Spousta lidí si pořád představuje, že dobrý výsledek vznikne hlavně díky jednomu geniálnímu promptu.

Tak jednoduché to není.

Výsledek ovlivňuje víc věcí:

  • správně napsaný prompt
  • zvolený model
  • reference
  • profil nebo preset
  • světlo
  • objektiv
  • úhel kamery
  • kompozice
  • předchozí obrázek, ze kterého pokračuju

Proto je důležité si ujasnit:

Jak přesně má výsledek vypadat a které prvky musím popsat nebo je dodat jako reference?

Čím přesněji zadám, co chci, tím menší prostor dávám AI, aby si scénu začala vykládat po svém.

Jaký AI model používám na video

Nepoužívám jeden model na všechno.

Model vybírám podle konkrétní scény.

Kling

Kling používám hlavně tam, kde potřebuju:

  • reklamní video
  • produktové video
  • dobrou konzistenci
  • práci s referencemi
  • konzistentní postavu nebo produkt napříč více záběry

Seedance

Seedance používám hlavně pro:

  • cinematic scény
  • výraznější atmosféru
  • zajímavější práci kamery
  • filmovější výsledek
  • přirozenější dynamiku záběru

Veo

Veo používám hlavně tehdy, když potřebuju:

  • generovaný český dialog
  • scénu, kde má postava rovnou mluvit česky

Zjednodušeně tedy:

  • reklama a produkt = Kling
  • cinematic = Seedance
  • český dialog = Veo

OpenArt, Higgsfield nebo Krea

Tady je dobré rozlišovat mezi platformou a samotným modelem.

OpenArt, Higgsfield nebo Krea jsou platformy.

Kling, Seedance nebo Veo jsou jednotlivé modely.

Já používám OpenArt, protože přes něj můžu řešit víc částí AI tvorby na jednom místě.

Pokud je ale pro vás hlavní AI video, stojí za pozornost také Higgsfield, který jde víc směrem k produkčnímu prostředí.

Krea je zase zajímavá například tehdy, když chcete rychle experimentovat a porovnávat výsledky různých modelů.

Při výběru platformy bych se dívala hlavně na:

  • jaké modely nabízí
  • kolik generování dostanu za svoje peníze
  • jestli potřebuju jen video, nebo i obrázky
  • jaké další funkce nabízí
  • jak dobře se mi v ní pracuje

Jak vytvořit AI video z obrázku

Jakmile mám připravené obrázky pro jednotlivé scény a vybraný model, přecházím k samotnému generování videa.

Tady už se moje přemýšlení mění.

  • Při generování obrázku řeším hlavně to, co chci vidět.
  • Při jeho rozpohybování řeším hlavně to, co se má stát.

V promptu proto popisuju například:

  • co udělá postava
  • kam se podívá
  • jak se pohne produkt
  • co se bude dít v pozadí
  • jak se má pohybovat kamera
  • jak rychlý má být pohyb
  • co musí během záběru zůstat konzistentní

Čím složitější akci po AI chci, tím větší šance, že něco pokazí.

Proto se snažím držet jednoduchého pravidla:

  • jedna scéna
  • jedna hlavní akce

Pokud potřebuju složitější děj, rozdělím ho do více záběrů.

Talking head většinou řeším přes video to video

Pokud chci opravdu přirozený talking head, většinou dávám přednost principu video to video.

Důvod je jednoduchý.

Mám větší kontrolu nad:

  • gesty
  • mimikou
  • pohybem těla
  • timingem
  • celkovou přirozeností projevu

Pokud ale potřebuju generovat video rovnou s českým dialogem, používám Veo.

První generace skoro nikdy není poslední

AI tvorba je pořád hodně o iteraci.

Když výsledek není dobrý, snažím se nejdřív zjistit, kde je problém.

Kontroluju:

  • vstupní obrázek
  • prompt
  • pohyb
  • model
  • kameru
  • samotný koncept scény

Pokud funguje 90 % výsledku, neměním automaticky všechno.

Snažím se opravit konkrétní problém.

A někdy je jednodušší změnit scénu než dalších dvacet generací přesvědčovat AI, aby udělala něco, co jí evidentně nejde. Vždy doporučuji nad prompty přemýšlet déle, než impulsivně vyhazovat peníze za kredity.

Finální video vzniká až při střihu

Vygenerovaný klip pro mě není hotové video.

Je to zdrojový materiál.

Ve Cap Cutu potom stříhám:

  • pořadí scén
  • délku záběrů
  • tempo
  • návaznost
  • hudbu
  • zvukové efekty
  • voiceover
  • případné další úpravy

Z několika sekund vygenerovaného videa klidně použiju jen jednu.

Stejně jako při klasické produkci.

Právě při střihu se podle mě rozhoduje, jestli výsledek působí jako několik náhodných AI generací poskládaných za sebe, nebo jako jedno promyšlené video.

Ne všechno musí být AI

Tohle je podle mě velmi důležité.

AI obsah by neměl automaticky nahradit všechno ostatní.

U značek pořád potřebujeme:

  • reálné lidi
  • výsledky
  • zákulisí
  • zkušenosti
  • důvěru
  • edukaci
  • skutečné produkty

AI obsah by měl sloužit jako podpůrný formát vedle hlavního obsahu značky. Nikdy by neměl nahrazovat hlavní obsah, který má budovat důvěru, ukazovat výsledky, reálné lidi, zákulisí, zkušenosti a edukovat.

AI podle mě dává největší smysl tam, kde klasický obsah rozšiřuje.

Například pro:

  • kreativní kampaně
  • novinky
  • akce
  • vizualizace
  • zábavné formáty
  • obsah, který by byl klasickou cestou drahý nebo složitý na produkci

Moje AI video workflow v kostce

Celý proces tedy vypadá takto:

  1. Cíl a koncept
  2. Brand DNA
  3. Reference a Pinterest
  4. Storyboard
  5. Generování konzistentních obrázků
  6. Volba správného AI video modelu
  7. Image to video
  8. Talking head případně přes video to video
  9. Iterace
  10. Výběr nejlepších výsledků
  11. Střih a postprodukce
  12. Finální kontrola proti původnímu konceptu

Samotné generování videa je tedy až někde v druhé polovině celého procesu.

Tady někde je ten rozdíl mezi kvalitním videem, za který je klient ochotný zaplatit a AI slopem, kterého jsou plné sociální sítě.

Nástroje se budou měnit.

Modely budou za půl roku jiné.

Ale schopnost vymyslet dobrý koncept, najít správné reference, připravit konzistentní obrázky a poznat, kdy výsledek opravdu funguje, zůstane.

Čím déle s AI pracuju, tím méně ji vnímám jako technickou disciplínu, ale právě jako kreativní práci.

Nejčastější otázky

Postupovala bych takto: připravit koncept, rozdělit video na jednotlivé scény, vytvořit konzistentní obrázky, vybrat vhodný AI video model, obrázky rozpohybovat, vybrat nejlepší generace a celé video sestříhat.

Obrázek použijete jako vstup pro image to video model. V promptu potom řešíte hlavně: pohyb postavy, pohyb produktu, dění v prostředí, pohyb kamery a rychlost akce.

Jeden univerzálně nejlepší podle mě neexistuje. Sama nejčastěji volím Kling pro reklamní a produktová videa, Seedance pro cinematic scény a Veo tam, kde potřebuju český dialog.

Pokud chci mít větší kontrolu nad vzhledem a konzistencí výsledku, preferuju image to video. Vizuální podobu scény si vyřeším už při generování obrázku a video model potom používám hlavně pro vytvoření pohybu.

Nemusíte. Důležitější je vědět, co přesně chcete vytvořit, a mít dobře připravené reference. Dlouhý prompt automaticky neznamená lepší výsledek.

Některé platformy nabízejí omezené kredity nebo bezplatné generování. Pokud ale chcete AI video používat pravidelně a ve vyšší kvalitě, většinou se bez placeného nástroje neobejdete.

Ano. Samotné generování je ale jen jedna část celého procesu. Výslednou kvalitu ovlivňuje hlavně koncept, kvalita obrázků, konzistence, volba správného modelu, iterace a finální střih a postprodukce.

Chcete vytvořit AI video pro vaše podnikání?

Ozvěte se mi a společně vytvoříme video, které se nebudete stydět prezentovat. A za zlomek ceny.