
W Grok image-to-video zaczynasz od zatwierdzonego obrazu. Pierwszy kadr ustala wygląd postaci, przedmiotów i sceny, lecz nie pokazuje ukrytej anatomii, głębi ani drogi, którą wykona dłoń. Te informacje model musi dopowiedzieć podczas animacji.
Dlatego kontrola zaczyna się przed przesłaniem pliku: wybierz obraz odpowiedni do ruchu, określ jedną zmianę i zaplanuj koniec ujęcia. Poniżej skupiamy się na pracy z pierwszym kadrem, konkretnych promptach oraz naprawianiu błędów. Parametry xAI zweryfikowano 21 września 2026 r.
Cztery różne role materiału wejściowego w Grok
| Materiał lub operacja | Co określa? |
|---|---|
| Obraz początkowy | Pierwszą klatkę w standardowym trybie obraz na wideo. |
| Obraz referencyjny | Wygląd, tożsamość lub styl; nie musi pojawić się jako pierwsza klatka. |
| Klatka końcowa | Docelowy wygląd zakończenia, do którego ma prowadzić ruch. |
| Edycja wideo | Zmianę istniejącego klipu, zamiast animacji nieruchomej grafiki. |
W API grok-imagine-video-1.5 standardowa animacja pojedynczego obrazu obsługuje 1–15 sekund oraz 480p, 720p i 1080p; domyślna rozdzielczość to 480p. Proporcje zwykle wynikają z obrazu. Wymuszenie innych może go rozciągnąć, więc przygotuj właściwy format wcześniej. API umożliwia również sterowanie generowaniem dźwięku. Dokumentacja generowania wideo.
Tryb referencyjny oraz kontrola pierwszej i ostatniej klatki w wersji 1.5 mają odrębny limit: do 15 sekund i najwyżej 720p. Nie przenoś na nie możliwości 1080p ze standardowej animacji obrazu. Dokumentacja obrazów referencyjnych i klatek granicznych.
Edycja i wydłużanie są osobnymi operacjami Imagine API; obecne przykłady używają starszego grok-imagine-video. Nie należy przypisywać ich automatycznie wersji 1.5. Parametr API nie gwarantuje też dostępności odpowiadającej mu opcji na koncie konsumenckim Grok. Opis operacji wideo API.
Pięć kroków od pierwszej klatki do czytelnego ruchu
1. Wybierz obraz, który zawiera potrzebne informacje
Szukaj jednego głównego obiektu, czytelnej twarzy, widocznych kończyn, oddzielenia od tła i stabilnego światła. Zostaw miejsce w kierunku działania. Chodzenie wymaga widocznych stóp i podłoża; reakcja twarzy — odpowiedniego zbliżenia.
Utrudnieniem są dłonie zasłaniające twarz, włosy na oczach, tłum, niejasne odbicia, skrajny skrót perspektywiczny i drobne przedmioty wymagające precyzyjnego chwytu. Usuń przypadkowe napisy i popraw anatomię. Narysowane smugi prędkości również mogą kolidować z nowym ruchem.
2. Podziel elementy na stałe, poruszane i reagujące
W przykładzie konserwator ceramiki siedzi przy stole i już trzyma lupę obok porcelanowego naczynia:
- Stałe: rysy twarzy, ubranie ochronne, profil naczynia i układ stołu.
- Poruszane: ręka lekko unosi lupę, wzrok przesuwa się po powierzchni.
- Reagujące: rękaw opada po geście, a refleks na szkle delikatnie zmienia położenie.
Porcelana pozostaje podparta na stole. Taki podział pozwala skierować uwagę na jedną czynność, zamiast animować wszystko jednocześnie.
3. Opisz zmianę, która następuje po obrazie
Zamiast ponownie opisywać wygląd pracowni, napisz: „Konserwator przez chwilę obserwuje wazon. Unosi trzymaną już lupę o kilka centymetrów i zatrzymuje ją przy dekoracji. Wzrok podąża za szkłem, rękaw osiada. Zachowaj twarz, kształt wazonu i rozmieszczenie narzędzi. Naczynie pozostaje nieruchome.”
Przykład określa kolejność i ogranicza trudny kontakt: model nie musi wymyślać chwytania lupy ani podnoszenia kruchego przedmiotu.
4. Podejmij osobną decyzję o kamerze
Do powyższego promptu można dodać „nieruchome półzbliżenie obejmujące twarz, lupę i wazon”. Najpierw oceń sam gest. Dopiero później rozważ najazd, odjazd, jazdę w bok, niewielkie okrążenie, panoramę w górę, delikatne drgania lub zmianę ostrości między wskazanymi elementami. Jeden wyraźny zamiar jest łatwiejszy do kontroli niż kilka konkurencyjnych ruchów.
5. Rozpisz czas i zakończenie
Podziel ujęcie na pauzę, czynność i zatrzymanie. W pięciosekundowej próbie możesz zaplanować sekundę obserwacji, dwie sekundy unoszenia lupy i dwie sekundy spokojnej kontroli dekoracji. To instrukcja tempa, bez gwarancji idealnej precyzji modelu. Musi mieścić się w wybranej długości klipu. Stabilny koniec daje montażyście miejsce na następne cięcie.
Sześć promptów do adaptacji
Dopasuj każdy przykład do rzeczywiście widocznego obrazu. Są to propozycje kierowania sceną, a nie gwarancja zachowania modelu.
A. Portret z mikroruchem
Dorosły księgarz z portretu lekko unosi ramiona przy oddechu, a jego wzrok przenosi się z zamkniętej książki w stronę pobliskiego okna. Następuje jedno naturalne mrugnięcie, gdy wzrok się ustabilizuje. Kamera pozostaje w tym samym bliskim kadrze. Kilka luźnych pasm włosów opada, nie zasłaniając oczu. Twarz, okulary i prosty kardigan zachowują swoje kształty w niezmienionym świetle z okna. Ostatni moment jest nieruchomy. Bez mowy, dodatkowej osoby czy cięcia kamery.
B. Przygotowanie do ruchu
Dorosły ogrodnik w stylu anime przenosi ciężar na przednią stopę i lekko pochyla się w stronę konewki spoczywającej na niskim kamiennym parapecie. Ręka zatrzymuje się tuż nad jej uchwytem, przed kontaktem. Fartuch podąża za tułowiem z niewielkim opóźnieniem. Delikatny ruch kamery w bok pozostaje wystarczająco wolny, aby obie stopy i konewka były widoczne. Twarz, fartuch, konewka i ścieżka pozostają rozpoznawalne. Końcowa poza utrzymuje się w oczekiwaniu; konewka nie jest podnoszona ani przekształcana.
C. Prezentacja produktu
Matowa butelka termiczna pozostaje pionowo na istniejącym postumencie studyjnym. Kamera kreśli krótki łuk, aby odsłonić tylko niewielką dodatkową część boku butelki. Jedno wąskie odbicie przesuwa się po zaokrąglonej górnej części butelki, podczas gdy pokrywka, sylwetka i wykończenie powierzchni zachowują swoją formę. Oświetlenie tła pozostaje stabilne. Ruch przechodzi płynnie w nieruchomy widok końcowy. Bez rąk, nowych napisów, otwierania pokrywki czy wymiany obiektu. Wybierz niewielki łuk, aby nie odsłaniać dużych niewidocznych powierzchni.
D. Spokojne otoczenie
Wzdłuż pustego przejścia w szklarni, światło słoneczne pozostaje w tym samym kierunku, podczas gdy kilka wiszących liści paproci lekko się kołysze, a następnie uspokaja. Cienka mgiełka unosi się między istniejącymi rabatami. Kamera przesuwa się tylko na krótką odległość wzdłuż otwartego przejścia, zachowując geometrię kadru i układ doniczek. Ruch pozostaje wystarczająco wolny, aby odległe drzwi pozostały czytelne. Zakończenie jest spokojne, bez pojawiania się osoby, nowych mebli czy zmienionej pory roku.
E. Reakcja bez dialogu
Dorosły archiwista biurowy słucha kogoś spoza kadru, bierze krótki oddech i lekko się uśmiecha, zanim powróci do neutralnego, uważnego wyrazu twarzy. Usta pozostają zamknięte, a ręce na biurku. Nieruchome półzbliżenie pokazuje wyraźnie twarz i kołnierz przy stałym oświetleniu pomieszczenia. Teczki i ściana za osobą zachowują swój układ. Tylko cichy dźwięk otoczenia, bez generowanych słów, bez synchronizacji ust i bez cięcia wewnątrz klipu; końcowa, uważna poza utrzymuje się krótko.
F. Przejście między pierwszą i ostatnią klatką
Pierwszy obraz przedstawia dorosłego gościa obok ławki ogrodowej; ostatni przedstawia tę samą osobę w niewielkiej odległości wzdłuż wyraźnej ścieżki. Osoba obchodzi zewnętrzną krawędź ławki i dociera do końcowej pozycji stojącej, nie przechodząc przez ławkę. Ubranie, tożsamość twarzy, nawierzchnia, kierunek światła i kierunek ruchu w kadrze pozostają spójne. Kamera nie wykonuje niezależnej orbity. Ujęcie kończy się zatrzymaniem w docelowej pozie. Ten przykład wymaga trybu pierwszej i ostatniej klatki: w opisanym API 1.5 najwyżej 720p i 15 sekund. Zwykłe przesłanie jednej grafiki nie zapewnia takiej kontroli.
Siedem problemów i celowane poprawki
- Zmienia się tożsamość: powiększ twarz w materiale wejściowym, ogranicz obrót, zasłanianie i zmiany światła.
- Ciało wygląda gumowo: sprawdź widoczność stawów; uprość ruch odsłaniający części ciała, których obraz nie pokazuje.
- Zoom zastępuje gest: ustal nieruchomą kamerę i nazwij konkretne części ciała, które mają się poruszać.
- Ruch jest zbyt mały: zastąp „ożyw scenę” mierzalnym działaniem, choćby uniesieniem przedmiotu do określonego miejsca.
- Tło się rozpływa: ogranicz zmianę perspektywy i paralaksę; złożone otoczenie pokaż w osobnym ujęciu.
- Dłonie lub przedmioty się deformują: zacznij od trzymanego już rekwizytu, zatrzymaj akcję przed kontaktem albo rozdziel przygotowanie i rezultat.
- Zakończenie nie pasuje do montażu: zaplanuj pozycję końcową, spojrzenie i kierunek ruchu względem kolejnego kadru. Sama wyższa rozdzielczość tego nie naprawi.
Siedem praktyk dla spójnej serii klipów
- Zatwierdź jeden wzorcowy wygląd postaci.
- Zachowaj krótki, niezmienny opis cech rozpoznawczych.
- Przygotowuj pierwsze klatki na podstawie tych samych referencji.
- Dokumentuj ubrania i ważne rekwizyty.
- Planuj kadrowanie, spojrzenia i kierunki ruchu między ujęciami.
- Generuj oraz oceniaj ujęcia osobno.
- Porównuj wynik z pierwotnym wzorcem, a nie tylko poprzednim klipem — inaczej drobne odchylenia mogą się kumulować.
Jeżeli błąd tkwi już w ilustracji, popraw ją przed kolejną próbą. Powtarzanie generacji wideo nie zastąpi dobrego obrazu źródłowego.
Jak planować koszt prób?
Zacznij od krótkiego, reprezentatywnego ujęcia. Wybierz najniższą rozdzielczość wystarczającą do oceny i zmieniaj jedną zmienną na próbę. Łatwy test nie odpowie jednak, czy działa trudny gest planowany do filmu. Zatwierdź ruch przed finalną generacją i zapisuj prompty oraz ustawienia.
W API koszt zależy od modelu, długości, rozdzielczości i danych wejściowych. Konsumencki Grok korzysta z uprawnień planu, a jego rozliczenie jest oddzielne od API. Sprawdzaj aktualny cennik i licz także odrzucone warianty. Generowanie może trwać kilka minut, więc budżet produkcji obejmuje również oczekiwanie.
Najczęściej zadawane pytania
Czy Grok używa przesłanego obrazu jako pierwszej klatki?
Tak w standardowym trybie obraz na wideo. Tryb referencyjny ma inne zadanie: obraz może wpływać na wygląd lub tożsamość bez odtworzenia go na początku.
Czy muszę ponownie opisywać całe zdjęcie?
Wskaż kilka cech, które muszą pozostać stałe. Resztę promptu poświęć akcji, kamerze, tempu, reakcji otoczenia i zakończeniu.
Czy Grok obsługuje pierwszą i ostatnią klatkę?
Dokumentacja trybu referencyjnego API 1.5 opisuje połączenie obrazu początkowego z parametrem last_frame. Obowiązują osobne limity 720p i 15 sekund. Dostępność w aplikacji należy sprawdzić na koncie.
Czy Grok może dodać dźwięk do animacji obrazu?
API opisuje generowanie dźwięku i możliwość żądania ciszy; obsługiwane tryby mają również dodatkowe opcje głosu. Opcje konsumenckie mogą się różnić. Obecność ścieżki nie gwarantuje poprawnej synchronizacji mowy.
Dlaczego pozornie nieruchoma postać zmienia wygląd?
Model nadal odtwarza przejściowe ustawienia i niewidoczne powierzchnie. Nieczytelna twarz, zasłanianie, silne zmiany światła oraz duży ruch zwiększają trudność zadania.
Czy można animować cudzą ilustrację chronioną prawem autorskim?
Przyjęcie pliku przez Grok nie oznacza zgody właściciela praw. Używaj własnych lub odpowiednio licencjonowanych materiałów i sprawdź warunki publikacji. Przy wizerunku prawdziwej osoby uwzględnij również jej zgodę.
Przy każdej próbie sprawdzaj jakość pierwszej klatki, czytelność gestu i przydatność zakończenia. Do eksperymentów z innym narzędziem możesz przejść na stronę przekształcania obrazu w wideo w VideoAny.