Obrazy i wideo
Generuj i edytuj zachwycające obrazy oraz wideo na podstawie promptów tekstowych i materiałów wizualnych.
Omówienie
Image & Video pozwala tworzyć wysokiej jakości materiały wizualne na podstawie prostych opisów tekstowych lub obrazów referencyjnych. Generuj statyczne obrazy albo dynamiczne filmy w dowolnym stylu, a potem dopracowuj je kolejnymi promptami, zwiększaj rozdzielczość i dodawaj synchronizację ruchu ust z audio.
Niektóre modele Image & Video oraz możliwości przesyłania materiałów są ograniczone w Stanach Zjednoczonych ze względu na wymogi prawne lub dostawców. Sprawdź opisy poszczególnych modeli, aby poznać ich dostępność.
Użytkownicy planu darmowego mogą generować tylko obrazy i są ograniczeni do trzech zapytań o obrazy dziennie. Generowanie filmów wymaga płatnego planu. Generowanie przez API wymaga planu Pro lub wyższego. W przypadku zapytań API modele ByteDance są domyślnie wyłączone i wymagają wyraźnej zgody przed użyciem. Klienci Enterprise mogą skontaktować się z pomocą techniczną, aby poprosić o dostęp.
Najważniejsze możliwości
- Generowanie obrazów: Twórz wysokiej jakości obrazy z promptów tekstowych lub obrazów referencyjnych, korzystając z modeli zoptymalizowanych pod kątem szybkości lub jakości
- Generowanie filmów: Generuj dynamiczne filmy z kinowym ruchem, realistyczną fizyką i zintegrowanym audio. Generowanie filmów jest dostępne tylko w płatnych planach
- Iteracyjne dopracowywanie: Dopracowuj generacje dodatkowymi promptami i twórz warianty
- Narzędzia ulepszające: Zwiększaj rozdzielczość nawet 4x i stosuj realistyczną synchronizację ruchu ust z audio
- Wiele modeli: Korzystaj ze specjalistycznych modeli do różnych zastosowań — od szybkich iteracji po treści gotowe do produkcji
- Obsługa materiałów referencyjnych: Kieruj generowaniem za pomocą klatek początkowych, końcowych i referencji stylu. Obsługuje wiele formatów obrazów, w tym JPG, PNG, WEBP i inne
- Elastyczny eksport: Pobieraj jako osobne pliki lub importuj bezpośrednio do projektów ElevenCreative Studio
Workflow
Proces tworzenia prowadzi od inspiracji do gotowego materiału w czterech etapach:
Odkrywaj: Przeglądaj materiały społeczności, by znaleźć inspirację i poznać skuteczne prompty.
Generuj: W polu promptu opisz, co chcesz stworzyć, wybierz model i dostosuj ustawienia.
Dopracowuj i ulepszaj: Przeglądaj generacje, twórz warianty i stosuj ulepszenia, takie jak zwiększanie rozdzielczości i synchronizacja ruchu ust.
Eksportuj: Pobieraj gotowe materiały lub wysyłaj je bezpośrednio do ElevenCreative Studio.
Obsługiwane formaty pobierania
Wideo:
- MP4: Kodeki H.264, H.265. Jakość do 4K (z upscalingiem)
Obraz:
- PNG: Wynik w wysokiej rozdzielczości, bez strat
Modele
Image & Video daje dostęp do wyspecjalizowanych modeli zoptymalizowanych pod różne zastosowania. Każdy model oferuje inne możliwości — od szybkiego iterowania po jakość gotową do produkcji.
Modele postprocessingu wymagają istniejącego wygenerowanego materiału, ale możesz też przesłać własny plik obrazu lub wideo.
Administratorzy obszarów roboczych Enterprise mogą kontrolować, które modele generowania obrazów i wideo są dostępne dla członków obszaru roboczego. Domyślnie wszystkie modele są wyłączone w obszarach roboczych Enterprise i muszą zostać wyraźnie włączone przez administratorów. Dowiedz się więcej o zatwierdzaniu modeli.
W przypadku żądań API modele ByteDance są domyślnie wyłączone i wymagają wyraźnej zgody przed użyciem. Klienci Enterprise mogą skontaktować się z pomocą techniczną, aby poprosić o dostęp.
Każdy z poniższych modeli jest dostępny w aplikacji Image & Video. Modele, które można też wywołać przez
Image & Video API, mają podane model_id w sekcji
API; pozostałe są dostępne tylko w aplikacji.
Generatywne modele wideo
Seedance 2.0
Ujednolicony multimodalny model wideo ze wspólnym generowaniem audio i wideo, oferujący reżyserską kontrolę nad grą aktorską, oświetleniem, cieniem i ruchem kamery, aby uzyskać ultrarealistyczne, filmowe efekty.
Materiały wejściowe do generowania:
- Tekst na wideo
- Pierwsza klatka
- Ostatnia klatka
- Referencje obrazów
- Referencje wideo
- Referencje audio
Funkcje:
- Ujednolicona architektura multimodalna, która jednocześnie generuje zsynchronizowane audio i wideo w jednym przebiegu
- Wiodące w branży możliwości pracy z referencjami multimodalnymi i edycji, z równoczesną obsługą tekstu, obrazu, audio i wideo
- Wyjątkowa stabilność ruchu z realizmem na poziomie filmowym, zgodnym ze standardami branżowymi
- Reżyserska kontrola twórcza nad grą aktorską, oświetleniem, cieniem i ruchem kamery
- Elastyczna długość generowania od 4 s do 15 s
- Natywna kontrola dźwięku — audio można włączyć lub wyłączyć dla każdego generowania
- Tworzenie wsadowe — do 4 generowań naraz
Opcje wyjścia:
- Rozdzielczości: 480p, 720p, 1080p
- Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
Najlepsze do:
- Filmowego storytellingu wymagającego zsynchronizowanego audio i obrazu
- Treści opartej na referencjach, która ściśle trzyma się obrazów, wideo lub audio źródłowego
- Profesjonalnych produkcji wymagających precyzyjnej kontroli oświetlenia i pracy kamery
Koszt: Zależy od wybranych ustawień i długości
Ustawienia można przełączać, aby dostosować zużycie kredytów.
Seedance 2.0 nie jest dostępny w Stanach Zjednoczonych.
Seedance 2.0 Fast
Szybszy i tańszy wariant Seedance 2.0 z tymi samymi multimodalnymi materiałami referencyjnymi, z wyjściem ograniczonym do 720p.
Materiały wejściowe do generowania:
- Tekst na wideo
- Pierwsza klatka
- Ostatnia klatka
- Referencje obrazów (do 9)
- Referencje wideo (do 3, łącznie 15 s)
- Referencje audio (do 3, łącznie 15 s)
Funkcje:
- Ta sama obsługa referencji co w Seedance 2.0, z łącznym limitem 12 referencji na generowanie
- Klatki i referencje wzajemnie się wykluczają: użyj pierwszej lub ostatniej klatki albo referencji, nie obu opcji
- Elastyczna długość generowania od 4 s do 15 s
- Natywna kontrola dźwięku — audio można włączyć lub wyłączyć dla każdego generowania
- Tworzenie wsadowe — do 4 generowań naraz
Opcje wyjścia:
- Rozdzielczości: 480p, 720p
- Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
Najlepsze do:
- Iterowania promptów Seedance 2.0 przed renderowaniem w pełnej rozdzielczości
- Klipów opartych na referencjach, dla których wystarcza 720p
Koszt: Zależy od wybranych ustawień i długości
API: bytedance-seedance-v2-fast
Seedance 2.0 Fast nie jest dostępny w Stanach Zjednoczonych.
Seedance 2.0 Mini
Najmniejszy wariant Seedance 2.0: około dwa razy szybszy od Seedance 2.0 przy mniej więcej połowie kosztu, z tymi samymi materiałami wejściowymi i wyjściem 720p.
Materiały wejściowe do generowania:
- Tekst na wideo
- Pierwsza klatka
- Ostatnia klatka
- Referencje obrazów (do 9)
- Referencje wideo (do 3, łącznie 15 s)
- Referencje audio (do 3, łącznie 15 s)
Funkcje:
- Ta sama obsługa referencji co w Seedance 2.0, z łącznym limitem 12 referencji na generowanie
- Klatki i referencje wzajemnie się wykluczają: użyj pierwszej lub ostatniej klatki albo referencji, nie obu opcji
- Elastyczna długość generowania od 4 s do 15 s
- Natywna kontrola dźwięku — audio można włączyć lub wyłączyć dla każdego generowania
- Tworzenie wsadowe — do 4 generowań naraz
Opcje wyjścia:
- Rozdzielczości: 480p, 720p
- Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
Najlepsze do:
- Szkiców i podglądów na dużą skalę
- Workflowów wrażliwych na koszt, które nadal wymagają audio i materiałów referencyjnych
Koszt: Zależy od wybranych ustawień i długości
API: bytedance-seedance-v2-mini
Seedance 2.0 Mini nie jest dostępny w Stanach Zjednoczonych.
Seedance 2.5
Następca Seedance 2.0 z ostrzejszym realizmem, do 50 łącznych referencji obrazów, wideo i audio oraz generowaniem do 30 sekund.
Materiały wejściowe do generowania:
- Tekst na wideo
- Pierwsza klatka
- Ostatnia klatka
- Referencje obrazów (do 30)
- Referencje wideo (do 10, łącznie 30 s)
- Referencje audio (do 10, łącznie 30 s)
Funkcje:
- Brak łącznego limitu między typami referencji; referencje wyłącznie audio są akceptowane bez obrazu lub wideo
- Klatki i referencje wzajemnie się wykluczają
- Elastyczna długość generowania od 4 s do 30 s
- Proporcje obrazu są pobierane z pierwszej klatki lub referencyjnego wideo, jeśli je podano
- Natywna kontrola dźwięku — audio można włączyć lub wyłączyć dla każdego generowania
- Tworzenie wsadowe — do 4 generowań naraz
Opcje wyjścia:
- Rozdzielczości: 480p, 720p
- Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
Najlepsze do:
- Dłuższych klipów, które muszą zachować spójność z wieloma referencjami
- Scen dialogowych i aktorskich opartych na referencyjnym audio
Koszt: Zależy od wybranych ustawień i długości
Seedance 2.5 nie udostępnia kontroli ziarna.
Seedance 2.5 nie jest dostępny w Stanach Zjednoczonych.
Seedance 2.5 Video Edit
Edytuje istniejące wideo na podstawie opisu zmian. Długość i proporcje obrazu wyjścia są zgodne z wejściowym wideo.
Materiały wejściowe do generowania:
- Wideo do edycji (wymagane, do 30 s)
- Prompt tekstowy opisujący edycję
- Referencje obrazów (do 30)
- Dodatkowe referencje wideo (do 10, łącznie 30 s)
- Referencje audio (do 10, łącznie 30 s)
Funkcje:
- Brak kontroli długości: wyjście ma długość wejściowego wideo
- Proporcje obrazu są pobierane z wejściowego wideo
- Natywna kontrola dźwięku — audio można włączyć lub wyłączyć dla każdego generowania
- Tworzenie wsadowe — do 4 generowań naraz
Opcje wyjścia:
- Rozdzielczości: 480p, 720p
Najlepsze do:
- Zmiany stroju, rekwizytów, oświetlenia lub miejsca w istniejącym materiale
- Transferu stylu, który zachowuje oryginalny ruch
Koszt: Zależy od wybranych ustawień i długości
Seedance 2.5 Video Edit nie jest dostępny w Stanach Zjednoczonych.
Seedance 2.5 Video Extend
Kontynuuje istniejące wideo od miejsca, w którym się kończy, zgodnie z promptem i opcjonalnymi referencjami.
Materiały wejściowe do generowania:
- Wideo do rozszerzenia (wymagane, do 30 s)
- Prompt tekstowy opisujący kontynuację
- Referencje obrazów (do 30)
- Dodatkowe referencje wideo (do 10, łącznie 30 s)
- Referencje audio (do 10, łącznie 30 s)
Funkcje:
- Długość rozszerzenia od 4 s do 30 s
- Proporcje obrazu są pobierane z wejściowego wideo
- Natywna kontrola dźwięku — audio można włączyć lub wyłączyć dla każdego generowania
- Tworzenie wsadowe — do 4 generowań naraz
Opcje wyjścia:
- Rozdzielczości: 480p, 720p
Najlepsze do:
- Wydłużania ujęcia, które kończy się zbyt wcześnie
- Łączenia kilku generowań w dłuższą sekwencję
Koszt: Zależy od wybranych ustawień i długości
Seedance 2.5 Video Extend nie jest dostępny w Stanach Zjednoczonych.
Kling 3.0
Zaawansowany model wideo działający jak reżyser AI, który zachowuje wysoką spójność postaci, przedmiotów i scen przy złożonych ruchach kamery.
Materiały wejściowe do generowania:
- Tekst na wideo
- Pierwsza klatka
- Ostatnia klatka
Funkcje:
- Wierne zachowanie postaci i scen dzięki wielokątnym referencjom obrazów lub wideo
- Natywne wspólne generowanie audio i obrazu z wielojęzycznym lip-sync oraz dźwiękami otoczenia
- Elastyczna długość generowania od 3 s do 15 s
- Generowanie do 4 wariantów jednocześnie
- Lepsza obsługa tekstu, dynamiki płynów i złożonych interakcji fizycznych
Opcje wyjścia:
- Rozdzielczości: tylko 1080p
- Proporcje obrazu: 16:9, 1:1, 9:16
Najlepsze do:
- Storytellingu opartego na postaciach, który wymaga ciągłości wizualnej
- Reklam i materiałów z konkretnymi wymaganiami dotyczącymi renderowania tekstu
Koszt: Zależy od wybranych ustawień i długości
Obsługuje negatywne prompty zapewniające precyzyjną kontrolę. Dźwięk można włączyć lub wyłączyć dla każdego generowania.
Kling 3.0 nie jest dostępny w Stanach Zjednoczonych.
Kling O3
Model wideo o wysokiej spójności, działający jak reżyser AI i zachowujący tożsamość postaci, przedmiotów oraz scen przy złożonych ruchach kamery.
Materiały wejściowe do generowania:
- Tekst na wideo
- Pierwsza klatka
- Ostatnia klatka
- Referencja wideo
- Referencja obrazu
Funkcje:
- Zachowuje dokładną tożsamość wizualną głównych postaci i przedmiotów dzięki referencjom z wielu kątów
- Obsługuje płynne generowanie o długości od 3 s do 15 s
- Generowanie do 4 wariantów naraz
- Dokładne modelowanie interakcji elementów i spójności ruchu
- Natywna obsługa włączonego lub wyłączonego audio dla każdego generowania
Opcje wyjścia:
- Rozdzielczości: tylko 1080p
- Proporcje obrazu: 16:9, 1:1, 9:16
Najlepsze do:
- Storytellingu opartego na postaciach, wymagającego ścisłej ciągłości wizualnej
- Profesjonalnych materiałów marketingowych i brandowych ze spójnym renderowaniem przedmiotów
Koszt: Zależy od wybranych ustawień i długości
Ustawienia można przełączać, aby dostosować zużycie kredytów.
Kling O3 nie jest dostępny w Stanach Zjednoczonych.
Kling O3 Edit
Model do edycji wideo na wideo sterowany językiem naturalnym, oparty na architekturze O3. Umożliwia złożone transformacje wizualne — takie jak zamiana postaci i środowiska — bez ręcznego maskowania ani zmian klatka po klatce.
Materiały wejściowe do generowania:
- Źródłowe wideo
- Referencje obrazów (do 4 różnych elementów/kątów)
- Opis tekstowy (instrukcje w języku naturalnym)
Funkcje:
- Interpretuje konwersacyjne prompty, aby zastępować obiekty lub otoczenie z zachowaniem oryginalnej struktury ruchu
- Zachowuje oryginalne kąty kamery, wzorce ruchu i relacje przestrzenne przez całą edycję
- Łączy do 4 elementów łącznie, w tym obrazy frontalne i z wielu kątów, aby zapewnić wierną spójność postaci
- Możliwość zachowania oryginalnego audio źródłowego lub generowania cichego wyjścia dla każdego generowania
- Generowanie do 4 edytowanych wariantów naraz
Opcje wyjścia:
- Rozdzielczości: zależne od źródłowego wideo
- Proporcje obrazu: zgodne ze źródłowym wideo
Najlepsze do:
- Wiernej zamiany postaci w istniejącym materiale z zachowaniem oryginalnych ruchów
- Pełnej transformacji otoczenia sceny (np. zmiany dziennego miasta w futurystyczny nocny krajobraz)
- Stosowania transferu stylu wymagającego ścisłego zachowania istniejącej dynamiki kamery
Koszt: Zależy od długości wideo i wybranych ustawień
Kling O3 Edit nie jest dostępny w Stanach Zjednoczonych.
Google Veo 3.1
Model klasy profesjonalnej do wysokiej jakości, filmowego generowania wideo.
Materiały wejściowe do generowania:
- Tekst na wideo
- Pierwsza klatka
- Ostatnia klatka
- Referencje obrazów
Funkcje:
- Doskonała jakość i kontrola twórcza dzięki negatywnym promptom
- W pełni zintegrowane i zsynchronizowane audio
- Realistyczne dialogi, lip-sync i efekty dźwiękowe
- Stałe długości: 4 s, 6 s i 8 s
- Tworzenie wsadowe — do 4 generowań naraz
- Dedykowana kontrola dźwięku
Opcje wyjścia:
- Rozdzielczości: 720p, 1080p
- Proporcje obrazu: 16:9, 9:16
Najlepsze do:
- Wysokiej jakości, filmowego generowania wideo z pełną kontrolą twórczą
Koszt: Zależy od wybranych ustawień i długości
API: veo-3.1-generate-001
Włączenie lub wyłączenie dźwięku zmienia liczbę kredytów za generowanie.
Google Veo 3.1 Fast
Szybki model zoptymalizowany pod błyskawiczne podglądy i generowanie, zapewniający ostrzejszy obraz przy mniejszych opóźnieniach.
Materiały wejściowe do generowania:
- Tekst na wideo
- Pierwsza klatka
- Ostatnia klatka
Funkcje:
- Zaawansowana kontrola twórcza z negatywnymi promptami i dedykowaną kontrolą dźwięku
- Stałe długości: 4 s, 6 s i 8 s
- Tworzenie wsadowe — do 4 generowań naraz
- Dokładnie modeluje fizykę świata rzeczywistego, zapewniając realistyczny ruch i interakcje
Opcje wyjścia:
- Rozdzielczości: 720p, 1080p
- Proporcje obrazu: 16:9, 9:16
Najlepsze do:
- Szybkiego iterowania i testowania wizualizacji A/B
- Dynamicznego tworzenia treści do mediów społecznościowych
Koszt: Zależy od wybranych ustawień i długości
Google Veo 3.1 Lite
Ekonomiczny, szybki wariant Veo 3.1 zoptymalizowany pod szybkie generowanie przy mniejszym zużyciu mocy obliczeniowej.
Materiały wejściowe do generowania:
- Tekst na wideo
- Pierwsza klatka
Funkcje:
- Precyzyjna kontrola twórcza z negatywnymi promptami i dedykowaną kontrolą dźwięku
- Stałe długości: 4 s, 6 s i 8 s
- Tworzenie wsadowe — do 4 generowań naraz
Opcje wyjścia:
- Rozdzielczości: 720p
- Proporcje obrazu: 16:9, 9:16
Najlepsze do:
- Tworzenia dużej liczby treści, gdy priorytetem są szybkość i oszczędność
- Szybkiego sprawdzania koncepcji i podglądów
Koszt: Zależy od wybranych ustawień i długości
Gemini Omni Flash 1.1
Model wideo Google uwzględniający fizykę, z natywnym audio, wyjściem do 4K oraz interpolacją klatek i generowaniem sterowanym referencjami.
Materiały wejściowe do generowania:
- Tekst na wideo
- Pierwsza klatka
- Ostatnia klatka
- Referencje obrazów (do 10)
- Referencje wideo (do 3, każde do 10 s)
Funkcje:
- Klatki i referencje wzajemnie się wykluczają: interpoluj między klatkami albo użyj referencji jako wskazówek
- Stała długość od 3 s do 10 s; długość jest zgodna z referencyjnym wideo, jeśli je dołączono
- Dobre renderowanie krótkiego tekstu i etykiet na ekranie
- Tworzenie wsadowe — do 4 generowań naraz
Opcje wyjścia:
- Rozdzielczości: 360p, 720p, 1080p, 4K
- Proporcje obrazu: 16:9, 9:16
Najlepsze do:
- Materiałów objaśniających i typografii kinetycznej z czytelnym tekstem
- Ruchu opartego na fizyce ze spójnymi obiektami w różnych referencjach
Koszt: Zależy od wybranych ustawień i długości
Gemini Omni Flash 1.1 Extend
Kontynuuje istniejące wideo od miejsca, w którym się kończy, przy użyciu Gemini Omni Flash 1.1, do łącznej długości 40 sekund.
Materiały wejściowe do generowania:
- Wideo do rozszerzenia (wymagane, do 30 s)
- Prompt tekstowy opisujący kontynuację
Funkcje:
- Długość rozszerzenia od 3 s do 10 s
- Proporcje obrazu są zgodne z wejściowym wideo
- Tworzenie wsadowe — do 4 generowań naraz
Opcje wyjścia:
- Rozdzielczości: 360p, 720p, 1080p, 4K
Najlepsze do:
- Wydłużania generowań Gemini Omni Flash bez widocznego cięcia
- Tworzenia sekwencji dłuższych, niż pozwala pojedyncze generowanie
Koszt: Zależy od wybranych ustawień i długości
Gemini Omni Flash
Pierwszy model wideo Gemini Omni: ruch uwzględniający fizykę, natywne audio i najlepsze renderowanie tekstu na ekranie spośród dostępnych modeli wideo, w 720p.
Materiały wejściowe do generowania:
- Tekst na wideo
- Referencje obrazów (do 8)
- Referencja wideo (1, do 10 s)
Funkcje:
- Stała długość od 3 s do 10 s; długość jest zgodna z referencyjnym wideo, jeśli je dołączono
- Bez pierwszej i ostatniej klatki; zamiast tego użyj referencji obrazów, aby zakotwiczyć obiekt
- Tworzenie wsadowe — do 4 generowań naraz
Opcje wyjścia:
- Rozdzielczości: 720p
- Proporcje obrazu: 16:9, 9:16
Najlepsze do:
- Krótkich podpisów, tytułów i opisów z etykietami
- Spójności wielu obrazów w 720p
Koszt: Zależy od wybranych ustawień i długości
Seedance 1.5 Pro
Ulepszony, wyspecjalizowany model do tworzenia dynamicznych sekwencji o wysokiej jakości, z lepszą stabilnością czasową i precyzyjną kontrolą przejść między klatkami kluczowymi.
Dane wejściowe generowania:
- Tekst na wideo
- Klatka początkowa
- Klatka końcowa
Funkcje:
- Płynnie łączy klatki początkową i końcową w spójne sekwencje wieloujęciowe
- Wysokiej jakości modelowanie złożonych działań i spójności otoczenia
- Obsługuje stałe długości generowania od 4 s do 12 s
- Generuj do 4 wariantów naraz
- Natywna obsługa włączania lub wyłączania dźwięku dla każdego generowania
Opcje wyjściowe:
- Rozdzielczości: 420p, 720p
- Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Opowieści i scen akcji wymagających stabilnej fizyki między konkretnymi punktami wizualnymi
- Filmowych przejść i profesjonalnych materiałów wideo ze ścisłymi wymaganiami dotyczącymi początku i końca
Koszt: Zależy od wybranych ustawień i długości
Seedance 1.5 Pro jest wycofywany. ByteDance wycofa model 11 listopada 2026 r. i nie jest on już oferowany do nowych generowań. Zamiast niego użyj modelu Seedance 2.0. Seedance 1.5 Pro nie jest dostępny w Stanach Zjednoczonych.
FLUX 3
Model wideo Black Forest Labs z naturalnym ruchem, scenami wieloujęciowymi, generowanym dźwiękiem i rozszerzaniem wideo.
Dane wejściowe generowania:
- Tekst na wideo
- Klatka początkowa
- Klatka końcowa
- Wideo do rozszerzenia (1, maks. 15 s)
Funkcje:
- Rozszerzanie wideo wyklucza użycie klatek początkowej i końcowej
- Elastyczne długości generowania od 5 s do 20 s
- Natywna kontrola dźwięku z możliwością włączenia lub wyłączenia dla każdego generowania
- Tworzenie wsadowe do 4 generowań naraz
Opcje wyjściowe:
- Rozdzielczości: 720p, 1080p
- Proporcje obrazu: 21:9, 2:1, 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Scen wieloujęciowych z jednego promptu
- Rozszerzania istniejącego klipu z pasującym ruchem i dźwiękiem
Koszt: Zależy od wybranych ustawień i długości
MiniMax H3
Flagowy model wideo MiniMax z multimodalnymi materiałami referencyjnymi, generowanym dźwiękiem i materiałem wyjściowym do 4K.
Dane wejściowe generowania:
- Tekst na wideo
- Klatka początkowa
- Klatka końcowa
- Obrazy referencyjne (do 9)
- Wideo referencyjne (do 3, każde od 2 s do 15 s, łącznie 15 s)
- Audio referencyjne (do 3, każde od 2 s do 15 s, łącznie 15 s)
Funkcje:
- Łączny limit to 12 materiałów referencyjnych na generowanie; audio referencyjne wymaga co najmniej jednego obrazu lub wideo referencyjnego
- Klatki i materiały referencyjne wzajemnie się wykluczają
- Elastyczne długości generowania od 5 s do 15 s
- Generuje zsynchronizowany dźwięk
- Tworzenie wsadowe do 4 generowań naraz
Opcje wyjściowe:
- Rozdzielczości: 480p, 768p, 2K, 4K (2K i 4K są skalowane w górę z 768p)
- Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Scen opartych na materiałach referencyjnych, wymagających dostarczenia w wysokiej rozdzielczości
- Klipów z dialogami opartych na audio referencyjnym
Koszt: Zależy od wybranych ustawień i długości
MiniMax H3 nie jest dostępny w Stanach Zjednoczonych.
MiniMax H3 Max
Niemal natychmiastowy wariant MiniMax H3 z tymi samymi danymi wejściowymi i dobrą estetyką, renderowany natywnie w rozdzielczości do 768p.
Dane wejściowe generowania:
- Tekst na wideo
- Klatka początkowa
- Klatka końcowa
- Obrazy referencyjne (do 9)
- Wideo referencyjne (do 3, każde od 2 s do 15 s, łącznie 15 s)
- Audio referencyjne (do 3, każde od 2 s do 15 s, łącznie 15 s)
Funkcje:
- Łączny limit to 12 materiałów referencyjnych na generowanie; audio referencyjne wymaga co najmniej jednego obrazu lub wideo referencyjnego
- Klatki i materiały referencyjne wzajemnie się wykluczają
- Elastyczne długości generowania od 5 s do 15 s
- Generuje zsynchronizowany dźwięk
- Tworzenie wsadowe do 4 generowań naraz
Opcje wyjściowe:
- Rozdzielczości: 480p, 768p
- Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Szybkiego iterowania promptów i materiałów referencyjnych
- Podglądów przed renderowaniem w MiniMax H3
Koszt: Zależy od wybranych ustawień i długości
MiniMax H3 Max nie jest dostępny w Stanach Zjednoczonych.
Kling O1
Zaawansowany model wideo z rozumowaniem, stworzony z myślą o doskonałym trzymaniu się promptów i złożonej symulacji świata fizycznego. Wykorzystuje zaawansowane przetwarzanie logiczne do interpretowania i wykonywania złożonych instrukcji.
Dane wejściowe generowania:
- Tekst na wideo (opis)
- Klatka początkowa i klatka końcowa
- Wideo referencyjne
- Obraz referencyjny
Funkcje:
- Wyjątkowo dobrze interpretuje wielowarstwowe prompty i wykonuje złożone działania chronologiczne
- Wykorzystuje obrazy i wideo jako wizualne punkty odniesienia, by zachować wysoką spójność postaci i scen
- Doskonałe modelowanie interakcji fizycznych, zależności przyczynowo-skutkowych i dynamiki płynów
- Obsługuje wysokiej jakości generowanie klipów 5 s i 10 s
- Generuj do 4 wariantów naraz
Opcje wyjściowe:
- Rozdzielczości: zależne od danych wejściowych
- Proporcje obrazu: 16:9, 1:1, 9:16
Idealne do:
- Bardzo konkretnych koncepcji kreatywnych wymagających precyzyjnego trzymania się długich, szczegółowych opisów
- Profesjonalnych opowieści, w których kluczowe są fizyczny realizm i spójność wielu materiałów referencyjnych
Koszt: Zależy od wybranych ustawień i długości
Kling O1 nie jest dostępny w Stanach Zjednoczonych.
Kling O1 Edit
Model do edycji wideo na wideo sterowany językiem naturalnym, który umożliwia złożone transformacje wizualne — takie jak wymiana postaci i otoczenia — bez ręcznego maskowania ani korekt klatka po klatce.
Dane wejściowe generowania:
- Wideo źródłowe
- Obrazy referencyjne (do 4 różnych elementów/kątów)
- Opis tekstowy (instrukcje w języku naturalnym)
Funkcje:
- Interpretuje konwersacyjne prompty, by zastępować obiekty lub otoczenie z zachowaniem oryginalnej struktury ruchu
- Zachowuje oryginalne kąty kamery, wzorce ruchu i relacje przestrzenne podczas całej edycji
- Łączy do 4 elementów łącznie (w tym obrazy frontalne i z wielu kątów), aby zapewnić wysoką spójność postaci
- Możesz zachować oryginalny dźwięk źródłowy lub wygenerować cichy materiał wyjściowy dla każdego generowania
- Generuj do 4 edytowanych wariantów naraz
Opcje wyjściowe:
- Rozdzielczości: zależne od wideo źródłowego
- Proporcje obrazu: zgodne z wideo źródłowym
Idealne do:
- Wysokiej jakości wymiany postaci w istniejącym materiale przy zachowaniu oryginalnych ruchów
- Pełnej transformacji otoczenia sceny (np. zmiany dziennego miasta w futurystyczny nocny krajobraz)
- Stosowania transferu stylu wymagającego ścisłego zachowania istniejącej dynamiki kamery
Koszt: Zależy od długości wideo i wybranych ustawień
Kling O1 Edit nie jest dostępny w Stanach Zjednoczonych.
Kling 2.6 Motion Control
Wyspecjalizowany model do precyzyjnego transferu ruchu, który pozwala sterować obrazem postaci za pomocą referencyjnego wideo, aby odtworzyć konkretne ruchy, gesty i kąty kamery.
Dane wejściowe generowania:
- Obraz postaci (źródło)
- Wideo ruchu (materiał referencyjny)
- Opis tekstowy (opcjonalnie)
Funkcje:
- Wybierz “Match Video”, aby dokładnie odtworzyć ruch, lub “Match Image”, aby dodać postaci nowy kreatywny ruch
- Obsługuje do 30 s w trybie Match Video i 10 s w trybie Match Image
- Wysokiej jakości odwzorowanie ruchu człowieka z materiału referencyjnego na nieruchomą postać
- Natywna obsługa włączania lub wyłączania dźwięku dla każdego generowania
- Generuj do 4 wariantów naraz
Opcje wyjściowe:
- Rozdzielczości: zależne od źródła
- Proporcje obrazu: zależne od źródła
Idealne do:
- Odtwarzania złożonej choreografii lub konkretnych ruchów na własnej postaci
- Długich animacji postaci wymagających wiernego odwzorowania ruchu
- Treści do mediów społecznościowych opartych na popularnych ruchach z wideo
Koszt: Zależy od wybranych ustawień i długości
Kling 2.6 Motion Control nie jest dostępny w Stanach Zjednoczonych.
Kling 3.0 Motion Control
Wyspecjalizowany model do precyzyjnego transferu ruchu oparty na architekturze Kling 3.0. Pozwala sterować obrazem postaci za pomocą referencyjnego wideo, aby z większą wiernością odtworzyć konkretne ruchy, gesty i kąty kamery.
Dane wejściowe generowania:
- Obraz postaci (źródło)
- Wideo ruchu (materiał referencyjny)
- Opis tekstowy (opcjonalnie)
Funkcje:
- Wybierz “Match Video”, aby dokładnie odtworzyć ruch, lub “Match Image”, aby dodać postaci nowy kreatywny ruch
- Obsługuje do 30 s w trybie Match Video i 10 s w trybie Match Image
- Wysokiej jakości odwzorowanie ruchu człowieka z materiału referencyjnego na nieruchomą postać
- Natywna obsługa włączania lub wyłączania dźwięku dla każdego generowania
- Generuj do 4 wariantów naraz
Opcje wyjściowe:
- Rozdzielczości: zależne od źródła
- Proporcje obrazu: zależne od źródła
Idealne do:
- Odtwarzania złożonej choreografii lub konkretnych ruchów na własnej postaci
- Długich animacji postaci wymagających wiernego odwzorowania ruchu
- Treści do mediów społecznościowych opartych na popularnych ruchach z wideo
Koszt: Zależy od wybranych ustawień i długości
Kling 3.0 Motion Control nie jest dostępny w Stanach Zjednoczonych.
Kling 2.6
Zoptymalizowany model generatywny zaprojektowany z myślą o większej wierności ruchu i płynniejszych przejściach, łączący szybką iterację z materiałem wizualnym o jakości produkcyjnej.
Dane wejściowe generowania:
- Tekst na wideo
- Klatka początkowa (obraz na wideo)
Funkcje:
- Ulepszona dynamika ruchu: znacznie płynniejszy ruch i bardziej realistyczne interakcje fizyczne
- Elastyczna kontrola dźwięku: natywna obsługa włączania lub wyłączania dźwięku dla każdego generowania
- Tworzenie wsadowe: generuj do 4 wariantów jednocześnie
- Precyzyjne dopracowanie: zaawansowana kontrola kreatywna dzięki obsłudze negatywnych promptów
- Stałe długości: obsługuje generowanie o długości 5 s i 10 s
Opcje wyjściowe:
- Rozdzielczości: zależne od danych wejściowych
- Proporcje obrazu: 16:9, 1:1, 9:16
Idealne do:
- Dynamicznych klipów wymagających płynnego ruchu postaci
- Profesjonalnych treści do mediów społecznościowych z dobrym trzymaniem się promptów
Koszt: Zależy od wybranych ustawień i długości
Kling 2.6 nie jest dostępny w Stanach Zjednoczonych.
Kling 2.5
Zrównoważony i wszechstronny model do generowania wysokiej jakości wideo w Full HD.
Dane wejściowe generowania:
- Tekst na wideo
- Klatka początkowa
Funkcje:
- Doskonale symuluje złożony ruch i realistyczną fizykę
- Precyzyjnie modeluje dynamikę płynów i ekspresję
- Stałe długości: 5 s i 10 s
- Tworzenie wsadowe do 4 generowań naraz
Opcje wyjściowe:
- Rozdzielczości: 1080p
- Proporcje obrazu: 16:9, 1:1, 9:16
Idealne do:
- Realistycznych symulacji fizycznych i złożonego ruchu
Koszt: Zależy od wybranych ustawień i długości
Klatka końcowa nie jest obecnie obsługiwana. Nie można podać obrazów referencyjnych. Kontrola dźwięku jest niedostępna.
Kling 2.5 nie jest dostępny w Stanach Zjednoczonych.
Runway Gen-4.5
Najnowocześniejsza jakość ruchu, zgodność z promptami i wierność wizualna dla filmowego, bardzo realistycznego wideo.
Dane wejściowe generowania:
- Tekst na wideo
- Klatka początkowa (obraz na wideo)
Funkcje:
- Wyjątkowa jakość ruchu z czołowym w branży realizmem i symulacją fizyki
- Doskonałe trzymanie się promptów dla precyzyjnej kontroli kreatywnej nad złożonymi scenami
- Wysoka wierność wizualna zapewniająca materiał o jakości filmowej
- Generuj do 4 wariantów jednocześnie
Opcje wyjściowe:
- Rozdzielczości: 720p
- Proporcje obrazu: 16:9, 9:16
Idealne do:
- Filmowych treści wymagających najwyższej jakości ruchu i realizmu
- Profesjonalnych produkcji wymagających precyzyjnego trzymania się promptów
- Wizualnego opowiadania historii w wysokiej jakości
Koszt: Zależy od wybranych ustawień i długości
Runway Gen-4 Turbo
Zaawansowany model wideo zaprojektowany do szybkiej iteracji i ekonomicznego tworzenia, zdolny generować wysokiej jakości wideo.
Dane wejściowe generowania:
- Tekst na wideo
- Klatka początkowa (obraz na wideo)
Funkcje:
- Zoptymalizowany pod kątem ultraszybkiego generowania, zapewnia wyniki nawet cztery razy szybciej niż poprzednie wersje
- Pozwala precyzyjnie kierować ruchem postaci, kątami kamery i kompozycją scen
- Doskonale zachowuje spójność wizualną i stabilność w dynamicznych scenach
- Obsługuje długości generowania od 2 s do 10 s
- Generuj do 4 wariantów jednocześnie
Opcje wyjściowe:
- Rozdzielczości: 720p
- Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Szybkiego prototypowania i eksperymentów kreatywnych wymagających niemal natychmiastowej informacji zwrotnej
- Profesjonalnych projektów wymagających szybkiej realizacji materiałów marketingowych w wysokiej rozdzielczości
- Treści filmowych ze szczególnymi wymaganiami dotyczącymi ruchu kamery
Koszt: Zależy od wybranych ustawień i długości
Runway Gen-4 Aleph
Najnowocześniejszy model wideo in-context do wielozadaniowego generowania wizualnego, zdolny do złożonej edycji przy zachowaniu bazowej struktury materiału źródłowego.
Dane wejściowe generowania:
- Wideo źródłowe
- Obraz referencyjny
- Opis tekstowy
Funkcje:
- Płynnie dodawaj, usuwaj lub przekształcaj obiekty i postaci w scenie z naturalnym oświetleniem, cieniami i perspektywą
- Zmieniaj lokalizacje, pory roku i pory dnia (np. zamieniaj pochmurne nagranie w dramatyczny zachód słońca) z realistyczną aktualizacją temperatury barwowej
- Modyfikuj wiek i wygląd aktorów albo zmieniaj tekstury ubrań i postaci za pomocą prostych promptów w języku naturalnym
- Zastosuj konkretny ruch i ścieżkę kamery z referencyjnego wideo do statycznego obrazu, aby precyzyjnie sterować animacją
- Generuj całkiem nowe kąty kamery, takie jak ujęcia z przeciwnej strony lub z dołu, z jednej istniejącej sekwencji wideo
- Obejmuje precyzyjne green screenowanie (izolację z wykrywaniem krawędzi), generowanie kolejnego ujęcia dla kontynuacji historii oraz transfer stylu estetycznego
- Generuj do 4 wariantów jednocześnie
Opcje wyjściowe:
- Rozdzielczości: 720p
- Proporcje obrazu: automatyczne
Idealne do:
- Profesjonalnych efektów wizualnych, takich jak cyfrowe odmładzanie, zmiana oświetlenia i usuwanie obiektów
- Szybkiego prototypowania filmowego i generowania alternatywnych ujęć kamery z jednego kadru
- Kreatywnych treści marketingowych wymagających radykalnych transformacji otoczenia lub stylu
Koszt: Zależy od wybranych ustawień i długości
Runway Aleph 2.0
Model do edycji wideo Runway: przekształca istniejące wideo w kierunku docelowego wyglądu, zachowując ruch i spójność.
Dane wejściowe:
- Wideo źródłowe (wymagane, od 2 s do 30 s)
- Obraz docelowego wyglądu (wymagany)
- Prompt tekstowy opisujący edycje
Funkcje:
- Długość i kadrowanie materiału wyjściowego są zgodne z wideo źródłowym
- Transfer stylu prowadzony przez obraz docelowego wyglądu
- Tworzenie wsadowe do 4 generowań naraz
Idealne do:
- Zmiany oświetlenia, stylu lub otoczenia istniejącego materiału
- Zastosowania wyglądu obrazu referencyjnego do całego klipu
Koszt: Zależy od wybranych ustawień i długości
Runway Act-Two
Wyspecjalizowany model transferu występu, który animuje postaci przez przenoszenie ruchu, mowy i mimiki z wideo sterującego na obraz postaci lub referencyjne wideo.
Dane wejściowe generowania:
- Występ sterujący (wideo)
- Dane postaci (obraz lub wideo)
Funkcje:
- Przenosi subtelną mimikę, synchronizację ruchu ust i zsynchronizowany dźwięk bezpośrednio z aktora źródłowego na dowolną postać
- Automatycznie dodaje ruch wtórny i subtelne drgania kamery do statycznych obrazów postaci, aby uzyskać bardziej naturalny efekt
- Precyzyjny przełącznik do włączania lub wyłączania ruchów ciała i dłoni podczas używania obrazu postaci
- Regulowane ustawienia równoważące intensywny występ emocjonalny i spójność wizualną postaci
- Możliwość zmiany głosu postaci po generowaniu przy zachowaniu idealnego dopasowania do występu sterującego
Opcje wyjściowe:
- Rozdzielczości: 720p
- Proporcje obrazu: automatyczne
Idealne do:
- Ożywiania statycznych portretów postaci realistycznym ludzkim ruchem i mową
- Animowania nieludzkich postaci lub stylizowanych awatarów z wierną mimiką
- Szybkiego tworzenia treści typu talking head ze zintegrowanymi gestami ciała
Koszt: Zależy od wybranych ustawień i długości
Seedance 1 Pro
Wyspecjalizowany model do tworzenia dynamicznych sekwencji wieloujęciowych z dużą ilością ruchu i akcji.
Dane wejściowe generowania:
- Tekst na wideo
- Klatka początkowa
- Klatka końcowa
Funkcje:
- Bardzo stabilna fizyka i płynne przejścia między ujęciami
- Stałe długości: 3 s, 4 s, 5 s, 6 s, 7 s, 8 s, 9 s, 10 s, 11 s i 12 s
- Tworzenie wsadowe do 4 generowań naraz
- Maksymalna swoboda twórcza dzięki licznym opcjom proporcji obrazu
Opcje wyjściowe:
- Rozdzielczości: 480p, 720p, 1080p
- Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Opowieści i scen akcji wymagających stabilnej fizyki
Koszt: Zależy od wybranych ustawień i długości
Proporcje obrazu i rozdzielczość nie wpływają na kredyty generowania, ale długość już tak.
Seedance 1 Pro nie jest dostępny w Stanach Zjednoczonych.
LTX Audio-to-Video
Model bazowy oparty na DiT, zaprojektowany do generowania zsynchronizowanego wideo i audio w jednym przebiegu, zapewniając spójną mowę i realistyczny ruch.
Dane wejściowe generowania:
- Text-to-Video
- Image-to-Video
- Audio-to-Video
- Depth-to-Video
Funkcje:
- Jednocześnie generuje dialog, ruch ust i dźwięk otoczenia, zapewniając idealne dopasowanie bez zewnętrznych narzędzi
- Dynamiczne sceny ze stabilnym ruchem, spójną tożsamością i dużą spójnością między klatkami
- Obsługuje wysokiej jakości zsynchronizowane generowanie do 20 sekund
- Zaawansowane sterowanie kreatywne dzięki szczegółowej obsłudze negative promptów
- Generuj do 4 wariantów naraz
Opcje wyjściowe:
- Rozdzielczości: 720p, 1080p
- Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Spójnej mowy i ekspresyjnych występów postaci
- Treści fabularnych wymagających zintegrowanego dźwięku otoczenia i spójnego timingu
- Dynamicznych scen ze złożoną logiką ruchu uwzględniającą kamerę
Koszt: Zależy od wybranych ustawień i długości
LTX 2 Pro
Wysokiej jakości model generatywny zoptymalizowany pod kątem maksymalnej szczegółowości obrazu i stabilności struktury, zdolny tworzyć materiały 4K gotowe do produkcji z płynnym ruchem.
Dane wejściowe generowania:
- Text-to-Video
- Klatka początkowa (Image-to-Video)
Funkcje:
- Stawia jakość i spójność obrazu ponad szybkością, zapewniając stabilne rezultaty w dłuższych sekwencjach
- Obsługuje 25 FPS i 50 FPS, zapewniając wyjątkowo płynny, profesjonalny ruch
- Zintegrowane generowanie audio-wideo z możliwością włączenia lub wyłączenia dźwięku
- Obsługuje natywne materiały 1080p, 2k i 4k bez utraty detali
- Generuj do 4 wariantów naraz
Opcje wyjściowe:
- Rozdzielczości: 1080p, 2k, 4k
- Liczba klatek: 25 FPS, 50 FPS
- Proporcje obrazu: 16:9 (domyślne)
- Długości: 6s, 8s, 10s
Idealne do:
- Kinowej produkcji w wysokiej rozdzielczości, wymagającej wyrazistości 4K
- Profesjonalnych treści wymagających płynnego ruchu w 50 FPS
- Szczegółowych sekwencji, w których kluczowe są stabilność obrazu i spójność struktury
Koszt: Zależy od wybranych ustawień i długości
LTX 2 Retake
Precyzyjne narzędzie AI do reżyserowania, które pozwala zmieniać dialog, emocje i akcję w istniejących ujęciach bez utraty ciągłości i ponownego generowania całej sekwencji.
Dane wejściowe generowania:
- Źródłowe wideo
- Opis tekstowy
Funkcje:
- Modyfikuj wybrane fragmenty, zachowując kontekst z otaczających klatek
- Zmieniaj wypowiadane kwestie, zachowując spójność głosu postaci, jej występu i otoczenia
- Wiele trybów edycji: wybierz „Audio i wideo”, „Tylko audio” lub „Tylko wideo”, aby wyodrębnić i wygenerować ponownie konkretne elementy ujęcia
- Nowa treść naturalnie dziedziczy oryginalny ruch, oświetlenie i ton, zapewniając płynne przejścia
- Natychmiast testuj inne reakcje postaci, emocjonalne momenty lub ruchy kamery w jednym ujęciu
- Generuj jednocześnie do 4 wariantów, aby łatwo porównać pomysły
Opcje wyjściowe:
- Proporcje obrazu: tylko 16:9
Idealne do:
- Dostosowywania scenariuszy i dopracowywania dialogów bez potrzeby ponownych zdjęć lub nagrań
- Poprawiania emocjonalnych momentów lub tempa w postprodukcji
- Testowania różnych komunikatów marki i wezwań do działania w jednym materiale marketingowym
Koszt: Zależy od wybranych ustawień i długości
LTX 2 Fast
Model generatywny zoptymalizowany pod kątem szybkości, stworzony do szybkich cykli feedbacku i intensywnego tworzenia treści, oferujący obraz w wysokiej rozdzielczości przy znacznie krótszym czasie renderowania.
Dane wejściowe generowania:
- Text-to-Video
- Klatka początkowa (Image-to-Video)
Funkcje:
- Zaprojektowany z myślą o szybkości i szybkich iteracjach, umożliwia szybkie eksperymenty wizualne i niemal natychmiastowe podglądy
- Obsługuje natywne materiały 1080p, 2k i 4k przy mniejszym zapotrzebowaniu na moc obliczeniową niż model Pro
- Obsługuje 25 FPS i 50 FPS, zapewniając płynny ruch przy dużej szybkości
- Umożliwia szybkie generowanie zsynchronizowanych treści audio-wideo o długości do 20 sekund
- Natywna obsługa włączania i wyłączania audio dla każdego generowania
- Generuj jednocześnie do 4 wariantów
Opcje wyjściowe:
- Rozdzielczości: 1080p, 2k, 4k
- Liczba klatek: 25 FPS, 50 FPS
- Proporcje obrazu: 16:9 (domyślne)
- Długości: 6s, 8s, 10s, 12s, 14s, 16s, 18s, 20s
Idealne do:
- Szybkiego prototypowania i kreatywnych eksperymentów, gdy szybkość jest ważniejsza niż maksymalna szczegółowość
- Dużej liczby treści do mediów społecznościowych wymagających szybkiej realizacji
- Testów A/B różnych koncepcji wizualnych i stylów ruchu
Koszt: Zależy od wybranych ustawień i długości
Wan 3.0
Kinowy model wideo z referencjami obrazu, wideo i audio, generowanym audio oraz generowaniem materiałów do 30 sekund.
Dane wejściowe generowania:
- Text-to-Video
- Klatka początkowa
- Klatka końcowa
- Referencje obrazu (do 10)
- Referencje wideo (do 5, łącznie 15s)
- Referencje audio (do 5, łącznie 15s)
Funkcje:
- Klatki i referencje wzajemnie się wykluczają
- Stałe długości: 5s, 10s, 15s, 20s i 30s
- Natywne sterowanie dźwiękiem z możliwością włączenia lub wyłączenia audio dla każdego generowania
- Opcjonalne ulepszanie promptu
- Tworzenie wsadowe: do 4 generowań naraz
Opcje wyjściowe:
- Rozdzielczości: 480p, 720p, 1080p
- Proporcje obrazu: Auto, 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Dłuższych kinowych ujęć ściśle zgodnych z promptem
- Scen opartych na referencjach z audio
Koszt: Zależy od wybranych ustawień i długości
Wan 3.0 nie jest dostępny w Stanach Zjednoczonych.
Wan 3.0 Prime
Szybszy wariant Wan 3.0 z tymi samymi danymi wejściowymi i opcjami wyjściowymi, odpowiedni do tworzenia pomysłów.
Dane wejściowe generowania:
- Text-to-Video
- Klatka początkowa
- Klatka końcowa
- Referencje obrazu (do 10)
- Referencje wideo (do 5, łącznie 15s)
- Referencje audio (do 5, łącznie 15s)
Funkcje:
- Czas generowania jest około dwukrotnie krótszy niż w Wan 3.0
- Stałe długości: 5s, 10s, 15s, 20s i 30s
- Natywne sterowanie dźwiękiem z możliwością włączenia lub wyłączenia audio dla każdego generowania
- Tworzenie wsadowe: do 4 generowań naraz
Opcje wyjściowe:
- Rozdzielczości: 480p, 720p, 1080p
- Proporcje obrazu: Auto, 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Testowania pomysłów przed finalnym renderowaniem w Wan 3.0
- Workflowów, w których liczy się szybka realizacja
Koszt: Zależy od wybranych ustawień i długości
Wan 3.0 Prime nie jest dostępny w Stanach Zjednoczonych.
Wan 2.6
Kinowa platforma wideo nowej generacji, która wykorzystuje zunifikowaną architekturę multimodalną do tworzenia treści 1080p gotowych do produkcji, z natywną synchronizacją audio i inteligentnym sekwencjonowaniem wielu ujęć.
Dane wejściowe generowania:
- Text-to-Video
- Klatka początkowa (Image-to-Video)
- Referencja wideo (Video-to-Video)
- Referencja audio (opcjonalne audio tła lub dialog)
Funkcje:
- Zunifikowany system multimodalny: przetwarza tekst, obrazy, wideo i audio w jednym zintegrowanym środowisku, zapewniając spójną jakość wyników
- Natywna synchronizacja audio: automatycznie generuje i dopasowuje dialogi, narrację oraz dźwięki otoczenia do ruchu na ekranie
- Inteligentne sekwencjonowanie wielu ujęć: automatycznie układa połączone sekwencje wideo w spójną narrację, zachowując spójność postaci
- Dłuższe materiały: obsługuje stabilne generowanie wysokiej jakości o stałej długości 5s, 10s i 15s
- Zaawansowana kontrola kreatywna: obsługuje negative prompty do szczegółowego zarządzania detalami oraz wsadowe tworzenie do 4 wariantów
Opcje wyjściowe:
- Rozdzielczości: 720p, 1080p
- Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Profesjonalnego storytellingu i złożonych, kinowych sekwencji z wieloma ujęciami
- Reklam w mediach społecznościowych i treści marketingowych wymagających zintegrowanego audio wysokiej jakości
- Treści opartych na postaciach, wymagających ścisłej spójności obrazu i ruchu dzięki referencjom wideo
Koszt: Zależy od wybranych ustawień i długości
Wan 2.6 nie jest dostępny w Stanach Zjednoczonych.
Wan 2.5 Video
Wszechstronny model, który zapewnia kinowy ruch i wysoką zgodność z promptem na podstawie tekstu lub obrazu początkowego.
Dane wejściowe generowania:
- Text-to-Video
- Klatka początkowa (Image-to-Video)
Funkcje:
- Szczegółowa kontrola kreatywna dzięki negative promptom i osobnemu sterowaniu dźwiękiem
- Stałe długości: 5s i 10s
- Tworzenie wsadowe: do 4 generowań naraz
Opcje wyjściowe:
- Rozdzielczości: 480p, 720p, 1080p
- Proporcje obrazu: 16:9, 1:1, 9:16
Idealne do:
- Kinowych treści ściśle zgodnych z promptem
Koszt: Zależy od wybranych ustawień i długości
Koszt generowania zależy od wybranych ustawień.
Wan 2.5 Video nie jest dostępny w Stanach Zjednoczonych.
Generatywne modele obrazów
GPT Image 2.5 Sunburst
Gotowy do produkcji model obrazu OpenAI do bardzo szczegółowych wyników i precyzyjnej edycji.
Dane wejściowe generowania:
- Text-to-Image
- Referencje obrazu (do 10)
Funkcje:
- Pięć poziomów jakości: od niskiej do maksymalnej
- Własna rozdzielczość do 3840px na bok, przy proporcjach obrazu do 3:1
- Tworzenie wsadowe: do 4 generowań naraz
Opcje wyjściowe:
- Rozdzielczości: 1K, 2K, 4K lub własna
- Proporcje obrazu: 3:1, 21:9, 2:1, 16:9, 3:2, 4:3, 5:4, 1:1, 4:5, 3:4, 2:3, 9:16, 1:2, 1:3
Idealne do:
- Finalnych materiałów, gdzie detale i wierność mają największe znaczenie
- Precyzyjnej edycji istniejących obrazów
Koszt: Zależy od wybranych ustawień i liczby wariantów
GPT Image 2.5 Flare
Szybki wariant GPT Image 2.5 z tymi samymi ustawieniami co Sunburst, dostrojony do codziennego generowania na dużą skalę.
Dane wejściowe generowania:
- Text-to-Image
- Referencje obrazu (do 10)
Funkcje:
- Pięć poziomów jakości: od niskiej do maksymalnej
- Własna rozdzielczość do 3840px na bok, przy proporcjach obrazu do 3:1
- Tworzenie wsadowe: do 4 generowań naraz
Opcje wyjściowe:
- Rozdzielczości: 1K, 2K, 4K lub własna
- Proporcje obrazu: 3:1, 21:9, 2:1, 16:9, 3:2, 4:3, 5:4, 1:1, 4:5, 3:4, 2:3, 9:16, 1:2, 1:3
Idealne do:
- Generowania dużej liczby obrazów
- Szybkich iteracji, które nadal wymagają 4K i własnych rozmiarów
Koszt: Zależy od wybranych ustawień i liczby wariantów
API: gpt-image-2.5-flare
GPT Image 2
Zaawansowany model AI zaprojektowany do precyzyjnego generowania obrazów, z lepszym renderowaniem tekstu i możliwością tworzenia materiałów w wysokiej rozdzielczości.
Funkcje:
- Precyzyjna kontrola tekstu pozwalająca tworzyć obrazy z czytelną i poprawną typografią
- Obrazy PNG w wysokiej rozdzielczości, odpowiednie do zastosowań profesjonalnych i komercyjnych
- Obsługuje wiele referencji obrazu do sterowania stylem i kompozycją
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: 3:2, 1:1, 2:3
- Opcje jakości: niska, średnia, wysoka
Idealne do:
- Wizualizacji marketingowych i materiałów projektowych wymagających precyzyjnego rozmieszczenia tekstu
- Profesjonalnych treści wymagających wysokiej rozdzielczości
- Kreatywnych projektów wymagających precyzyjnej kontroli obrazu opartej na tekście
Koszt: Zależy od wybranych ustawień i liczby wariantów
API: gpt-image-2
Nano Banana 2
Zaawansowany model AI do generowania obrazów, łączący jakość gotową do produkcji z ultraszybkim przetwarzaniem, lepszą wiedzą o świecie i spójnością obiektów.
Funkcje:
- Natywne obrazy w rozdzielczości 4K bez skalowania, z krystalicznie wyraźnymi detalami
- Błyskawiczne generowanie obrazów już w 1–2 sekundy
- Doskonała zgodność z promptem dzięki zaawansowanemu rozumowaniu i realizowaniu instrukcji
- Wyraźne, poprawne renderowanie tekstu w wielu językach do makiet, oznakowania i infografik
- Spójny styl wielu obiektów, zachowujący tożsamość postaci i przedmiotów
- Lepsza wiedza o świecie dla dokładniejszego generowania scen
- Obsługuje wiele referencji obrazu do sterowania generowaniem
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16
- Rozdzielczości: do 4K
Idealne do:
- Szybkich kreatywnych workflowów wymagających iteracji w czasie rzeczywistym
- Treści marki i storytellingu ze spójną tożsamością postaci
- Profesjonalnych materiałów wizualnych z poprawnym tekstem i typografią
Koszt: Zależy od wybranych ustawień i liczby wariantów
Nano Banana 2 Lite
Szybki, tani wariant Nano Banana 2 do szybkiego generowania i edycji w 1K.
Dane wejściowe generowania:
- Text-to-Image
- Referencje obrazu (do 14)
Funkcje:
- Stały wynik 1K dla przewidywalnej szybkości i kosztu
- Taka sama obsługa 14 referencji obrazu jak w Nano Banana 2
- Tworzenie wsadowe: do 4 generowań naraz
Opcje wyjściowe:
- Rozdzielczości: 1K
- Proporcje obrazu: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16
Idealne do:
- Szybkich iteracji i wersji roboczych
- Masowej edycji, gdy 1K wystarcza
Koszt: Zależy od wybranych ustawień i liczby wariantów
Krea 2 Medium
Wszechstronny, gotowy do produkcji model generowania obrazów od Krea AI, równoważący jakość i szybkość w szerokim zakresie kreatywnych workflowów.
Funkcje:
- Generowanie obrazów wysokiej jakości, ściśle zgodnych z promptem
- Obsługuje wiele referencji obrazu do sterowania generowaniem
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Profesjonalnego tworzenia treści wymagającego stałej jakości
- Szybkich iteracji różnych kreatywnych koncepcji
Koszt: Zależy od wybranych ustawień i liczby wariantów
Krea 2 Large
Flagowy model generowania obrazów Krea AI, oferujący maksymalną wierność wizualną i zaawansowaną kontrolę kreatywną dla profesjonalnych workflowów produkcyjnych.
Funkcje:
- Wyjątkowe detale i realizm w materiałach profesjonalnej jakości
- Zaawansowana kontrola stylu z obsługą wielu referencji obrazu
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Wysokiej klasy komercyjnej i redakcyjnej produkcji obrazów
- Złożonych kompozycji kreatywnych wymagających maksymalnej wierności
Koszt: Zależy od wybranych ustawień i liczby wariantów
Recraft V4.1
Model text-to-image skupiony na designie, oferujący dobrą kontrolę promptu i czyste kompozycje.
Dane wejściowe generowania:
- Text-to-Image
Funkcje:
- Wynik 2K wykorzystuje wariant modelu Pro
- Tworzenie wsadowe: do 4 generowań naraz
Opcje wyjściowe:
- Rozdzielczości: 1K, 2K
- Proporcje obrazu: 2:1, 16:9, 3:2, 14:10, 4:3, 5:4, 1:1, 4:5, 3:4, 10:14, 2:3, 6:10, 9:16, 1:2
Idealne do:
- Grafik opartych na układzie, ikon i plakatów
- Czystych kompozycji tworzonych wyłącznie z tekstu
Koszt: Zależy od wybranych ustawień i liczby wariantów
Recraft V4
Model obrazu skupiony na designie, który potrafi dopasować styl obrazów referencyjnych.
Dane wejściowe generowania:
- Text-to-Image
- Referencje stylu (do 10)
Funkcje:
- Kontrola dopasowania stylu: Precise ściśle trzyma się stylu referencji, Flexible dopasowuje ogólny wygląd
- Wynik 2K wykorzystuje wariant modelu Pro
- Tworzenie wsadowe: do 4 generowań naraz
Opcje wyjściowe:
- Rozdzielczości: 1K, 2K
- Proporcje obrazu: 2:1, 16:9, 3:2, 14:10, 4:3, 5:4, 1:1, 4:5, 3:4, 10:14, 2:3, 6:10, 9:16, 1:2
Idealne do:
- Spójnych z marką grafik na podstawie zestawu referencji stylu
- Ilustracji i prac projektowych
Koszt: Zależy od wybranych ustawień i liczby wariantów
Seedream 5 Lite
Lekki model obrazów od ByteDance, który szybko generuje wysokiej jakości wyniki przy mniejszym zapotrzebowaniu na moc obliczeniową.
Funkcje:
- Szybkie generowanie dla sprawnych kreatywnych iteracji
- Obsługuje wiele referencji obrazu do sterowania generowaniem
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Workflowów tworzenia dużej liczby obrazów, w których liczy się szybkość
- Szybkiego odkrywania koncepcji i podglądów
Koszt: Zależy od wybranych ustawień i liczby wariantów
API: bytedance-seedream-5-lite
Seedream 5 Lite nie jest dostępny w Stanach Zjednoczonych.
Seedream 5 Pro
Wariant Seedream 5 o wyższej jakości, do precyzyjnej edycji, tekstu wielojęzycznego i gęstych infografik.
Dane wejściowe generowania:
- Text-to-Image
- Obrazy referencyjne (do 10)
Funkcje:
- Dokładne renderowanie tekstu w wielu językach
- Obsługuje gęste układy, takie jak infografiki i plakaty
- Tworzenie wsadowe do 4 generacji naraz
Opcje wyjściowe:
- Rozdzielczości: 1K, 2K
- Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Projektów z dużą ilością tekstu w wielu językach
- Edycji wielu obrazów ze ścisłym trzymaniem się materiałów referencyjnych
Koszt: Zależy od wybranych ustawień i liczby wariantów
Seedream 5 Pro nie jest dostępny w Stanach Zjednoczonych.
GPT Image 1.5
Szybki flagowy model do precyzyjnego generowania obrazów na podstawie tekstu i złożonej, nieniszczącej edycji zdjęć, która zachowuje oryginalne detale.
Funkcje:
- Niezawodnie wprowadza wskazane zmiany, zachowując oświetlenie, kompozycję i wygląd obiektów na obrazach źródłowych
- Obsługuje złożone zadania edycyjne, w tym dodawanie, usuwanie, łączenie i mieszanie elementów
- Działa do 4 razy szybciej niż poprzednie wersje
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: 3:2, 1:1, 2:3
- Opcje jakości: niska, średnia, wysoka
Idealne do:
- Praktycznych poprawek zdjęć i realistycznych wirtualnych przymiarek ubrań lub fryzur
- Koncepcyjnych przekształceń i filtrów stylistycznych, które zachowują charakter obrazu wejściowego
- Szybkiego iterowania pomysłów text-to-image
Koszt: Zależy od wybranych ustawień i liczby wariantów
API: gpt-image-1.5
GPT Image 1
Obrazowy model pierwszej generacji OpenAI z dobrym trzymaniem się promptów, czytelnym tekstem i szczegółową edycją.
Dane wejściowe generowania:
- Text-to-Image
- Obrazy referencyjne (do 5)
Funkcje:
- Trzy poziomy jakości: niski, średni, wysoki
- Tworzenie wsadowe do 4 generacji naraz
Opcje wyjściowe:
- Proporcje obrazu: 3:2, 1:1, 2:3
Idealne do:
- Workflow opartych już na wynikach GPT Image 1
- Prostych edycji i zadań z tekstem na obrazie w standardowej rozdzielczości
Koszt: Zależy od wybranych ustawień i liczby wariantów
API: gpt-image-1
Seedream 4.5
Wydajny multimodalny model bazowy, który łączy syntezę text-to-image, precyzyjną edycję obrazów i złożone kompozycje z wielu obrazów w jednym wydajnym rozwiązaniu.
Funkcje:
- Natywna obsługa szybkiego generowania obrazów wysokiej jakości w rozdzielczości do 4K
- Wyjątkowo dobrze zachowuje rysy twarzy, oświetlenie, ton kolorów i drobne detale podczas edycji na podstawie materiałów referencyjnych
- Dokładnie rozpoznaje i łączy docelowe elementy z wielu obrazów wejściowych, zapewniając kontrolowane i spójne wyniki
- Oferuje możliwości kompozycji na poziomie projektanta oraz wyraźne, dokładne renderowanie małego tekstu na plakatach i materiałach marki
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
- Rozdzielczości: 2K, 4K
Idealne do:
- Profesjonalnych workflow projektowania graficznego wymagających precyzyjnego układu i typografii
- Złożonej edycji zdjęć wymagającej ścisłego zachowania tożsamości i oświetlenia z materiałów referencyjnych
- Kreatywnych kompozycji w wysokiej rozdzielczości z użyciem wielu źródeł wizualnych
Koszt: Zależy od wybranych ustawień i liczby wariantów
Seedream 4.5 nie jest dostępny w Stanach Zjednoczonych.
Kling O1 Image
Model do generowania obrazów wysokiej jakości z zaawansowanymi możliwościami rozumowania, zaprojektowany z myślą o doskonałym trzymaniu się promptów i precyzyjnej spójności wizualnej w złożonych kompozycjach.
Funkcje:
- Wyjątkowo dobrze interpretuje i realizuje złożone, wielowarstwowe opisy tekstowe z dużą dokładnością
- Wykorzystuje obrazy referencyjne, by zachować tożsamość obiektu, oświetlenie i styl estetyczny między generacjami
- Zoptymalizowany pod kątem realistycznych tekstur, złożonych relacji przestrzennych i profesjonalnych efektów oświetleniowych
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: Auto, 16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3, 21:9
- Rozdzielczości: 1K, 2K
Idealne do:
- Profesjonalnych materiałów kreatywnych wymagających ścisłego trzymania się szczegółowych i technicznych promptów tekstowych
- Edycji obrazów o wysokiej spójności i projektowania postaci na podstawie materiałów wizualnych
Koszt: Zależy od wybranych ustawień i liczby wariantów
Kling O1 Image nie jest dostępny w Stanach Zjednoczonych.
FLUX.2 [Pro]
Gotowy do produkcji model do generowania i edycji obrazów, stworzony dla profesjonalnych workflow i oferujący najnowocześniejszą jakość wizualną z naciskiem na szybkość, precyzję i spójność.
Funkcje:
- Odwołuje się jednocześnie do wielu obrazów, zapewniając wiodącą w branży spójność postaci i tożsamości w setkach materiałów
- Zapewnia bezprecedensowy skok jakości detali, zbliżając się do prawdziwej fotografii — od faktur tkanin po elementy architektoniczne
- Oferuje gotowe do produkcji renderowanie tekstu dla złożonej typografii, makiet UI i infografik
- Obsługuje precyzyjne wskazywanie kolorów marki za pomocą kodów hex, bez przybliżeń
- Zapewnia dokładne rozmieszczenie obiektów, realistyczną fizykę, spójne oświetlenie i właściwą perspektywę w złożonych scenach
- Zoptymalizowany pod kątem lepszej dokładności i reakcji na uporządkowane, złożone instrukcje
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
- Rozdzielczości: 720p, 1080p, 2K
Idealne do:
- Prowadzenia kampanii ze spójnymi postaciami i dokładnego umieszczania produktów w każdym kontekście
- Tworzenia makiet interfejsów z czytelnym tekstem i spójnymi systemami projektowania wizualnego
- Generowania na skalę zdjęć produktów i ujęć lifestylowych w kontekście
Koszt: Zależy od wybranych ustawień i liczby wariantów
Nano Banana Pro
Profesjonalny, oparty na rozumowaniu model do generowania i edycji obrazów, stworzony do produkcji materiałów wysokiej jakości, zaawansowanej kontroli kreatywnej i precyzyjnego wykonywania instrukcji.
Dane wejściowe:
- Obraz referencyjny
- Opis tekstowy (obsługuje złożone, wielowarstwowe prompty)
Funkcje:
- Planuje sceny przed renderowaniem, zapewniając oświetlenie zgodne z fizyką, dokładne relacje między obiektami i doskonałe trzymanie się promptów
- Generuje ostry, czytelny tekst w wielu językach, w różnych stylach czcionek i pisma odręcznego, do wyrazistych plakatów i makiet produktów
- Utrzymuje wysoką jakość i podobieństwo dla maksymalnie 5 osób oraz wielu obiektów w różnorodnych materiałach kreatywnych
- Integruje Google Search, aby wzbogacać obrazy o faktyczne dane, wiedzę o świecie i informacje w czasie rzeczywistym, takie jak pogoda lub wyniki sportowe
- Dostosowuj kąty kamery, punkty ostrości i oświetlenie sceny (np. zmieniaj dzień w noc) dzięki zaawansowanym narzędziom do lokalnej edycji
- Doskonałe rozumienie przestrzeni pozwala generować dokładne infografiki, diagramy techniczne i slajdy prezentacji
- Generuje do 4 wariantów naraz
Opcje wyjściowe:
- Rozdzielczości: 1K, 2K, 4K
- Proporcje obrazu: Auto, 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16
Idealne do:
- Profesjonalnych reklam, materiałów marki i wysokiej klasy zdjęć produktów dla e-commerce
- Materiałów edukacyjnych, infografik opartych na danych i złożonej dokumentacji technicznej
- Szybkiego prototypowania projektów wizualnych w wysokiej rozdzielczości ze spójną tożsamością postaci lub marki
Koszt: Zależy od wybranych ustawień i liczby wariantów
API: gemini-3-pro-image
Nano Banana
Szybki model do sprawnego generowania i edycji obrazów wysokiej jakości bezpośrednio z promptów tekstowych.
Funkcje:
- Obsługuje wiele obrazów referencyjnych, które kierują generowaniem
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16
Idealne do:
- Szybkiego tworzenia i iterowania obrazów
Koszt: Zależy od wybranych ustawień i liczby wariantów
Runway Gen-4 Image
Zaawansowany model bazowy do generowania obrazów wysokiej jakości, oferujący bezprecedensową kontrolę stylu i pamięć wizualną, która pomaga zachować spójność między scenami.
Funkcje:
- Zakotwicz postacie, style lub konkretne obiekty za pomocą obrazów wejściowych, aby zachować profesjonalną spójność w wielu wynikach
- Zoptymalizowany do interpretowania złożonych opisów w języku naturalnym, zapewniając precyzyjną kontrolę nad detalami wizualnymi, oświetleniem i emocjami
- Potrafi generować wysokiej jakości obrazy do różnych zastosowań — od filmowych storyboardów po profesjonalne zdjęcia produktów
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
- Rozdzielczości: 720p, 1080p
Idealne do:
- Zapewniania, że główne postacie zachowują wygląd w różnych środowiskach i oświetleniu
- Szybkiego tworzenia materiałów marki w wysokiej rozdzielczości, wirtualnych przymiarek i gotowych do skalowania wizualizacji produktów
- Odkrywania różnych kierunków artystycznych przy zachowaniu głównej tożsamości wizualnej dzięki obrazom referencyjnym
Koszt: Zależy od wybranych ustawień i liczby wariantów
Runway Gen-4 Image Turbo
Zoptymalizowany pod kątem szybkości model do generowania obrazów, który daje wyniki 2,5 razy szybciej niż standardowy Gen-4 Image, przy identycznej jakości wyjściowej.
Funkcje:
- Zoptymalizowane przetwarzanie pozwala szybko odkrywać możliwości kreatywne i generować obrazy wysokiej jakości w ułamku czasu
- Prześlij do trzech obrazów referencyjnych, aby pomóc modelowi zrozumieć konkretne postacie, środowiska i style artystyczne
- Rozwiązuje problem dryfu wizualnego, kodując konkretne cechy wizualne z obrazów referencyjnych, aby zachować tożsamość między wieloma generacjami
- Z łatwością zastosuj estetykę, oświetlenie i teksturę obrazu referencyjnego do całkiem nowych obiektów i scen
- Używaj parametrów seed, aby systematycznie badać warianty lub precyzyjnie odtwarzać konkretne wyniki
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
- Rozdzielczości: 720p, 1080p
Idealne do:
- Szybkiego tworzenia na skalę obrazów zoptymalizowanych dla Instagram Stories (9:16) lub standardowych postów (1:1)
- Utrzymywania ścisłej tożsamości wizualnej kampanii dzięki używaniu wytycznych stylu marki jako obrazów referencyjnych
- Tworzenia spójnych póz postaci i scenografii przy zachowaniu rozpoznawalności głównego bohatera
- Dokładnego tworzenia różnorodnych lifestylowych i sezonowych zdjęć produktów na podstawie materiałów referencyjnych
Koszt: Zależy od wybranych ustawień i liczby wariantów
Seedream 4
Specjalistyczny model obrazowy do generowania sekwencji wielu ujęć lub scen z dużą ilością ruchu i akcji.
Funkcje:
- Doskonale tworzy obrazy ze stabilną fizyką i spójnymi przejściami
- Obsługuje wiele obrazów referencyjnych, które kierują generowaniem
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: auto, 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Scen akcji i dynamicznych kompozycji
Koszt: Zależy od wybranych ustawień i liczby wariantów
Seedream 4 nie jest dostępny w Stanach Zjednoczonych.
Wan 2.5 Image
Wariant obrazowy Wan 2.5, z wysoką zgodnością z promptami i obsługą obrazów referencyjnych.
Dane wejściowe generowania:
- Text-to-Image
- Obrazy referencyjne (do 2)
Funkcje:
- Kontrola negatywnego promptu i seed
- Tworzenie wsadowe do 4 generacji naraz
Opcje wyjściowe:
- Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
Idealne do:
- Nieruchomych obrazów pasujących do wyglądu generacji wideo Wan
- Obrazów koncepcyjnych zgodnych z promptem
Koszt: Zależy od wybranych ustawień i liczby wariantów
Wan 2.5 Image nie jest dostępny w Stanach Zjednoczonych.
FLUX.1 Kontext [Pro]
Profesjonalny model do zaawansowanego generowania i edycji obrazów, oferujący wysoką spójność scen i kontrolę stylu.
Funkcje:
- Kontrola stylu na podstawie obrazu, wymagająca obrazu referencyjnego do określenia estetyki wizualnej
- Generuje do 4 obrazów naraz
Opcje wyjściowe:
- Proporcje obrazu: 21:9, 16:9, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16, 9:21
Idealne do:
- Profesjonalnych materiałów z precyzyjnymi wymaganiami stylistycznymi
Koszt: Zależy od wybranych ustawień i liczby wariantów
Modele synchronizacji ruchu ust
Creatify Aurora
Najnowocześniejszy model diffusion transformer (DiT), stworzony do renderowania ultrarealistycznych, reagujących awatarów sterowanych dźwiękiem i tekstem.
Dane wejściowe generowania:
- Awatar (obraz źródłowy)
- Mowa (plik audio)
- Opis tekstowy (wskazówki)
Funkcje:
- Wykracza poza podstawową synchronizację ruchu ust, uwzględniając mruganie, oddychanie i naturalną mimikę zależne od kontekstu
- Automatycznie synchronizuje ruchy dłoni i całego ciała na podstawie tonu oraz intonacji głosu, zapewniając jakość studyjnej produkcji
- Precyzyjnie interpretuje natężenie i wysokość głosu, by oddać emocje zgodne z wykonaniem
- Zachowuje wysoką wierność postaci i spójność zachowania nawet w długich dialogach lub występach muzycznych
- Zoptymalizowany pod różne ujęcia, w tym prezentacje z boku, dialogi w stylu podcastu i stylizowane animacje
- Generuj do 4 wariantów naraz
Opcje wyjściowe:
- Rozdzielczości: 480p, 720p
Idealny do:
- Profesjonalnych reklam wideo z awatarami i treści marketingowych
- Wirtualnego storytellingu wysokiej jakości i ekspresyjnych występów muzycznych
- Długich materiałów edukacyjnych lub szkoleniowych, które wymagają stałej obecności postaci
Koszt: Zależy od danych wejściowych, ustawień i czasu trwania
API: creatify-aurora
Veed Fabric
Szybki i precyzyjny model synchronizacji ruchu ust z obrazu do wideo, który animuje nieruchomy obraz zgodnie z podanym dźwiękiem.
Dane wejściowe:
- Obraz źródłowy
- Plik audio z mową
Funkcje:
- Animuje usta i mimikę na obrazie źródłowym zgodnie z podanym dźwiękiem
- Tworzy wysokiej jakości „mówiące” wideo z nieruchomych obrazów
- Narzędzie do synchronizacji ruchu ust, nie pełny model generowania wideo
Idealny do:
- Tworzenia mówiących awatarów z nieruchomych obrazów
- Dodawania dialogów do portretów postaci
- Profesjonalnych workflow z treściami opartymi na awatarach
Koszt: Zależy od danych wejściowych, ustawień i czasu trwania
Dla najlepszych efektów obraz powinien zawierać wykrywalną postać.
HeyGen Avatar 4
Najnowszy model awatarów HeyGen do tworzenia bardzo realistycznych, ekspresyjnych filmów z mówiącą twarzą na podstawie jednego obrazu i dźwięku.
Dane wejściowe:
- Obraz źródłowy
- Plik audio z mową
Funkcje:
- Animuje mimikę i ruchy ust zgodnie z podanym dźwiękiem, zachowując wysoką wierność
- Tworzy naturalne ruchy głowy i subtelną mikroekspresję dla realistycznego efektu
- Narzędzie do synchronizacji ruchu ust, nie pełny model generowania wideo
Idealny do:
- Profesjonalnych filmów ze spikerami i prezenterami
- Tworzenia spersonalizowanych treści z awatarami na dużą skalę
- Filmów marketingowych i szkoleniowych ze stałą obecnością postaci
Koszt: Zależy od danych wejściowych, ustawień i czasu trwania
Dla najlepszych efektów obraz powinien zawierać wyraźnie widoczną twarz.
Sync 3
Najnowszej generacji model synchronizacji ruchu ust w wideo od Sync, zapewniający studyjną jakość synchronizacji dla wielu typów treści.
Dane wejściowe generowania:
- Wideo źródłowe
- Audio z mową
Funkcje:
- Precyzyjna synchronizacja ruchu ust, która zachowuje unikalne rysy twarzy, naturalne zęby i teksturę skóry
- Zoptymalizowany pod wszystkie typy treści, w tym nagrania aktorskie, animacje 3D i wideo generowane przez AI
- Narzędzie do synchronizacji ruchu ust wideo z wideo, nie pełny generator wideo
Idealny do:
- Profesjonalnego dubbingu i lokalizacji filmów oraz reklam
- Ulepszania lub poprawiania dialogów w każdym formacie wideo
- Workflow tłumaczenia dużej liczby treści
Koszt: Zależy od danych wejściowych, ustawień i czasu trwania
Dla najlepszych efektów wideo powinno zawierać wykrywalną postać.
Sync Lipsync 2 Pro
Najnowocześniejszy model do edycji wideo, stworzony do studyjnej synchronizacji ruchu ust. Zachowuje unikalne rysy twarzy i obsługuje wyjścia w wysokiej rozdzielczości.
Dane wejściowe generowania:
- Wideo źródłowe
- Audio z mową
Funkcje:
- Wykorzystuje zaawansowane skalowanie, by obsługiwać wyjście 4K przy zachowaniu ostrych, naturalnych tekstur
- Chroni unikalne cechy twarzy, takie jak naturalne zęby, piegi, makijaż i złożony zarost, bez utraty wyrazistości
- Zoptymalizowany pod wszystkie typy treści, w tym nagrania aktorskie, animacje 3D i wideo generowane przez AI
- Od razu zapewnia ekspresyjne, zsynchronizowane efekty bez trenowania dla konkretnego mówcy ani dostrajania modelu
- Generuj do 4 wariantów jednocześnie
Idealny do:
- Profesjonalnego dubbingu i lokalizowanych treści dla filmu oraz reklam premium
- Ulepszania lub poprawiania dialogów postaci w animacji 3D i wideo generowanym przez AI
- Projektów w wysokiej rozdzielczości, wymagających spójności i szczegółów twarzy co do piksela
Koszt: Zależy od danych wejściowych, ustawień i czasu trwania
OmniHuman 1.5
Specjalny model użytkowy do tworzenia wyjątkowo realistycznej, ludzkiej synchronizacji ruchu ust.
Dane wejściowe:
- Nieruchomy obraz źródłowy
- Plik audio z mową
Funkcje:
- Animuje usta na obrazie źródłowym zgodnie z podanym dźwiękiem
- Tworzy wysokiej jakości „mówiące” wideo z nieruchomych obrazów
- Narzędzie do synchronizacji ruchu ust, nie pełny model generowania wideo
Idealny do:
- Tworzenia mówiących awatarów
- Dodawania dialogów do nieruchomych obrazów
- Profesjonalnych workflow dubbingu
Koszt: Zależy od danych wejściowych, ustawień i czasu trwania
Dla najlepszych efektów obraz powinien zawierać wykrywalną postać.
OmniHuman 1.5 nie jest dostępny w Stanach Zjednoczonych.
Veed Lipsync
Szybki, przystępny cenowo i precyzyjny model użytkowy do stosowania realistycznej synchronizacji ruchu ust w wideo.
Dane wejściowe:
- Wideo źródłowe
- Nowy plik audio z mową
Funkcje:
- Ponownie animuje ruchy ust w wideo źródłowym, aby pasowały do nowego dźwięku
- Narzędzie do synchronizacji ruchu ust wideo z wideo, nie pełny generator wideo
Idealny do:
- Dubbingu dużej liczby materiałów przy niskich kosztach
- Tłumaczenia treści
- Poprawiania dźwięku w klipach wideo z realistycznym efektem
Koszt: Zależy od danych wejściowych, ustawień i czasu trwania
Dla najlepszych efektów wideo powinno zawierać wykrywalną postać.
Veed Lipsync 2.0
Następca Veed Lipsync o wyższej jakości, do stosowania realistycznej synchronizacji ruchu ust w istniejących filmach.
Dane wejściowe:
- Wideo źródłowe
- Nowy plik audio z mową
Funkcje:
- Ponownie animuje ruchy ust w wideo źródłowym, aby pasowały do nowego dźwięku
- Narzędzie do synchronizacji ruchu ust wideo z wideo, nie pełny generator wideo
- Tworzenie wsadowe: do 4 generacji naraz
Idealny do:
- Dubbingu i tłumaczeń, gdy jakość wyniku jest ważniejsza niż koszt
- Poprawiania dialogów w gotowych klipach
Koszt: Zależy od danych wejściowych, ustawień i czasu trwania
Dla najlepszych efektów wideo powinno zawierać wykrywalną postać.
Modele użytkowe
Topaz Upscale
Specjalny model użytkowy do skalowania obrazów i wideo, stworzony do zwiększania rozdzielczości i szczegółowości nawet 4x.
Funkcje:
- Narzędzie ulepszające, które przetwarza istniejące materiały
- Zwiększa rozmiar materiałów, zachowując naturalne tekstury i minimalizując artefakty
- Bardzo precyzyjne współczynniki skalowania: 1x, 1.25x, 1.5x, 1.75x, 2x, 3x, 4x
- Dla wideo: elastyczna kontrola liczby klatek (zachowaj źródłową lub zmień na 24, 25, 30, 48, 50 albo 60 fps)
Idealny do:
- Poprawiania jakości wygenerowanych materiałów
- Odnawiania archiwalnych nagrań lub zdjęć
- Przygotowywania zasobów na wyświetlacze o wysokiej rozdzielczości
Koszt: Zależy od danych wejściowych
Usuwanie tła
Usuwa tło z obrazu i zwraca go z przezroczystością alfa.
Dane wejściowe:
- Obraz źródłowy
Funkcje:
- Nie wymaga promptu
- Jeden wynik na uruchomienie
Idealny do:
- Wycinania produktów i komponowania obrazów
- Przygotowywania obiektów do użycia jako referencje w innych generacjach
Koszt: Zależy od danych wejściowych
Runway Ruby
Konwertuje wideo o standardowym zakresie dynamiki na HDR.
Dane wejściowe:
- Wideo źródłowe (do 30 s)
Funkcje:
- Nie wymaga promptu
- Jeden wynik na uruchomienie; długość i kadrowanie są zgodne ze źródłem
Idealny do:
- Przygotowywania nagrań na wyświetlacze HDR
- Ponownej korekcji kolorów wygenerowanego wideo przed publikacją
Koszt: Zależy od długości wideo