
Image-to-image AI zaczyna od istniejącego obrazu i tworzy jego nową wersję zgodnie z promptem. W przeciwieństwie do text-to-image nie trzeba odtwarzać całej kompozycji słowami: zdjęcie lub ilustracja przekazują modelowi układ, pozę, perspektywę i część oświetlenia. Twórca decyduje, które cechy zachować, a które przebudować.
Narzędzie określane jako „uncensored” może dopuszczać szerszy zakres legalnych tematów artystycznych, lecz nie zwalnia z zasad. Przetwarzaj wyłącznie materiały, do których masz prawa. Rozpoznawalna osoba musi być pełnoletnia i świadomie zgodzić się na konkretny rodzaj modyfikacji oraz publikacji. Intymne deepfake’i bez zgody i jakiekolwiek treści seksualizujące nieletnich są niedopuszczalne.
Trzy sygnały sterujące wynikiem
Najważniejszy jest obraz bazowy. Wyznacza położenie obiektów, proporcje i ogólną geometrię. Drugi sygnał to prompt opisujący docelowy wygląd. Trzeci stanowią parametry, przede wszystkim siła transformacji, seed, proporcje, maska oraz ewentualna referencja stylu.
Przy niskiej sile wynik przypomina źródło, a zmiany dotyczą koloru, faktury i drobnych detali. Przy wysokiej wartości model swobodniej interpretuje scenę: może zmienić ubranie, twarz, tło i układ obiektów. Nie istnieje jedna „najlepsza” wartość. Zależy ona od celu i powinna być ustalana przez serię kontrolowanych prób.
Jeśli chcesz stworzyć obraz bazowy od zera, zacznij w module text-to-image. Zachowaj plik w pełnej jakości oraz oryginalny prompt. W kolejnych etapach pracuj na kopiach, aby każdą zmianę można było cofnąć.
Przygotowanie obrazu wejściowego
Najlepiej działa materiał o czytelnych konturach, spójnym świetle i wystarczającej rozdzielczości. Usuń silną kompresję, przypadkowe napisy i elementy interfejsu. Nie wyostrzaj agresywnie — halo wokół krawędzi może zostać wzmocnione przez model.
Sprawdź także prywatne informacje: identyfikatory, adresy, tablice rejestracyjne, odbicia w lustrze i metadane lokalizacyjne. Jeśli w tle znajdują się osoby postronne, usuń je przed uploadem. Nazwa pliku również nie powinna zawierać danych osobowych.
Dla portretu zwróć uwagę na linię włosów, uszy, dłonie i biżuterię. Dla produktu liczą się logo, typografia, proporcje i krawędzie. Generatywna edycja często zmienia litery, dlatego finalne oznaczenia marki lepiej nanieść po zakończeniu pracy w klasycznym edytorze.
Prompt: co zachować, co zmienić
Opis warto podzielić na cztery części:
- Stały podmiot — kim lub czym jest główny element.
- Zakres zachowania — poza, rysy, ubranie, kadr albo produkt.
- Zmiana — styl, tło, paleta, światło i faktura.
- Wykluczenia — nowe osoby, tekst, dodatkowe kończyny lub niepożądane obiekty.
Przykładowy neutralny prompt:
Ta sama wyraźnie dorosła, w pełni ubrana fikcyjna modelka w grafitowym płaszczu, zachowana poza i rysy; nocna ulica po deszczu, kinowe bursztynowe światło, subtelne ziarno, realistyczna tkanina, bez nowych osób, bez napisów i bez zmiany dłoni.
Zamiast naśladować nazwisko konkretnego żyjącego artysty, opisz obserwowalne cechy: medium, paletę, rodzaj linii, kontrast i kompozycję. Referencje stylu powinny być własne, licencjonowane lub należeć do domeny publicznej.
Globalna transformacja czy maska?
Globalna transformacja sprawdza się przy zmianie całej estetyki, na przykład z fotografii na ilustrację. Jeśli celem jest korekta tła, koloru ubrania lub pojedynczego rekwizytu, użyj maski. Ogranicza ona obszar, w którym model może ingerować.
Maskę maluj z małym marginesem wokół obiektu. Zbyt ciasna zostawia twardą obwódkę, a zbyt szeroka przebudowuje sąsiednie elementy. Przy twarzy unikaj przypadkowego objęcia włosów, szyi i tła, jeśli mają pozostać bez zmian. Krawędzie kontroluj na powiększeniu.
Złożoną zmianę rozbij na etapy. Najpierw popraw tło, potem światło, a na końcu detal. Jedno polecenie żądające nowego stroju, wnętrza, pozy, makijażu i stylu zwykle utrudnia ustalenie, skąd pojawił się błąd.
Metoda iteracji A/B/C
Wygeneruj trzy wersje z tym samym promptem i różną siłą transformacji. Nadaj im jasne nazwy, na przykład low, mid i high. Porównaj:
- zgodność rysów i proporcji;
- czytelność dłoni i oczu;
- zgodność oświetlenia z tłem;
- jakość krawędzi maski;
- obecność nowych, niezamówionych elementów;
- szczegółowość po powiększeniu do 100%.
Wybierz najbardziej stabilny wariant, a następnie zmień tylko jeden element promptu. Jeśli platforma pozwala ustawić seed, zachowaj go. Dzięki temu kolejne próby są prawdziwymi wariantami tego samego pomysłu, a nie całkowicie nowymi losowaniami.
Nie oceniaj wyłącznie atrakcyjności miniatury. Porównaj wynik ze źródłem obok siebie i sprawdź, czy model nie zmienił faktów: liczby osób, rodzaju kontaktu, wieku postaci, logotypu produktu albo cech potrzebnych do ciągłości serii.
Od statycznego obrazu do filmu
Zaakceptowaną klatkę można ożywić w image-to-video. Przed tym etapem usuń drobne artefakty, ponieważ ruch często je wzmacnia. W promptach wideo określ, co ma pozostać nieruchome, jaki jest kierunek ruchu i czy kamera ma pracować.
Jeśli po animacji potrzebna jest dodatkowa stylizacja, wykonaj ją na kopii przez video-to-video. Zachowaj ciąg plików: źródło, edycja image-to-image, zatwierdzona klatka, animacja i finalny montaż. Taki zapis ułatwia zarówno korekty, jak i ustalenie pochodzenia materiału.
Prywatność i warunki platformy
Przed przesłaniem zdjęcia sprawdź, czy projekty są prywatne domyślnie, czy uploady służą do trenowania, jak długo pozostają na serwerze i jak działa trwałe usunięcie. Zweryfikuj licencję komercyjną oraz prawa operatora do wyniku. „Pełna własność” w reklamie musi mieć potwierdzenie w warunkach usługi.
Płatność określoną metodą ani brak publicznej galerii nie gwarantują anonimowości. Obraz może zawierać cechy biometryczne, lokalizację i prywatne wnętrza. Do materiałów poufnych stosuj minimalizację danych, kontrolę dostępu i ustalony termin usunięcia kopii roboczych.
Lista kontrolna przed publikacją
- Czy źródło jest własne lub poprawnie licencjonowane?
- Czy wszystkie rozpoznawalne osoby są pełnoletnie i wyraziły zgodę na ten zakres edycji?
- Czy wynik nie zmienia kontekstu w sposób krzywdzący lub wprowadzający w błąd?
- Czy dłonie, oczy, tekstury i krawędzie maski są poprawne?
- Czy usunięto prywatne dane i artefakty?
- Czy regulamin pozwala na planowane użycie komercyjne?
- Czy materiał syntetyczny wymaga oznaczenia?
Uncensored image-to-image AI jest najbardziej użyteczne jako kontrolowany edytor, nie jako obietnica braku reguł. Dobry rezultat powstaje z czystego źródła, jednoznacznego promptu, rozsądnej siły transformacji i małych iteracji. Zgoda, pełnoletność, prawa do obrazu oraz prywatność pozostają warunkiem każdego etapu.