AI VIDEO

Fünf Memes, ein Spaziergang, kein Schnitt.

Ich laufe eine Pariser Straße entlang und treffe nacheinander fünf Gesichter, die jeder aus dem Netz kennt. Kein Schnitt, keine Montage: acht Referenzbilder liegen in Runway, ein einziger Prompt teilt ihnen ihre Rolle und ihr Zeitfenster zu, und Seedance 2.5 rendert daraus 23 Sekunden Handyvideo am Stück — inklusive Ton.

  • ChatGPT
  • Gemini
  • Runway
  • 45 Min
  • Fortgeschritten

ERGEBNIS

Das ist dabei rausgekommen.

  • 8Referenzbilder
  • 1Video-Prompt
  • 23sein Take, kein Schnitt
  • 9:161080p aus Seedance 2.5
  • Selfie-Ansicht: hinter dem Vlogger tippt sich ein Mann in schwarzer Lederjacke im Vorbeigehen an die Schläfe Der Schläfen-Tipp0:00 – 0:04
  • Ein Mann im Karohemd dreht sich mitten auf dem Gehweg nach dem Vlogger um, neben ihm läuft ein Kleinkind in Grün Der Blick zurück0:05 – 0:09
  • Ein Mann mit Schnurrbart lacht auf einer Pariser Caféterrasse unkontrolliert, die Gäste am Nebentisch reagieren nicht Das Lachen am Cafétisch0:10 – 0:14
  • Ein schwarzer Hund sitzt auf einem Bistrostuhl und starrt mit weit aufgerissenen Augen in die Kamera Der Hund, der nicht wegsieht0:15 – 0:19
  • Ein Mann im blauen Hemd mit Rucksack steht lächelnd auf dem Gehweg und sieht in die Kamera „Hi.“ — „Okay.“0:20 – 0:23

DAS BRAUCHST DU

Womit das gebaut ist.

  • ChatGPT
  • Gemini
  • Runway
  • Charakterbogen: links ein Brustbild, rechts eine Ganzkörperaufnahme desselben Mannes im dunklen Pullover vor weißem Hintergrund @image1 · VloggerCharakterbogen, zwei Panels
  • Pariser Straße mit Haussmann-Fassaden, Caféterrasse mit grüner Markise rechts und parkenden Autos links @image2 · LocationVordergrund komplett frei
  • Mann in schwarzer Lederjacke tippt sich mit dem Zeigefinger an die Schläfe und grinst @image3 · Schläfen-TippGeste und Grinsen
  • Ein Mann dreht sich auf der Straße nach einer Frau um, seine Begleiterin sieht ihn entgeistert an @image4 · Drei-Personen-SzeneNur das Paar, die Dritte bin ich
  • Mann mit Schnurrbart und grauem Strickpullover lacht in einem Fernsehstudio unkontrolliert @image5 · Der LacherStudio wird ignoriert
  • Schwarzer Hund mit weit aufgerissenen Augen auf einer Wohnzimmerdecke @image6 · Der HundDer Blick, nicht das Wohnzimmer
  • Lächelnder Mann im blauen Hemd mit Rucksack auf einem grünen Waldweg @image7 · Das LächelnHemd, Rucksack, Haltung
  • Kleinkind im grünen Anzug am Strand mit geballter Faust und entschlossenem Gesichtsausdruck ohne Slot · das KindHochgeladen, nie adressiert

ANLEITUNG

So baust du es nach.

  1. Einen Charakterbogen von dir bauen

    Ein normales Foto von dir in ChatGPT hochladen und Prompt 1 einsetzen. Heraus kommt ein Bogen mit zwei Panels: links Brustbild, rechts Ganzkörper, weißer Hintergrund. Das Outfit im Prompt ist das Outfit im Video — bei mir steht dort noch weißes T-Shirt und Jeans, benutzt habe ich am Ende die Version im dunklen Pullover. Trag ein, was du wirklich tragen willst, und beschreib es im Video-Prompt später noch einmal wörtlich.

  2. Die Location generieren

    Prompt 2 in Nano Banana 2 (Gemini) geben. Wichtig sind drei Stellen darin: die Caféterrasse rechts, der freie Vordergrund und das Negative-Prompt gegen lesbare Schriftzüge. Der freie Vordergrund ist der Grund, warum später Platz für die Begegnungen ist; lesbare Ladennamen wären in jedem Frame ein Wort, das das Videomodell neu erfindet.

  3. Die Vorlagen hochskalieren

    Die Vorlagen, die du treffen willst, liegen meistens als kleines, weich komprimiertes JPEG vor. In Runway einmal durch Upscale Image schicken, dann steht das Gesicht in einer Auflösung da, mit der das Videomodell etwas anfangen kann. Bilder mit Rand oder Balken vorher zuschneiden — der Rand ist sonst Teil der Referenz.

  4. Alles als Referenzen laden und die Slots vergeben

    In Runway links auf Tool, oben den Video-Tab, dann Reference. Alle Bilder in einem Rutsch hochladen, der Zähler zeigt danach 8/30. Die Reihenfolge dort bestimmt, welches Bild im Prompt @image1, @image2 und so weiter ist — der Block REFERENCE ASSIGNMENT ganz oben im Video-Prompt muss exakt dazu passen.

  5. Video-Prompt einsetzen und die @-Chips verbinden

    Den kompletten Video-Prompt ins Textfeld kopieren. Danach jedes @imageN löschen und an derselben Stelle ein @ tippen: Runway öffnet die Liste der Referenzen, du wählst das Bild, und aus dem Text wird ein Chip mit Vorschaubild. Bleibt irgendwo @image5 als reiner Text stehen, ist es kein Verweis, sondern eine Zeichenkette, die das Modell ignoriert.

  6. Rendern und die Geografie prüfen

    Unten rechts Seedance 2.5, darüber 1080p, Format 9:16, Dauer auf 25 Sekunden. Nach dem Rendern zuerst die Straße prüfen: Läuft er die ganze Zeit denselben Gehweg entlang, oder springt der Ort zwischendurch? Springt er, hat fast immer eine Referenz ihren eigenen Hintergrund mitgebracht — dann den Satz über die ignorierten Hintergründe verschärfen, statt die Szene umzuschreiben.

CREATOR KIT

Alles, was du brauchst.

01-charakterbogen.txt
Photorealistic character reference sheet on a plain seamless white background, two panels side by side of the same person @image1:
LEFT — chest-up portrait facing the camera, relaxed natural expression; RIGHT — full-body standing pose, head to toe, arms relaxed at their sides.
Keep the exact face, hair and skin from @image1 in both panels — same features, same hair length, texture and colour, same skin tone and texture, same natural asymmetry.
Do not beautify, do not slim, do not change the age, do not smooth the skin. Ignore the background, lighting, clothing and camera angle of @image1.
Wardrobe in both panels: a plain white crew-neck t-shirt, straight-leg mid-blue jeans, clean white low-top sneakers.
Soft even studio lighting, natural skin and fabric texture, sharp focus. No props, no text, no labels.

SETTINGS

Die Einstellungen im Überblick.

Einstellungen
ModellSeedance 2.5
Referenzen8 Bilder, 7 davon im Prompt adressiert
Format9:16
Auflösung1080p
Dauer25s angefragt, 23s geliefert
Tonaus dem Modell: Dialog, Straße, Café
KameraFront und Rück im selben Take

WORAUF ES ANKOMMT

Darauf musst du achten.

  • Referenzen sind Rollen, keine Kulissen

    Der entscheidende Absatz steht ganz oben: Die Vorlagen sind ausdrücklich nur FACE, EXPRESSION, POSE AND GESTURE references, ihre Hintergründe, ihr Licht und ihr Bildausschnitt werden ignoriert und im Pariser Tageslicht neu aufgebaut. Ohne diesen Satz bringt der Lacher sein Fernsehstudio mit und der Hund sein Wohnzimmer.

  • Was du hochlädst, spielt mit

    In meiner Session lag ein achtes Referenzbild, das im Prompt keinen Slot bekommen hat. Es ist trotzdem aufgetaucht: In Begegnung 2 steht im Prompt ein Paar, im fertigen Video läuft neben dem Mann das Kind aus dem unbenutzten Bild. Das Modell liest den Reference-Tab, nicht nur die @-Chips — wer sauber choreografieren will, lädt nichts hoch, was er nicht adressiert.

  • Ein Take muss dreimal dranstehen

    Der Prompt sagt im ersten Satz ONE SINGLE UNINTERRUPTED HANDHELD TAKE, wiederholt an jedem Übergang SAME TAKE, NO CUT und schließt mit einem eigenen Absatz über die Kontinuität. Fünf Begegnungen sind für ein Videomodell die Einladung, fünf Clips zu schneiden — die Wiederholung ist das, was dagegenhält.

  • Zeitfenster statt Szenenliste

    Jede Begegnung hat einen Stempel — 0:00–0:05, 0:05–0:10 und so weiter — plus eine Angabe, wo sie auf dem Gehweg passiert und dass die Figur danach nie wiederkommt. Damit wird aus fünf Ideen ein Ablauf. Ohne die Stempel schiebt das Modell die Höhepunkte zusammen und lässt am Ende zwanzig Sekunden Laufen übrig.

Fünf Gesichter, die jeder sofort erkennt.

Ein Charakterbogen von dir, eine Location, fünf Vorlagen — den Rest macht der Prompt oben.

Mehr Tipps auf @till.schae

FAQ

Häufige Fragen.

Warum ein Charakterbogen und kein normales Foto?
Weil die Kamera im Video zwischen Selfie und Rückkamera wechselt und ich mal formatfüllend, mal von hinten und mal halb im Bild bin. Ein Brustbild allein zwingt das Modell, Hose, Schuhe und Silhouette zu erfinden — und genau die wechseln dann mitten im Take. Der Bogen mit Porträt und Ganzkörper liefert beides in einem Bild.
Kommt der Ton wirklich aus dem Modell?
Ja. Seedance 2.5 rendert die Tonspur mit: Straßengeräusch, Schritte, Cafégeschirr und die deutschen Sätze, die im Prompt stehen. Deshalb steht im Prompt ein eigener AUDIO-Block, der Musik, Untertitel und Grafiken ausdrücklich ausschließt — sonst legt das Modell gern einen Score darunter.
Warum sind es 23 Sekunden und nicht 25?
Im Prompt steht approximately 25 seconds, geliefert hat Runway 23. Der Regler geht bis 30 Sekunden, aber die Zeitstempel im Prompt sind die eigentliche Vorgabe: Das Modell hält sich an die Reihenfolge der Beats und beendet den Take, wenn die letzte Begegnung durch ist. Wer präzise landen will, verteilt die Beats auf die eingestellte Länge statt umgekehrt.
Darf ich bekannte Meme-Bilder als Referenz benutzen?
Auf den Vorlagen sind echte Menschen zu sehen, und die Fotos selbst gehören jemandem — daran ändert eine KI-Nachbildung nichts. Für ein privates Experiment ist das eine Sache, für Werbung oder alles Bezahlte eine ganz andere. Wenn du sichergehen willst, baust du dir eigene Gesichter mit derselben Geste: Der Prompt beschreibt Haltung, Blick und Timing so genau, dass er auch mit selbstgemachten Referenzen funktioniert.