AI VIDEO

Teile fallen, die Luft friert, das Auto steht.

Auf dieser Bergstraße hat nie ein Auto gestanden, und gefilmt habe ich sie auch nicht. Vier Referenzbilder aus ChatGPT, ein Prompt mit Sekundenstempeln, zehn Sekunden Seedance 2.5 — und das Auto baut sich mitten in der Luft zusammen.

  • ChatGPT
  • Artlist
  • 40 Min
  • Fortgeschritten

ERGEBNIS

Das ist dabei rausgekommen.

  • 4Referenzbilder
  • 1Prompt mit Sekundenstempeln
  • 10sein Take, kein Schnitt
  • 9:161080 × 1920 aus Seedance 2.5
  • Blick nach oben in den Abendhimmel, hoch über der Bergstraße schwebt ein Schwarm winziger dunkler Autoteile Der Himmel wirft ab0:00 – 0:02
  • Die Kamera ist auf die Straße heruntergeschwenkt, blaue Karosserieteile und Räder schlagen mit Bewegungsunschärfe auf dem Asphalt auf Aufschlag auf dem Asphalt0:02 – 0:03
  • Zwei geschlossene Fäuste am unteren Bildrand, darüber stehen Räder, Türen und Karosserieteile reglos in der Luft Fäuste zu, Schwerkraft aus0:03 – 0:05
  • Die Teile sind zu einem blauen Nissan Skyline R34 zusammengeschlagen, unter den Reifen steht eine Staubwolke Alles auf einmal nach innen0:05 – 0:06
  • Eine schnippende Hand im Vordergrund, dahinter steht der blaue R34 mit eingeschalteten Scheinwerfern auf der Straße Schnipsen, Licht an, weg0:07 – 0:10

DAS BRAUCHST DU

Womit das gebaut ist.

  • ChatGPT
  • Artlist
  • Leere Alpenstraße im Sonnenuntergang, links Felswand, rechts Leitplanke und Tal mit See, im Asphalt ein reparierter Riss @image1 · die leere BühneStraße, Licht, Bodenmarke
  • Ich-Perspektive auf der Bergstraße: zwei Hände am unteren Bildrand, darüber schweben die Einzelteile des blauen R34 reglos in der Luft @image2 · der FreezeBildaufbau und Hände
  • Der fertig zusammengebaute blaue R34 steht mit der Front zur Kamera auf der Bergstraße, davor zwei Fäuste am unteren Bildrand @image3 · das ZielSollte die Ausrichtung setzen
  • Blauer Nissan Skyline R34 GT-R von schräg vorn vor hellgrauem Studiohintergrund @image4 · die Identität des AutosForm, Farbe, Felgen, Linien

ANLEITUNG

So baust du es nach.

  1. Die leere Bühne bauen

    Zuerst entsteht in ChatGPT die Straße, auf der später alles passiert — hochkant, freier Vordergrund, Licht von hinten. Zwei Dinge müssen drin sein: eine klar erkennbare Bodenmarke, bei mir der reparierte Riss im Asphalt, und ein Vordergrund, in dem nichts steht. Die Marke ist der Anker, an dem das Auto später landet, und ohne freien Vordergrund ist kein Platz für die Teile. Genau dieses Bild wird @image1 und setzt Straße, Kameraposition, Licht und Schattenrichtung für den ganzen Clip.

  2. Das Auto einmal sauber fotografieren lassen

    Das zweite Bild ist ein reines Katalogfoto: der Wagen von schräg vorn, schlichter Hintergrund, sonst nichts. Es wird @image4 und ist die einzige Quelle für Form, Farbe, Felgen und Karosserielinien. Alles, was auf diesem Bild zu sehen ist, bekommst du im Video — und alles, was fehlt, erfindet das Modell. Deshalb lieber ein langweiliges, scharfes Studiofoto als eine stimmungsvolle Aufnahme mit halb verdeckten Rädern.

  3. Den Freeze und das Ziel vorzeichnen

    Jetzt kommen die beiden Bilder, die den Clip eigentlich regieren: einmal der Moment, in dem die Teile in der Luft stehen und die Hände von unten ins Bild kommen (@image2), und einmal das fertige Auto an seinem Platz (@image3). Beide entstehen wieder in ChatGPT, beide in derselben Perspektive wie @image1. Das erste legt Bildaufbau und Handhaltung fest, das zweite die Endposition. Lies dazu unbedingt die erste Lektion weiter unten — @image3 hat bei mir eine Anweisung im Prompt schlicht überstimmt.

  4. In Artlist die Referenzen laden und die Slots vergeben

    Im AI-Bereich von Artlist das Videomodell auf Seedance 2.5 stellen, Format 9:16, Dauer zehn Sekunden. Dann die Bilder hochladen. Die Reihenfolge im Referenz-Bereich entscheidet, welches Bild @image1, @image2 und so weiter ist — der REFERENCES-Block ganz oben im Prompt muss exakt dazu passen. Vier Bilder, vier Slots — jedes hat im Prompt eine Aufgabe.

  5. Den Prompt einsetzen und die Uhr anpassen

    Der Prompt unten ist für zehn Sekunden geschrieben. Bei anderer Cliplänge verschiebst du die Zeiten im ACTION-Block und hältst die Abstände proportional — die Reihenfolge der Beats ist wichtiger als die exakte Sekunde. Was du inhaltlich anfasst, sind nur zwei Stellen: die Bodenmarke, an der das Auto landet, und das Auto selbst. Der Rest, vor allem der LOCKS-Block, bleibt wortgetreu stehen.

  6. Rendern und zuerst die Ausrichtung prüfen

    Nach dem Rendern nicht auf die Physik schauen, die sitzt meistens. Schau auf das fertige Auto: Steht es so herum, wie du es geschrieben hast? Wenn nicht, liegt es fast nie am Text, sondern am Zielbild — und dann tauschst du das Bild aus, statt den Satz noch einmal zu verschärfen.

CREATOR KIT

Alles, was du brauchst.

auto-aus-der-luft.txt
Create a single continuous photorealistic 9:16 image-to-video shot on a narrow alpine mountain road at golden hour.

REFERENCES

@image1 is the empty location reference. It defines the environment, road layout, camera position, lighting, road texture, repaired crack in the asphalt, rocky cliff on the left, guardrail and valley on the right, distant lake, mountains and sunset light.

@image2 is the freeze moment reference. It defines the first-person POV framing with bare hands entering from the bottom of frame and the car parts suspended in mid air. Use it as the key reference for the stopped floating-parts moment.

@image3 is the completed-car staging reference. It defines the correct final orientation of the car: the Nissan Skyline GT-R R34 is fully assembled with its REAR facing the POV camera and its FRONT facing away down the road, so it can drive naturally away into the distance.

@image4 is the identity reference for the car. From the moment the car is fully assembled, it must match this image exactly in shape, colour, proportions, wheels, body lines and overall design.

SCENE

First-person POV on a mountain pass road at sunset. The shot feels like a real handheld action camera at eye level. Only bare forearms and hands may enter frame from the bottom edge. The environment must remain consistent with @image1 the whole time.

The car is a blue Nissan Skyline GT-R R34.

The fixed ground mark is the repaired crack in the asphalt. The car assembles beside that crack.

IMPORTANT STORY BEATS

There are THREE distinct hand gestures:

1. first hand gesture stops the parts in mid air
2. second hand gesture pulls the parts together and assembles the car
3. final finger snap turns on the lights, starts the engine, and the car drives away

ACTION

0.0s to 1.8s — the shot begins on the mountain road environment. Car parts are already present in motion and then settle into the scene as if they have just been falling. The camera tilts naturally and feels alive, but the operator stays on the same spot.

1.8s to 2.2s — both hands rise into frame from the bottom edge and close into fists in front of the lens.

2.2s — on that exact frame, gravity switches off and every single car part STOPS in mid air.

2.2s to 4.0s — true freeze moment. The separate parts remain suspended in mid air around the build point, clearly separated, solid, readable, and floating in three-dimensional space. This moment should look like @image2. The car is NOT assembled yet. The rear-side components are closest to the camera, because the completed car will end up with its rear facing the POV.

4.0s — second distinct hand gesture. One fist snaps shut / pulls inward.

4.0s to 5.4s — the parts are pulled in and assemble progressively, piece by piece, not as an instant morph. The assembly order should be readable:
first chassis and structural core,
then drivetrain and suspension,
then rear section,
then side panels and doors,
then front section,
then wheels,
then glass,
then wing and final trim.
All parts fly inward toward one build point on the road beside the repaired crack.

The car must assemble in the correct orientation shown by @image3:
REAR toward the camera,
FRONT away from the camera,
aligned with the road so it can drive forward away from camera.

5.4s — final part clicks into place. The completed Nissan Skyline GT-R R34 stands fully assembled on all four wheels. Suspension compresses slightly and rebounds once. Small burst of dust at tyre contact.

5.4s to 6.8s — the car stands still in completed form, rear toward camera, engine still off, lights still off.

6.8s to 7.0s — one hand comes slightly up again, preparing for the snap.

7.0s — final finger snap. On that exact frame the headlights turn on bright white and the engine fires instantly with a sharp aggressive bark.

7.0s to 7.4s — the engine settles for a very short beat, headlights remain on, the car loads up naturally as if gear is engaged.

7.4s to last frame — the car pulls away smoothly and powerfully, driving FORWARD away from the POV camera down the mountain road, following the curve naturally into the distance. No drifting, no sliding toward camera, no warping, no deformation.

LOOK

Ultra photorealistic, real action-camera feel, real lens behaviour, natural motion blur, subtle sensor grain, realistic golden-hour lighting, realistic shadows, realistic reflections on blue paint, realistic asphalt contact, cinematic but believable.

LOCKS

- keep the same environment and framing language as @image1
- keep the freeze composition and hands feeling of @image2
- keep the completed car orientation of @image3
- keep the exact car identity of @image4
- true mid-air stop before assembly
- assembly must be progressive and readable
- car must finish rear-first to camera
- only after the final finger snap do lights and engine activate
- only after that does the car drive away
- no extra people
- no extra vehicles
- no text
- no unnatural morphing
- no geometry warping
- no car driving toward camera

SETTINGS

Die Einstellungen im Überblick.

Einstellungen
PlattformArtlist, AI-Bereich
ModellSeedance 2.5
Referenzen4 Bilder, jedes im Prompt adressiert
Format9:16
Auflösung1080 × 1920
Dauer10 Sekunden
Tonaus dem Modell: Aufschläge, Motor, Wind
Bildquellealle vier Referenzen aus ChatGPT

WORAUF ES ANKOMMT

Darauf musst du achten.

  • Das Zielbild schlägt den Prompt-Text

    In meinem Prompt steht bei @image3 ausdrücklich, das fertige Auto stehe mit dem Heck zur Kamera und der Front die Straße hinunter, und im LOCKS-Block steht es gleich noch zweimal. Das Bild, das ich als @image3 hochgeladen habe, zeigt den Wagen aber mit der Front zur Kamera. Herausgekommen ist die Front. Das Modell hat sich für das Bild entschieden und den Satz ignoriert — und die Anweisung „fährt vom Betrachter weg" dann so gelöst, dass das Auto mit der Front zur Kamera rückwärts die Straße hinunterrollt. Wenn Bild und Text sich widersprechen, gewinnt das Bild. Also das Bild ändern, nicht den Satz.

  • Die Reihenfolge hält, die Uhrzeit nicht

    Jeder Beat aus dem ACTION-Block kommt, und zwar in genau der Reihenfolge, in der er dasteht: Fall, Aufschlag, Freeze, Einzug, Stand, Schnipsen, Abfahrt. Nur die Sekunden stimmen nicht. Der Freeze soll bei 2,2 s einsetzen und setzt bei rund 3,5 s ein, das Licht soll bei 7,0 s angehen und geht bei 7,3 s an, die Abfahrt soll bei 7,4 s beginnen und beginnt bei rund 9,0 s. Die Stempel sind eine Partitur, kein Timecode — sie sortieren, sie takten nicht.

  • Eine Geste, ein Schalter

    Der Prompt nennt die drei Handbewegungen ganz oben unter IMPORTANT STORY BEATS noch einmal einzeln durch, bevor sie im ACTION-Block ihre Zeit bekommen: Fäuste schließen hält die Teile an, die Faust einziehen holt sie zusammen, das Schnipsen macht Licht und Motor an. Jede Geste schaltet genau eine Sache. Hängt man zwei Änderungen an dieselbe Bewegung, wirkt keine von beiden richtig — und ein Adverb an der Hand („langsam", „sanft") bremst nicht die Hand, sondern den ganzen Clip.

  • Der LOCKS-Block ist die eigentliche Arbeit

    Alles, was unten unter LOCKS steht, sind keine Wünsche, sondern Gegengewichte zu bekannten Fehlleistungen: kein ganzes Auto, das vom Himmel fällt, ein echter Stillstand vor dem Zusammenbau, ein lesbarer Aufbau Stück für Stück, kein Morphen, kein verzerrtes Blech, kein Auto, das auf die Kamera zufährt. Diese Zeilen sind der Teil des Prompts, den du beim Anpassen nicht anfassen solltest — die Szene beschreibst du neu, die Sperren bleiben stehen.

Eine Straße, die nie ein Auto gesehen hat.

Vier Bilder, ein Prompt, zehn Sekunden. Die Bodenmarke und das Auto tauschst du aus, alles andere bleibt stehen.

Mehr Tipps auf @till.schae

FAQ

Häufige Fragen.

Muss ich die Straße selbst filmen?
Nein. Die Vorlage, auf der das hier aufbaut, stammt von @justdodani und arbeitet mit einem selbst gefilmten Handyclip als @video1 — zehn Sekunden, hoch in den Himmel schwenken, halten, auf den Boden tilten. Bei mir kommt die Straße stattdessen aus ChatGPT und geht als Standbild rein. Das Ergebnis unterscheidet sich kaum, weil der Prompt die Kamerabewegung ohnehin beschreibt. Der Vorteil des gefilmten Wegs ist, dass es wirklich deine Straße ist; der Vorteil des generierten Wegs ist, dass du dir die Bühne aussuchst.
Warum fährt das Auto am Ende mit der Front zur Kamera weg?
Weil mein Zielbild es so zeigt. Im Prompt steht dreimal, dass das Heck zur Kamera zeigen soll, aber @image3 zeigt die Front — und das Bild hat gewonnen. Das Modell hat die Anweisung „fährt weg" trotzdem befolgt und den Wagen rückwärts die Straße hinunterrollen lassen. Wenn du die Abfahrt nach vorn willst, erzeugst du dein Zielbild von hinten: derselbe Blickwinkel, dieselbe Straße, aber Heck zur Kamera.
Kommt der Ton wirklich aus dem Modell?
Ja. Seedance 2.5 rendert die Tonspur im selben Durchlauf mit — die Aufschläge auf dem Asphalt, das Anspringen des Motors, der Wind auf der Passhöhe. Im Prompt oben steht dazu bewusst nichts Eigenes; alles, was du hörst, hat das Modell aus der Szene abgeleitet. Wer Musik oder Untertitel ausschließen will, schreibt das ausdrücklich dazu, sonst legt es manchmal etwas darunter.
Geht der Prompt auch woanders als auf Artlist?
Ja, denn Seedance 2.5 läuft auf mehreren Plattformen. Die Vorlage von @justdodani ist für Higgsfield geschrieben, mein Paris-Video ist mit demselben Modell in Runway entstanden. Der Prompt selbst ist plattformunabhängig — unterschiedlich ist nur, wie die Referenzen adressiert werden. Auf manchen Oberflächen tippst du @ und wählst das Bild aus einer Liste, dann wird aus dem Text ein Chip mit Vorschaubild. Bleibt irgendwo @image3 als reiner Text stehen, ist es kein Verweis mehr, sondern eine Zeichenkette.