Moin. Wer generative KI-Videomodelle mit gewöhnlichem Fließtext füttert, erlebt unweigerlich das pure Chaos: Gesichter verformen sich von Sekunde zu Sekunde, Kameraperspektiven springen unkontrolliert und Produkte morphen in bizarre Formen. Diffusionsmodelle sind gigantische Wahrscheinlichkeitsräume – und ohne deterministische mathematische Leitplanken raten sie blind ins Blaue.
Im professionellen B2B-Marketing können wir uns kein „Prompt-Lotto“ leisten. Eine Corporate-Brand oder ein Software-Unternehmen verzeiht keine driftenden Charaktere oder unsaubere Kameraschnitte. Genau hier setzt die FlowLabs Code-Architektur für Google Omni Flash an.
Anstatt vage Romane zu schreiben, steuern wir die Generierung über ein modulares System aus Entity-Ankern (@), kinetischen Direktiven (/) und latenten Stabilisierungs-Schilden. Hier ist der vollständige technische Leitfaden, wie dieser Stack in der Praxis aufgebaut ist und wie der Compiler im Hintergrund funktioniert.
1. Das LEGO-Prinzip: Warum endlose Fließtext-Prompts im Video versagen
Klassische Text-Prompts („Ein Mann im Anzug geht durch ein modernes Büro und spricht in die Kamera“) überlassen dem Modell hunderte Freiheitsgrade: Welcher Anzug? Welche Brennweite? Wie schnell geht er? Wann öffnet sich der Mund? Das Resultat ist bekannt: Halluzinierte Gliedmaßen und wechselnde Gesichter.
| Dimension | Naiver Standard-Prompt | FlowLabs / Omni Flash Code-Pattern |
|---|---|---|
| Charakter-Identität | Textbeschreibung („junger Gründer“) ➔ Morpht bei jedem Schnitt | @name Entity-Lock ➔ Feste Bindung an biometrische 3D-Referenzdaten |
| Stimm-Stabilität | Zufälliger Tonfall ➔ Akzentsprünge und wechselnde Stimmfarben | @voice Vokal-Lock ➔ Unveränderliche Zuweisung des akustischen Profils |
| Kamera-Choreografie | Zufällige Schwenks oder unkontrollierte Zooms | /tracking /dollyin ➔ Deterministischer Kamerawinkel und Brennweite |
| Physik & Stabilität | Flickern, zuckende Kanten und Geisterartefakte | /rigidhold /driftguard ➔ Latente Schilde zur Begrenzung von Vektordrifts |
| Lippensynchronität | Dauerhaftes Mundzappeln auch in Sprechpausen | Millisekunden-Mund-Status ➔ Klare Trennung von Sprech- und Schweigephasen |
2. Die 3 fundamentalen Entity-Anker (@)
Die Entity-Anker fungieren als unveränderliche Vektor-Referenzen im Inferenz-Speicher:
@name(Der Identitäts-Anker): Friert die Gesichtsbiometrie, Knochenstruktur und unverwechselbaren Merkmale des Darstellers ein (z. B.@CemGPT). Das Modell darf die Gesichtsgeometrie über Schnittgrenzen hinweg nicht neu interpretieren.@voice(Der Vokale Anker): Weist der sprechenden Person ein definiertes, akustisches Profil zu (z. B.@cem_voice: sonorer deutscher Bariton mit klarer Hanseaten-Kadenz). Sobald ein Charakter spricht, ist@voicezwingend erforderlich. Ohne diesen Anker halluzinieren Videomodelle willkürliche Akzente, Tonhöhen-Sprünge oder asynchrones Lippenflattern.@object(Der Materie-Anker): Sperrt physische Objekte, Hardwaresysteme, Bildschirme oder Fahrzeuge (z. B.@device_display,@product_unit), damit Logos, Tasten und Kanten exakt formstabil bleiben.
3. Lighting als Konsistenz-Anker: Warum Licht das Gesicht rettet
Hier liegt das größte Geheimnis professioneller KI-Videoproduktion, das 99 % der Creator übersehen: Diffusionsmodelle haben kein räumliches 3D-Gedächtnis aus Polygonen. Sie berechnen Gesichtsmerkmale, Knochenbau und Kleidungsfalten primär aus den Schattenverläufen und Highlight-Reflexionen.
Wenn ein Prompt das Licht nicht mathematisch fixiert, „erfindet“ das Modell bei jedem Kameraschnitt einen neuen Lichtvektor: Im ersten Shot kommt die Sonne von links (weiche Wangenschatten), im zweiten Shot steht ein Deckenstrahler darüber (harte Augenringe). Für das menschliche Gehirn sieht der Darsteller augenblicklich wie ein völlig anderer Mensch aus – der gefürchtete Facial Drift.
💡 Die 4 Säulen des deterministischen Lighting-Lockings:
- Kelvin-Farbtemperatur verankern: Ob
5600K overcast(neutrales nordisches Tageslicht),3200K tungsten(warme Innenraum-Beleuchtung) oder2800K golden hour– die Kelvin-Zahl muss clipübergreifend unverrückbar bleiben. - Kanten-Separation mit
/rimlight: Ein hochintensives Gegen-/Streiflicht trennt die Silhouette (Haare, Schultern) haarscharf vom Hintergrund. Es verhindert, dass Konturen im Hintergrundrauschen verschwimmen. - Kontrast-Verhältnis (Key-to-Fill): Befehle wie
/chiaroscurooder/rembrandtdefinieren das exakte Helligkeitsverhältnis zwischen beleuchteter und abgewandter Gesichtshälfte. - Atmosphärische Kohärenz (
/volumetric): Sichtbare Lichtkegel und Schwebepartikel (Crepuscular Beams) betten Darsteller und Architektur in denselben physikalischen Raum ein.
4. Der vollständige /SLASH-Codex: 40+ Direktiven für Regie, Optik, Licht & Physik
Anstatt vage Beschreibungen zu tippen, steuern wir die Inferenz mit dem internen Kimpress / FlowLabs Regie-Codex. Diese Tokens wirken wie Assembler-Befehle direkt auf die Cross-Attention-Schichten des Modells:
Kamera-Rigging & Bewegung
| Slash-Befehl | Kinetische Aktion & Verhalten | Einsatzbereich (Director Intent) |
|---|---|---|
/tracking |
Parallele Kamera-Mitfahrt auf Augenhöhe mit fixer Distanz | Dynamische Geh-Szenen, Begleitung durch Räume |
/dollyin / /dollyout |
Physische Vorwärts- oder Rückwärtsfahrt des Rigs im 3D-Raum | Spannungsaufbau, Fokusverstärkung oder Szenen-Exit |
/pushin / /pullout |
Subtiler, langsamer Kriechmodus auf Details zu / weg | Micro-Reaktionen, emotionale Offenbarung |
/orbit |
360-Grad-Radialrotation um den fixierten Subjekt-Anker | Heldenhafter Reveal, Raum-Präsentation |
/truckleft / /truckright |
Strikte Seitwärtsfahrt parallel zur Szene | Architektur-Fassaden, Vorbeifahrt an Arbeitsplätzen |
/craneup / /cranedown |
Vertikaler Jib-Arm Bogen von oben herab / aufsteigend | Eröffnungs-Shots, epische Szenerie-Abschlüsse |
/droneview |
Höhenflug mit fließender Gimbal-Ausrichtung | Landschaften, Firmengebäude, Fahrzeug-Verfolgung |
/whippan |
Extrem schneller Peitschenschwenk mit Bewegungsunschärfe | Nahtlose Match-Cuts zwischen zwei Locations |
/static |
Absolutes Fixieren der Kameraplattform; nur Darsteller bewegen sich | Trockene B2B-Kameraansprache, Cockpit-Framing |
Framing, Linsen & Optik
| Slash-Befehl | Optische Charakteristik | Einsatzbereich |
|---|---|---|
/establishing |
Weitwinkel-Totale (16mm–24mm) zur Verortung der Szene | Szenenauftakt, Architektur, Wetterlage |
/closeup |
Fokussierte Nahaufnahme auf Gesicht, Mimik oder Hände | Intensive Sprechmomente, emotionale Bindung |
/macro |
Extremer Makrofokus auf Texturen und Oberflächen | Uhrendetails, Materialprüfung, Displays |
/shallowdepth / /bokeh |
Messerscharfe Trennung mit butterweicher Hintergrundunschärfe | Isolierung des Speakers von unruhigem Hintergrund |
/lowangle |
Untersicht von unten nach oben | Autorität, Souveränität, imponierende Haltung |
/overhead |
Senkrechte 90-Grad-Vogelperspektive (Top-Down) | Table-Top-Setups, UI-Boards, Lagepläne |
/rackfocus |
Verlagerung der Schärfeebene von Vorder- auf Hintergrund | Lenkung des Zuschauerblicks auf ein Produkt/Detail |
Lighting, Photonen-Ratio & Atmosphäre
| Slash-Befehl | Photonen-Geometrie & Spektrum | Atmosphärischer Nutzen & Konsistenz |
|---|---|---|
/rimlight |
Hartes Gegenlicht für präzise Kanten-Separation | Goldstandard für Gesichtskonsistenz: trennt Silhouette vom Rauschen |
/volumetric |
Sichtbare Lichtkegel durch atmosphärische Partikel (God Rays) | Echtes Raumgefühl, filmische Tiefenstaffelung |
/overcast |
Diffuses 5600K Himmelslicht mit weichen, neutralen Schatten | Ehrliche nordische Sachlichkeit, reflexionsfrei für Produkte |
/goldenhour |
Tiefstehende Sonne (2800K–3200K) mit langen, warmen Schatten | Emotionale Wärme, Aufbruchsstimmung, Testimonials |
/bluehour |
Dämmerungslicht (7500K–9000K) mit tiefem Cyan- und Indigoton | Eleganz, Tech-Atmosphäre, hochwertige Nachtszenen |
/chiaroscuro |
Harte Hell-Dunkel-Kontraste nach Renaissance-Vorbild | Dramatische Introspektion, tiefgründige B2B-Storys |
/rembrandt |
Klassisches 45-Grad-Dreieck auf der Schattenwange | Natürliche Gesichtsautorität im B2B-Interview |
/tungsten |
Warmer 3200K Kunstlicht-Glow | Gemütliche Büroatmosphäre, Kaminfeuer, Hotel-Lounge |
/caustics |
Fließende Lichtreflexionen von Wasseroberflächen | Luxus-Bäder, Spa-Bereiche, futuristisches Glasdesign |
Kinetik & Zeit-Dynamik
| Slash-Befehl | Temporale Propagation | Wirkung & Einsatz |
|---|---|---|
/slowmo |
High-Frame-Rate Rendering (60–120fps) | Betonung von Gewicht, Sportler-Fokus, fließenden Stoffen |
/speedramp |
Fließender Wechsel zwischen Echtzeit und Zeitlupe | Kinoreife Action-Hooks, Aufprallmomente |
/timelapse / /hyperlapse |
Temporale Zeitraffung mit oder ohne Kamerafahrt | Wetterwechsel, Baufortschritte, dynamische Stadtrundgänge |
/dollyzoom |
Vertigo-Effekt (Fahrt vorwärts bei gleichzeitigem Zoom zurück) | Schock, plötzliche Erkenntnis, psychologische Tiefe |
Latente Guardrails & Anti-Drift-Schilde
| Slash-Befehl | Mathematische Schutzschranke | Verhindertes Problem |
|---|---|---|
/locksubject |
Friert die anatomische Gesamterscheinung im Vektor-Raum ein | Körpergrößen-Drift und Haltungsbrüche |
/faceid |
Bindet Gesichtsmerkmale fest an die 3D-Referenzdaten | Gesichtsverformungen bei wechselnden Winkeln |
/wardrobelock |
Sperrt Textur, Schnitt und Farbe der Kleidung | Morphende Anzugkragen oder wechselnde Farbnuancen |
/rigidhold |
Nicht-deformierbare Netzbeschränkung auf Hartteile | Verbiegen von Autos, Glasfronten, Laptops und Produkten |
/driftguard |
Verankert Hintergrund-Geometrie und globale Fixpunkte | Verschwimmende oder schmelzende Wände und Gebäude |
/smoothflow |
Temporaler Glättungsfilter über die gesamte Bewegungstrajektorie | Ruckeln, stotternde Phasen und Artefakt-Sprünge |
/antiflicker |
Luminanz-Normalisierung zwischen aufeinanderfolgenden Frames | Helligkeits-Flickern auf Gesichtern und Glasflächen |
5. Die 5-Schichten-Architektur eines Produktions-Prompts
Jeder Befehl in unserer Pipeline wird strikt in fünf hierarchischen Schichten aufgebaut – flexibel für Hochformat (9:16 Social) und Querformat (16:9 Web & Cinema):
[SCHICHT 1: KINETISCHE & OPTISCHE DIREKTIVEN]
/establishing /tracking /dollyin /shallowdepth
[SCHICHT 2: LIGHTING KEY & PHOTONEN-GEOMETRIE]
/overcast /rimlight /volumetric
Beleuchtungs-Vektor: 5600K neutrales Nordlicht, 3:1 Key-to-Fill Ratio, scharfes Rimlight für Kanten-Separation, diffuse Kontaktschatten.
[SCHICHT 3: LATENTE SCHILDE & PHYSIK-SCHUTZ]
/locksubject /faceid /wardrobelock /seedlock /smoothflow /driftguard /rigidhold /antiflicker
[SCHICHT 4: SZENEN-CHRONOLOGIE & AKTIONEN]
00:00.0 - 00:02.5: @CemGPT betritt das moderne Buero, Blick fokussiert in die Kamera. Mund fest geschlossen.
00:02.5 - 00:04.5: @CemGPT spricht lippensynchron im Praesenz-Ton @cem_voice: „Moin. Wer seine Prozesse automatisiert, gewinnt Zeit.“
[SCHICHT 5: PARAMETER & NEGATIV-LEITPLANKEN]
No morphing, no limb distortion, consistent lighting vector, no text on clothing.
Aspect Ratio: Adaptive (9:16 Social / 16:9 Cinema) | Duration: 4.5s | FPS: 24
6. Die 3-Stufen-Compiler-Pipeline („Was das System verbirgt“)
Wer rohe Befehle unreflektiert in ein Diffusionsmodell wirft, scheitert oft an einem kuriosen Nebeneffekt: Das Modell versucht manchmal, das wörtliche Textzeichen @ auf Hemden oder Displays zu malen. Unser interner Compiler führt daher vor der Inferenz drei Schritte aus:
- Token-Resolution: Der Compiler löst rohe Entwickler-Variablen (wie
@CemGPT) in natürliche, hochauflösende Substantive auf, verknüpft sie jedoch im Hintergrund fest mit den Vektor-Referenz-Sheets der Inferenz-Session. - Mund-Status & Stimm-Isolierung: Das System deklariert für jeden Zeitabschnitt explizite Zustände:
mouth closed,moves in syncoderfrozen closed. Bei Dialogen erzwingt der Compiler Strict Speaker Isolation – nur der aktive Sprecher mit zugewiesenem@voicedarf die Lippen bewegen. - Der 200ms Anti-Bleed Stille-Puffer: Zwischen Dialogwechseln wird exakt ein Puffer von 0,2 Sekunden absoluter Stille erzwungen (z. B. Sekunde
00:04.8 bis 00:05.0). Ohne diesen Puffer verschluckt die Audio-Engine Satzenden oder erzeugt unschönes Echo.
7. Master JSON-Spezifikation für Google Omni Flash Agent Mode
Für automatisierte Workflows (z. B. via n8n oder Cloud-Inferenz) wird der Prompt als deterministisches JSON-Objekt an die Inferenz-Schnittstelle übergeben – mit eigenem Lighting- und Photonen-Block:
{
"project": "Kimpress B2B Studio Showcase",
"generation_mode": "Google Omni Flash Agent Mode",
"technical_blueprint": {
"camera": "ARRI Alexa Mini LF, 35mm anamorphic prime lens",
"fps": 24,
"format": "Adaptive (9:16 Social / 16:9 Cinema)",
"duration_sec": 10.0
},
"lighting_blueprint": {
"color_temperature": "5600K overcast neutral daylight",
"key_fill_ratio": "3:1 directional key",
"directives": ["/rimlight", "/volumetric", "/overcast"],
"rim_separation": "crisp hair and shoulder silhouette lock",
"ambient_shadows": "soft diffuse contact shadows without luminance strobing"
},
"entity_locks": {
"character_anchor": "@CemGPT_3D_Master_Vektor_v2",
"voice_anchor": "@cem_voice"
},
"sequence_structure": [
{
"clip_id": "shot_01_hook",
"timecode": "00:00.0 - 00:03.0",
"camera": "/dollyin /tracking /shallowdepth",
"lighting": "/rimlight /volumetric /overcast",
"action": "Creator geht zielstrebig durch den Raum, Blickkontakt zur Linse. Mund geschlossen.",
"audio": {
"speaker": "@CemGPT",
"voice": "@cem_voice",
"voiceover": "Moin. Wer seine Prozesse automatisiert, gewinnt echte Freiheit.",
"timing_constraint": "Voiceover finishes at 00:02.8. 0.2s silence gap."
},
"shields": ["/faceid", "/rigidhold", "/driftguard", "/wardrobelock", "/antiflicker"]
}
],
"negative_prompts": [
"morphing faces",
"jittering hands",
"unnatural lip sync",
"changing light angle",
"luminance strobing",
"cartoon look",
"overlapping voices"
]
}
8. Vollständiges Python-Artefakt: Der Omni Flash Prompt Compiler
Hier ist das lauffähige Python-Tool, mit dem wir Directorial-Prompts parsen, Slash-Befehle (Kamera, Lighting, Schilde) trennen, die @voice-Bindung validieren und verifizierte Payloads für Google Omni Flash kompilieren:
# Vollstaendiges, verifiziertes Produktions-Script: Der Omni Flash Prompt Compiler
# Zero External Dependencies (nutzt ausschliesslich Python Standard Library)
import re
import json
from dataclasses import dataclass, asdict
from typing import List, Dict, Any, Optional
CAMERA_DIRECTIVES = {
"tracking", "dollyin", "dollyout", "orbit", "closeup", "macro",
"whippan", "establishing", "shallowdepth", "lowangle", "highangle",
"overhead", "craneup", "cranedown", "truckleft", "truckright", "pov"
}
LIGHTING_DIRECTIVES = {
"rimlight", "chiaroscuro", "rembrandt", "butterfly", "toplight",
"volumetric", "goldenhour", "bluehour", "overcast", "tungsten",
"hazylight", "lowfog", "caustics", "lensflare"
}
LATENT_SHIELDS = {
"locksubject", "faceid", "seedlock", "smoothflow",
"driftguard", "rigidhold", "anatomyanchor", "wardrobelock", "antiflicker"
}
@dataclass
class CompiledOmniFlashShot:
shot_id: int
timecode: str
camera_directives: List[str]
lighting_directives: List[str]
latent_shields: List[str]
visual_entities: List[str]
voice_anchor: Optional[str]
mouth_state: str
cleaned_visual_prompt: str
audio_dialogue: Optional[str] = None
anti_bleed_buffer_ms: int = 200
def compile_omniflash_prompt(raw_text: str) -> Dict[str, Any]:
"""
Kompiliert rohe Directorial Slash- und Entity-Befehle (/ und @)
in einen deterministischen Google Omni Flash Agent Payload mit Lighting-Lock.
"""
# 1. Direktiven nach Funktionsbereichen parsen
slash_tokens = re.findall(r"/([a-zA-Z0-9_]+)", raw_text)
camera_cmds = [t for t in slash_tokens if t in CAMERA_DIRECTIVES]
lighting_cmds = [t for t in slash_tokens if t in LIGHTING_DIRECTIVES]
shield_cmds = [t for t in slash_tokens if t in LATENT_SHIELDS]
# 2. Entity- & Voice-Anker isolieren
raw_entities = re.findall(r"@([a-zA-Z0-9_]+)", raw_text)
voice_candidates = [e for e in raw_entities if "voice" in e.lower()]
voice_anchor = f"@{voice_candidates[0]}" if voice_candidates else None
visual_entities = [f"@{e}" for e in sorted(set(raw_entities)) if "voice" not in e.lower()]
# 3. Timecode ermitteln
tc_match = re.search(r"(d{2}:d{2}(?:.d+)?s*-s*d{2}:d{2}(?:.d+)?)", raw_text)
timecode = tc_match.group(1) if tc_match else "00:00.0 - 00:04.5"
# 4. Dialog & Mund-Status analysieren (Minerva-Gate)
mouth_state = "frozen_closed"
dialogue_text = None
warnings = []
dialogue_match = re.search(r'[„"]([^„“”"]+)[“”"]', raw_text)
if dialogue_match:
dialogue_text = dialogue_match.group(1)
is_speaking = bool(
dialogue_text or
"moves in sync" in raw_text.lower() or
"spricht" in raw_text.lower() or
"lippensynchron" in raw_text.lower()
)
if is_speaking:
mouth_state = "active_lip_sync"
if not voice_anchor:
warnings.append(
"MINERVA-VALIDIERUNG: Sprech-Aktion ohne expliziten @voice-Anker! "
"Gefahr von Vokal-Drift und Sprachhalluzination."
)
elif "listening" in raw_text.lower() or "zuhoeren" in raw_text.lower():
mouth_state = "sealed_listening"
# 5. Token-Resolution: Bereinige Prompt fuer Diffusions-Inferenz
cleaned = re.sub(r"@[a-zA-Z0-9_]*voice[a-zA-Z0-9_]*s*:?", ":", raw_text, flags=re.IGNORECASE)
cleaned = re.sub(r"/[a-zA-Z0-9_]+", "", cleaned)
cleaned = re.sub(r"@([a-zA-Z0-9_]+)", r"\1", cleaned)
if tc_match:
cleaned = cleaned.replace(tc_match.group(0), "")
cleaned = re.sub(r"s+:", ":", cleaned)
cleaned = re.sub(r":+", ":", cleaned)
cleaned = re.sub(r"s+", " ", cleaned).strip().lstrip(":").strip()
shot = CompiledOmniFlashShot(
shot_id=1,
timecode=timecode,
camera_directives=camera_cmds,
lighting_directives=lighting_cmds,
latent_shields=shield_cmds,
visual_entities=visual_entities,
voice_anchor=voice_anchor,
mouth_state=mouth_state,
cleaned_visual_prompt=cleaned,
audio_dialogue=dialogue_text,
anti_bleed_buffer_ms=200
)
return {
"engine": "Google Omni Flash Agent Mode",
"compiler_version": "2026.3-flowlabs",
"strict_speaker_isolation": True,
"lighting_validation": "LOCKED" if lighting_cmds else "UNLOCKED_WARNING",
"validation_status": "PASS" if not warnings else "FLAGGED_FOR_REVIEW",
"validation_warnings": warnings,
"compiled_shot": asdict(shot)
}
# Verifizierter Sandbox-Durchlauf mit Lighting-Pass
sample_directorial_input = (
"00:00.0 - 00:04.5: /establishing /tracking /dollyin /overcast /rimlight /volumetric /locksubject /faceid /driftguard "
"@CemGPT betritt das Buero, mouth moves in sync @cem_voice: „Moin. Wer seine Prozesse automatisiert, gewinnt Zeit.“"
)
if __name__ == "__main__":
compiled_result = compile_omniflash_prompt(sample_directorial_input)
print(json.dumps(compiled_result, indent=2, ensure_ascii=False))
9. B2B-Umsatzhebel & Dein Einstieg bei Kimpress
Statt Wochen mit Prompt-Engineering und Fehlversuchen zu verschwenden, erhalten Unternehmen bei Kimpress schlüsselfertige Ergebnisse:
- Erstes Test-Video (10–20 Sek.): 100 % KOSTENLOS (0 €) als verbindlicher Proof of Value vorab. Wir testen deine visuelle Identität und liefern dein erstes fertiges Creative in 48 Stunden.
- Schlüsselfertiges 12er-Video-Paket (1.950 € Festpreis): 12 fertige Full-HD / 4K Videos (20–45s) – flexibel optimiert für jedes Format (9:16 Social & 16:9 Web/Cinema) inklusive AIDA-Skripting, Sprecher-Synthese, Schnitt, animierten Untertiteln und Google Omni Flash Choreografie. Rechnerisch 162,50 € pro Video – transparenter Festpreis, flexibel auf Abruf.
Dein kostenloses 10–20s Test-Video anfordern
Erlebe den Unterschied zwischen wackeligen Hobby-Prompts und deterministischer Video-Architektur – 100 % kostenlos zum Kennenlernen.
Kostenloses Test-Video anfragen ➔