So produziere ich ein Video

20.08.2026 | AI Coaching

⏱️ Lesezeit: ca. 7 Minuten · 🤖 mit KI-Unterstützung erstellt (Details am Ende)

Am 13. August ging mein erstes Video seit langer Zeit online. 7 Minuten und 7 Sekunden. Was mich daran am meisten überrascht hat: Nicht das Sprechen war schwer, sondern die vielen kleinen Entscheidungen drumherum — wo steht die Kamera, wie lese ich ab, ohne dass es auffällt, warum sieht das Thumbnail in klein aus wie Brei. Diesen Artikel hätte ich vorher gern gelesen. Also habe ich diesmal mitgeschrieben: Hier steht Schritt für Schritt, wie ich ein YouTube Video selbst produziere — vom fertigen Blogartikel über zwei Kamerapositionen bis zum Upload.

Das ist kein Profi-Setup. Es ist das, was ich hier am Schreibtisch habe.

🎥 Lieber schauen als lesen? Es gibt diesen Artikel auch als Video — zwölf Minuten, am echten Setup, mit allen Schritten zum Mitmachen:

iPhone auf einem Stativ neben dem Schreibtisch, dahinter Mac mini und Bildschirm — so kann man ein YouTube Video selbst produzieren.
Mehr ist es nicht: iPhone auf dem Stativ, Mac mini, Schreibtisch. Kein Studio.

Wie ich überhaupt hierher gekommen bin, steht im ersten Teil: Mein Relaunch als @Ingo Düsentrieb. Das hier ist die praktische Fortsetzung — das Handwerk dahinter. Und so sieht das Ergebnis aus, um dessen Herstellung es gleich geht:

Ablaufgrafik der Videoproduktion in sechs Schritten: Planung, Text, Visuals, Blog live, Video, Rausbringen. Ein Band nach Schritt 3 markiert „Der Artikel ist das Skript". Zwei Notizen zeigen, wo KI hilft.
Der ganze Ablauf auf einen Blick — der Blogartikel entsteht zuerst, weil er später das Sprechskript ist.

Die Grafik kannst du haben. Als Vektor (SVG), als PDF zum Drucken und als PNG —
kostenlos. Du darfst sie verändern, weitergeben und in eigene Sachen einbauen,
auch in verkaufte, ohne mich zu nennen.

Content-Ablauf als Vektor-Grafik

Gumroad fragt dich dabei nach einem Preis. Trag eine 0 ein — das ist so gemeint.

Was brauche ich wirklich, um ein Video aufzunehmen?

KomponenteMeine Ausstattung
Stativ und Smartphone-HalterungEinfaches Cullmann Stativ mit Quadlock Halterung für mein iPhone-Case
drahtloses Mikrofon — Empfänger am Smartphone, Sender/Mikro am T-ShirtDJI Mic mit USB-C Receiver
Teleprompter App auf demselben SmartphoneTeleprompter Pro
Screenrecording SoftwareScreenflow
Video SchnittsoftwareFinal Cut Pro

Es reicht ein sehr einfaches Stativ. Um mein Handy darauf zu montieren habe ich einen Adapter gekauft, der an meine iPhone-Hülle passt. Das Case und die Halterung ist von Quadlock, das nutze ich auch am Fahrrad. Ein separates Mikrofon zu nutzen erhöht die Qualität sehr. Ich hatte ein drahtloses Mikrofon von DJI, das hat wechselbare Anschlüsse für alte und neue iPhones. Ich benutze die kostenlose Version der Teleprompter Pro App, das reicht für mich. Für meine Screenrecordings benutze ich Screenflow, den Schnitt erledige ich mit Final Cut Pro.

Der eigentliche Trick steckt in einer Zeile der Tabelle, die harmlos aussieht: Der Teleprompter läuft auf demselben iPhone, das filmt. Das klingt nach Kompromiss und ist in Wahrheit der Grund, warum das Ganze funktioniert — du guckst genau dahin, wo die Linse ist.

Was ich nicht habe bzw. nicht genutzt habe ist ein Licht-Setup, eine zweite Kamera und ein externes Sound-Recording-Interface.

Vom Artikel zum Skript

Hier kommt der erste echte KI-Anteil rein — und der Grund, warum bei mir immer der Blogartikel zuerst kommt: Der fertige Blog-Artikel ist das Skript. Er ist schon sortiert, schon geprüft, schon einmal durchdacht.

Mein Ablauf geht wie folgt: Aus dem Blog-Artikel entsteht ein gekürztes Sprechskript mit [KAM]– und [SCREEN]-Cues. Hier gibt die KI Vorschläge zu möglichen Aufnahmen und abwechselnde Kamerapositionen. Das Skript gehe ich natürlich durch damit es in meinem eigenen Tonfall, meiner Wortwahl ist. Ich habe der KI gesagt, wie ich dieses Skript zerlegt haben möchte, damit ich kurze einzelne Aufnahmen erstellen kann. In meinem Fall hat dann Claude ein kleines Python-Skript erstellt (skript-zu-teleprompter.py) mit dem der Sprechtext mit den Sprecher-Anweisungen (Cues) in kurze Text-Dateien gespeichert werden, die ich dann alle per AirDrop auf das iPhone übertrage.

Sprechskript für ein YouTube-Video mit eingefügten Kamera-Anweisungen [KAM] und [SCREEN] zwischen den Absätzen.
Aus dem Blogartikel wird das Skript — die Cues sagen mir, welche Kamera dran ist.

Natürlich muss ich den Text auch etwas anpassen da Schriftsprache und gesprochene Sprache sich unterscheiden. Nebensätze raus, Zahlen ausschreiben, jeden Satz laut probieren. Letzte Anpassungen kann man am Handy machen. Der Text läuft durch und man liest ihn dann ab. Nach zwei, drei Takes kennt man dann auch die Scroll-Geschwindigkeit, die für einen selbst die richtige ist. Bei mir ist es Speed 19. Diese Zahl findet man nur durch Ausprobieren, und sie ist bei jedem anders — aber mit einem Startwert probiert es sich leichter als bei null.

Die App Teleprompter Pro auf einem iPhone mit laufendem Sprechtext, montiert auf einem Stativ.
Teleprompter und Kamera sind dasselbe Gerät — deshalb stimmt die Blickrichtung.

Aufnehmen: zwei Positionen, drei Takes

Damit es für den Zuschauer abwechslungsreich und gut anzuschauen ist, empfiehlt es sich mindestens zwei Kamerapositionen zu benutzen. Ich stelle das Handy zum Einen neben den Schreibtisch etwa auf Augenhöhe in etwa 1,5 m Abstand zu mir. Dieser Abstand zum Sprecher ist schon groß genug, damit durch die Selfie-Kamera des iPhones nicht sichtbar wird, dass man nicht in die Linse schaut, sondern 8 cm daneben. Die andere Kamera Position ist bei mir neben dem Bildschirm. Diese Sicht benutze ich immer wenn ich Aktionen am Bildschirm kommentiere.

Eine wichtige Faustregel lautet: nach zwei, drei Takes sitzt es. Der perfekte Take kommt nicht, er wird nur später.

Nach der Aufnahme kann man den Clip sofort per AirDrop auf den Mac übertragen. Es lohnt sich nicht die Datei auf dem Handy zu speichern, das spart Aufräumen und Speicherplatz.

Am Anfang ist es natürlich komisch allein im Raum zu sitzen und in eine Kameralinse zu quatschen. Aber das hört nach dem dritten oder vierten Take auf.

Tatsächlich gehen die Aufnahmen sogar ziemlich schnell und man wird schnell besser.

Die Screenrecordings, also das zeigen von Vorgängen am Computer, mache ich danach. Im Kopf habe ich den Text den ich dazu aufgenommen habe, das Zeigen am Bildschirm passe ich ungefähr darauf ab.

Zweite Kameraposition: iPhone im Stativ direkt neben dem Bildschirm, für Passagen, in denen der Bildschirm kommentiert wird.
Position B neben dem Monitor — für alles, was am Bildschirm passiert.

Schneiden: die vier Handgriffe, die alles ausmachen

  • Alle Takes in die Timeline laden.
  • Den Ton der gesprochenen Takes in der Lautstärke etwas anheben, +12 dB.
  • Danach noch die Loudness automatisch anpassen.
  • Dann die einzelnen Aufnahmen vorne und hinten kürzen damit z.B. der Griff zur Kamera nicht mehr zu sehen ist.

Musik kann man noch ganz leise, −20 dB, unter alles legen. Diese Hintergrund-Musik habe ich aus der YouTube Studio Audio-Mediathek heruntergeladen, die kann man lizenzfrei nutzen (also nach Standardlizenz filtern, oder Künstler nennen). Ich habe nach Ambient und Inspirational gefiltert und mir einen Track gesucht, der lang genug war.

Am Ende des eigenen Videos muss man noch etwa 20 Sekunden Nachlauf für den Abspann haben. Hier wird dann später eingeblendet, welche anderen Videos man sich noch auf deinem Kanal anschauen kann. Dieser Abspann sollte mindestens noch etwas Musik enthalten, man kann aber auch noch etwas erzählen.

Natürlich gibt es jede Menge vorgefertigte Effekte für Überblendungen und Texteinblendungen in Final Cut (und in anderen Schnittprogrammen sicher auch), aber wenn möglich versuche ich meine selbst erstellten Templates zu nutzen, die ich mit Apple Motion erstellt habe.

Final-Cut-Pro-Timeline mit mehreren geschnittenen Takes, darunter die Tonspur und eine leise Musikspur.
Der Schnitt in Final Cut: Takes vorne und hinten kürzen, Ton anheben, Musik leise drunter.

Hochladen, ohne sich zu verbrennen

Wenn man sein Video hochlädt, setzt man es natürlich zuerst auf privat. Dann kann man in Ruhe alle weiteren Details und Infos zum Video ergänzen, ohne dass die eigenen Abonnenten etwas unfertiges zu sehen bekommen.

Neben dem Titel des Videos, der unter dem Clip steht, hat man das Vorschaubild, das ebenfalls Text enthält. Diese beiden Texte bilden zusammen quasi einen Satz, sie enthalten nicht zweimal dasselbe. Das Vorschaubild stellt die Frage, der Titel gibt die Antwort. Zwei Kleinigkeiten, die ich erst lernen musste: Der Titel darf höchstens 60 Zeichen haben, sonst schneidet YouTube ihn in der Übersicht ab. Und es heißt „KI“, nicht „AI“ — auf Deutsch wird nun mal deutsch gesucht.

In der Beschreibung fügt man eine Kapitel-Liste ein. Für die Kapitellängen gibt es Vorgaben, mindestens 10 Sekunden und die erste Marke beginnt bei 0:00. Die Zeiten lassen sich übrigens aus der herunterladbaren captions.sbv Datei heraussuchen. Diese Untertitel erstellt YouTube automatisch und diesen Text sollte man natürlich einmal durchlesen und wo nötig korrigieren. Das Transkribieren funktioniert sehr gut, aber bei Namen muss man eben manchmal nachhelfen. Die Untertitel stehen schon nach wenigen Minuten zur Verfügung.

YouTube Studio mit geöffnetem Beschreibungsfeld und einer Kapitelliste, die bei 0:00 beginnt.
Kapitelmarken gehören in die Beschreibung — erste Marke immer bei 0:00.

Das Thumbnail für das Video ist natürlich sehr wichtig. Ich habe mir in Affinity ein Template erstellt1280 × 720 Pixel, damit es meinem Branding folgt. Ich habe mir einige Kanäle angeschaut die mir selber gut gefallen und deren Thumbnails analysiert. Das Erstellen eines Fotos zum Video sollte passenderweise am selben Tag passieren an dem man die Video Clips aufnimmt.

Thumbnail-Vorlage in Affinity Designer mit Textfläche, Foto und den Markenfarben für den YouTube-Kanal.
Thumbnail nach eigener Vorlage in Affinity — damit jedes Video gleich aussieht.

Da natürlich viel auf dem Smartphone-Bildschirm konsumiert wird, muss dieses Thumbnail auch noch lesbar sein wenn es nur sehr klein zu sehen ist. Der Test ist, die Bildgröße auf eine Breite von 210 Pixel herunter zu rechnen. Was man da nicht entziffern kann fliegt raus.

Dasselbe YouTube-Thumbnail auf 210 Pixel Breite verkleinert — der Lesbarkeitstest für die Ansicht auf dem Smartphone.
Der 210-px-Test: Was hier nicht mehr lesbar ist, fliegt aus dem Thumbnail raus.

Als letztes noch dieser Tipp: Wenn man „speziell für Kinder“ angibt, hat man keine Endbildschirme, Infokarten, Kommentare und Merklisten.

Und noch einer, den man erst merkt, wenn es zu spät ist: „Einbetten erlauben“ muss angehakt sein. Sonst läuft das eigene Video im eigenen Blogpost nicht — so wie es oben in diesem Artikel läuft.

Wo die KI wirklich hilft – und wo nicht

Es gibt mehrere Stellen, an denen mir die KI geholfen hat. Aber vor der Kamera sitze ich, ich muss meinen Mut aufbringen und ich entscheide, ob ein Take gut genug geworden ist.
Im Detail sind diese Tätigkeiten für mich sehr hilfreich gewesen:

  • Den Artikel auf den Sprechtext herunter zu brechen.
  • Das Herausholen der Kapitelmarken.
  • Die Erstellung des Thumbnails nach meinen Branding Vorgaben. Ich konnte schnell mehrere Varianten erstellen lassen, die ich interaktiv in die von mir gewünschte Richtung bringen konnte.
  • Die KI hat in meiner Affinity Datei gearbeitet, die ich weiter abändern und verfeinern kann, auch später.
  • Der Workflow zum Check der Lesbarkeit in 210-px.
  • Kenntnisse der Details im Vorgehen zum Erstellen und Hochladen der Videos zu YouTube.

Die KI hat mir hier geholfen die Hürde des Machens herunter zu legen, dennoch bin ich derjenige der den Hintern hoch kriegen muss. Für mich ist der Einsatz von KI vergleichbar mit der Nutzung eines E-Bikes. Die Bequemlichkeit ist toll und ich erhöhe meinen Radius. Treten muss ich trotzdem. Wer sich nicht draufsetzt, kommt auch mit Motor nirgendwo an.

Was ich beim nächsten Mal anders mache

Einige Ideen und Verbesserungsvorschläge habe ich für mich auch mitgenommen.

  • Das nächste Mal möchte ich den Abspann, also den Nachlauf in meinem Video, etwas großzügiger gestalten.
  • Ich möchte meine eigene Motion-Template-Bibliothek vorher komplettieren.
  • Das Vorbereiten auf Screenrecording möchte ich vereinfachen.

Eine Sache werde ich ausprobieren: Statt ganzer Sätze auf dem Teleprompter möchte ich Stichworte sehen. Evtl. führt das zu einem natürlicheren Vortrag.

Und wenn du das selbst vor dir herschiebst

Genau davor stand ich im Juni auch. Das Setup oben kostet zusammen weniger als eine anständige Kamera, und in eine Linse zu sprechen ist nach vier Takes nicht mehr komisch. Das Schwierigste an dem ganzen Ablauf ist der erste Take — alles danach ist Handwerk, und Handwerk kann man lernen.

Du kommst irgendwo nicht weiter? Ich mache das 1:1 — in Berlin oder per Call, ganz praktisch an deinem eigenen Fall. Schreib mir einfach über ingohoffmann.de. Und wenn du sehen willst, was dabei herauskommt: mein Kanal auf YouTube.

Häufige Fragen

Wie kann ich ein YouTube Video selbst produzieren? Was brauche ich mindestens?

Ein Smartphone auf einem einfachen Stativ, ein drahtloses Ansteckmikrofon, eine Teleprompter-App auf demselben Smartphone und ein Schnittprogramm. Licht-Setup, zweite Kamera und externes Audio-Interface braucht es für den Anfang nicht.

Wie lese ich ab, ohne dass man es sieht?

Der Teleprompter läuft auf demselben Gerät, das filmt — der Blick geht damit fast in die Linse. Ab etwa 1,5 Metern Abstand fallen die verbleibenden acht Zentimeter Versatz nicht mehr auf.

Wie bekomme ich Kapitelmarken in ein YouTube-Video?

Als Liste in die Videobeschreibung: erste Marke bei 0:00, mindestens drei Kapitel, jedes mindestens zehn Sekunden lang. Die Zeiten lassen sich aus der automatisch erzeugten Untertiteldatei captions.sbv ablesen.

Wozu brauche ich eine KI bei der Videoproduktion?

Für die Fleißarbeit drumherum: den Artikel aufs Sprechskript kürzen, Kapitelmarken aus den Untertiteln ziehen, Thumbnail-Varianten durchspielen. Aufnehmen, sprechen und entscheiden, ob ein Take gut ist, nimmt einem niemand ab.


🤖 Transparenz: Diesen Beitrag habe ich mit KI-Unterstützung erstellt und anschließend selbst redigiert und freigegeben. Eingesetzte Werkzeuge: Claude Cowork (Opus 5) für Struktur und Text, Draw Things (Flux 2 klein 9B KV) für ein Bild. Eine gesetzliche Kennzeichnungspflicht besteht für einen redaktionell verantworteten Blogpost wie diesen nicht (EU AI Act Art. 50) — Transparenz finde ich aber einfach fair.

Beitrag teilen:

0 Kommentare

Einen Kommentar abschicken

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert