Descript
Audio- und Videoschnitt im Text-Editor-Modus — schneiden = Tippen, KI macht den Rest.
Funktionen von Descript
- Text-basiertes Editing — Wörter im Transkript löschen ⇒ entsprechende Audio-/Video-Stelle wird entfernt.
- Overdub — Voice-Clone für Korrekturen ohne Neu-Aufnahme.
- Studio Sound — KI-Noise-Removal auf Studio-Niveau in Sekunden.
- Eye Contact — Blickrichtung in Kamera „korrigieren" für Talking-Heads.
- Underlord — KI-Editor-Agent, der ganze Episoden automatisch schneidet.
- AI Speakers — Skript zu Voice-Over in 80+ Sprachen.
Preise von Descript
- Free · 1 Stunde Transkription/Mon., Wasserzeichen, kein Voice Clone.
- Hobbyist · $24 / Mon. · 10 Std. Transkription, kein Wasserzeichen.
- Creator · $35 / Mon. · 30 Std., Multitrack, Studio Sound.
- Business · $60 / Mon. · 40 Std., Brand Templates, SSO.
- Enterprise · individuell · höchste Limits, API auf Anfrage.
Descript hat die Audio- und Video-Bearbeitung in den letzten Jahren neu definiert: Statt mit Wellenformen und Timeline-Knipsern zu arbeiten, schneidet man im Transkript — ein gelöschtes Wort entfernt automatisch die entsprechende Audio-Sekunde. Wer einmal so produziert hat, kehrt selten zu Audacity oder Premiere zurück, wenn es um Sprache geht.
Die Magie steckt im KI-Backbone: Overdub klont die eigene Stimme und ermöglicht Korrekturen ohne erneutes Mikrofon-Setup. Studio Sound entfernt Hintergrundlärm, Hall und Echo in einem einzigen Klick und bringt das Audio auf ein Niveau, für das früher ein Recording-Studio nötig war. Eye Contact richtet den Blick eines Sprechers in die Kamera, selbst wenn er auf dem zweiten Monitor abgelesen hat.
Mit Underlord (2024 hinzugekommen) hat Descript einen agentischen KI-Editor eingeführt, der ganze Podcast-Episoden auf Wunsch automatisch schneidet — Versprecher raus, Werbeblöcke an die richtige Stelle, Kapitelmarken setzen.
Schwächen: Bei sehr großen Projekten (mehrstündige Multi-Track-Sessions) merkt man die App-Architektur. Voice-Clone und höhere Stunden-Limits sind in den teureren Tarifen hinter Paywalls. Eine offizielle API fehlt — wer Descripts Magie programmatisch nutzen möchte, ist auf Web-UI-Workflows angewiesen.
Screenshot
Pro & Contra
- Text-basierter Audio-/Video-Edit
- Overdub Voice Clone
- Studio Sound (Noise Removal in einem Klick)
- Multitrack mit Live-Transkription
- Performance bei sehr langen Projekten
- Voice-Clone-Tarife teuer
- Kein offizieller API-Zugang
Anwendungsfälle
Verwandte Tools
Vozo
KI-Videoübersetzung und -Synchronisation in über 160 Sprachen — klont die Originalstimme statt einer generischen KI-Stimme, übersetzt eingeblendeten Text im Bild („Visual Translate“) und synchronisiert die Lippenbewegungen.
Gemini Omni
Googles I/O-2026-Generative-Media-Modell — erzeugt aus jedem Input (Text, Bild, Audio, Video) jeden Output, mit deutlich verbessertem Physik-Verständnis.
Google Flow
Googles kreatives Studio für KI-Filmemacher:innen — Storyboarding, Multi-Scene-Komposition, Music-Video-Direction und Vibe-Coding eigener Tools in einer Plattform.
