Drei Sekunden entscheiden, ob der Rest überhaupt läuft
Ein Video kann eine starke Idee und einen guten Schluss haben. Wenn die ersten drei Sekunden nicht halten, sieht das kaum jemand. Im Feed wird weitergewischt, oft bevor die Story überhaupt angefangen hat.
Die Plattformen messen diesen Moment auf ihre Art. Meta zählt 3-Sekunden-Videowiedergaben und ThruPlays (15 Sekunden oder das ganze Video, wenn es kürzer ist). TikTok weist 2- und 6-Sekunden-Views aus, dort tritt der 2-Sekunden-View an die Stelle. Daraus lässt sich eine einfache Kennzahl für den Einstieg bauen:
Hook Rate = 3-Sekunden-Views / Impressions
Die Hook Rate sagt, wie viele Kontakte den Einstieg überstanden haben, aber nicht, warum. Das beantworten wir über einen Vergleich: Was machen die stärksten Videos eines Kontos in den ersten Sekunden anders als die schwächsten?
Der Vergleich: Top 10 gegen Bottom 10, pro Konto und Objective
Ein Video ist nur gut oder schlecht im Vergleich zu Videos mit demselben Job. Deshalb ranken wir Creatives immer innerhalb eines klaren Rahmens:
- Pro Konto und Plattform: Eine Marke wird mit sich selbst verglichen, nicht mit dem Durchschnitt einer ganzen Branche.
- Pro Objective: Awareness-Videos nach Average Watch Time (Reichweitenkampagnen nach CPM), Engagement nach Engagement Rate, Traffic nach CPC, Sales nach Cost per Order.
- Mit Mindestmengen: Ein Video mit sehr wenig Spend und ein paar hundert Impressions landet nicht zufällig auf Platz 1.
Aus diesem Ranking nehmen wir die zehn stärksten und die zehn schwächsten Videos. Die Top 10 zeigen, was wiederholt werden sollte. Die Bottom 10 zeigen, was vermieden werden sollte.
Ein Video gilt bei uns erst dann als über oder unter Benchmark, wenn es genug Daten hat und genug vergleichbare Videos existieren. Fehlt eins davon, lautet das Urteil ehrlich: zu wenig Daten. Das Urteil kommt aus dem Benchmark, nicht aus dem Rang. So wird kein solides Video zum Verlierer, nur weil es in einem kleinen Pool hinten lag.
Abbildung 1: Dieselben drei Sekunden, zweimal gebaut. Oben passiert sofort etwas, unten wartet das Video auf sich selbst.
Was eine KI sieht, die das ganze Video schaut
Ein Thumbnail erzählt wenig über einen Einstieg. Deshalb schaut die KI in sugarLENS das Video selbst, wo immer sich der Clip abrufen lässt. Sie läuft für die fünf stärksten und fünf schwächsten Videos jedes Kontos, weitere lassen sich einzeln analysieren. Sie beschreibt unter anderem:
- Hook: Was passiert in den ersten drei Sekunden? Die erste Einstellung, ihre Bewegung, gesprochene Worte und Text auf dem Screen.
- Erster Markenmoment: In welcher Sekunde die Marke zum ersten Mal auftaucht, und wie: gesprochen, gesungen, als Text, als Logo-Overlay, als Logo im Bild oder über das Produkt.
- Produktpräsenz: Kommt das Produkt früh, spät, dominant oder eher beiläufig vor?
- Tempo und Schnitte: Schnell geschnitten, langsam aufbauend, dynamisch oder ruhig, abgeleitet aus der tatsächlichen Schnittfrequenz.
- Text Overlay: Gibt es Text im Bild, und wo sitzt er?
- CTA-Platzierung: Wann und wo kommt die Handlungsaufforderung?
- Angle und Storytelling: Emotional, funktional, aspirativ oder Social Proof, und wie die Geschichte gebaut ist.
Wo nur ein Standbild verfügbar ist, etwa bei vielen Creator- und Spark-Ads, sagt die Analyse das und lässt zeitbasierte Felder leer.
Daraus entsteht eine kurze Erklärung, warum das Video über oder unter seinem Benchmark liegt, plus was wiederholt oder vermieden werden sollte.
Abbildung 2: Wie ein schwacher Einstieg Zuschauer gleich am Anfang verlieren kann. Schematische Darstellung, keine echten Werte.
Die Hook-Checkliste für die ersten drei Sekunden
Diese Fragen lassen sich vor dem Upload an jedes Video stellen:
- Passiert in Sekunde 0 etwas? Bewegung, ein Gesicht, eine Frage, ein Problem. Kein Schwarzbild, kein langsames Einfaden.
- Ist klar, worum es geht? Nach drei Sekunden sollte man wissen, ob einen das Thema betrifft.
- Wann kommt die Marke? Früh genug, um erinnert zu werden, aber nicht als Logo-Intro, das den Einstieg blockiert.
- Funktioniert es stumm? Untertitel oder eine Textzeile tragen die Kernaussage auch ohne Ton.
- Ist der Text lesbar? Wenige Worte, groß genug, nicht in Bereichen, die von der Plattform-Oberfläche verdeckt werden.
- Passt das Tempo zum Objective? Ein Traffic-Video darf schneller zur Sache kommen als ein Brand-Film.
- Kommt der Message Moment rechtzeitig? Der Moment, in dem die Kernbotschaft klickt, sollte nicht erst kommen, wenn die meisten schon weg sind.
- Ist der CTA dort, wo noch jemand zuschaut? Ein CTA ganz am Ende eines langen Videos erreicht nur die Wenigsten.
Do und Avoid: typische Gegensätze zwischen Top und Bottom
Typische Gegensätze zwischen Top und Bottom. Welche davon in einem Konto gelten, zeigt erst der Vergleich:
| Do | Avoid |
|---|---|
| Mit dem Problem, der Frage oder dem Ergebnis einsteigen | Mit Logo, Claim oder Intro-Animation einsteigen |
| Produkt oder Nutzen früh zeigen, im echten Gebrauch | Produkt erst nach langem Aufbau zeigen |
| Ein Gesicht, das direkt anspricht (bei Creator Content) | Lange Totale ohne erkennbare Person oder Handlung |
| Eine kurze Textzeile, die die Hook stumm trägt | Volle Textblöcke oder gar kein Text bei Sprecher-Videos |
| Erster Schnitt früh, Rhythmus passend zum Objective | Gleichförmiger, langsamer Einstieg ohne Wechsel |
| CTA dort, wo die Kurve noch hoch ist | CTA nur in der letzten Sekunde |
Abbildung 3: Vom Vergleich zum Briefing. Ein Muster zählt erst, wenn es mehrere Assets teilen.
Warum ein Muster erst ab mehreren Assets zählt
Ein einzelnes Top-Video mit Gesicht in Sekunde 0 beweist nichts. Ein Muster wird erst belastbar, wenn mehrere starke Videos es teilen und es in den schwachen Videos seltener vorkommt.
Deshalb hängt an jedem Learning eine einfache Angabe: Auf wie vielen Assets beruht es? Ein Rechenbeispiel: Angenommen, sieben der zehn Top-Videos zeigen das Produkt in den ersten zwei Sekunden, aber nur zwei der zehn Bottom-Videos. Das ist ein klarer Kandidat für ein Do. Zeigen es fünf oben und vier unten, ist es kein Unterschied, sondern Rauschen.
Dazu kommen drei Regeln, die wir nie überspringen:
- Muster sind kontospezifisch. Was bei einer Marke funktioniert, kann bei einer anderen ins Leere laufen.
- Muster sind objective-spezifisch. Ein schneller Einstieg kann den CPC senken und trotzdem die Watch Time eines Brand-Videos nicht verbessern.
- Korrelation ist keine Ursache. Ein Muster ist eine Hypothese für den nächsten Test, kein Gesetz.
So macht es sugarLENS
sugarLENS rankt die Videos jedes Kontos nach der Kennzahl ihres Objectives, mit Mindestwerten für Impressions und Spend. Die KI analysiert die stärksten und schwächsten Videos und bewertet jedes Asset gegen eine Vergleichsgruppe, wo möglich aus demselben Konto, derselben Plattform und demselben Objective. Gibt es zu wenige Vergleichsvideos, sagt das Urteil das auch, statt ein Gewinner- oder Verlierer-Label zu erzwingen.
Learnings verbinden die KI-Analyse mit den Reviews des Teams, brauchen mindestens zwei Assets und verweisen auf die Videos, aus denen sie stammen. Sie fließen in die nächsten Briefings und in sugarOS, die kreative Seite des Stacks. Später messen wir, ob Videos, die ein Learning umgesetzt haben, wirklich besser liefen.
FAQ
Was ist eine gute Hook Rate?
Eine allgemeingültige Zahl gibt es nicht. Plattform, Format, Zielgruppe und Objective verändern den Wert stark. Sinnvoll ist der Vergleich mit eigenen Videos aus demselben Konto und mit demselben Ziel.
Reicht es, nur die Hook zu optimieren?
Nein. Eine starke Hook bringt Menschen ins Video, aber der Message Moment und der CTA müssen danach noch kommen.
Warum vergleicht ihr nicht mit Branchen-Benchmarks?
Branchenwerte helfen bei der Einordnung, sagen aber nicht, welcher Einstieg bei einer bestimmten Marke funktioniert.
Wie viele Videos braucht ein belastbares Muster?
Ein Muster, das nur ein oder zwei Videos teilen, behandeln wir als Idee für einen Test, nicht als Learning. Entscheidend ist, dass es oben deutlich häufiger vorkommt als unten.