
Warum ist Content Discovery im Jahr 2026 überhaupt noch ein ungelöstes Problem?
Das hat ganz verschiedene Ursachen. Aber vor allem ist es ein Problem geworden, der schieren Masse an Content Herr zu werden. Es herrscht eine große Asymmetrie zwischen der verfügbaren Zeit des Users auf der einen und dem Content-Angebot auf der anderen Seite. Der technische Fortschritt macht es nun mal wesentlich leichter, mehr Content zu produzieren, angefangen bei Creatorformaten fürs Netz bis hin zu professionellen High-end-Produktionen.
Doch je günstiger die Content-Produktion wird, desto aufwändiger und teurer wird es für die Anbieter, diesen Content dann sichtbar und auffindbar zu machen. Und für den User wird es in der Masse der Angebote immer schwieriger, passgenauere Angebote für sich finden. Zudem haben die User inzwischen auch eine entsprechende Erwartungshaltung entwickelt, dass sie immer besser zu ihnen passenden Content bekommen. Das müssen die Anbieter lösen.
Wir haben inzwischen riesige Mengen an Nutzerdaten und sehr ausgefeilte Algorithmen. Warum führt mehr Datenverfügbarkeit offenbar nicht automatisch zu besserer Discovery?
Bei allen Daten- oder KI-Projekten entscheidet die Menge an Daten allein erst einmal noch nicht viel, sondern vor allem eine geschickte Kombination der Daten. Die Frage ist, auf welche Metriken setzt man, welche Ziele verfolgt man und worauf optimiert man hin mit einem Algorithmus?
Wir haben mit der Hyperspezialisierung der letzten Jahre gesehen, dass User immer mehr vom Selben zu sehen bekommen weil das System einfach zig Millionen Datenpunkte dazu gesammelt hat, was der einzelne User in der Vergangenheit geschaut hat. Das ist natürlich mit ein Problem, denn ein Klick allein bedeutet ja nicht Zufriedenheit mit dem Content. Selbst wenn ich den Content ganz angeschaut habe, heißt das ja nicht, dass ich als User danach der Meinung bin, dass ich meine Zeit jetzt gut investiert habe. Deswegen lösen mehr Daten das Problem nicht.
Gibt es aus Deiner Sicht einen grundlegenden Unterschied zwischen „Was könnte diesem Nutzer gefallen?“ und „Was möchte dieser Nutzer gerade wissen oder sehen?“
Das kommt auf die Plattform an, aber grundsätzlich sehe ich da einen großen Unterschied. Bei einigen Plattformen sieht man das Phänomen allerdings deutlicher als bei anderen.Ich würde zwischen ‚Was spricht mich an?‘ und ‚Was ist mein Ziel?‘ unterscheiden: Was mich jetzt schnell anspricht oder was ich eigentlich möchte, sind zwei Paar Schuhe. Ein Beispiel: Ich öffne die Seite eines Nachrichtenmagazins und klicke schnell einen Artikel zur Tagespolitik an, weil der wieder so eine reißerische Überschrift hat, die mich ärgert. Dabei möchte ich eigentlich lieber Hintergrundwissen zu einem anderen Thema lesen. Aber dann ist mein Zeitbudget schon aufgebraucht. Bei der Frage ‚Was möchte der Nutzer gerade wissen?‘ muss man also auf ganz andere Signale schauen, als auf die Klicks der Vergangenheit.
Plattformen optimieren häufig auf Metriken wie Watch Time, Click-through Rate oder Retention. Kann ein Algorithmus gleichzeitig das Nutzerinteresse maximieren und das Nutzerinteresse wirklich verstehen?
Auch hier muss man unterscheiden. Die meisten Plattformen setzen vor allem auf auf emotionale Trigger, auf Sensationen, auf bestimmte visuelle Reize, bunte Farben usw. und optimieren ganz stark darauf hin, dass man immer weiter scrollt und möglichst lange bleibt. User investieren dann unter Umständen viel Zeit, weil Youtube und andere Plattformen wahnsinnig gut drin sind, dieses Verhalten zu erfassen.
Aber am Ende sind die User dann eben gar nicht zufrieden damit, wie sie ihre Zeit verbracht haben. Damit ein User zufrieden ist, dafür muss man seine Interessen, seine wahren Intentionen viel besser kennen, herausfinden oder analysieren. Andere Metriken sind da viel zentraler oder haben einen qualitativ besseren Aussagewert. Wenn man jetzt nicht allein auf Watchtime geht, sondern eben auf andere Metriken wie Completion Rate, Anteil an Shares oder Saves, oder ganz grundsätzlich das Einbeziehen von möglichst viel Kontext-Daten.
Was müsste ein technisch besseres Discovery-System über einen Nutzer wissen?
In einer idealen Welt, wo Datenschutz überhaupt keine Rolle spielt, wäre so etwas wie der situative Kontext natürlich wichtig. Zu wissen: Sitzt der User gerade in der Bahn, im Wohnzimmer oder Schlafzimmer. Gut wäre natürlich auch, wenn der Algorithmus wüsste, schaue ich gerade allein oder mit mehreren, und, wenn ja, mit wem. Genau so die psychologische oder die kognitive Verfassung. Also zum Beispiel, habe ich heute den ganzen Tag gearbeitet und bin jetzt müde oder hatte ich eigentlich frei und bin noch voll aufnahmefähig.
Ein spannendes Thema in dem Zusammenhang, auch in der Arbeit mit unseren Usern, ist die Diskrepanz zwischen dem sogenannten „Aspirational Self“ und dem „True Self“. Das war ja schon früher in der Fernsehforschung ein spannendes Phänomen: Wenn man Leute fragt, ‚Was ist dein Lieblingssender?‘ sagt ja meist jeder Arte. Aber abends, nach einem langen Tag, gibt es eben auch noch eine müde Seite mit ganz anderen Bedürfnissen. Und dann schaut man eben etwas ganz anderes. Wenn der Algorithmus diese Diskrepanz auch kennen würde, wäre das enorm vorteilhaft. Aber da gibt es verschiedene Hürden, damit er das alles aufnehmen und erfassen kann.
Du hast nach mehr als zehn Jahren in KI- und Datenabteilungen großer Medienunternehmen ein eigenes Unternehmen gegründet. Was hat Dir bei den bestehenden Lösungen gefehlt, dass Du gesagt hast: Das müssen wir grundsätzlich anders bauen?
Die Menschen sind einfach unzufrieden damit, dass sie viel Zeit und Fokus auf den Plattformen verlieren. Viel Zeit in die Suche in Scrollen stecken, dass sie mitunter auch einfach „falsch abbiegen“ und sich von den Algorithmen verführen lassen. Ein wichtiger Aspekt sind natürlich auch die verfügbaren Technologien, die es inzwischen gibt, die dieses semantische Kontextverständnis mitbringen, was altbewährte Machine-Learning-Methoden nicht in der Form abdecken. Die primäre Motivation war also die Kombination aus dem Problem der Nutzer-Unzufriedenheit und den verfügbaren neuen Technologien.
Dein Ansatz ist ein persönlicher AI Media Agent, der News, Podcasts, Video und Social Media kuratiert. Was ist architektonisch der entscheidende Unterschied zu einer klassischen Recommendation Engine?
Es ist vor allem die Schicht der Semantik. Wenn man User fragt, für welche Themen sie sich interessieren, antworten sie oft mit Genres. Dabei hat jeder User eine ganze spezielle Sichtweise und Perspektive auf ein Thema. Themen wie KI oder Geopolitik haben enorm viele Facetten und nicht jeder interessiert sich bei KI für das neueste Modell-Update, sondern will zB viel mehr wissen, was das für die Gesellschaft bedeutet. Solche Feinheiten werden vom Genre-Label einfach nicht erfasst. Und genau das können wir auswerten.
Ein persönlicher Media Agent könnte theoretisch sehr genau wissen, was ein Mensch interessiert. Wo liegt die Grenze zwischen hilfreicher Personalisierung und einer neuen Form der Filterblase?
Im Gegensatz zur Filterblase bringen wir das, was den User spontan und bauchgefühlsmäßig anspricht und was er langfristig erreichen will, zusammen. Medien waren ja noch nie vollkommen neutral, sondern es gibt einfach Publikationen, die sind eher links gerichtet, andere eher konservativ. Wenn ich mit meinem Vater beispielsweise über Politik diskutiere, und ich lese den Spiegel und er die FAZ, haben wir unterschiedliche Meinungen, aber wir haben immer noch die gleiche Grundlage und die gleichen Informationen. Und wir können uns verständigen, weil wir nicht ein völlig anderes Empfinden der Welt haben.
Das Gefährliche an Filterblasen ist ja, dass die großen Plattformen meist auf das emotionale Bauchgefühl der Nutzer optimieren und Fakten im Extremfall irgendwann überhaupt keine Rolle mehr spielen. Bei unterhaltsamen oder informierenden Inhalten finde ich es daher nicht problematisch, dass man eine sehr personalisierte Auswahl trifft. Insofern denke ich, dass die Art der Personalisierung, die wir verfolgen, sehr nützlich ist für die Menschen. Natürlich verfolgen wir dabei gleichzeitig den Ansatz, dass wir ihnen immer wieder auch neue Inhalte zur Auswahl geben.
Wenn ein Agent für mich entscheidet, welche Informationen ich sehe: Wie transparent muss er erklären können, warum er mir etwas zeigt?
Das ist genau das Prinzip unseres Produkts, dass der User und die Userin erfahren, warum es für ihre Weltsicht relevant ist, warum sie sich dafür interessieren sollten. Erst das gibt ja dem User Vertrauen. Wenn man also erklärt: ‚Hey, ich als Agent habe jetzt 300 Inhalte für dich aus so und so viel verschiedenen Quellen gescannt, die aus den und den Gründen ausgewählt wurden.‘ Erst das schafft das Vertrauen und auch das Zufriedenheitsgefühl der User. Ihre Auswahl wird radikal reduziert, sodass sie sich bei der Suche nach geeigneten Inhalten nicht mehr überfordert fühlen.
Wem gehört das persönliche Interessenmodell eines Nutzers? Sollte dieses Profil zwischen verschiedenen Medienplattformen portierbar sein?
Das wäre aus Sicht des Users natürlich sehr praktisch und natürlich sollte es auch ihm gehören. Dieses Modell ist ja datenschutztechnisch eh so vorgeschrieben, dass wir als Anbieter immer Auskunft geben können, welche Daten wir über den User erhoben haben.
Das Problem ist ja, dass Daten in Silos erhoben werden: Youtube weiß, was bei ihnen auf der Plattform passiert. Das Handelsblatt, die Zeit, wer auch immer, wissen, nur was bei ihnen auf der Plattform passiert. Aber dass vielleicht jemand, der morgens harte Finanznachrichten beim Handelsblatt liest, abends dann Line-Dancing-Videos auf Youtube schaut, dass eben das Interessenprofil der Leute teilweise so divers ist, darauf kommt man nicht.
Wenn sie User das Datenprofil mitnehmen können zu anderen Plattformen, sodass sie eben dort auch genau die richtigen Angebote bekommen, dann wird dieses berühmt-berüchtigte Kaltstartproblem vom Plattform-eigenen Empfehlungssystem vermieden umgangen und ein viel reicheres, realistischeres Userprofil zur Grundlage der Kuratierung.
Eine der großen Herausforderungen ist heute nicht mehr der Mangel an Content, sondern die Fragmentierung: Streamingdienste, Mediatheken, Podcasts, News, YouTube, Social Media etc. Ist Aggregation allein noch eine sinnvolle Strategie?
Und genau deswegen muss es eine Kuratierung bzw. Vorauswahl geben. Nehmen wir das Beispiel Nachrichten: Erst die Auswahl und Bewertung macht ein Geschehnis zu einer Information. Und nur durch die Auswahl der relevanten Informationen gewinnt man Klarheit.
Auch bei Unterhaltung geht es immer um bestimmte Geschichten, die für mich relevant sind, weil ich daraus ja etwas lernen möchte über die Welt. Aber wenn ich überhaupt keine Auswahl habe und eine viel zu große Menge an Content, dann bin ich gefühlt nie fertig mit Lernen. Ich denke also eher, dass es negative Konsequenzen hat für User. Und wenn man sich bestimmte Studien zu diesem Thema anschaut, bestätigt sich das.
Insofern denke ich, ist genau diese Verengung eigentlich wieder wichtig. Und vielleicht brauchen wir aber diesmal nicht eine Redaktion, die diese Auswahl trifft, sondern ein KI-Modell des Users, das im Sinne seiner Intention und Interessen die Plattformen absucht, weil er selbst damit gar nicht mehr hinterher kommt.
Gerade bei News und Social Media kann derselbe Sachverhalt in Dutzenden Varianten auftauchen. Kann KI inzwischen zuverlässig erkennen, dass 20 Beiträge eigentlich dieselbe Story sind und daraus einen Mehrwert erzeugen?
Ja das gelingt inzwischen sogar sehr gut.
Wo liegen derzeit die größten technischen Grenzen: Datenzugang, Metadaten, Rechte, Modellqualität, Kosten oder fehlende Standards?
Die Kosten sind natürlich ein echtes Problem. Wir berechnen die Empfehlung wirklich pro User, also nicht nach User-Kohorten oder Segmenten, sondern wirklich individuell für den User. Auf den Monat gesehen fallen so relativ hohe Kosten an. Auch die Qualität der Ergebnisse ist ein Thema, wo man sehr viel Arbeit ins Refinement stecken muss, dass es wirklich den Ton der User trifft. Aber sobald das Modell das einmal verstanden hat, waren wir sehr positiv überrascht von den Ergebnissen, auch die User selbst, wie nah das wirklich an ihrer eigenen Welt, an ihren Werten dran ist.
Das sind aktuell bei uns die größten Themen. Natürlich muss man auch Urheberrechte, Datenschutz usw. beachten. Man kann alles datenschutzkonform umsetzen, wenn man genügend Zeit dafür hat. Bei der Datennutzung ist ja auch immer gar nicht das Problem, dass man viele Daten erhebt, sondern was man mit ihnen tut und in welchem Interesse man diese Daten von Usern weiterverwendet. Das bekommt man aber gut in den Griff.
Die Session auf der #MTHCON26 stellt ausdrücklich die Verbindung von Algorithmen und menschlicher Kuratierung in den Mittelpunkt. Was kann ein Mensch besser als ein Algorithmus und umgekehrt?
Ich weiß gar nicht, ob der Mensch das so viel besser kann. Weil er weiß ja auch gar nicht mehr als der Algorithmus, zumindest wenn wir von klassischen Algorithmen ausgehen. Ein Mensch kann natürlich einen redaktionellen Schwerpunkt setzen, der der Linie der Publikation oder der Plattform entspricht. Das finde ich auch weiterhin eine sehr wichtige Aufgabe im Journalismus.
Aber vor allem wenn es jetzt wirklich danach geht, nach Interessen und nach der Zufriedenheit der User zu optimieren, habe ich mit den aktuell neu verfügbaren Mitteln nicht das Gefühl, dass Menschen das auf jeden Fall besser können. Ein Algorithmus kann das natürlich viel schneller, mit viel weniger Arbeit in einer ganz anderen Art der Skalierung umsetzen. Da sehe ich so die großen Unterschiede.
Wenn wir in drei Jahren auf das Discovery-Problem schauen: Was wird dann fundamental anders sein?
Also, ich denke, die Ergebnisse werden viel besser sein. Es wird aber auch einen Preis haben. Dann muss man schauen, Iist es den Usern das auch wert? Oder finden sie es doch gut, immer x Stunden am Tag auf verschiedensten Plattformen zu verbringen und sich das alles mühselig, händisch selbst rauszusuchen, was ja die Alternative ist.
Ich denke, es wird sehr viel mehr in Richtung Micro Surveys gehen, dass User immer mal wieder kleine Fragen beantworten müssen oder dass es auch tatsächlich immer mehr in so eine konversationelle Datenerhebung geht, der User Spracheingaben machen kann.
Was viele Menschen aktuell stört, ist die fehlende Kontrolle über die Algorithmen. Man klickt eventuell einen Artikel an, der gar nicht dem eigenen Weltbild entspricht, und auf einmal bekommt man nur noch ähnliche angezeigt, ohne dass man aktiv selber etwas dagegen tun kann. Das wird sich definitiv ändern müssen.
Welche Technologie wird dabei überschätzt, welche wird heute noch unterschätzt?
Ich glaube, das Potenzial der generativen KI und der LLMs sehen viele. Es stellt sich jetzt einfach die Frage, wie sich das sinnvoll implementieren lässt, dass es für die User einen Mehrwert schafft, aber auch technisch und kostentechnisch noch handlebar ist.
Überschätzt oder unterschätzt wird eigentlich keine Technologie. Man wird ja auch nicht weggehen vom klassischen Machine Learning, Ansätzen in den Empfehlungssystemen, die man jetzt schon verfolgt, aber man wird sie eben miteinander immer stärker verzahnen und kombinieren.
Vielen Dank für das Gespräch.
BIld oben: Pixabay/Roland 4D Pippes