Zusammenfassung
AI-Erfolg für Unternehmen hängt von kontextbewussten Daten ab, die auf Wissensgrafiken und semantischen Schichten basieren, da ein besserer Kontext – nicht nur bessere Modelle – genaue, skalierbare AI-Ergebnisse ermöglicht.
In den letzten zwei Jahren der Unternehmens-AI drehte sich alles um Experimente, und es war einfach, dort zu bleiben. Die Modelle änderten sich ständig, sodass die Produktionszeitpläne rutschten und jede Verbesserung neue Funktionen aufzeigte, die Teams einbinden wollten, was mehr Umfang, mehr Tests und mehr Verzögerungen bedeutete. Ein Teufelskreis, bei dem sich das Modell als Grund dafür entwickelt, dass nichts ausgeliefert wird. Dieser Zyklus bricht und Unternehmen sind bereit, von Experimenten zu AI überzugehen, die tatsächlich einen Mehrwert für das Unternehmen bietet. Was bei dieser Verschiebung am wichtigsten ist, ist nicht, welches Modell Sie auswählen, und nicht einmal, wie viele Daten Sie haben, sondern ob Ihre Daten den Kontext tragen, den ein Modell haben muss, um genau zu sein.
Die Modellauswahl ist jetzt weniger wichtig, da die besten Open-Weg- und Frontier-Modelle konvergiert sind. Kimi K3 und Claude Fable 5 sind bereits nahe genug, dass Sie bei den meisten Unternehmensaufgaben Schwierigkeiten haben würden, sie voneinander zu unterscheiden, das offene Modell einen Bruchteil der Kosten kostet und die nächste Version Ihnen nur einen schrittweisen Gewinn bringt, nicht wie in den Vorjahren. Die Engineering-Bemühungen haben sich auf den Gurt verlagert: die Tools, den Speicher, die Auswertungen und die Leitplanken, die um das Modell gewickelt sind, wobei sich das schwierige Problem darauf verlagert hat, agentische Workloads stundenlang mit minimaler menschlicher Aufsicht am Laufen zu halten. Beim Erfolg geht es nun darum, Flexibilität aufzubauen, die für den Benutzer unsichtbar ist, wobei der Workflow, der gestern ausgeführt wurde, heute auf die gleiche Weise ausgeführt wird, während der Kabelbaum die darunter liegenden Modelle wechselt, um Kosten, Performance oder andere wichtige KPIs zu optimieren. Das Modell wird zu einem Implementierungsdetail.
Diese Flexibilität basiert auf der wichtigsten Ebene, die Unternehmen nutzen können – den darunter liegenden Daten. Denken Sie daran, dass das älteste Sprichwort in der Datenverarbeitung hier noch gilt: Müll rein, Müll raus. Die beste Nutzung der Welt basiert auf dem, was Sie füttern, und die wichtigsten Daten, die Sie füttern können, sind Ihre eigenen. Es war schon immer das Unterscheidungsmerkmal für Unternehmen in der AI, und jetzt, da jeder im Grunde dieselben Modelle betreibt, ist es das einzige, das noch übrig ist. Jedes Unternehmen sitzt auf Volume, jahrzehntelangen Tischen, Dokumenten und Tickets, aber Volume allein macht ein Modell schlimmer und nicht besser. Was ein Modell genau macht, ist zu wissen, welche Tabelle kanonisch ist, welches Dokument aktuell ist und wie der Kunde in einem System mit dem Kunden in einem anderen System in Beziehung steht.

Datenqualität entscheidet über KIAIErfolg
In einer IDC-Umfrage unter Unternehmensleitern darüber, was den AIErfolg bestimmt, gaben 94 % an, dass die Datenqualität entscheidend ist. Umfrageergebnisse kommen selten so nahe an einstimmig. Der Bericht nennt auch die Hauptursachen für schlechte Qualität, und es sind die üblichen Verdächtigen: redundante Daten, isolierte Daten und veraltete Daten. Ich werde feststellen, dass die Modellfunktion nicht auf dieser Liste angezeigt wird, und auch nicht der Modell-Kabelbaum. Die Probleme, die heute die Unternehmens-AI untergraben, sind dieselben, die in den letzten 20 Jahren die Analysen untergraben haben. Was sich geändert hat, ist, wie sie erscheinen, da jedes dieser drei Datenprobleme die Antworten eines Modells auf seine eigene Weise verschlechtert.
Veraltete Daten liefern Antworten, die zwar wie Halluzinationen aussehen, dies aber nicht der Fall sind. Die Abruf-Pipeline erfüllt die Rückgaberichtlinie des letzten Jahres, der Agent zitiert sie einem Kunden fließend und souverän, und das Unternehmen ist jetzt auf dem richtigen Weg für die Rückerstattungsbedingungen, die es vor Monaten eingestellt hat. Die Ingenieure, die den Vorfall überprüfen, protokollieren ihn als Halluzination, aber das Modell hat seine Arbeit richtig ausgeführt. Es sind die Inputs, die falsch waren.
Redundante Daten führen zu Zufallssicherheit. Wenn sechs nahezu identische Kopien einer Tabelle existieren und zwei davon nicht übereinstimmen, gibt es zwei Möglichkeiten, wie dies schief geht. Wenn der Abruf nur eine Kopie enthält, die das Modell erhält, ist dies eine Frage des Zufalls, d. h. die Antwortqualität enthält jetzt eine zufällige Variable. Wenn beide Daten abgerufen werden, sollte das Modell den Widerspruch auffangen, aber in einem Zusammenhang kann es sich auf eine Kopie konzentrieren und die andere vollständig ignorieren. In beiden Fällen kann die gleiche Frage, die an zwei verschiedenen Tagen gestellt wird, zwei verschiedene Antworten liefern, und weder der Benutzer noch der Ingenieur können erklären, warum dies ohne Rückverfolgung des Abrufs der Fall ist.
Isolierte Daten verwandeln gemeinsames Wissen in lokales Wissen. Ein Silos ist selten eine absichtliche Einschränkung. Häufiger bedeutet die Art und Weise, wie ein System implementiert wurde, Daten, die für alle nur für ein paar Teams sichtbar sein sollten. Infolgedessen gibt eine allgemeine Frage zu Unternehmenswissen unterschiedliche Antworten, je nachdem, welche Datenschicht das Modell sehen kann. Zwei Mitarbeiter können dieselbe Frage stellen, zwei verschiedene Antworten erhalten, aber beide Antworten sind den Teildaten hinter ihnen treu. Das Problem besteht, da mehr AITools auf den Daten des Unternehmens basieren. Ein Tool, das ein Team auf seiner Ebene aufbaut, wird unterschiedliche Antworten und schließlich unterschiedliche Entscheidungen erreichen als die Tools, die andere Teams auf ihrer Ebene aufbauen, und was beginnt, wenn zwei Mitarbeiter inkonsistente Antworten erhalten, endet als automatisierte Systeme, die auf widersprüchliche Informationen reagieren, wobei das Unternehmen die Kosten für diesen Konflikt trägt.
Diese Kombination führt zu einer vorhersehbaren Fehldiagnose. Wenn ein leistungsfähiges Modell auf schlechten Daten läuft, sehen die Ingenieure falsche Antworten und kommen zu dem Schluss, dass das Modell fehlerhaft ist, die Teams reagieren, indem sie einen Ersatz bewerten, und der Experimentierungszyklus beginnt von vorne. Das Ersetzen des Modells ändert nichts, da die darunter liegenden Daten gleich bleiben.
Daten sind kein Kontext
Wenn schlechte Daten die Antworten eines Modells verschlimmern, dann muss man bei der Behebung wissen, welche guten Daten ein fähiges Modell nicht bereits bietet. Die Antwort lautet Kontext, und ich kann den Unterschied zwischen Daten und Kontext mit einer Analogie aus dem Alltag erklären. Nehmen wir an, ein Freund sendet Ihnen ein Foto aus seinem Urlaub: Er ist auf einem Boot, auf einem See und die Sonne ist draußen. Sie haben jetzt Daten und können die Szene jedem genau beschreiben: einer Person, einem Boot, einem See, etwa mittags.
Dann rufen Sie ihn an und Sie erhalten Kontext. Der Wind bläste an diesem Tag 20 Knoten, stark genug, um die gesamte Kreuzung zu rauen. Der Motor starb auf halber Strecke, und die Familie stürzte eine Stunde lang. Seine Kinder entschieden, dass das Driften der beste Teil der gesamten Reise war, und es ist die Geschichte, die sie im nächsten Jahrzehnt bei Thanksgiving erzählen werden. Es ist die gleiche Szene, aber Sie wissen jetzt sehr unterschiedliche Dinge darüber. Das Foto zeigt Ihnen, was sichtbar ist, während der Freund Ihnen sagt, was passiert ist, warum es wichtig war und womit es verbunden ist.
Die Zuordnung zum Unternehmen erfolgt direkt: Ihre Daten sind das Foto und Ihre Mitarbeiter sind der Freund. Irgendwo in Ihrem Unternehmen weiß ein Analyst, dass von zwei Umsatztabellen, die austauschbar aussehen, nur eine die korrigierten Zahlen für das Q3 enthält. Jemand im Finanzwesen weiß, dass „Kunde“ im Abrechnungssystem die juristische Person bedeutet, während „Kunde“ im Produktsystem den Endbenutzer bedeutet, und dass die Zusammenführung der beiden einst eine Abwanderungsnummer falsch genug verursachte, dass sie vor dem CEO korrigiert werden musste. Hier kommt Unternehmenswissen tatsächlich her: Menschen, die Ihnen sagen können, warum dieser Datensatz der richtige für die Analyse ist, und nicht der andere Datensatz, der oberflächlich dieselben Informationen erfasst. Das Modell sieht nichts davon, sondern nur das Foto.
Kontextbewusste Daten sind die Art und Weise, wie Sie das Konto des Freundes in eine Form bringen, die eine Maschine verwenden kann. Es besteht aus zwei Hauptkomponenten. Wissensgrafiken kodieren Beziehungen und Herkunft: Diese Tabelle ersetzt diejenige, die diese Metrik aus diesen drei Quellen ableitet. Dieses Konto im Vertriebssystem ist dieselbe Entität wie dieses Konto in der Abrechnung. Semantische Schichten übernehmen die Definitionen, die Ihre Mitarbeiter formlos tragen, und machen sie explizit und geregelt: was „Umsatz“ bedeutet, welches Kundenfeld kanonisch ist und welcher Pipeline das Finanzteam tatsächlich vertraut.
Kontextbewusste Daten sind auch der Grund für den Wandel der Branche vom schnellen Engineering zum Kontext-Engineering. Beim schnellen Engineering ging es darum, die Frage gut zu formulieren. Beim Context Engineering geht es darum, zu entscheiden, was das Modell im Moment sehen kann, wenn es antwortet, und das ist ein Architekturproblem und keine Schreibkompetenz.

Abbildung: Zweischichtiger Stack. Obere Schicht: Austauschbare Modelle, frei austauschbar. Untere Schicht: Die langlebige Kontextschicht (Wissensgrafik + semantische Schicht), die jedem Modell das gleiche institutionelle Wissen vermittelt.
Das nächste Modell behebt keine schlechten Daten
Leser, die nahe an der Modellebene arbeiten, erheben an dieser Stelle in der Regel denselben Einwand. Wenn Kontextfenster über eine Million Token hinaus gewachsen sind und die Argumentation mit jedem Release zunimmt, warum werden unordentliche Daten nicht irgendwann kompensiert werden? Es ist eine faire Frage, und Skalierung hilft. Ein längeres Fenster bedeutet weniger willkürliche Einschnitte bei dem, was das Modell sehen kann, und bessere Argumentation fängt mehr Widersprüche auf als früher. Was der Maßstab nicht kann, sind Reparatureingaben, die falsch sind.
Ein veraltetes Dokument in einem Millionen-Token-Fenster ist immer noch veraltet, Sie zahlen nur mehr für die Verarbeitung. Bessere Argumentation, die auf widersprüchliche Tabellen angewendet wird, löst den Widerspruch nicht; sie erzeugt eine deutlichere Verteidigung gegen die Kopie, der das Modell vertrauen wollte. Das bereits in diesem Artikel erwähnte Sprichwort hat sechs Jahrzehnte exponentiellem Rechenwachstum überstanden und wird auch dieses überdauern.
AIQualität ist ein Data-Intelligence-Problem
Wenn die Antwortqualität enttäuscht, besteht der Instinkt eines technisch tiefgreifenden AI-Leaders darin, auf der Modellebene (feine Abstimmung auf dem Korpus des Unternehmens, Destillieren, härtere Bewertung) oder auf der Kabelbaumebene (Neuversuche hinzufügen, die Schutzgeländer festziehen) zu arbeiten. Keines funktioniert, da keines die Daten berührt. Die Feinabstimmung redundanter, veralteter Daten verschiebt das Problem in die Gewichtung des Modells, wo es nicht mehr in einem Abrufprotokoll angezeigt wird, das ein Ingenieur überprüfen kann. Ein stärkerer Kabelbaum lässt sich auch nicht beheben, da er nur dazu führt, dass der Agent anmutiger ausfällt.
Die Kontextebene ist der Punkt, an dem diese Bemühungen stattdessen erfolgen sollten. Modelle werden ersetzt und Auffanggurte werden neu aufgebaut, aber die Kontextschicht bleibt erhalten und alles, was Sie hinzufügen, baut auf dem auf, was bereits vorhanden ist. Jede Beziehung, die Sie codieren, jede Definition, die Sie explizit definieren, und jedes institutionelle Wissen, das Sie vom Kopf eines Analysten in ein Diagramm verschieben, verbessert jedes Modell, das darauf ausgeführt wird – das Modell, das Sie heute implementieren und das Sie im nächsten Quartal austauschen.
Ein Modell verliert an dem Tag, an dem es ausgeliefert wird, an Wert, weil ein besseres Modell bereits auf dem Weg ist. Während ich dies schreibe, trennen drei Punkte das führende Frontier-Modell vom Open-Source-Challenger des Artificial Analysis Intelligence Index, und die Reihenfolge wird sich in wenigen Wochen ändern. Die Kontextschicht bewegt sich in die entgegengesetzte Richtung. Es gewinnt mit allem, was Sie hinzufügen, einen Mehrwert, und jedes Modell, das Sie jemals ausführen, übernimmt diesen Mehrwert.
Der Aufbau dieser Ebene ist ein Datenintelligenzproblem, kein Modellproblem. Katalogisierung, Abstammung, Entitätsauflösung und geregelte Semantik sind die Maschinen, die das erfassen, was Ihre Mitarbeiter wissen, und sie dorthin bringen, wo das Modell sie nutzen kann. Ich werde nicht vorgeben, dass dies gelöst ist; das Codieren von stillschweigendem menschlichem Wissen im Unternehmensmaßstab ist wirklich schwierig. Aber es ist das schwierige Problem, an dem es sich lohnt, daran zu arbeiten, denn es ist der eine Teil des Stacks, der nicht kommerzialisiert wird.
Die Modelle halten die Handelsplätze an der Spitze, und das ist in Ordnung, denn mit einem flexiblen Gurt können Sie sie an einem Nachmittag austauschen. Was Sie nicht eintauschen können, ist das, was Ihr Unternehmen weiß. Jedes Modell kann sich das Foto ansehen, aber nur Ihre Kontextschicht weiß, was an diesem Tag auf dem See passiert ist.
Erfahren Sie, warum AI kontextbewusste Daten benötigt
Erfahren Sie, was IDC über die Dateninfrastruktur und die Storage-Grundlagen hinter erfolgreichen AIProjekten herausgefunden hat.






