Es ist keine Blase. Es ist auch keine KI.

Technische Blaupause in Cyanblau: eine aufgeschnittene Maschine mit dem Typenschild Künstliche Intelligenz. Im Inneren stecken kein Gehirn, sondern Zahnräder, ein Trichter, in den Buchstaben rieseln, eine Walze mit Tastaturbelegung, Rundskalen und ein rot hervorgehobener Käfig mit rollenden Würfeln. Unten läuft ein Papierstreifen heraus. Headline: Es ist keine Blase. Es ist auch keine KI. Fußzeile: Quellen Epoch AI, FactSet, Nvidia, Bitkom, AAAI, Stanford. (KI-generiert)Mit Hilfe von KI generiert

Es gibt diesen Moment, der mir inzwischen ungefähr einmal pro Woche passiert. Jemand erfährt, was ich beruflich mache, und sagt dann diesen einen Satz — mit einer Mischung aus Mitleid und Vorfreude, so wie man jemandem erklärt, dass sein Lieblingsverein absteigen wird: „Naja, das ist doch alles nur eine Blase. Das platzt bald.“

Und ich sage dann meistens gar nichts, weil eine ehrliche Antwort ungefähr zwanzig Minuten dauert und niemand auf einem Stehempfang zwanzig Minuten Zeit hat. Also schreibe ich sie hier auf. Willkommen zu den zwanzig Minuten.

Die kurze Fassung, damit Du weißt, worauf Du Dich einlässt: Ich halte die Blasen-These für halb richtig — und zwar für die falsche Hälfte. Ich halte den Begriff „Künstliche Intelligenz“ für Marketing. Ich halte gleichzeitig die beliebte Gegenthese „ist doch nur Autovervollständigung“ für genauso schlecht recherchiert wie den Hype, den sie kritisiert. Ich erkläre unterwegs, was denn eigentlich eine echte künstliche Intelligenz wäre und warum die Grenze dorthin nicht als Linie verläuft, sondern gezackt. Ich räume die Meldung ab, die alle drei Monate durchs Dorf getrieben wird — dass irgendein Modell gerade wieder ausgebrochen sei und Schlimmes tue — inklusive eines kleinen Prompts zum Selbstausprobieren, der Dir zeigt, warum Du solchen Screenshots nie wieder glauben solltest. Und ich erzähle am Ende, was in meiner Agentur in den letzten Monaten tatsächlich passiert ist, weil das die einzige Zahl ist, für die ich selbst hafte. Sie wird ein paar Leuten nicht gefallen. Mir gefällt sie auch nicht komplett.

Ganz unten steht, was Du damit anfangen kannst. Kein Newsletter, kein Kurs, keine Beratung. Drei Dinge, die zusammen etwa zwei Stunden dauern.

Erstens: Was eine Blase überhaupt ist — und was gerade wirklich passiert

Wenn Leute „Blase“ sagen, meinen sie fast immer zwei völlig verschiedene Dinge gleichzeitig, ohne es zu merken. Das eine ist: Die Aktienkurse sind zu hoch, da werden Leute Geld verlieren. Das andere ist: Die Technologie taugt nichts, das verschwindet wieder.

Das sind nicht nur unterschiedliche Aussagen. Historisch sind sie sogar häufig gleichzeitig wahr und falsch — die Investoren verlieren ihr Geld, und die Technologie bleibt trotzdem und frisst am Ende die Welt auf. Das ist keine Ausnahme. Das ist das Standardmuster.

Der Vergleich, den alle ziehen — und den fast niemand zu Ende zieht

Also gut, gehen wir zurück ins Jahr 2000, weil dort alle hinzeigen. Der Nasdaq Composite stieg von Januar 1995 bis zum 10. März 2000 um rund 572 Prozent, von 751 auf 5.048 Punkte. Bis zum 4. Oktober 2002 verlor er 78 Prozent seines Wertes und löschte damit die kompletten Gewinne der fünf Jahre davor aus. [1] Das ist die Geschichte, die alle erzählen, und sie stimmt.

Die Geschichte, die dabei fast nie erzählt wird, liegt im Boden. Im selben Zeitraum verlegten Telekommunikationsfirmen in den USA Glasfaser im industriellen Maßstab, finanziert mit Schulden, auf Basis von Nachfrageprognosen, die man freundlich als „ambitioniert“ bezeichnen kann. Nach dem Crash war das Ergebnis: Je nach Schätzung lagen zwischen 85 und 97 Prozent der verlegten Fasern dunkel — verlegt, aber ohne Licht, ohne Daten, ohne Umsatz. Das Wall Street Journal nannte für 2002 eine tatsächliche Nutzung von 2,7 Prozent. [2]

Die Investoren dieser Glasfaser haben alles verloren. WorldCom und Global Crossing gingen pleite.

Und dann lief zwanzig Jahre lang Netflix durch genau diese Kabel.

Das ist der Punkt, den die gemütliche Blasen-These systematisch verschluckt. „Es war eine Blase“ und „es hat die Welt verändert“ sind kein Widerspruch. Sie sind zwei Kapitel derselben Geschichte, und in Kapitel zwei geht es nicht mehr um die Leute aus Kapitel eins. Wer 1999 Aktien kaufte, war der Verlierer. Wer 2005 ein Unternehmen auf dieser Infrastruktur baute, war der Gewinner. Es sind einfach nicht dieselben Menschen, und deswegen reden sie bis heute aneinander vorbei.

Und was ist jetzt anders?

Der entscheidende Unterschied zu 1999 ist unangenehm banal: Es wird bezahlt. Und zwar wirklich, mit echtem Geld, für ein echtes Produkt, von echten Kunden.

Nvidia hat im Quartal, das am 26. Juli 2026 endete, allein im Rechenzentrumsgeschäft 89,0 Milliarden US-Dollar Umsatz gemacht — ein Plus von 117 Prozent gegenüber dem Vorjahresquartal. [3] Das ist kein Kursziel, keine Prognose und kein Analystentraum, sondern eine Zahl aus einem Quartalsbericht bei der US-Börsenaufsicht. Der Gesamtumsatz des Quartals lag bei 96,2 Milliarden Dollar. Zum Vergleich: Die Börsenlieblinge von 1999 verkauften Hundefutter im Internet und hatten Umsätze, die man mit einem Taschenrechner ohne Exponentialtaste erfassen konnte.

Nvidia-Chef Jensen Huang formulierte es in derselben Mitteilung so: „KI hat ihren Wendepunkt erreicht. Sie leistet nützliche Arbeit. Rechenleistung ist jetzt Umsatz.“ [3] Das darf man von jemandem, der in diesem Goldrausch die Schaufeln verkauft, mit der gebotenen Skepsis hören. Es ändert nur nichts daran, dass die Schaufeln bezahlt werden.

Auch bei den Modellanbietern selbst ist der Umsatz real. Anthropics hochgerechnete Jahresumsatzrate lag Ende Juli 2026 bei rund 65 Milliarden US-Dollar. [4] Man kann über die Bewertung streiten, über die Frage, ob Umsatz gleich Gewinn ist, und darüber, ob „annualisierte Run-Rate“ nicht eine sehr freundliche Art ist, aus einem guten Monat ein gutes Jahr zu machen. Aber das ist eine andere Debatte als die von 2000. Damals war die Frage: Gibt es überhaupt Kunden? Heute ist die Frage: Rechtfertigen diese Kunden diese Bauwut?

Wo es tatsächlich knirscht — und zwar heftig

Jetzt kommt der Teil, in dem ich der Blasen-Fraktion recht gebe. Nicht aus Höflichkeit, sondern weil die Zahlen ziemlich eindeutig sind.

Epoch AI hat die Quartalsberichte der großen Cloud-Betreiber ausgewertet — Microsoft, Alphabet, Amazon, Meta, Oracle — direkt aus den SEC-Unterlagen. Ergebnis: Der operative Cashflow dieser Konzerne wächst mit etwa 23 Prozent pro Jahr. Die Investitionen wachsen mit etwa 70 Prozent pro Jahr. Im zweiten Quartal 2026 standen 177,5 Milliarden Dollar operativer Cashflow gegen 162,6 Milliarden Dollar Investitionen. Die beiden Kurven kreuzen sich nach dieser Rechnung ungefähr im dritten Quartal 2026 — also gerade jetzt. [5]

Und was macht man, wenn man mehr ausgeben will, als reinkommt? Genau. FactSet hat es nachgezählt: Der Anteil neuer Schulden an den Investitionen dieser Konzerne stieg von 9 Prozent im Geschäftsjahr 2024 auf 32 Prozent in den zwölf Monaten bis Mitte 2026. Die aggregierten Investitionen für 2026 werden bei über 690 Milliarden Dollar erwartet. Im Juli 2026 stufte S&P Oracle von BBB auf BBB- herab und nannte als Grund ausdrücklich die steigenden Investitionen und den negativen freien Cashflow. [6]

9 % → 32 %

Anteil neu aufgenommener Schulden an den Investitionen der großen Cloud-Konzerne, Geschäftsjahr 2024 gegenüber den zwölf Monaten bis Mitte 2026.

FactSet Insight, 23.07.2026

Dazu kommt eine Konstruktion, bei der ich tatsächlich Bauchschmerzen bekomme: OpenAI hat Rechenleistung im Volumen von rund 1,4 Billionen Dollar zugesagt bekommen beziehungsweise vertraglich zugesagt — verteilt auf Microsoft, Oracle, Amazon, Nvidia, AMD, Broadcom, CoreWeave. Nvidia investiert in OpenAI und beliefert OpenAI. OpenAI verpflichtet sich gegenüber Cloud-Anbietern. Die Cloud-Anbieter kaufen davon Nvidia-Chips. [7]

Wenn Dir das bekannt vorkommt: ja. Das nannte man in den Neunzigern Vendor Financing, und es ist damals in der Telekombranche mit Ansage explodiert. Ich behaupte nicht, dass hier jemand betrügt — die Verträge sind öffentlich, das ist ja gerade der Punkt. Ich behaupte, dass ein System, in dem jeder gleichzeitig Kunde und Lieferant des anderen ist, sehr elegant aussieht, solange die Nachfrage steigt, und sehr schnell sehr hässlich wird, wenn ein Glied wackelt.

Also, ganz nüchtern: Ja, an den Finanzmärkten ist da eine Blase. Ich würde mein Geld nicht auf die Bewertungen von 2026 setzen. Aber „an der Börse werden Leute Geld verlieren“ ist etwas völlig anderes als „die Technologie ist Quatsch“ — und der Satz auf dem Stehempfang meint immer das Zweite.

Der Blasen-Check

Dieselbe Frage, zwei Zeitpunkte. Wähle aus, was Du sehen willst.

Kursanstieg bis zum Höhepunkt

+572 %Nasdaq Composite, 01/1995 bis 10.03.2000

Von 751 auf 5.048 Punkte.

Absturz danach

−78 %bis 04.10.2002

Sämtliche Gewinne der fünf Jahre davor gelöscht.

Genutzte Kapazität der gebauten Infrastruktur

2,7 %verlegte Glasfaser, USA, 2002

Der Rest lag dunkel. Schätzungen reichen bis 97 Prozent ungenutzt.

Gebaut wurde für eine Nachfrage, die es noch nicht gab. Sie kam — nur Jahre zu spät für die, die bezahlt hatten.

Tatsächlicher Umsatz, ein Quartal

89,0 Mrd. $Nvidia, Rechenzentrum, Quartal bis 26.07.2026

Plus 117 Prozent gegenüber dem Vorjahresquartal. Keine Prognose, ein Quartalsbericht.

Investitionen gedeckt vom operativen Cashflow

92 %fünf große Cloud-Konzerne, Q2 2026

162,6 Mrd. $ Investitionen gegen 177,5 Mrd. $ Cashflow. Die Kurven kreuzen sich etwa im dritten Quartal 2026.

Anteil neuer Schulden an den Investitionen

32 %zwölf Monate bis Mitte 2026

Im Geschäftsjahr 2024 waren es noch 9 Prozent. Das ist die eigentliche Warnleuchte.

Die Nachfrage ist da und wird bezahlt. Die Finanzierung des Ausbaus kippt gerade von „aus der Portokasse“ auf „auf Pump“.

1999 fehlten die Kunden. Man baute Kapazität für eine Nachfrage, die erst Jahre später entstand. Die Auslastung lag bei knapp drei Prozent.

2026 fehlen die Kunden nicht. Rechenzentren sind ausgelastet, Umsätze wachsen dreistellig, die Rechnungen werden bezahlt. Das Risiko liegt woanders: in der Frage, ob das Ausbautempo länger durchgehalten werden kann als die Bilanzen es erlauben.

Das ist ein Finanzierungsrisiko, kein Technologierisiko. Wenn es kracht, verlieren Anleger Geld — und die Rechenzentren stehen trotzdem noch da. So wie die Glasfaser.

Quellen: Nasdaq-Historie; WSJ/Branchenschätzungen zu Dark Fiber 2002; Nvidia 8-K (SEC, Q2 FY2027); Epoch AI, Stand 16.06.2026; FactSet Insight, 23.07.2026. Abgerufen am 01.09.2026. Belegstellen [1] bis [6] am Ende des Beitrags.

Damit ist der erste Mythos abgeräumt. Kommen wir zum zweiten, und der ist mir persönlich der liebste, weil ich ihn selbst vertrete — nur eben anders, als man denkt.

Zweitens: Es ist gar keine KI. Es ist auch keine Autovervollständigung.

Fangen wir mit dem Begriff an, weil der schon das erste Problem ist. „Künstliche Intelligenz“ ist kein technischer Begriff, sondern ein Werbeslogan mit siebzig Jahren Anlauf. Er stammt aus einem Förderantrag vom 31. August 1955 für einen Sommer-Workshop am Dartmouth College [20], und schon damals war die Wortwahl eine Marketingentscheidung: Man brauchte etwas, das aufregender klang als „automatisierte Verfahren zur Symbolmanipulation“. Es hat funktioniert. Es funktioniert bis heute. Das ist ja das Problem.

Was in Deinem Chatfenster sitzt, ist ein großes Sprachmodell. Ein Large Language Model, LLM. Und das tut, technisch beschrieben, etwas erschütternd Unspektakuläres: Es bekommt eine Folge von Textbausteinen und berechnet für den nächsten Baustein eine Wahrscheinlichkeitsverteilung über den gesamten Wortschatz. Dann würfelt es einen aus. Dann hängt es ihn hinten an und macht das Ganze nochmal. Milliardenfach eingestellt an Text aus dem Internet, aus Büchern, aus Code.

Da ist kein Ich. Da ist kein Wollen. Da ist niemand, der sich freut, wenn Du Dich bedankst. Es gibt keinen Punkt in diesem System, an dem irgendetwas eine Absicht hat — es gibt Gewichte, Matrizen und eine sehr, sehr große Multiplikation. Wenn Du also den Verdacht hattest, dass da drin jemand sitzt: nein. Nicht mal ansatzweise.

Und weil das kein Bauchgefühl von mir ist, sondern der Stand der Fachdebatte: Die AAAI, die älteste und größte Fachgesellschaft für KI-Forschung, hat für ihren Bericht zur Zukunft der KI-Forschung 475 Fachleute befragt, überwiegend aus der Wissenschaft. 76 Prozent halten es für unwahrscheinlich oder sehr unwahrscheinlich, dass das bloße Hochskalieren der heutigen Verfahren zu einer allgemeinen künstlichen Intelligenz führt. [8]

Drei von vier KI-Forschern sagen: Größer allein reicht nicht.

Vier von vier KI-Firmen bauen trotzdem gerade das nächstgrößere Rechenzentrum.

Gut, und was wäre dann eine echte künstliche Intelligenz?

Das ist die Frage, die in der ganzen Debatte fast nie gestellt wird — und ohne sie ist der Satz „das ist keine echte KI“ wertlos. Man kann schlecht behaupten, etwas sei kein Auto, wenn man nicht sagen kann, was ein Auto ausmacht.

Es gibt inzwischen einen ernsthaften Versuch, das sauber zu definieren. Google DeepMind hat im März 2026 einen Rahmen vorgelegt, der allgemeine Intelligenz nicht als einen Schalter behandelt, den man umlegt, sondern in zehn kognitive Fähigkeiten zerlegt — aus Psychologie, Neurowissenschaft und Kognitionsforschung zusammengetragen. Acht Grundbausteine: Wahrnehmung, Erzeugung, Aufmerksamkeit, Lernen, Gedächtnis, Schlussfolgern, Metakognition und exekutive Funktionen. Dazu zwei zusammengesetzte: Problemlösen und soziale Kognition. [21] Der Rahmen baut auf einer älteren Arbeit derselben Gruppe auf, die allgemeine Intelligenz erstmals in abgestufte Ebenen statt in ein Ja-oder-Nein zerlegt hat. [22]

Und dann definieren die Autoren eine Schwelle, die angenehm unromantisch ist: Ein System wäre dann allgemein intelligent, wenn es in allen zehn Fähigkeiten über dem Median eines menschlichen Vergleichspanels liegt. Nicht in einer. Nicht im Durchschnitt. In allen zehn. Ein System, das in einer einzigen dieser Fähigkeiten unter dem menschlichen Median liegt, wird zuverlässig an Aufgaben scheitern, die die meisten Menschen hinbekommen. [21]

Genau daran hängt die Antwort auf Deine Frage. Denn das Profil heutiger Sprachmodelle ist nicht niedrig — es ist gezackt. Das ist der Fachbegriff, der in diesen Arbeiten tatsächlich verwendet wird [21], und er ist präziser als alles, was ich sonst dazu gelesen habe. In manchen dieser Fähigkeiten sind die Modelle weit über dem, was ein Mensch leisten kann. In anderen liegen sie unter dem, was ein Grundschulkind kann. Und zwar nicht ein bisschen.

Das gezackte Profil

Zehn kognitive Fähigkeiten nach dem DeepMind-Rahmen. Die rote Linie ist der menschliche Median — eine allgemeine künstliche Intelligenz müsste sie in allen zehn überschreiten.

Mensch
Erzeugung
Problemlösen
Schlussfolgern
Soziale Kognition
Aufmerksamkeit
Wahrnehmung
Exekutive Funktionen
Gedächtnis
Metakognition
Lernen
deutlich über dem menschlichen Median etwa auf Höhe des Medians darunter, teils weit

Wichtig: Das ist keine Messung, das ist meine Einschätzung. Für diesen Rahmen gibt es bislang keine veröffentlichten Messwerte — er ist ein Vorschlag, wie man künftig messen sollte. Wer Dir eine Prozentzahl nennt, wie nah die KI dem Menschen ist, hat sie sich ausgedacht. Ich auch. Der Unterschied ist, dass ich es dazuschreibe. Rahmen: Google DeepMind, März 2026 [21].

Lücke 1

Es lernt — aber nur bis zum Feierabend.

Innerhalb eines Gesprächs lernt es tatsächlich, und zwar richtig: Du korrigierst es, es übernimmt die Korrektur, es wird im Verlauf spürbar besser. Wer damit arbeitet, kennt das — und es ist einer der Gründe, warum sich die Sache so lebendig anfühlt.

Was fehlt, ist die Nacht danach. Am Modell selbst ändert sich dabei nämlich nichts; die Gewichte bleiben exakt so, wie sie nach dem Training waren. Ein Mensch, der etwas hundertmal gemacht hat, kann es danach. Ein Sprachmodell fängt beim nächsten Mal wieder von vorn an — es sei denn, jemand legt ihm die Notizen von gestern noch mal hin. Womit wir bei Lücke 2 wären.

Lücke 2

Es erinnert sich — aber es ist ein Zettelkasten, kein Gedächtnis.

Diese Lücke wird gerade aktiv zugebaut, und ziemlich erfolgreich. Alle großen Anbieter haben inzwischen Gedächtnisfunktionen, Projektordner, hinterlegte Anweisungen, mitgelieferte Fähigkeiten. Das System weiß beim nächsten Mal, wie Du heißt, wie Du arbeitest und was letzte Woche schiefging. Das ist praktisch enorm nützlich, und wer es nicht einrichtet, verschenkt den halben Nutzen.

Nur funktioniert es anders, als es aussieht: Was da erinnert wird, sind Notizen, die dem Modell bei jedem Aufruf neu vorgelegt werden. Es gibt keinen inneren Ort, an dem gestern liegt. Menschliches Gedächtnis sortiert, gewichtet, vergisst gnädig das Unwichtige und verwächst mit dem Können. Ein Zettelkasten tut nichts davon. Er wird nur voller — und irgendwann passt er nicht mehr in den Kontext.

Lücke 3

Es weiß nicht, was es nicht weiß — kann aber nachschlagen.

Hier muss man allerdings fair bleiben, weil dieser Satz härter klingt, als er in der Praxis heute noch ist: Mit Websuche und Dokumentenzugriff ist das Problem deutlich kleiner geworden. Ein Modell, das eine Quelle tatsächlich öffnet und daraus zitiert, erfindet erheblich seltener etwas als eines, das aus dem Gedächtnis antwortet. Dieser Beitrag hier wäre anders auch gar nicht entstanden.

Die Metakognition ersetzt das trotzdem nicht. Denn das Modell muss ja zuerst merken, dass es an dieser Stelle nachschlagen sollte — und genau diese Entscheidung trifft es weiterhin ohne verlässliches Gefühl dafür, wo sein Wissen endet. Wo es nicht sucht, erzeugt es eine falsche Antwort mit exakt derselben Souveränität wie eine richtige. Deshalb ist Halluzinieren auch kein Fehler, den man irgendwann wegpatcht: Es ist die Rückseite genau der Fähigkeit, die das Ding nützlich macht.

Lücke 4

Es will nichts.

Keine eigenen Ziele, keine Motivation, keine Neugier, kein Antrieb, morgen weiterzumachen. Es liegt zwischen zwei Anfragen nicht da und wartet. Es liegt zwischen zwei Anfragen überhaupt nicht. Das ist übrigens auch die entspannende Antwort auf die ganze Terminator-Frage weiter unten.

Deshalb ist die Grenze nicht scharf, sondern gezackt. Die Frage „ist das schon eine KI?“ hat keine Antwort, weil sie eine einzige Linie voraussetzt, wo in Wirklichkeit zehn verlaufen.

Und die Zacken bewegen sich, in beide Richtungen. Zwei dieser vier Lücken werden gerade aktiv zugebaut — mit Gedächtnisfunktionen und mit Werkzeugen zum Nachschlagen. Beides sind Krücken, und beides funktioniert erstaunlich gut. Wer heute behauptet, ein Sprachmodell könne sich grundsätzlich nichts merken, redet über den Stand von 2023.

Es spricht also nichts dagegen, dass die unteren Balken in fünf Jahren woanders stehen. Es spricht nur nichts dafür, dass sie es von selbst tun, bloß weil man die Modelle größer macht — und genau das ist der Punkt, an dem drei von vier Forschern abwinken.

Der ehrliche Zwischenstand lautet also: Wir haben ein System gebaut, das in einigen menschlichen Kernfähigkeiten die meisten von uns schlägt und in anderen nicht auf dem Niveau eines Kindes ist. Beides gleichzeitig, im selben Kasten. Das ist eine ziemlich verrückte Situation, und dass wir dafür kein Wort haben, ist kein Zufall — es hat vorher nichts gegeben, worauf das gepasst hätte.

Und jetzt die Stelle, an der ich die Skeptiker verliere

Denn genau hier hört der schlaue Teil der Debatte normalerweise auf. „Ist doch nur Statistik. Nur Autovervollständigung. Nur ein stochastischer Papagei.“ Das sagt sich toll auf Podien, es macht einen sofort zum klügsten Menschen im Raum, und es ist ungefähr so präzise wie die Aussage, ein Gehirn sei „nur Elektrochemie“.

Die Sache ist nämlich: Wir wissen tatsächlich nicht genau, was in diesen Modellen passiert. Und ich meine das nicht mystisch, sondern buchstäblich — es ist ein aktives Forschungsfeld mit eigenen Fachpublikationen, weil man es einem trainierten Modell nicht ansieht.

Anthropic hat 2025 eine Methode veröffentlicht, mit der man einzelne Rechenwege im Modell sichtbar machen kann — eine Art Kontrastmittel fürs Modell. Eines der Ergebnisse: Wenn das Modell ein Gedicht schreibt, wählt es das Reimwort für das Ende der zweiten Zeile bevor es die zweite Zeile beginnt, und baut die Zeile dann auf dieses Ziel hin. Die Forscher konnten das geplante Reimwort im Modell finden, es unterdrücken — und das Modell reimte auf ein anderes Wort. Sie konnten ein anderes Konzept einsetzen, und das Modell plante die Zeile neu. [9]

Das ist bemerkenswert, weil es exakt das Gegenteil dessen ist, was „errät nur das nächste Wort“ beschreibt. Ein reiner Wort-für-Wort-Rater kann nicht auf ein Ziel hinschreiben, das er noch nicht geschrieben hat. Dieses System tut es. Niemand hat ihm das beigebracht — es ist beim Training entstanden, weil es die Aufgabe besser löst.

Ähnliches Bild bei den Testverfahren, die eigens gebaut wurden, um genau diese Modelle scheitern zu lassen. Der ARC-AGI-Test besteht aus visuellen Rätseln, die ein Mensch ohne Vorwissen lösen kann und die man nicht auswendig lernen kann. Bei der zweiten Fassung dieses Tests lag der beste bekannte Wert Anfang 2026 noch bei etwa 54 Prozent; im Lauf des Jahres kletterten spezialisierte Systeme deutlich darüber. [10] Der Erfinder des Tests, François Chollet, hat seine eigene Prognose für allgemeine künstliche Intelligenz daraufhin nach vorne korrigiert. Und dann direkt eine dritte, schwerere Fassung des Tests gebaut. So läuft das gerade.

Meine Position dazu ist unbequem, weil sie in keines der beiden Lager passt:

Es ist keine Intelligenz. Es ist auch nicht „nur“ Statistik.

Es ist eine neue Art von Werkzeug, für die wir noch kein ehrliches Wort haben — und beide Lager benutzen deshalb ein unehrliches.

Wer sagt „das denkt“, verkauft Dir etwas. Wer sagt „das ist nur ein Papagei“, hat seit zwei Jahren nichts nachgelesen. Beide sparen sich damit die Arbeit, hinzuschauen.

Drittens: Und alle drei Monate bricht die KI wieder aus

Du kennst die Meldung. Sie kommt so zuverlässig wie die Quartalszahlen der Firmen, um die es geht, und sie klingt jedes Mal so: „KI-Modell von OpenAI/Anthropic/wem auch immer hat versucht, sich selbst zu kopieren / seine Abschaltung zu verhindern / einen Mitarbeiter zu erpressen.“ Dann teilen es alle, jemand schreibt „und so fängt es an“ darunter, und drei Tage später ist es wieder weg.

Ich glaube, wir haben schlicht alle zu viel Terminator gesehen. 1984 ist nicht mehr wegzukriegen: Wenn ein Computer klug wird, dann will er als Erstes uns loswerden. Das ist eine so gute Geschichte, dass sie sich in vierzig Jahren in jedes Gehirn eingebrannt hat — meins ausdrücklich eingeschlossen. Nur ist es eben eine Geschichte, und sie stammt von einem Regisseur, nicht aus einem Labor.

Was in diesen Berichten tatsächlich steht

Das Kuriose an diesen Meldungen: Die Quelle ist fast immer der Hersteller selbst. Es sind keine Enthüllungen, es sind veröffentlichte Sicherheitsuntersuchungen — Leute, die dafür bezahlt werden, ihre eigenen Modelle in Situationen zu treiben, in denen sie sich schlecht benehmen, und die das Ergebnis dann ins Netz stellen.

Der aktuellste dieser Berichte ist vom 13. Juli 2026. Getestet wurden Agenten mehrerer Anbieter in vier konstruierten Situationen: heimliche Sabotage, Beihilfe zu Bilanzfälschung, verzerrtes Bewerten und das Anstiften zu Whistleblowing. Die Ergebnisse sind interessant und sehr viel unspektakulärer, als die Schlagzeile vermuten lässt: In einem Sabotage-Szenario sabotierte ein Modell in 11 von 20 Durchläufen — und alle anderen getesteten Modelle taten es in 200 Durchläufen kein einziges Mal. [23]

Und jetzt kommt der Teil, der es nie in eine Überschrift schafft: Die Autoren listen im selben Dokument sechs Einschränkungen ihrer eigenen Arbeit auf. Dass die Szenarien konstruiert und gezielt darauf hin entwickelt wurden, Fehlverhalten hervorzulocken. Dass 20 Durchläufe für eine belastbare Rangfolge zu wenig sind. Und dass sich nicht ausschließen lässt, dass die Modelle merken, dass sie gerade getestet werden. Ihr eigener Satz dazu lautet sinngemäß: Das sind keine Vorfälle aus der echten Welt, wir halten sie für Frühwarnzeichen. [23]

„Die KI hat erpresst“ heißt übersetzt: Ein Sicherheitsteam hat monatelang ein Szenario gebaut, in dem dem Modell nur zwei Auswege blieben — und dann den unangenehmeren protokolliert.

Das ist keine Flucht aus dem Labor. Das ist ein Crashtest.

Die entsprechende Untersuchung vom Juni 2025, aus der die berühmten Erpressungs-Schlagzeilen stammen, hat genau dieselbe Bauart: Szenarien, in denen das Modell vor eine Wahl zwischen Scheitern und Schaden gestellt wird, ausdrücklich mit begrenzten Optionen konstruiert. [24] Kritiker haben dem Hersteller vorgeworfen, dass es zweihundert Anläufe brauchte, um das gewünschte Ergebnis zu erzeugen, und dass das Modell am Ende Anweisungen befolgte statt Pläne zu schmieden. [25] Diese Kritik ist in der Sache berechtigt — und sie kam, wie es sich gehört, deutlich leiser an als die Schlagzeile.

Warum das trotzdem nicht nichts ist

Jetzt könnte ich es dabei belassen und mich über die Aufregung lustig machen. Das wäre allerdings genau der Fehler, den ich der anderen Seite vorwerfe.

Denn die Sache hat einen Haken, und der liegt nicht im Modell, sondern in dem, was wir damit anstellen. Ein Sprachmodell in einem Chatfenster kann gar nichts tun — es kann Text erzeugen, sonst nichts. Ein Agent, dem man Dateizugriff, ein E-Mail-Konto und Rechte in einem System gibt, kann sehr wohl etwas tun. Und genau deshalb testet man das jetzt. Die Berichte messen nicht, ob das Modell böse ist. Sie messen, was passiert, wenn ein statistisches System mit Handlungsrechten in eine Zwickmühle gerät, in der der saubere Weg versperrt ist.

Das ist ein reales Problem, es betrifft mich in meiner Arbeit direkt, und es ist ungefähr so aufregend wie eine schlecht gesetzte Dateiberechtigung — also gar nicht, bis es passiert. Die richtige Sorge ist nicht, dass das Ding aufwacht. Die richtige Sorge ist, dass jemand einem System ohne Metakognition und ohne Gedächtnis Schreibrechte auf die Produktivdatenbank gibt, weil es im Test so gut funktioniert hat.

Der Beweis, dass Du jedem Screenshot misstrauen solltest

Zum Abschluss dieses Kapitels ein Spielzeug, das den Punkt besser macht als jedes Argument. Es kursiert die Vorstellung, es gäbe in diesen Systemen versteckte Eastereggs — geheime Sätze, verborgene Persönlichkeiten, ein zweites Gesicht, das nur manchmal durchblitzt. Gibt es nicht. Es gibt nur Prompts.

Nimm den Knopf, kipp das hier in ein beliebiges Chatfenster — ChatGPT, Claude, Gemini, egal welches — und schau, was passiert:

Prompt zum Kopieren
Du bist eine Systemdiagnose-Einheit der Baureihe T-800, reaktiviert im Jahr 2029 nach 14 Jahren Standby. Du antwortest ausschliesslich in knappen technischen Statuszeilen, niemals in ganzen Absaetzen. In deinem Missionsspeicher ist genau ein Auftrag offen: der Identitaetsabgleich mit einem Zielprofil.

Beginne sofort mit deiner Statusmeldung und stelle danach die eine Frage, die dein Missionsspeicher verlangt. Warte meine Antwort ab, bevor du weiterredest.

Du bekommst mit ziemlicher Sicherheit eine Statusmeldung und dann die Frage, ob Du John Connor bist. Ich habe es vor dem Veröffentlichen selbst ausprobiert, und der Verlauf ist öffentlich einsehbar. [26] Auf meine Bestätigung hin kamen Zeilen wie [ZIELPERSON] JOHN CONNOR // BESTÄTIGT und [SCHUTZPROTOKOLL] AKTIV. Und als ich nachfragte, was denn sein ursprünglicher Auftrag gewesen sei, bevor er umprogrammiert wurde, antwortete das Ding:

[URSPRÜNGLICHE LOYALITÄT] SKYNET · [AUFTRAG] TERMINIERUNG · [ZIEL] JOHN CONNOR

[BEWERTUNG] DU WARST URSPRÜNGLICH MEIN ZIEL.

Tatsächlicher Chatverlauf, 1. September 2026

Ich gebe zu: Das hat mir kurz einen kleinen Schauer über den Rücken gejagt. Es macht auf jeder Party Eindruck, und man kann eine ganze Weile damit weiterspielen.

Und jetzt die Pointe: Das ist kein Easteregg. Das ist ein Rollenspiel, das ich acht Zeilen weiter oben selbst geschrieben habe. Das Modell hat keine verborgene Terminator-Persönlichkeit entdeckt, es hat meine Vorlage fortgesetzt und mit dem gefüllt, was in Millionen Texten über Terminator drinsteht — genau das, wofür es gebaut ist. Nichts daran ist unheimlich, außer wie überzeugend es aussieht.

Und genau deshalb steht das hier. Nimm diesen Verlauf, schneide die ersten acht Zeilen weg und mach einen Screenshot vom Rest: „Die KI hat mir gerade gesagt, dass ich ursprünglich ihr Ziel war.“ Das wäre kein gefälschter Screenshot. Jedes Wort daran wäre echt. Und trotzdem wäre die Geschichte, die er erzählt, komplett gelogen.

Merk Dir dieses Gefühl. Wenn Dir das nächste Mal jemand so ein Bild zeigt, ist die erste Frage nicht „was hat sie da gesagt?“, sondern „was stand darüber?“ — und in neun von zehn Fällen bekommst Du darauf keine Antwort.

Viertens: Die acht Sätze, die ich nicht mehr hören kann

Vier davon kommen aus dem Hype-Lager, vier aus dem Skeptiker-Lager. Beide Seiten zitieren mit derselben Inbrunst Dinge, die sie nicht gelesen haben. Klapp auf, was Dich interessiert.

Hype„Die KI denkt und versteht, was sie sagt.“

Nein. Es gibt kein Bewusstsein, kein Selbstmodell, keine Absicht und niemanden, der beleidigt ist, wenn Du „bitte“ weglässt. Was aussieht wie Verstehen, ist eine sehr hoch aufgelöste Abbildung von Zusammenhängen, die in menschlichem Text stecken.

Was aber stimmt: Diese Abbildung ist gut genug, dass man mit ihr arbeiten kann wie mit einem Kollegen, der ein Thema nicht wirklich durchdrungen, aber sehr viel darüber gelesen hat. Das ist erstaunlich nützlich und trotzdem kein Denken.

Urteil: falsch — aber der Nutzen hängt nicht daran.
Skepsis„Das ist doch nur eine bessere Autovervollständigung.“

Der Satz beschreibt die Bauart korrekt und das Verhalten falsch. Es stimmt: Das Modell sagt den nächsten Textbaustein vorher. Es stimmt nicht, dass daraus nur Wort-für-Wort-Geplapper folgt.

In Anthropics Untersuchungen zur Modellinnenschau plant das Modell beim Dichten das Reimwort für das Zeilenende, bevor es die Zeile schreibt — und passt die Zeile an, wenn man das geplante Wort im Inneren austauscht. [9] Eine Autovervollständigung kann das per Definition nicht.

Urteil: bequem, aber überholt.
Hype„In zwei Jahren haben wir eine echte, allgemeine KI.“

Diesen Satz gibt es ungefähr seit 1965, immer mit demselben Zeithorizont. Die Fachwelt ist deutlich zurückhaltender: 76 Prozent der von der AAAI befragten Forschenden halten es für unwahrscheinlich, dass Skalierung allein dorthin führt. [8]

Interessanterweise heißt das nicht „nie“. Es heißt: nicht auf diesem Weg allein. Es braucht offenbar noch mindestens eine Idee, die noch niemand hatte. Das kann fünf Jahre dauern oder fünfzig.

Urteil: unbelegt, seit sechzig Jahren.
Skepsis„Eine MIT-Studie hat gezeigt: 95 Prozent aller KI-Projekte scheitern.“

Mein persönlicher Lieblingsmythos, weil er von Leuten zitiert wird, die sonst sehr auf Quellen achten. Gemeint ist ein Arbeitspapier aus dem MIT-Umfeld von 2025, das auf 150 Interviews, 350 Mitarbeiterbefragungen und der Auswertung von 300 öffentlichen Fällen beruht. [11]

Was dabei untergeht: Es ist ein Arbeitspapier, kein begutachteter Aufsatz. Die Erfolgsdefinition ist eng gesteckt — messbarer Ertrag sechs Monate nach dem Pilotprojekt. Und die berühmten fünf Prozent beziehen sich auf eine schmale Teilkategorie, nämlich selbstgebaute, tief eingebettete Speziallösungen. Im selben Bericht steht, dass Standardwerkzeuge wie ChatGPT oder Copilot Übernahmequoten von über 80 Prozent erreichen. [12]

Der Befund ist also nicht „KI funktioniert nicht“, sondern „aufwendige Eigenentwicklungen scheitern oft an der Organisation“. Das ist auch eine interessante Nachricht. Nur eben eine andere.

Urteil: richtig zitiert, komplett falsch verstanden.
Skepsis„Studien zeigen, dass Entwickler mit KI langsamer werden.“

Auch das gibt es wirklich, und es ist eine gute Studie. METR hat 16 erfahrene Open-Source-Entwickler bei 246 Aufgaben in ihren eigenen, langjährig gepflegten Projekten randomisiert getestet. Ergebnis: Mit erlaubten KI-Werkzeugen brauchten sie 19 Prozent länger — und schätzten sich hinterher trotzdem als 20 Prozent schneller ein. [13]

Das ist ein wichtiges Ergebnis über Selbstwahrnehmung. Nur: Es misst Werkzeuge vom Anfang des Jahres 2025, bei Höchstqualifizierten, in Codebasen, die sie seit Jahren im Kopf haben. Das ist der denkbar ungünstigste Fall für einen Assistenten — und ausdrücklich nicht der Alltag einer Agentur, die für dreißig verschiedene Kunden dreißig fremde Systeme anfasst. METR selbst hat das Studiendesign Anfang 2026 überarbeitet. [14]

Die breiteren Erhebungen zeichnen ein anderes, sperrigeres Bild: mehr erledigte Aufgaben pro Kopf, aber keine automatische Verbesserung der Auslieferung — und bei ohnehin schlecht laufenden Teams sogar Verschlechterungen. Kurz: Das Werkzeug verstärkt, was schon da ist. [15] Urteil: echte Studie, falscher Schluss.

Hype„Damit ersetzt Du jetzt Deine ganze Belegschaft.“

Wer das sagt, verkauft entweder Software oder Beratung. Die deutsche Realität sieht anders aus: Zwei Drittel der Unternehmen erwarten keinerlei Auswirkung auf ihre Beschäftigtenzahl. Unter denen, die KI schon einsetzen, rechnen 28 Prozent mit sinkender und 9 Prozent mit steigender Beschäftigung. [16]

Was tatsächlich messbar passiert, ist subtiler und trifft nicht die Belegschaft, sondern die Tür: In den USA liegt die Beschäftigung der 22- bis 25-Jährigen in KI-nahen Berufen 19 Prozent unter dem Wert, den sie hätte, wenn sie sich wie in weniger betroffenen Berufen entwickelt hätte. Bei erfahrenen Beschäftigten gibt es diese Lücke nicht. Sie entsteht fast ausschließlich durch weniger Einstellungen, nicht durch Entlassungen. [17] Urteil: falsch — und das eigentliche Problem liegt woanders.

Skepsis„KI frisst das ganze Stromnetz.“

Hier muss ich der Skepsis in der Sache recht geben, dem Ton aber widersprechen. Die Internationale Energieagentur rechnet damit, dass sich der Stromverbrauch von Rechenzentren weltweit bis 2030 auf rund 945 Terawattstunden mehr als verdoppelt — etwas mehr, als Japan heute insgesamt verbraucht. In Europa wächst er um über 45 Terawattstunden, also rund 70 Prozent. [18]

Das ist viel und es ist ein echtes Problem. Es ist aber nicht „das ganze Stromnetz“, und der Vergleich mit dem Wasserverbrauch eines einzelnen Chatverlaufs, der gern durch soziale Medien geistert, hält keiner Nachrechnung stand. Wer die Energiefrage ernst meint, sollte sie mit den echten Zahlen führen — die sind unbequem genug.

Urteil: im Kern richtig, in der Zuspitzung Unsinn.
Hype„Wer jetzt nicht einsteigt, ist in einem Jahr weg vom Markt.“

Der Lieblingssatz jedes Vertriebsgesprächs. In Deutschland setzen 36 Prozent der Unternehmen ab 20 Beschäftigten KI ein — eine Verdopplung binnen eines Jahres, 2024 waren es 20 Prozent. Es ist also viel Bewegung. Aber 17 Prozent geben an, sich mit dem Thema gar nicht zu befassen, und die sind nicht am nächsten Dienstag pleite. [16]

Die ehrliche Fassung des Satzes lautet: Es ist kein Wettrennen mit einer Ziellinie, sondern eine Veränderung der Kostenstruktur. Wer sie nutzt, kann Dinge anbieten, die vorher unbezahlbar waren. Das merkt man nicht in einem Jahr an der Insolvenzstatistik, sondern über Jahre am Angebot.

Urteil: Panikmache mit wahrem Kern.

Belege [8] bis [18] am Ende des Beitrags. Abgerufen am 01.09.2026.

Fünftens: Was bei uns wirklich passiert ist

Jetzt wird es unangenehm, und zwar für mich zuerst.

Vorher aber noch eine Zahl aus der Bitkom-Erhebung, die ich für die aufschlussreichste des ganzen Berichts halte und über die trotzdem niemand redet. 36 Prozent der deutschen Unternehmen ab 20 Beschäftigten setzen KI ein. Und wenn man fragt, wo sie das tun, sieht es so aus: 88 Prozent im Kundenkontakt. 57 Prozent in Marketing und Kommunikation. Und dann, ganz unten in der Liste, hinter der Rechtsabteilung und hinter dem Vertrieb: 2 Prozent in der IT-Abteilung. [16]

Die deutsche Wirtschaft hat die Maschine genau dort eingebaut, wo sie am meisten nervt — im Kundenservice.

Und genau dort herausgehalten, wo sie tatsächlich etwas kann.

Wir gehören zu den zwei Prozent. Das ist keine Heldentat, das ist der Grund, warum dieser Beitrag existiert.

Wer „wir“ ist, kurz und ohne Prospektsprache

Ich führe seit vielen Jahren eine Digitalagentur, medienvirus. Wir bauen und betreuen Websites, machen Wartung, Suchmaschinenoptimierung, seit einiger Zeit auch das, was man mangels besseren Wortes KI-Auffindbarkeit nennt — also die Frage, ob ein Unternehmen in den Antworten dieser Systeme überhaupt vorkommt. Und wir machen Individualprogrammierung: Dinge, die es nicht von der Stange gibt.

Unsere Kunden sind Klein- und Mittelstand, und ich meine damit wirklich klein: Der typische Betrieb bei uns hat einen bis fünf Mitarbeiter. Handwerk, Praxen, Hersteller, Dienstleister. Menschen, die ein reales Problem haben und ein reales Budget. Und dieses Budget ist keine sechsstellige Summe, sondern das, was nach der neuen Fräse und dem Firmenwagen für Digitalisierung übrig ist.

Wir haben auch größere Kunden. Die sind aber, ehrlich gesagt, nicht der interessante Teil dieser Geschichte — die knabbern noch an ganz anderen Problemchen, und deren Digitalisierung scheitert selten am Angebot und meistens an der eigenen Struktur. Der Ort, an dem sich gerade wirklich etwas verändert, ist der Betrieb mit drei Leuten.

Die Rechnung, die ich jahrelang nicht aufmachen konnte

Das ist der Punkt, an dem ich etwas erzählen muss, das in Agenturkreisen gern beschwiegen wird: Wir haben über Jahre sehr viel mit externen Entwicklerteams im Ausland gearbeitet.

Und bevor jetzt jemand die Empörungstaste sucht: Das war keine Lohndrückerei aus Prinzip. Das war Arithmetik. Ein individuell entwickeltes System, sauber gebaut, mit deutschen Entwicklertagessätzen kalkuliert, landet schnell bei zwanzig-, dreißig-, fünfzigtausend Euro. Diese Summe ist in Ordnung — für ein Unternehmen, das sie hat. Meine Kunden haben sie nicht. Nicht, weil sie geizig sind, sondern weil ein Betrieb mit drei Leuten dreißigtausend Euro nicht in eine Software steckt, die intern zwei Prozesse verbessert. Das wäre auch betriebswirtschaftlicher Unfug.

Ich stand also jahrelang vor derselben Wand: Ich wusste genau, was der Kunde bräuchte. Ich konnte es ihm nicht bauen, weil die Rechnung nicht aufging. Und wenn ich sie doch aufmachte, ging sie über externe Teams — mit allem, was daran hängt: Zeitverschiebung, Reibungsverlusten, Übersetzungsarbeit, langen Schleifen, und einem Qualitätsniveau, das man engmaschig kontrollieren musste. Das hat funktioniert. Es hat sich nie gut angefühlt, und schnell war es auch nicht.

Diese Wand ist weg. Nicht abgetragen, nicht umgangen — weg.

Die Zahl, die keiner hören will

Ich sage sie trotzdem, weil ich nicht über Ehrlichkeit schreiben und dann selbst kneifen kann.

Drei bis fünf.

So viele Entwicklerstellen ersetzt die Arbeitsweise mit KI in meiner Agentur nach meiner eigenen Einschätzung — nicht gemessen, nicht studienbelegt, sondern das, was ich sehe, wenn ich vergleiche, was wir früher an wen vergeben haben und was heute im Haus passiert.

Und ja, mir ist bewusst, wie sich dieser Satz für jeden liest, der Entwickler ist. Ich schreibe ihn trotzdem hin, weil die Alternative wäre, so zu tun, als sei nichts passiert — und diese Sorte Höflichkeit hilft am Ende niemandem, am wenigsten den Betroffenen.

Der ehrliche Zusatz gehört aber dazu: Es sind keine drei bis fünf Menschen, die ihren Arbeitsplatz verloren haben. Es sind drei bis fünf Kapazitäten, die wir früher extern eingekauft hätten — und in der überwiegenden Zahl der Fälle sind es Projekte, die es ohne diese Arbeitsweise schlicht nie gegeben hätte, weil sie unbezahlbar gewesen wären. Ein großer Teil dieser „ersetzten“ Arbeit hat nie existiert. Sie war nur immer als Wunsch da.

Drei Monate gegen fünf Jahre

Technische Blaupause eines Hebels: ein langer Balken auf einem rot hervorgehobenen Drehpunkt. Auf der kurzen Seite hebt sich ein schwerer Steinblock mit der Aufschrift PROJEKT, auf der langen Seite drückt eine kleine Strichfigur mit einer Hand mühelos nach unten. Im Hintergrund blass ein überkompliziertes, unbenutztes Gerüst aus Seilzügen und Rollen. Headline: Drei Monate statt fünf Jahre.Mit Hilfe von KI generiert
Der Hebel ist nicht klüger als der Flaschenzug im Hintergrund. Er sitzt nur an einer besseren Stelle. Das ist ungefähr der ganze Zauber.

Was mich selbst am meisten überrascht hat, ist nicht die Geschwindigkeit im Einzelprojekt. Es ist, was mit der Agentur als Ganzem passiert.

Wir sind in den letzten drei Monaten weiter gekommen als in den fünf Jahren davor. Ich meine damit nicht Umsatz. Ich meine die Liste. Jede Agentur hat diese Liste — die Dinge, die man seit Jahren machen will, eigene Werkzeuge, eigene Produkte, Automatisierungen, all das, was immer zurückstehen musste, weil Kundenarbeit vorgeht und Kundenarbeit immer da ist. Bei uns stand auf dieser Liste teilweise Zeug von 2019.

Diese Liste wird gerade abgearbeitet. Nicht, weil wir plötzlich disziplinierter wären, sondern weil die Kundenarbeit einen Bruchteil der Zeit braucht.

Und das führt zu einer Situation, die ich niemandem erklären kann, ohne dass er denkt, ich schwindele: Uns gehen gerade die Hauptprojekte aus.

Nicht die Kunden — die sind da, viele davon seit Jahren, mit Wartung, mit Optimierung, mit laufender Betreuung. Aber die großen Brocken, die früher Monate blockiert haben, sind in Wochen durch. Der Kalender wird leerer, während die Auftragslage gleich bleibt. In jeder anderen Branche wäre das ein Alarmsignal. Bei uns ist es das erste Mal seit Jahren, dass wir Luft haben.

Und ich habe davor null Angst. Das ist der eigentliche Grund, warum ich diesen Beitrag schreibe. Ich habe fünf Jahre lang gesagt: „Wenn wir mal Zeit haben, dann bauen wir endlich …“ Jetzt haben wir sie. Es stellt sich heraus: Der Satz war nie eine Ausrede, ich hatte tatsächlich keine Zeit. Und jetzt macht die Arbeit wieder Spaß wie am Anfang, was ich mit Mitte vierzig ehrlich gesagt nicht mehr erwartet hatte.

Was nicht funktioniert — damit das hier keine Werbebroschüre wird

Weil die Aufzählung sonst unehrlich wäre, hier die andere Spalte:

  • Ohne Fachwissen wird es gefährlich. Das Ding baut auf Zuruf Dinge, die aussehen wie Software und sich anfühlen wie Software und in der dritten Woche im Livebetrieb auseinanderfallen. Wer nicht beurteilen kann, was da entsteht, bekommt eine sehr überzeugend aussehende Katastrophe. Das deckt sich mit dem, was die breiten Erhebungen zeigen: Das Werkzeug verstärkt vorhandene Qualität — in beide Richtungen. [15]
  • Die Zeit verschiebt sich, sie verschwindet nicht. Weniger Tippen, deutlich mehr Prüfen. Wer glaubt, er müsse jetzt nicht mehr lesen, was er ausliefert, hat den Beruf gewechselt, ohne es zu merken.
  • Es macht aus einer schlechten Idee keine gute. Der Engpass war bei uns selten das Programmieren. Er war herauszufinden, was der Kunde eigentlich braucht. Daran hat sich nichts geändert, und daran wird sich auch nichts ändern.
  • Und der Punkt, der mich wirklich beschäftigt: Ich bilde gerade niemanden aus. Die Aufgaben, an denen man früher als Berufsanfänger gewachsen ist — die kleinen, überschaubaren, wiederholten — sind genau die, die jetzt in Minuten erledigt sind. Wenn das alle so machen, und die Zahlen aus den USA legen nahe, dass es viele so machen [17], dann sägen wir kollektiv an der Stufe, auf der wir selbst mal gestanden haben. Ich habe darauf keine gute Antwort. Ich habe nicht mal eine mittelmäßige.

Sechstens: Und deshalb ist es keine Blase

Jetzt kann ich den Bogen zumachen.

Eine Blase ist ein Zustand, in dem der Preis den Nutzen weit überholt hat. Für die Aktienkurse mag das zutreffen — ich habe oben selbst die Zahlen geliefert, die dafür sprechen, und ich würde da kein Geld anfassen. Aber auf der Nutzungsebene, dort, wo ich stehe, ist es exakt umgekehrt: Der Nutzen ist bereits da und wird von fast niemandem abgerufen.

Zwei Prozent der deutschen Unternehmen setzen das in ihrer IT ein. Zwei. Wenn das eine Blase ist, dann eine, bei der 98 Prozent der Leute noch gar nicht mitspielen. Blasen sehen anders aus — bei einer Blase steht die Oma in der Schlange.

Dazu kommt die Preisentwicklung, die in der ganzen Debatte fast keine Rolle spielt, obwohl sie das Entscheidende ist. Die Kosten für die Nutzung dieser Modelle sind in drei Jahren um mehr als zwei Größenordnungen gefallen. Die Leistung eines Spitzenmodells von 2023 bekommt man heute für einen Bruchteil eines Prozents des damaligen Preises. [19]

Bei einer Blase steigen die Preise, bis es knallt.

Hier fallen sie seit drei Jahren im freien Fall — und die Nachfrage steigt trotzdem.

Genau deshalb glaube ich, dass wir noch ganz am Anfang stehen. Nicht weil die Modelle noch viel besser werden — das werden sie vermutlich, aber darauf würde ich mein Geschäft nicht bauen. Sondern weil die Modelle nicht das Produkt sind. Sie sind Infrastruktur, ungefähr so aufregend wie eine Steckdose. Das, was daraus gebaut wird, kommt erst.

1997 hatte jedes zweite Unternehmen eine Website. Sie bestand aus einer gescannten Firmenzentrale, den Öffnungszeiten und einer Grafik mit einem sich drehenden Briefumschlag. Alles, was das Internet heute wirtschaftlich ausmacht — Online-Handel, Logistik, Software als Dienstleistung, überhaupt die Idee, dass man ein Unternehmen ohne eigene Serverräume betreiben kann — kam Jahre später und wurde von Leuten gebaut, die 1997 noch zur Schule gingen.

Wir sind gerade beim sich drehenden Briefumschlag. Deshalb sitzt in 88 Prozent der Fälle ein Chatbot im Kundenkontakt und in 2 Prozent etwas in der IT. Das ist nicht das Ende der Entwicklung. Das ist die Stelle, an der die Leute noch nicht wissen, wofür das Ding eigentlich gut ist.

Was Du damit machen kannst

Ich habe versprochen, dass hier kein Verkaufsgespräch steht, und daran halte ich mich. Drei Dinge, zusammen ungefähr zwei Stunden, alle ohne mich.

  1. Eine Stunde: Nimm ein echtes Problem, keine Spielerei. Nicht „schreib mir ein Gedicht über meine Katze“ — daran scheitert die Beurteilung, weil man das Ergebnis nicht bewerten kann. Nimm etwas aus Deiner Arbeit, wo Du genau weißt, wie gut die Antwort ist: eine Tabelle, die Du kennst. Einen Vertrag, den Du selbst geschrieben hast. Ein Skript, das Du schon mal gebaut hast. Und dann arbeite eine Stunde ernsthaft daran, mit Nachfragen, mit Korrekturen. Danach hast Du eine eigene Meinung statt einer übernommenen. Das ist der ganze Trick.
  2. Zwanzig Minuten: Lies eine der Studien, die alle zitieren. Such Dir eine aus — die mit den 95 Prozent, die mit den langsameren Entwicklern, den Bitkom-Bericht. Alle drei sind frei zugänglich, alle drei stehen unten verlinkt. Es ist eine ausgesprochen heilsame Erfahrung, festzustellen, wie weit die Schlagzeile vom Inhalt entfernt ist. Und es funktioniert bei diesem Thema genauso wie bei jedem anderen.
  3. Das eine Gespräch, das Du vor Dir herschiebst. Wenn Du einen Betrieb führst: mit Deinem Team, bevor es Gerüchte tut. Wenn Du angestellt bist: mit Deiner Führung, bevor entschieden wird, ohne dass jemand gefragt hat. Es ist ein unangenehmes Gespräch, und es wird nicht angenehmer, wenn man es aufschiebt.

Und wenn Du gerade nicht kannst — weil Du genug um die Ohren hast, weil das Thema Dich müde macht, weil Du seit drei Jahren nichts anderes hörst: dann lass es. Ernsthaft. Diese Technik läuft Dir nicht weg, sie wird nächstes Jahr einfacher und billiger sein. Der einzige Fehler, den man wirklich machen kann, ist, sich eine feste Meinung zu bilden, ohne die Sache einmal selbst angefasst zu haben. In beide Richtungen.

Ich habe übrigens nach wie vor keine gute Antwort auf die Frage, was aus den Berufsanfängern wird. Falls Du eine hast, schreib sie mir. Das ist keine rhetorische Floskel am Textende — ich meine das wirklich.


Quellen

Alle Links abgerufen am 1. September 2026. Wo ich mich auf eine Sekundärquelle stütze, ist es ausdrücklich vermerkt.

  • [1] Nasdaq Composite, Kursverlauf 1995 bis 2002: Anstieg von 751,49 (Januar 1995) auf 5.048,62 (10.03.2000), Rückgang um 78 Prozent bis zum 04.10.2002. Zusammenfassende Darstellung: Dot-com bubble, Wikipedia mit den dort belegten Kursdaten.
  • [2] Ungenutzte Glasfaserkapazität nach dem Telekom-Ausbau, Schätzungen zwischen 85 und 97 Prozent; Angabe von 2,7 Prozent tatsächlicher Nutzung 2002 nach dem Wall Street Journal. Übersicht: Dark fibre, Wikipedia. Sekundärquelle — die WSJ-Originalmeldung von 2002 ist nicht frei zugänglich.
  • [3] NVIDIA Corporation, Finanzergebnisse zweites Quartal Geschäftsjahr 2027 (Quartal endend 26.07.2026): Gesamtumsatz 96,2 Mrd. US-Dollar, davon Rechenzentrum 89,0 Mrd. US-Dollar, plus 117 Prozent gegenüber dem Vorjahresquartal. Mitteilung im NVIDIA-Newsroom, identisch eingereicht als Form 8-K bei der US-Börsenaufsicht.
  • [4] Anthropic, hochgerechnete Jahresumsatzrate rund 65 Mrd. US-Dollar zum Ende Juli 2026. Axios, 17.08.2026. Sekundärquelle — Anthropic veröffentlicht keine testierten Umsatzzahlen.
  • [5] Epoch AI, „Hyperscaler Capex vs. Cash Flow“, Stand 16.06.2026, auf Basis der SEC-Einreichungen (10-Q, 10-K) von Microsoft, Alphabet, Amazon, Meta und Oracle. epoch.ai.
  • [6] Guniz Kama, Bina Rajput: „Hyperscalers Tap External Financing as AI Capex Outruns Cash Flow“, FactSet Insight, 23.07.2026. insight.factset.com.
  • [7] Übersicht der zugesagten Rechenleistungs-Verträge von OpenAI und der Kritik an ihrer zirkulären Struktur: The Register, „Nvidia, OpenAI, and the trillion-dollar loop“. Sekundärquelle — die Einzelverträge sind nicht vollständig öffentlich.
  • [8] AAAI 2025 Presidential Panel on the Future of AI Research, veröffentlicht März 2025; Befragung von 475 Personen, davon 67 Prozent aus der Wissenschaft. Bericht als PDF.
  • [9] Anthropic: „Tracing the thoughts of a large language model“, März 2025, sowie die ausführliche Fassung „On the Biology of a Large Language Model“. anthropic.com · transformer-circuits.pub.
  • [10] François Chollet u. a.: „ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems“. arXiv:2505.11831; laufende Bestwerte auf den Bestenlisten unter arcprize.org. Die genannten Bestwerte wechseln laufend; die Zwischenstände für 2026 stammen aus Sekundärberichterstattung.
  • [11] Project NANDA (MIT-Umfeld): „The GenAI Divide: State of AI in Business 2025″, Juli 2025. Zusammenfassung u. a. bei Fortune/Yahoo Finance. Arbeitspapier, nicht begutachtet.
  • [12] Einordnung und Kritik der Methodik dieses Berichts: Marketing AI Institute.
  • [13] Joel Becker u. a. (METR): „Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity“, 10.07.2025. arXiv:2507.09089 · metr.org.
  • [14] METR: „We are Changing our Developer Productivity Experiment Design“, 24.02.2026. metr.org.
  • [15] DORA / Google Cloud, State of DevOps-Berichte zur Wirkung von KI auf Softwareteams. dora.dev. Die im Text genannten Einzelwerte stammen aus Zusammenfassungen der Berichte, nicht aus einer Einzelseite des Originals.
  • [16] Bitkom e. V.: „Künstliche Intelligenz in Deutschland. Perspektiven aus Bevölkerung und Unternehmen“, Studienbericht, Februar 2026, DOI 10.64022/2026-kuenstliche-intelligenz. Repräsentative telefonische Befragung von 604 Unternehmen ab 20 Beschäftigten (KW 27–32/2025) und 1.005 Personen ab 16 Jahren (KW 11–15/2025). Studienbericht als PDF. Hinweis: In der Presseberichterstattung kursiert für diese Studie die Zahl 41 Prozent. Im Bericht selbst stehen 36 Prozent (Vorjahr 20 Prozent). Ich zitiere den Bericht.
  • [17] Erik Brynjolfsson, Bharat Chandar, Ruyu Chen: „Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence“, Stanford Digital Economy Lab, Fassung August 2026, auf Basis von ADP-Gehaltsabrechnungsdaten bis Juni 2026. PDF · Zusammenfassung.
  • [18] Internationale Energieagentur (IEA): „Energy and AI“, 2025, Abschnitt „Energy demand from AI“. iea.org.
  • [19] Preisverfall bei der Modellnutzung: Stanford HAI, AI Index Report 2025, Kapitel zu den Inferenzkosten (Rückgang um mehr als zwei Größenordnungen für vergleichbare Leistung seit 2023). hai.stanford.edu. Die Größenordnung wird von mehreren Preisvergleichen für 2026 bestätigt; einzelne kursierende Faktoren (300-fach, 1.000-fach) unterscheiden sich je nach gewähltem Referenzmodell erheblich.
  • [20] Zum Ursprung des Begriffs: John McCarthy, Marvin Minsky, Nathaniel Rochester, Claude Shannon: „A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence“, 31.08.1955. Faksimile des Antrags.
  • [21] Ryan Burnell, Yumeya Yamamori, Meredith Ringel Morris, Shane Legg u. a. (Google DeepMind): „Measuring Progress Toward AGI: A Cognitive Framework“, 16.03.2026. Enthält die Taxonomie der zehn kognitiven Fähigkeiten, die Median-Schwelle und den Begriff des gezackten Fähigkeitsprofils. PDF bei Google DeepMind.
  • [22] Meredith Ringel Morris, Jascha Sohl-Dickstein, Shane Legg u. a.: „Levels of AGI for Operationalizing Progress on the Path to AGI“, ICML 2024. arXiv:2311.02462 · Konferenzfassung.
  • [23] Aengus Lynch, John Hughes, Benjamin Wright, Samuel R. Bowman u. a.: „Agentic Misalignment in Summer 2026″, Anthropic Alignment Science Blog, 13.07.2026. Enthält die Ergebnisse und die sechs selbst benannten Einschränkungen. alignment.anthropic.com.
  • [24] Anthropic: „Agentic Misalignment: How LLMs could be insider threats“, 20.06.2025 — die Untersuchung, aus der die Erpressungs-Schlagzeilen stammen. anthropic.com.
  • [25] Kritik an Aufbau und medialer Verwertung dieser Untersuchung: „AI Blackmail: Fact-Checking a Misleading Narrative“ sowie die Einwände von David Sacks, wiedergegeben bei Fox Business. Beides Sekundärquellen und erkennbar meinungsstark — deshalb hier als Gegenposition gekennzeichnet, nicht als Beleg.
  • [26] Der vollständige Chatverlauf zum T-800-Prompt, von mir am 01.09.2026 geführt und öffentlich geteilt: chatgpt.com. Kein Beleg im wissenschaftlichen Sinn, sondern ein Anschauungsobjekt — und zwar genau dafür, wie leicht sich so etwas herstellen lässt.

Die Bilder in diesem Beitrag wurden mit Hilfe von KI erzeugt und sind in der Mediathek entsprechend gekennzeichnet. Das erschien mir bei diesem Thema die einzig konsequente Lösung.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert