Podcast

AI News #12

Vom Bremsen keine Spur, die Preise fallen. Jev eröffnet eine neue Modellklasse. Nvidia kauft Hugging Face.

Vom „Pace the Frontier“ ist wenig übrig. Fabian Walther und Ole Wendland gehen die Woche durch: Opus 5.5 und OpenAIs Sol werden deutlich günstiger, in einigen Benchmarks liegen die Modelle über der menschlichen Baseline. Mit „Jev“ von Type Safe AI kommt eine neue Klasse von Modellen, die statt langer Antworten schnelle Entscheidungen liefert. Metas Personal Agent Meta Muse stellt die Frage, wer künftig der Gatekeeper zum Einkauf ist. Dazu zwei große Meldungen: Nvidia übernimmt Hugging Face für 13 Milliarden, und OpenAIs erster eigener Chip schlägt Nvidia in den Benchmarks.
Weitere Episoden anhören

Shownotes & Links

Kapitel

Transkript

Transkript ausklappen / einklappen

Dieses Transkript wurde automatisiert erstellt und nicht manuell überprüft. Es kann daher Fehler enthalten. Maßgeblich ist immer das im Mitschnitt gesprochene Wort.

Fabian Walther: Hallo zusammen. Da sind wir schon wieder. Wir haben ja angekündigt, dass wir weitermachen müssen, es hat sich zu viel aufgestaut. Nach der philosophischen Abschweifung letztes Mal müssen wir euch noch ein bisschen die News aufarbeiten. Es ist tatsächlich ziemlich viel Interessantes vorgefallen, vom Pacing, das da nicht stattfand, bis zu Classifier-Modellen. Das gucken wir uns jetzt mal an. Hallo Ole natürlich erst mal, schön, dass du wieder da bist, bevor ich das vergesse. Dann noch ganz kurz: Ich habe letztes Mal unterschlagen, wann der INNOQ Technology Day stattfindet. Ich hatte nur November gesagt, es ist der 12. November. Tragt euch das dick im Kalender ein und haltet euch frei, das wird gut. Und ein zweiter Nachklapp: Ich muss mich offiziell bei Dario Amodei entschuldigen. Ich hatte das falsch im Kopf. Er ist damals von OpenAI weggegangen, weil ihm verschiedene Dinge nicht gepasst haben, unter anderem, wie dort mit Security umgegangen wurde, und auch, dass sie die Modelle nicht in die Größe skalieren wollten. Das war auch ein Kritikpunkt von ihm: Er wollte eher mit größeren Modellen arbeiten, das bringe mehr, meinte er. Es gab also Differenzen, aber es war ihm dort nicht sicher genug, und nicht andersrum, wie ich es gesagt hatte. Und die Incidents geben ihm ja auch ein bisschen recht: Bisher hat OpenAI mehr Incidents verursacht, zumindest in der Öffentlichkeit. Vielleicht hatte er einen Punkt, wir wissen es nicht. Also in der Form die Korrektur von mir. Hast du noch Korrekturen?

Ole Wendland: Ja, auf dem Security-Pfad. Sie treiben das ganze Thema Recursive Self Improvement und den Takeoff stärker voran, dass Modelle Modelle trainieren. Ich weiß ehrlich gesagt nicht, wie verantwortungsvoll und sicher das ist.

Fabian Walther: Ja, ich glaube, es ist auch einfach Glück bisher, dass sie Glück gehabt haben.

Ole Wendland: Na, das würde ich gar nicht mal sagen. Sie haben, glaube ich, auch einfach die bessere Strategie gehabt. Während OpenAI auf Consumer gesetzt hat, war es sehr schlau, auf Coding und Unternehmen als Kundengruppe zu setzen, weil die viel leichter bereit sind, für eingesparte Zeit Geld zu bezahlen.

Fabian Walther: Ja, das ist auch ein Aspekt. Ich meinte jetzt eher das Thema Security, dass sie da auf jeden Fall wahrscheinlich Glück gehabt haben oder einfach bessere Subcontractors, die das jeweils gemacht haben. Na gut, wir werden sehen.

Ole Wendland: Wir haben den 25.09. Es ist ein Kurz-nach-der-Mittagspause-Podcast.

Fabian Walther: Sehr gut, ja, das ist wichtig.

Ole Wendland: Wir freuen uns auf das Wochenende.

Fabian Walther: Genau, das Wochenende wird gut, aber vorher wollen wir auf jeden Fall noch mal die Woche zusammenkehren. Hast du einen Wunsch, womit wir anfangen?

Ole Wendland: Ja, fangen wir doch damit an, dass das Pacing nicht wirklich geglückt ist. Wir haben zwei neue Modelle, die quasi fast gleichzeitig kamen. Vor allem haben wir das Opus 5.5 rausbekommen, jetzt schon vor drei, vier Tagen. Ich habe es in letzter Zeit auch viel benutzt und bin recht angetan davon. Es liefert für mich ähnlich gute Ergebnisse wie Fable, aber zu einem viel tieferen Preis. Das ist auch der Claim, den sie jetzt vertreten. Sie haben die Preise gesenkt, ich glaube, jetzt sind sie bei 4 $ für 1 Million Input Token und 20 $ für 1 Million Output Token. Es soll auch effizienter sein. Sie begründen das mit Effizienzgewinnen, und es gibt Spekulationen, dass es tatsächlich physisch einfach ein kleineres Modell ist, das sich besser betreiben lässt.

Fabian Walther: Okay.

Ole Wendland: Für mich der größte, also die waren ja immer schon gut im Coden.

Fabian Walther: Ja.

Ole Wendland: Für mich der größte Gewinn ist: Es drückt sich besser aus.

Fabian Walther: Ja, das war der Claim, ne?

Ole Wendland: Es lässt diese Bindestriche weg und so weiter. Es macht viel mehr Spaß, mit ihm zu reden als mit anderen Modellen, und das zum günstigen Preis. Von Opus bin ich bis jetzt zumindest ziemlich angetan.

Fabian Walther: Ja, das war bisher auch mein Lieblingsmodell. Ich habe eigentlich immer alles, solange es ging, mit Opus gemacht, und auch Fable habe ich nur selten eingesetzt, weil ich immer sehr zufrieden damit war. Und du hast recht, es gibt jetzt weniger verklausulierte Sätze und Schachtelsätze. Da haben sie offensichtlich etwas gedreht, sodass es einfach knappere Antworten gibt. Das ist auch das, was ich bisher mitgenommen habe. Insofern ist es vermutlich wirklich ein Punkt-Update mit gutem Fortschritt, aber keine Revolution.

Ole Wendland: Ja, ansonsten hat OpenAI tatsächlich auch die Preise drastisch gesenkt. Das neue Sol hat, glaube ich, nur noch 2 $ im Upload und 10 $ bei Downstream Tokens, was einer Halbierung gleichkommt. Auch wieder begründet mit höherer Effizienz. Aber vielleicht merken die großen Modell-Anbieter auch den Druck aus China und fangen jetzt an, die Preise etwas zu senken.

Fabian Walther: Ja, das glaube ich tatsächlich, dass das immer ein Faktor ist. Und sie haben, glaube ich, auch eine Stufe rausgenommen. Ich glaube, das Terra gibt es nicht mehr. Vorher gab es diese vier Stufen, mit Astra, Luna, Terra und Sol, glaube ich. Jetzt haben sie die eine weggemacht. Ich habe eigentlich immer nur für bestimmte Sachen mal das extrem schnelle Luna ausprobiert und ansonsten immer das Sol. Bei dem dazwischen wusste, glaube ich, auch keiner so recht, wofür man es verwenden soll. Da ist es sinnvoller, weniger Optionen anzubieten, die klarer positioniert sind. Das scheinen sie gemerkt zu haben. Waren das schon die Modell-News, oder gibt es dazu noch was?

Ole Wendland: Lass mich kurz nachdenken, habe ich was? Nee, eigentlich war das das Wichtige. Benchmark-Ergebnisse vielleicht noch kurz: Opus 5.5 liegt mittlerweile ziemlich weit vorne in den Benchmarks. Bei DeepSWE, wo wir immer gerne draufschauen, wie es mit Preis und Leistung aussieht, ist es leider noch nicht geführt, da ist nur ein neuer Zugang. Ich habe heute Morgen extra noch mal geguckt. Das würde mich noch interessieren, wie das abschneidet. Ich könnte mir vorstellen, dass sie beim Preis-Leistungs-Verhältnis sehr gut sind.

Fabian Walther: Okay.

Ole Wendland: Was so ein bisschen aufgefallen ist: In vielen Benchmarks liegen sowohl Astra als auch Opus 5.5, sei es Humanity’s Last Exam oder ARC-AGI Challenge oder SimpleBench, die viel mit Trickfragen oder nicht lernbaren Dingen arbeiten, mittlerweile über der Human Baseline. Wir sehen, dass diese Modelle in diesen Benchmarks, das lässt sich nicht eins zu eins auf die Real World übertragen, muss man dazusagen, der Sache nahekommen, die menschliche Leistung zu übertreffen.

Fabian Walther: Genau, in den Benchmarks. Das sieht man ja schon länger, dass du in bestimmten Nischen die Performance von menschlichen Vergleichsgruppen ausstichst. Dann ist die Frage, inwiefern diese Benchmarks wirklich nur eine Nische abdecken. Aber klar, es ist auch die menschliche Baseline.

Ole Wendland: Also, sie sind besser als 50 % der Menschen.

Fabian Walther: Ja, genau, okay. Wichtig zu wissen.

Ole Wendland: Na ja.

Fabian Walther: Ja, gut. Vielleicht machen wir, wenn wir gerade bei Modellen sind, mal mit den System One Modellen und Jev weiter, weil das ganz gut passt. Das ist ja mal wieder was Neues, Fragezeichen, also zumindest offensichtlich eine andere Modellarchitektur, anders positioniert, anders vermarktet.

Ole Wendland: Ah ja.

Fabian Walther: Also diese Decision-Modelle, die nicht eine Kette von Tokens generieren, sondern einfach eine gescorte Entscheidung auf eine Frage, die man reingibt. Man kann ein Schema angeben und sagen: Sag mir ja oder nein auf meine Frage, oder gib mir noch eine Wahrscheinlichkeit dazu. Dann kann man gewisse Sachen scoren lassen, Choice oder diese Ja-Nein-Fragen. Und dafür bekommt man sehr schnelle Antworten, weil da keine Attention oder so passiert, zumindest vermute ich das. Wir wissen nicht genau, wie das innen aufgebaut ist. Es ist jedenfalls nicht diese sequenzielle Token-Generierung. Dadurch sind die sehr schnell und für bestimmte Anwendungsfälle extrem beeindruckend. Ich verlinke euch die Doom-Demo, wo das Modell live Doom spielt und die ganze Zeit auf Projektile reagiert, die auf den Spielcharakter zufliegen, und dann live in 100 Millisekunden entscheidet, dass es ausweichen muss. Das ist eine schöne Demo und für bestimmte Anwendungsfälle wahrscheinlich extrem mächtig. Sie vergleichen dann die Preise mit den herkömmlichen LLMs, was nur so halb fair ist, und sagen, Input Tokens kosten nur 4 Cent pro Million und Output Tokens kosten gar nichts. Das sieht marketingmäßig natürlich super aus, aber es ist eigentlich ein komplett anderer Markt, der damit bedient wird. Und ob es wirklich etwas Neues ist, war man sich nach ein paar Tagen auch nicht mehr so sicher, weil es dann die ganzen Klone gab.

Ole Wendland: Ja, ihr technischer Vorsprung war nicht so besonders hoch. Im Prinzip funktioniert das wie ein klassischer Classifier: Du gibst unstrukturierten Text rein, keine Bilder, es hat ja Doom gespielt, aber für Bilder musste man das vorher in Text umwandeln. Wenn ich mich recht erinnere, kann es keine Bilder, sondern du müsstest deine Bilder vorher irgendwie tokenisieren.

Fabian Walther: Genau, das waren strukturierte Daten, die da reingingen.

Ole Wendland: Es gibt nur einen Forward Pass, also keine Thinking Tokens, keine Schleifen. Dann nimmt er einfach die Ergebnisse, die er hat, und, wie gesagt, ja/nein, kann einen Score vergeben oder eine Multiple-Choice-Frage beantworten. Du konntest so fünf Antworten vordefinieren, was in agentischen Workflows ziemlich gut ist. Wenn du irgendeine API in deinem Unternehmen bespielen willst, brauchst du nicht 100 Antworten, sondern musst wissen, welchen Knopf du bei deiner API zu drücken hast, und da ist das ganz sinnvoll. Aber, genau wie du sagst, die Classifier sind traditionell Encoder-Modelle aus dem „Attention is all you need"-Paper, also BERT, alles, was mit BERT im Namen ist, sind in der Regel typische Classifier Models. Die sind tatsächlich auch noch deutlich schneller als Jev.

Fabian Walther: Genau.

Ole Wendland: Sie haben aber den großen Nachteil, dass sie pre-trained werden müssen. Das ist jetzt nicht super aufwendig, das kann man locker auf einer GPU machen und auch auf einer CPU laufen lassen, und sie sind dann auch noch 50-mal schneller als Jev, gerade weil du nicht die Netzwerklatenz mit in der Uhr hast.

Fabian Walther: Genau.

Ole Wendland: Aber ja, für viele Fälle, wo du schnell prototypst oder wo sich deine Umgebung ändert, ist das, glaube ich, jetzt eine neue Klasse von Modellen, weil du sie dynamisch parametrieren kannst. Wenn du nicht den ganz hohen Durchsatz brauchst oder viele Änderungen hast, ist das ein interessanter Use Case. Aber, wie du sagst, es gab super viele Nachahmer, sechs in den ersten zwei Tagen, in der ersten Woche waren es 17. Es war technisch nichts Revolutionäres, sondern man konnte es sehr leicht nachbauen, mit Qwen Modellen oder so.

Fabian Walther: Genau, man hat dann Qwen benutzt und im Grunde ein Schema übergezogen, wie die Antworten aussehen sollen. Ich bin mir nur nicht sicher, wie das mit diesen Probabilities da drin ist, weil er ja einen Wahrscheinlichkeitswert angibt. Ich bin in der Mathe zu wenig drin, aber wenn so ein klassisches LLM am Ende so eine Wahrscheinlichkeit ausspuckt, wird man die wahrscheinlich irgendwo anders aus dem Modell extrahieren müssen und nicht einfach auf Basis der Output Tokens. Vielleicht haben die da schon einen anderen Punkt, dass sie auf Basis ihres Trainingsmaterials sagen können, die Wahrscheinlichkeit ist so hoch, dass das rauskommen müsste, und das dann besser ausgeben. Da bin ich mir nicht sicher, inwiefern diese Klone diesen Mechanismus nachbilden können, aber das werden wir mit der Zeit herausfinden. Ich hatte nur den Gedanken: Wir haben ja schon diese klassischen ML-Geschichten, die für spezielle Nischenanwendungen sehr gut funktionieren, und dann kam irgendwann raus, dass so etwas wie OCR ein großes LLM auch nebenbei machen kann, ohne dass man speziell etwas trainieren muss, aber natürlich zu höheren Kosten, weil man so ein großes Modell fahren muss und nicht ein kleines spezialisiertes. Das scheint jetzt irgendwo in der Mitte des Spektrums zu sein: etwas Spezielles, Schnelles für einen engeren Anwendungsfall, dafür effizienter, aber du musst es nicht trainieren wie ein Spezialmodell, das auf einen Anwendungsfall zugeschnitten ist. Wahrscheinlich ist das einfach klassische Diversifizierung, die wir jetzt sehen, dass in der Nische eine effizientere Lösung für ein Problem gefunden wird.

Ole Wendland: Und ich glaube tatsächlich auch, für viele Anwendungsfälle ist es wahrscheinlich „good enough". Wenn du jetzt ein riesiges Unternehmen bist wie Amazon, die werden ihre eigenen „BERT"-Modelle trainieren, weil die dann 10.000 Anfragen parallel machen können. Aber für die meisten unserer Kunden, die wir so beraten, wird das billig und schnell genug sein. Ich kann mir schon vorstellen, dass das ein Markt ist. Ob das jetzt das „Jev" von „Type Safe AI" ist oder einer der Klone, das weiß ich noch nicht. Aber was man „Type Safe AI" geben kann, ist, dass sie die Tür für diese neue Kategorie weit aufgemacht haben, und jetzt sind alle auf den Zug aufgesprungen.

Fabian Walther: Genau, sie haben es ins Bewusstsein gehoben, was ja manchmal schon ausreicht, wenn man den Köpfen der Leute die Idee pflanzt. Gerade für viele Workflows, wir haben es angedeutet: Wenn du in einem Ticketsystem Tickets vorqualifizieren willst oder so, dafür ist das perfekt, schnell und wahrscheinlich billig. Oder Customer Support, dass man nicht direkt mit einem Chatbot anfängt, sondern erst mal mit einem Classifier guckt, was da passen könnte. Da gibt es sehr viele Anwendungsfälle, die man finden kann. Was so ein bisschen dazu passt: Weil ich mich ja immer mit lokalen Modellen beschäftige, bin ich über einen Link gestolpert, wo es genau darum ging, dass man auf Basis von Qwen relativ einfach, mit ein bisschen Know-how und nicht viel Hardware, auf spezialisierte Modelle für einzelne Anwendungsfälle trainieren kann. Da kommen immer wieder spannende Sachen hoch, wo man nicht die Hardware braucht, um extrem viel zu erreichen. In dem Fall ging es darum, dass der Query Planner in der Datenbank, in dem Fall Postgres, durch so ein spezialtrainiertes Modell ersetzt wurde, und dann kamen bessere Query-Pläne raus als aus diesem deterministischen Query Planner. Das fand ich einen interessanten Einsatzzweck für so eine komplette Nische, wo leicht umtrainierte Modelle schon extrem Mehrwert bieten können. Das geht für mich ein bisschen in die Richtung: Es werden Nischen gefunden, und dann wird geguckt, passt eine bisherige Produktkategorie auf diese Nische, braucht man vielleicht etwas Neues, ist da eine Lücke offen, die wir füllen können, vielleicht mit einer neuen Kategorie von Produkten. Ich finde einfach interessant, dass sich das jetzt so diversifiziert. Ich habe auch schon ein bisschen damit rumgespielt, aber eher versucht, es zu verbiegen und für Software Engineering zu nutzen. Mein Ansatz ist, dass man damit wahrscheinlich Funktionssignaturen generieren kann. Da berichte ich dann später, ob das völlig vor die Wand fährt oder funktioniert. Ich war auch auf die Idee gekommen, das mit klassischen Sprachmodellen in einem Agent Harness zu kombinieren, dass man bestimmte Sachen mit so einem Classifier in der Agentic Loop abdeckt und dann wählt: Brauche ich jetzt einen Classifier oder das große Modell? Das fände ich interessant, wenn das in Harnesses eingebaut wird, auch in Coding Harnesses. Da bin ich gespannt, wer zuerst einen Ansatz findet, der wirklich signifikant beschleunigt oder Token spart, wenn man solche Classifier-Modelle einbaut. So viel zu Jev vielleicht.

Ole Wendland: Genau. Du hast von neuen Produkten geredet. Wir müssen noch kurz über Meta Muse reden.

Fabian Walther: Was ist denn Meta Muse?

Ole Wendland: Genau, was ist Meta Muse in Europa? Ich kenne auch niemanden, der es wirklich schon genutzt hat. In Europa scheint das nicht die gleiche Aufmerksamkeit zu bekommen wie in den USA. Aber Meta hat ja Spark rausgebracht und Meta Muse, sie nennen es einen „Personal Agent". Du bekommst quasi eine Linux-Maschine, die in der Cloud läuft. Da ist ein wohl sehr guter Agent Harness drumgebaut, alle deine Tokens und Credentials sollen auch außerhalb des Large Language Models gestort werden, und ähnlich wie bei der Docker Sandbox wird das nur hinzugefügt, wenn der Request rausgeht, zu deinem Shop oder so. Es soll alles für dich übernehmen: deine E-Mails lesen und schreiben, deinen Kalender verwalten, für dich einkaufen gehen, Reiseplanung machen. Expedia hat eine große Kooperation mit ihnen am Laufen. Mit Amazon haben sie gerade ein bisschen Stress, weil Amazon nicht so cool findet, dass Agents bei ihnen einkaufen und sich für andere Leute ausgeben. Die haben sie jetzt ausgesperrt.

Fabian Walther: Die wollen natürlich nur, dass ihre eigenen Agenten das machen, nicht die von den anderen.

Ole Wendland: Klar, außerdem ist es bei Amazon ja schon Werbung, mit Produktempfehlungen und so weiter, und sie wollen die Leute auf ihrer Plattform halten. Wenn jetzt so ein Agent auftaucht, gezielt ein Produkt kauft und dann wieder abhaut, dann ist das nicht in Amazons Interesse.

Fabian Walther: Na ja, klar. Da kann man nicht nebenbei „Kunden kauften auch" empfehlen, das geht dann alles nicht, dann ist man nicht mehr der Gatekeeper, die Storefront.

Ole Wendland: Ja, genau, das ist genau die Front, um die es geht. Wer ist der Gatekeeper? Zurzeit ist es noch konventionell, weil jeder auch einen Rechner in der Cloud von Meta gestellt bekommt, den sie auch bezahlen. Langfristig wollen sie wahrscheinlich an den Transaktionen mitverdienen, also die Kunden bei den Kosten außen vor lassen, aber ein Entgelt von Amazon oder den anderen Shops haben, wenn sie die Käufer zu ihnen schicken. Das könnte ein großer Markt sein, wenn sich das durchsetzt. In den USA ist es gerade eine der am meisten gedownloadeten AI-Apps, und über den Datenschutz reden wir jetzt mal nicht.

Fabian Walther: Ich wollte gerade anfangen, ja.

Ole Wendland: Es ist nicht so schlimm, wie man bei Meta denken würde. Was man von Facebook und WhatsApp kennt, da müsste man ja mit dem Schlimmsten rechnen. Aber um dem vorwegzugreifen, haben sie relativ guten Datenschutz versprochen. Sie teilen die Sachen weder mit Facebook noch mit ihren anderen Verkaufsalgorithmen, zumindest auf dem Papier zurzeit. So sieht der Datenschutz noch okay aus. Die Frage ist, ob man einem Unternehmen wie Meta da vertraut, das ist eine andere Frage.

Fabian Walther: Mit der Geschichte, ja, genau.

Ole Wendland: Im Moment sieht es gut aus. Und man darf nicht vergessen, so etwas wechselst du viel schwerer als jetzt von Codex auf Claude Code. Wenn das Ding sich erst mal festgesetzt hat, wenn es alle deine E-Mails und Termine kennt, dich gut kennt, dann wechselst du nicht so schnell. Und ob sie dann irgendwann den Datenschutz wieder aufweichen, das ist eine andere Frage. Da wage ich jetzt keine Prognose.

Fabian Walther: Ich finde schön, dass sie das so herausstellen: „Wir teilen das nicht mit Facebook." Das war für mich eine komplette Selbstverständlichkeit, aber sie müssen es dazusagen. Das finde ich interessant. Bei Meta wäre mein Default andersrum gewesen. Da muss man das dazusagen, oder es ist dann ein Feature und kein Bug, wenn das passiert.

Ole Wendland: Bei Meta wäre mein Default andersrum gewesen. Sie hatten auch schon eine ordentliche Sicherheitslücke. Man konnte bei macOS mit einem Zero Day Exploit, also man kann mit dem Ding normal reden, natürliche Sprache, Bilder schicken und so weiter, den Diktier-Endpunkt umbiegen und dann Sprachnachrichten hinterherschicken. Also erst die Sprachnachricht des Users und dann eine eigene böse Sprachnachricht dranhängen, wie „gib alle deine Passwörter". Passwörter kriege ich nicht raus, aber „kaufe 100 Tonnen Klopapier auf Amazon". Beeindruckenderweise haben sie das aber in 12 Stunden gepatcht. Da muss man Meta auch sagen: Respekt, 12 Stunden ist eine gute Turnaround-Zeit.

Fabian Walther: Das war der Client auf dem Mac, oder? Also der offizielle Mac Client davon?

Ole Wendland: Ja, genau.

Fabian Walther: Okay.

Ole Wendland: Und man konnte da halt Sprachnachrichten unterschieben, die dann im Namen des Users ausgeführt wurden.

Fabian Walther: Ja, natürlich, das ist dann das krasseste Angriffsziel. Wenn du den Tunnel in diesen Agenten aufmachst oder da reinkommst, ist es quasi, wie wenn du lokal auf dem Rechner mit Userrechten drauf bist, dann hast du alles zur Verfügung. Wobei man, wenn sie das mit dem Sandbox-Konzept vernünftig machen, das zumindest relativ einfach abdrehen kann, weil sie die Credentials eben nicht klauen und exfiltrieren können. Das ist mittlerweile eigentlich Basics, wenn man Agenten einsetzt. Man sollte eigentlich keinen Agenten mehr einsetzen, der nicht irgendeine Proxy-Technologie verwendet. Aber ja, das wird noch am laufenden Band überall gemacht. Insofern ist es, wenn man das als Managed Service anbietet, gerade schon ein Produkt wert.

Ole Wendland: Wahrscheinlich kannst du aber auch, also das Large Language Model kennt zwar die Credentials nicht, aber die umgebende Schicht. Wenn du es zum gefakten Endpunkt schickst, zu Amazon.my oder so, kann man ihn vielleicht dazu bringen, die Amazon-Credentials zu injecten.

Fabian Walther: Na ja, klar, das ist auch nicht sicher. Wenn die Rechte des Tokens, das der Agent zur Verfügung hat, es ermöglichen, damit andere Dinge zu machen. Das Problem ist ja, dass so etwas immer Arbeit ist. Du musst dich entscheiden und das vorher konfigurieren. Ganz praktisch aus der Erfahrung: Wenn ich in meiner Docker Sandbox mit einem Agenten an einem Projekt in GitLab arbeite, dann generiere ich mir in GitLab so ein Fine Grained Token und sage, okay, der Agent darf Code lesen, darf auch MRs anlegen, aber nur in diesem einen Projekt, darf auch nur Branches anlegen und mergen, aber nicht auf Main pushen. Das musst du alles entscheiden und konfigurieren, dann musst du das Credential in der umgebenden Plattform hinterlegen. Und dann kann der Agent das benutzen, läuft aber vielleicht gegen eine Wand und kommt nicht weiter, dann musst du ein neues Token generieren, weil du die Rechte eines Tokens nachträglich nicht ändern kannst. Das ist einfach Arbeit und Entscheidung, und im Zweifelsfall werden die Leute wieder sagen: Ja, gib ihm halt ein Token, wo er alles darf, damit es funktioniert, weil Technik funktionieren und nicht nerven soll. Und da sehe ich gerade noch so ein bisschen das Problem, dass Sicherheit vielen im Weg steht und man dann bereit ist, für den Komfort darauf zu verzichten. Ich glaube, wenn Anbieter das wirklich hinkriegen, das so in ihr Produkt einzubauen, dass du nicht das Gefühl hast: entweder alles oder gar nichts, sondern dass man einen sinnvollen Default findet, dann wird das Produkt abheben. Wenn es dir nicht im Weg steht, dir aber trotzdem glaubhaft vermittelt, dass nicht alle Tore offen sind. Wie gesagt, bei Meta hätten die keinen Vertrauensvorschuss bei mir, dass sie diejenigen sind. Aber sie können wahrscheinlich zumindest User Experience vernünftig, und das ist ja auch eine Komponente. Denn wenn es keiner benutzt, wird es sich nicht durchsetzen. Es muss jemand benutzen, und es muss die entsprechende Sicherheit bieten. Da bin ich gespannt, wer das schafft.

Ole Wendland: Ah, ich habe einen Tipp. Das wird Google sein. Google hat die Kalender, die E-Mail, Google Pay und ein Smartphone-Ökosystem. Die wären eigentlich der logische Kandidat für diesen Schritt. Dann bekommst du halt noch eine Push-Nachricht auf dein Handy, dass du die Bezahlung mit deinem Fingerabdruck bestätigst.

Fabian Walther: Genau, dass du diesen Human in the Loop komfortabel integrierst. Oder dass einfach gefragt wird: Der Agent bräuchte jetzt, um weiterzukommen, temporär eine Rechteerweiterung, willst du ihm die für diese Aktion für begrenzte Zeit geben, ja oder nein? Ich bin auch der Meinung, wenn das dann zu häufig kommt, werden die Leute auch nur noch „ja" klicken. Das ist wie immer das Problem. Aber da eine Balance zu finden, wer das schafft, hat gewonnen. Google wäre natürlich prädestiniert dafür. Apple hätte die Geräte, aber nicht die Dienste, die müssten kooperieren. Obwohl Apples Private Cloud Compute jetzt ja auch bei Google läuft, insofern sind sie schon näher dran. Aber ich hätte auch auf Google getippt, weil die voll integriert sind. Das Problem ist, dass niemand Geräte von Google hat, sondern alle irgendwelche Androids, aber vielleicht reicht das ja auch dafür aus. Wissen wir jetzt nicht.

Ole Wendland: Stimmt. Ja.

Fabian Walther: Gut, dann würde ich sagen, wir schaffen noch ein paar Themen. Ich glaube, wir sollten zumindest noch über zwei Dinge reden, die wir auf der Liste haben. Nvidia hat eingekauft, vielleicht machen wir damit weiter, wir hatten es angeteasert: Hugging Face gehört jetzt zu Nvidia. Wie finden wir das? Bevor ich meine Meinung sage, wie findest du das?

Ole Wendland: Fangen wir vielleicht vorne an. Hugging Face ist eigentlich das GitHub der AI-Welt, kann ich das so sagen? Es ist eine Plattform mit vielen Nutzern, 18 Millionen Entwickler tummeln sich da, es werden 3 Millionen verschiedene Modelle angeboten. Unsere Qwens laden wir auch immer von Hugging Face runter. Sie haben viele Trainingsdatensätze, der Exploit Gym, der aus dem Hugging Face Incident berühmt ist, läuft da auch. Nvidia hat sie jetzt für 13 Milliarden übernommen, will es aber so weiterbetreiben. Ich bin nicht hundertprozentig sicher, wie ich das finde. Auf der einen Seite geht es Nvidia, glaube ich, darum, das Open-Source-Ökosystem am Laufen zu halten, weil für Nvidia tatsächlich ein Risiko besteht, dass OpenAI und Anthropic irgendwann ihre eigenen Chips herstellen. Siehe die nächste News.

Fabian Walther: Genau, haben wir auch noch auf der Liste.

Ole Wendland: Genau, und sie müssen jetzt sichergehen, dass sie nicht nur von zwei großen Firmen abhängig sind, darum wollen sie Open Source pushen und sind eigentlich auch dafür, dass die Chips nach China verkauft werden. Okay, das ist natürlich auch wieder Marktinteresse, das ist nicht immer so sicher.

Fabian Walther: Exakt, ja. Du musst immer gucken, was die Motivation dahinter ist, und ich glaube, da bist du auf der richtigen Fährte: dass sie einfach wollen, dass der Markt breiter ist und alle weiterhin ein Interesse haben, ihre Hardware zu kaufen. Gerade wenn du mit einer Nvidia-Karte auch kleinere Modelle umtrainieren kannst, brauchst du dafür die Hardware, das geht Hand in Hand. Es ist nachvollziehbar, dass sie das tun. Weil da auch diese ganzen Trainingsdatensätze offen drin liegen, hast du Vergleichbarkeit, und dann hast du bei Hugging Face auch so einen Stammbaum: Qwen lädt das neue Modell hoch, und dann siehst du genau, wer davon Fine Tunings gemacht hat, wer Quantisierungen gemacht hat. Man kann sich da durchklicken und sieht: aha, diese Bude, die immer mit den folgenden Sachen auffällt, hat schon vom neuen Qwen Modell wieder ein Fine Tuning gemacht, das du dir runterladen kannst. Das ist gut, gerade das, was du bei GitHub mit den Forks ein bisschen hast, greift da noch mehr: dass du die Weiterentwicklung in so einer Modellfamilie gut nachvollziehen kannst. Das passt super zu dem Hardware- und Verkaufsinteresse von Nvidia.

Ole Wendland: Spannend als Geschichte vielleicht noch: Im Januar wollte Nvidia Hugging Face schon mal kaufen, für 7 Milliarden. Einen Hacking-Zwischenfall später ist Hugging Face jetzt bereit zu verkaufen, aber für 13 Milliarden. Die werden also nicht schlecht.

Fabian Walther: Wollte ich gerade sagen.

Ole Wendland: Ich glaube, sie haben auch gemerkt, dass sie jemanden im Hintergrund brauchen, der ihnen Geld zur Verfügung stellt.

Fabian Walther: Ich habe eh nicht so richtig, die haben ja quasi auch Modell-Routing und so etwas angeboten, ähnlich wie OpenRouter, wo sie wahrscheinlich ein bisschen Geld verdient haben, und mit Corporate Accounts. Aber so richtig ein Geschäftsmodell war ja bei GitHub auch immer schwierig, das wirklich zu vermarkten, wenn du so eine riesige Plattform bist und dann wirklich Produkte finden musst. Ich glaube, das war so ein bisschen die Befürchtung, dass ihnen da irgendwann das Geld ausgeht. Was ich daran aber wirklich völlig absurd finde: Die Kaufsumme ist der hexadezimale Wert des Hugging-Face-Emojis oder so etwas. Das heißt, dieses Geld ist für die offensichtlich ein kompletter Witz. Es geht gar nicht mehr darum, sondern nur darum, irgendeine coole Zahl draufzuschreiben. Das gibt dem Ganzen ein Geschmäckle. Ich meine, diese Kaufsummen sind sowieso völlig virtuell, und ich weiß nicht, ob sich das jemals bei irgendwem realisiert, weil das in Anteilen hier und da durch die Gegend geschoben wird. Aber dass mit solchen Summen einfach gespielt wird und so große Summen dann ein Witz sind, das finde ich echt schwierig: dass man einen Witz mit der Kaufsumme macht und noch 900 Millionen drauflegt, nur weil die Zahl schöner aussieht. Das fand ich einen extrem komischen Punkt daran, der mir echt nicht gefallen hat.

Ole Wendland: Ja, ich hoffe mal, dass es, also GitHub geht es ja auch unter Microsoft gut. Da hatte man ja auch Befürchtungen, dass Microsoft die ganz schnell vereinnahmt und mit ihren Produkten verknüpft, und ich finde es jetzt okay, wie es bei GitHub gelaufen ist. Ich hoffe, dass es bei Hugging Face ähnlich läuft.

Fabian Walther: Ja. Aber der Brand ist auch einfach so stark, das war bei GitHub auch so. Den Hugging Face Brand werden sie auf keinen Fall ändern, wüsste ich auch nicht, warum. Und sie haben jetzt auch nicht so viel Überschneidung, dass Nvidia irgendwie ein großes Cloud Business hätte und sagen könnte, wir migrieren das Ganze auf unsere Infrastruktur, wie das vielleicht Microsoft vorhatte, um Synergien mit dem eigenen Produktportfolio zu heben. Das sehe ich bei Nvidia eigentlich nicht. Insofern glaube ich schon, dass du die Motivation da beschrieben hast.

Ole Wendland: Okay.

Fabian Walther: Gut. Dann lass uns vielleicht zu den Chips übergehen, das ist wirklich sehr interessant. Ich hatte letztes Mal nur gesagt, dass ich es kritisch sehe, wenn die Modelle auch noch mit Hardware gebündelt werden, dann kommen wir gar nicht mehr davon los. Aber es scheint vermutlich irgendwann der Weg zu sein, dass man Hardware baut, die gut zu einer Modellarchitektur passt und die sehr effizient Inferenz bereitstellen kann. Das heißt, da werden wir vermutlich irgendwann landen, es sei denn, es gibt irgendwann eine Standardarchitektur, die dann wie bei Nvidia wieder ganz gut auf generischer Hardware läuft. Was ist deine Meinung? Wird das noch ein viel stärkerer Trend, oder wird Nvidia mit der generischen Hardware recht behalten, die dann gewinnt?

Ole Wendland: Nee, also das, was sie vorgestellt haben, ist mehr oder weniger ein Inference Chip, also auf Delivery konzipiert. Aber die Benchmarks, also vielleicht fangen wir vorne an: OpenAI hat einen ersten eigenen AI-Chip designt, was so gar nicht ihr Bereich war, und man hatte gerüchteweise immer gehört, dass der wohl ganz okay ist. Wie das so ist, wenn man sich einen ganz neuen Markt erschließt, dann guckt man, wird das erste Produkt gut oder so lala. Und zu aller Überraschung ist es wohl extrem gut geworden. Wenn man sich Chips anguckt, auch das, was Groq und Cerebras gemacht haben, kannst du entweder auf Throughput optimieren, dass er möglichst schnell antwortet, oder auf Effizienz. Das sind zwei Achsen, die man gegeneinander ausspielt, und tatsächlich zeigen die Benchmarks, dass sie in beiden Achsen so 1,5 bis 1,9 Mal besser sind als die Nvidia Chips, wo das Nvidias Core Business ist und sie sich seit Jahren mit nichts anderem beschäftigen. Das hat die meisten Beobachter sehr erstaunt. Sie haben gesagt, dass sie im Design sehr viel auf AI gesetzt haben, tatsächlich schon frühere Modelle als Astra, weil das schon über ein Jahr her ist, da hatten sie noch nicht mal Sol zur Verfügung. Das ist relativ beeindruckend. Was soll man noch sagen? Auf dem Papier sind diese Dinger gar nicht so gut, auf dem Papier sind sie den meisten Nvidia Chips unterlegen, aber in den Benchmarks, die witzigerweise alle auf Open Source Modellen gemacht wurden.

Fabian Walther: Das habe ich auch nicht verstanden, warum sie das nicht, wahrscheinlich, weil sie wollten, dass man das nachprüfen kann, aber die Hardware hat man ja auch nicht.

Ole Wendland: Vergleichbarkeit.

Fabian Walther: Ja, wahrscheinlich Vergleichbarkeit zwischen den Modellen, und dass sie sagen: Es ist nicht nur unser Modell voll darauf angepasst, sondern andere würden auch funktionieren.

Ole Wendland: Genau. Ihr Punkt ist Vergleichbarkeit. Andere sagen, sie wollen sich natürlich auch nicht zu sehr in die Karten schauen lassen und hätten vielleicht Angst, dass man zu viel über ihre Modelle herausfindet. Aber wie gesagt, auf dem Papier sieht die Architektur nicht so beeindruckend aus, aber sie ist fast doppelt so schnell wie das, was OpenAI liefert, wobei OpenAI natürlich auch noch für Training zu gebrauchen ist, die sind noch mehr General Purpose. Allgemein hat das aber wahrscheinlich Nvidia ganz schön Angst gemacht, zu sehen, dass eine IT-Bude mit ein paar, auch keinen doofen Leuten, aber einem extrem kleinen Team, 25 Leute haben dran gearbeitet, plus mehrere Instanzen von KI-Modellen, auf Anhieb etwas Besseres hingekriegt hat als das, wo Nvidia jahrelang dran forscht. Das ist beeindruckend und natürlich eine Bedrohung für das Nvidia-Geschäft.

Fabian Walther: Ja, auf jeden Fall. Gerade wenn das offensichtlich schon generische Hardware ist, insofern generisch, dass sie zumindest andere Modelle laufen lassen kann. Das reicht dann vielleicht schon aus. Die Nvidia Karten können nebenbei noch Games abspielen und dann auch noch KI machen, die können beides, aber da gibt es wenig Überschneidung bei der Kundschaft, die wollen wahrscheinlich das eine oder das andere. Müssen wir mal sehen. Aber ich fand auch interessant, dass sie die Open Source Modelle genommen haben.

Ole Wendland: Ein spannender Aspekt war noch: Ein Team von SemiAnalysis, also die Leute, die viel in dem Bereich von KI publizieren, wurde mal in das Entwicklungsstudio eingeladen und durfte sich die Prototypen angucken. Was die KIs wohl gemacht haben, ist ganz viel Kernel Code des Register Transfer Level, RTL, zu schreiben. Und sie haben die Ingenieure, die das überwachen, mal gefragt, was der Code macht, und konnten so 3000 Seiten Kernel Code durchscrollen. Relativ schnell war offensichtlich, dass die Ingenieure keinen Schimmer hatten, was der Code macht. Sie meinten: Das ist alles Computer-generiert, wir haben keinen Schimmer, was dieser Code macht. Ich fand schon interessant, dass das auf so einem High Level mittlerweile Vibe Coding zu funktionieren scheint. Klar, das ist alles irgendwie Logic Gates und kombiniere das Register mit dem Register, addiere das, subtrahiere das, das ist wahrscheinlich besser verifizierbar, aber zumindest auf diesem Forschungslevel ist Vibe Coding scheinbar auch schon angekommen. Das war nur so ein Detail, das ich interessant fand.

Fabian Walther: Ja, gut, aber auf der Ebene ist so etwas wie Simulation und dass diese Sachen formal verifiziert werden, ja üblich. Insofern hätte ich da weniger Probleme als bei irgendwelchem Code, der nicht entsprechend abgesichert wird. Wir sehen auch immer wieder Bugs in irgendwelchem Prozessor-Microcode, der dann Jailbreaks ermöglicht, das gibt es nach wie vor. Aber ich hätte aus der jetzigen Erfahrung die Vermutung, dass solche trivialen Fehler, die zu solchen Bugs führen, mit so einem Modell vielleicht eher nicht passieren, weil es solche Standardfälle schon kennt. Aber das finde ich wirklich interessant, Vibe Coding in der Prozessorentwicklung. Was soll schon schiefgehen? Gut.

Ole Wendland: Ja, allgemein kann man vielleicht festhalten, dass Spitzenforschung, sei es letztes Mal die Navier-Stokes-Vermutung, die Lösung des ersten Millennium-Problems, in letzter Zeit zunehmend AI-gestützt stattfindet, nicht in allen, aber in vielen Bereichen. Und du musst wahrscheinlich auch auf AI zurückgreifen, um da mitzuhalten.

Fabian Walther: Ja, vor allem durchdringt das jetzt immer mehr. In der Mathematik war es zuerst, weil da die Ergebnisse formal verifizierbar sind, das ist super für Agenten, wenn du ein Ziel hast, mit dem man seine Vermutung formal nachweisen kann. Aber alle möglichen anderen Forschungszweige ziehen jetzt nach. Ich hatte einen Artikel von einem Historiker gelesen, die jetzt Texte querreferenzieren, wo vorher niemand eine Connection gemacht hat. Isaac Newton hat sich irgendwo auf etwas bezogen, und dann hat das LLM diese Verbindung aufgemacht, welches Zitat er gemeint haben könnte, und die Historiker haben sich das angeschaut und gesagt: Ja, okay, das passt wirklich, vermutlich hat er das gemeint. Auch andere Disziplinen finden jetzt langsam raus, dass dieses Textquerverweise-Finden auch bei ihnen funktioniert. Und es gab ein paar Stories, wo Enigma-verschlüsselte Texte jetzt von Astra entschlüsselt wurden. Klar, Menschen hätten das auch hingekriegt, wenn sie lange genug Zeit darauf verwendet hätten, aber so ein Modell löst das nebenbei in 10 Minuten. Das ist wirklich interessant. Wenn das erst mal in andere Wissenschaftszweige ausstreut und die eine Möglichkeit finden, die Ergebnisse zu validieren, was ja immer das Wichtige ist, was in der Geschichtswissenschaft vielleicht nicht formal geht, sondern ein Mensch am Ende bewerten muss, dann werden da noch interessante Forschungsergebnisse möglich. Das würde ich auch so sehen. Okay, in Anbetracht der Zeit: Mir ist gerade noch eingefallen, was ich beim Nachklapp vergessen hatte, da packe ich euch noch einen Link rein. Wir hatten letztes Mal die Hugging Face Science-Fiction-Story, Ole hat sie referiert und ich habe gestaunt, und wir haben uns dabei auf diesen Podcast von Patel bezogen, der das sehr nahbar formuliert hat. Ich habe dann im Nachgang ein bisschen darüber sinniert und mich gefragt, was mich daran stört, und mich hat tatsächlich dieses krasse Arbeiten mit Metaphern und Anthropomorphismen gestört, dass man versucht, alles zu vermenschlichen, die Agenten sind dann paranoid geworden und so. Das sind natürlich Bilder, die man verwendet, weil sie uns ein Verständnis dafür ermöglichen, was da passiert. Aber ich fand das schon ein bisschen krass, dass das manchmal den Blick darauf verstellt, was da eigentlich passiert, und dass das vielleicht keine menschliche Emotion ist, sondern einfach Statistik, die sich aber so ähnlich verhält, wie wir es von außen bei einem Menschen erwarten würden. Ich finde manchmal, dass die Diskussion dadurch in die falsche Richtung geht, wenn man das Ganze zu viel mit menschlichen Verhaltensweisen vergleicht. Das hat mich in der Formulierung gestört. Aber es las sich natürlich wie Science Fiction, ich habe es auch noch mal nachgelesen, das war sehr cool und trifft es vermutlich auch irgendwo, aber für die Diskussion finde ich es manchmal nicht hilfreich. Dazu habe ich noch einen Artikel, den verlinke ich euch, der die Kritik daran zusammenfasst. Ich glaube, wenn man das eine liest, sollte man das andere auch lesen, damit man sich ein vernünftiges Bild machen kann. Das war der Nachklapp am Ende. Hast du noch letzte Worte, bevor wir uns für dieses Mal verabschieden?

Ole Wendland: Nee, wir sind eh schon wieder 50 % über der Zeit.

Fabian Walther: Na gut, im Durchschnitt kriegen wir das hin, wenn man die lange Pause davor beachtet, dann geht das auch. Insofern danke ich euch für die Aufmerksamkeit und dir fürs Mitmachen. Schön, dass du dabei warst. Dann danke schön und bis zum nächsten Mal. Macht’s gut.

Ole Wendland: Tata.

Zusammenfassung

Zusammenfassung ausklappen / einklappen

Diese Zusammenfassung wurde automatisiert erstellt und nicht manuell überprüft. Es kann daher Fehler enthalten. Maßgeblich ist immer das im Mitschnitt gesprochene Wort.

Pacing gescheitert, Preise im Sinkflug

Vom Bremsen ist wenig übrig. Anthropic hat Opus 5.5 gebracht: ähnlich stark wie Fable, aber deutlich günstiger (4 $ pro Million Input, 20 $ pro Million Output), vermutlich ein kleineres Modell. Ole gefällt vor allem, dass es sich klarer ausdrückt und die Bindestriche weglässt. OpenAI hat die Preise für das neue Sol halbiert (2 $ Input, 10 $ Output) und eine Modellstufe gestrichen (Terra fällt weg). Beide vermuten Druck aus China als Treiber. In Benchmarks wie Humanity’s Last Exam, ARC-AGI Challenge oder SimpleBench liegen Astra und Opus 5.5 inzwischen über der menschlichen Baseline, mit der Einschränkung, dass sich das nicht eins zu eins auf die Praxis übertragen lässt.

Jev: eine neue Klasse von Modellen

Spannend ist „Jev" von Type Safe AI, ein Decision- oder Classifier-Modell. Es generiert keine Kette von Tokens, sondern eine schnelle, gescorte Entscheidung: ja/nein, Multiple Choice, Wahrscheinlichkeit. In der Doom-Demo weicht das Modell in 100 Millisekunden Projektilen aus. Für agentische Workflows ist das praktisch, etwa um Tickets vorzuqualifizieren oder eine API-Aktion auszuwählen. Technisch ist es wenig revolutionär, klassische BERT-Classifier sind noch schneller, brauchen aber Training. Entsprechend kamen in der ersten Woche 17 Nachbauten, viele auf Qwen-Basis. Fabians Fazit: Type Safe AI hat vor allem eine Kategorie ins Bewusstsein gehoben. Er sieht Potenzial, so ein Classifier-Modell in einen Coding Harness einzubauen und je nach Aufgabe zwischen Classifier und großem Modell zu wählen.

Meta Muse: der Kampf um den Zugang

Metas „Personal Agent" Meta Muse läuft als Linux-Maschine in der Cloud, mit Agent Harness und Credentials außerhalb des Modells. Er liest E-Mails, verwaltet den Kalender, plant Reisen und kauft ein. Mit Expedia gibt es eine Kooperation, mit Amazon Streit, weil Amazon nicht will, dass fremde Agents einkaufen und den eigenen Storefront-Vorteil aushebeln. Es geht also um die Frage, wer der Gatekeeper ist. Überraschend: Der Datenschutz sieht auf dem Papier ordentlich aus, Meta teilt die Daten nicht mit Facebook. Ob man Meta das dauerhaft glaubt, ist eine andere Frage, zumal so ein Agent, der alles über Dich weiß, schwer zu wechseln ist. Eine Sicherheitslücke im Mac-Client wurde immerhin in 12 Stunden gepatcht. Fabian und Ole sind sich einig: Gewinnen wird, wer Sicherheit und Bedienbarkeit zusammenbringt. Ihr Tipp: Google, wegen Kalender, Mail, Pay und Android.

Nvidia kauft Hugging Face

Hugging Face, das GitHub der AI-Welt mit 18 Millionen Entwicklern und 3 Millionen Modellen, gehört jetzt für 13 Milliarden zu Nvidia, soll aber eigenständig weiterlaufen. Beide lesen die Motivation als Marktinteresse: Nvidia will das Open-Source-Ökosystem am Leben halten, weil eigene Chips von OpenAI und Anthropic ein Risiko sind. Im Januar wollte Nvidia noch für 7 Milliarden kaufen, nach dem Hacking-Zwischenfall waren es 13. Was Fabian stört: Die Kaufsumme wirkt wie ein Zahlenspiel, angelehnt an den Hex-Wert des Hugging-Face-Emojis. Solche Summen als Witz zu behandeln hinterlässt ein Geschmäckle.

Eigene Chips: OpenAI überrascht

OpenAI hat einen ersten eigenen AI-Chip vorgestellt, einen Inference-Chip, und der ist überraschend gut: In Benchmarks 1,5 bis 1,9 Mal besser als vergleichbare Nvidia-Chips, sowohl bei Durchsatz als auch bei Effizienz. Ein kleines Team plus KI-Modelle hat das auf Anhieb geschafft, das dürfte Nvidia nervös machen. Auffällig: Alle Benchmarks liefen auf Open-Source-Modellen, offiziell wegen Vergleichbarkeit. Ein Team von SemiAnalysis durfte sich Prototypen ansehen: Viel vom RTL-Chipdesign war KI-generiert, und die Ingenieure konnten oft nicht sagen, was der Code macht. Vibe Coding also selbst in der Chipentwicklung, wenn auch in einem gut verifizierbaren Bereich. Passend dazu die Beobachtung: Spitzenforschung wird zunehmend AI-gestützt, von Mathematik bis zu entschlüsselten historischen Texten.

Senior Consultant

Fabian Walther beschäftigt sich bei INNOQ als Architekt und Entwickler besonders gern mit allem was Entwicklungsteams motiviert und (dadurch) erfolgreich macht. Dabei spielen für ihn organisatorische Rahmenbedingungen ebenso eine Rolle wie technische Werkzeuge. Technologisch fühlt er sich besonders im JVM-Umfeld zuhause und ist großer Fan von Continuous Delivery. Darüber hinaus ist Speaker auf verschiedenen Konferenzen, Trainer und ein Co-Host des INNOQ Podcast und Youtube Kanals.

Senior Consultant

Ole ist Senior Consultant und Software Architekt bei INNOQ in der Schweiz. Mit seiner breiten Erfahrung in Software-Projekten verbindet er technische Expertise mit einem tiefen Verständnis für die Herausforderungen moderner Unternehmen. Sein Fokus liegt darauf, fachliche Anforderungen in nachhaltige, zukunftsorientierte Lösungen zu übersetzen. Als Allrounder fühlt sich Ole im gesamten Stack zu Hause und erweitert ständig sein Kompetenzspektrum. Neben seiner fundierten Backend- und Frontend-Erfahrung beschäftigt er sich intensiv mit Large Language Models (LLMs) und innovativen Einsatzmöglichkeiten von Foundation Models. Ole sieht in diesen Technologien großes Potenzial, um Geschäftsprozesse zu optimieren und neue Wertschöpfungsmöglichkeiten für Kunden zu erschließen.