KI-Update 🤖 : ChatGPT Bildmodell, Agenten, Manus und n8n
Shownotes
Zwei Wochen Vietnam – und die KI-Welt hat sich komplett gedreht! Joel Kaczmarek holt mit KI-Experte Hamid Hosseini (Ecodynamics) das Update: OpenAIs neues Bildmodell, autonome Agenten, DeepSeek & Manus aus China und ein No-Code-Tool, das alles verändert. Wer KI wirklich verstehen will, hört hier rein. Du erfährst... ...wie das neue Bildmodell von OpenAI kreative Prozesse revolutioniert ...welche spannenden Möglichkeiten autonome Agenten bieten ...wie Manus als innovatives Tool die KI-Welt verändert ...warum DeepSeek und andere chinesische Modelle im Fokus stehen ...wie n8n Automatisierung auf ein neues Level hebt __________________________ ||||| PERSONEN ||||| 👤 Joel Kaczmarek, Geschäftsführer digital kompakt 👤 Hamid Hosseini, CEO ECODYNAMICS __________________________ ||||| SPONSOREN ||||| 🔥 Übersicht aller Sponsoren __________________________ ||||| PLAYLISTS ||||| Lust auf mehr? Entdecke unsere Playlists mit weiteren spannenden Episoden zum Thema: 🎧 Künstliche Intelligenz __________________________ ||||| LEXIKON ||||| Du verstehst nur Bahnhof? Zu viel Fachchinesisch? Unser Lexikon hilft dir dabei, die wichtigsten Fachbegriffe zu verstehen: 🔹 autonome Agenten - KI-Systeme, die eigenständig Aufgaben ausführen und Entscheidungen treffen können. 🔹 Transformer - Eine Architektur für neuronale Netzwerke, die besonders effektiv für die Verarbeitung von sequenziellen Daten wie Text ist. 🔹 neuronales Netz - Ein Machine-Learning-Modell, das aus miteinander vernetzten künstlichen Neuronen besteht und komplexe Muster in Daten erkennen kann. 🔹 Dali - Ein KI-Tool zur Bilderzeugung, das auf bestimmten Plattformen verwendet wird. 🔹 Bildmodell - Ein KI-Modell, das speziell für das Erstellen und Verarbeiten von Bildern entwickelt wurde. __________________________ ||||| KAPITEL ||||| (00:00:00) Vorstellung und Einführung ins Thema (00:01:32) OpenAI's neue Bild-KI (00:07:18) Workflow mit GPTs (00:09:00) Autonome AI Agenten (00:15:13) Was ist Manus? (00:18:02) Neue Entwicklungen auf dem Chinesischen Markt (00:22:17) Coding mit n8n __________________________ ||||| WIR ||||| 🧢 Ich bin übrigens Joël, der Macher dieses Podcasts. Ich bin ein Creator und Medienunternehmer, der für Wachstum und Vielfalt steht. Mein Vorgehen besteht darin, dass ich inspirierende und erfolgreiche Menschen interviewe, um von ihnen zu lernen und Wissensabkürzungen für dich und mich aufzutun. 👉 Mit meinem Podcast digital kompakt zeige ich dir Wachstumsstrategien für dein (Digital-)Business, indem ich erfolgreiche Unternehmen und Expert:innen interviewe 👉 Mit meinem Podcast 5 Dinge mit 20 zeige ich dir, wie du persönlich wachsen kannst, indem ich inspirierende Menschen frage, was sind ihre 5 Dinge, die sie gerne schon mit 20 gewusst hätten 👉 In meinem Newsletter fasse ich dir Jeden Freitag die besten Learnings aus meinen Podcasts zusammen sowie viele weitere Einsichten aus meinen Aktivitäten. 💛 Abonniere „digital kompakt“ auf Apple Podcasts, Spotify & Co. Wenn dir die Folge gefallen hat, hinterlasse uns bitte eine Fünf-Sterne-Bewertung! 👥 Wir streben die Verwendung einer geschlechtsneutralen Sprache an. In Fällen, in denen dies nicht gelingt, gelten sämtliche Personenbezeichnungen für alle Geschlechter.Transkript anzeigen
00:00:00: Digital Kompakt.
00:00:01: Heute aus dem Bereich künstliche Intelligenz mit deinem Moderator Joel Katzmarek.
00:00:06: Los geht's!
00:00:16: Hallo Leute, hier ist Joel.
00:00:17: Ihr wisst ja ich bin ein großer KI-Fan benutzt das fleißig und ich brauche aber auch immer mal jemanden und vielleicht geht es euch genauso.
00:00:23: der mich war so mit den wichtigsten Updates mittenden weil ganz ehrlich Ich war jetzt knapp zwei Wochen in Vietnam kommen wieder Und mein Freund Hamid sagt Joel hast du in Darmstein gelebt?
00:00:31: Das hat sich schon so viel getan an Sachen KI.
00:00:33: also habe ich mir gedacht hey März zwanzig fünfundzwanzig ist Mal wieder Zeit für ein ordentliches KI Update.
00:00:38: und besagter Hamid Hamit Reza Hosseini nämlich Der hat eine eigene KI-Beratung namens Eco Dynamics.
00:00:44: Und ich darf das sagen, weil er selber ist dazu zu bescheiden, voll die Maschine der Typ!
00:00:48: Also MIT-Absolvern kennt sich ganz tief aus mit KI Sachen, ganz nahe Bezüge zur OpenAI.
00:00:53: also er kennt richtig viel Shit und wir gehen heute mal durch.
00:00:55: Also wir nehmen euch mal an der Hand.
00:00:57: was sind so die wichtigsten Entwicklungen?
00:00:59: Wir werden natürlich reden über das neue Bildmodell von OpenAI.
00:01:01: da redet ja gerade die ganze Welt drüber.
00:01:03: Wir werden viel auch über autonome Agenten sprechen, da speziell auch Manus.
00:01:06: also sollte die unbedingt gehört haben.
00:01:08: Plus, wir gucken mal rüber nach China.
00:01:10: Was gibt's denn eigentlich so für neue chinesische Modelle?
00:01:12: Was ist mit Deepseak?
00:01:13: und dann haben wir noch ein geiles Tool für euch am Ende das Snowcoat-Modell N-Achtenden.
00:01:17: Das ist ja auch gerade bei vielen in der Benutzung.
00:01:18: also heute nehmt ihr richtig was mit!
00:01:20: So that being said Hallo Hamid Danke dass du mich hier wieder aufschlaust.
00:01:23: Hallo
00:01:23: Joel Ja Vielen Dank für die Einladung.
00:01:25: Es ist immer eine Freude mit dir Podcast zu machen Und ja den Menschen da draußen hoffentlich auch mal paar Neuigkeiten zu erzählen Jut
00:01:32: und wie angedroht.
00:01:33: Also, Bildmodell OpenAI lass uns mal damit anfangen weil ich glaube das ist das womit die meisten Leute richtig geil relate können und was ja auch gerade viele Menschen begeistert.
00:01:41: Magst du mal so einen kurzen Wrap-up geben?
00:01:43: Was das Modul jetzt kann, was da anders ist und warum alle so drauf abgehen?
00:01:46: Ja
00:01:46: klar.
00:01:46: also grob gesagt Wir haben in den letzten Jahren, wir haben ja seit Dolly nichts mehr gehört und hatten zum Beispiel Probleme teilweise mit Halluzinationen.
00:01:55: Wenn man z.B.
00:01:56: für so ein Mensch gepromptet hat dann waren da sechs Finger da dran oder vier Beine oder teilweise war das auch so dass Schriften auf irgendwelche Bilder überhaupt nicht richtig dargestellt wurden wenn überhaupt mit mehreren Versuchen auf Englisch aber andere Sprachen waren nicht möglich
00:02:12: d.h.,
00:02:13: die Modelle haben tatsächlich oder das Modell hat ein Kontextverständnis bekommen, kann also auch Schriften sehr gut darstellen.
00:02:20: Kann auch vor allem das was in dem Prompt gefordert wird supergut abbilden.
00:02:25: und da sind eine Reihe von zusätzlichen Neuigkeiten dazu gekommen die durchaus auch sagen wir mal dass Prompten auf der einen Seite vereinfacht und auf einer anderen Seite viele Möglichkeiten Option bieten.
00:02:37: Also so wie es ja mitbekommen hat haben sie's ja von Dali entkoppelt So habe ich das verstanden richtig?
00:02:41: Also dass sich quasi aus meinem Chat heraus Bilder erzeugen kann und nicht mehr diese Anbindung braucht.
00:02:45: Richtig, genau.
00:02:46: Dann normal war das so dass wir da extra angesteuert werden musste und jetzt ist es quasi ein Teil des Transformer oder Neuronalnetzes von OPPO und SORA beziehungsweise als SORA mit Anbindung und vielleicht ein paar Highlights dazu.
00:03:02: Das war vorher schon vielen kreativen Menschen daraus sich schon sehr gute Bildproms erstellen konnten oder auch Fotografen fotografieren Relativ klar, nur jetzt ist es so dass das auch demokratisiert wird.
00:03:14: Das heißt also jeder von uns oder jede ist in der Lage auch sehr schöne Bilder zu erstellen und mal ein paar Tipps zu geben oder Beispiele.
00:03:21: die kann halt viel mehr über die Figuren schreiben über die Szene mit einfachen auch wenn ich keinen Know-how habe im Bereich kreativen Bereich Stilmedium Schriften Sprach und Charakter Konsistenz natürlich Top-Thema.
00:03:36: Ich habe ja auch eine Zusammenfassung auf meinem LinkedIn Profil dazu gepostet, das heißt also bis Anzahl der Position Detail gerade und und und deshalb, ich würde sagen fast regelrecht flippt das Netz aus und da sieht man fast jede zwei Stunden neue Bilder ohne Katze gerade zum Beispiel ins Wasser guckt und das Spiegelbild nen Löwe ist oder Was man sich in einem Küken, was im Spiegel guckt und ein T-Rex sieht.
00:04:00: Und das wirklich sehr detailgetreut und sehr gut.
00:04:03: aber auch professionelle Anwendungen mit Produkten und Schriften darauf.
00:04:07: Das ist schon etwas wo ich sage nur ansten sogar besser als mit Journey mittlerweile.
00:04:13: Ja ich meine lange war es ja so, dass man auch gerade für sowas wie Mitjourney sehr spezifisch diese genauen Promts brauchte und das war gar nicht so einfach manchmal zu verstehen.
00:04:21: wenn ich jetzt was in dem und im Lok will.
00:04:23: Wie brauche ich das dann?
00:04:24: Und also das erste was hier zum mitnehmen ist die Demokratisierung.
00:04:26: Es ist viel einfacher geworden.
00:04:28: Das zweite braucht kein Stuhl mehr ansteuern.
00:04:30: und das dritte wo ich hellhörig geworden bin ist das Thema Schrift.
00:04:33: Also das ist jetzt endlich auch mal funktioniert, dass da geschriebenen Inhalte draufstehen.
00:04:36: Weil das war ja bisher ein einziger Krampf wenn du mit KI Bilder erzeugt hast und irgendwas mit Text drin hattest.
00:04:41: Da hat man sich immer bis heute sehr geschickt sage ich mal mit Entan ne?
00:04:45: Ja
00:04:45: das hat auch.
00:04:45: zum Beispiel kannst du damit jetzt Kinderbücher erstellen in der Du Charakter Konsistenz heißt bei deinen Figuren und auf die Schriften immer die gleichen Art und Weise dargestellt werden Und das ist natürlich eine coole Sache.
00:04:57: aber auch in den Industrie Das heisst für die Unternehmen Menschen da draußen bedeutet das, dass in sehr vielen Bereichen kann man auch wirklich mittlerweile auch professionelle Bilder erstellen.
00:05:08: Wenn
00:05:08: wir jetzt sage ich mal wie ich zwei Wochen unter dem vietnamesischen Stein geschlummert hat kannst du mal den menschen so beschreiben wenn ich jetzt genau was machen möchte was du gerade beschrieben hast ja sagen wir mal Kinderbuch weil es ist so einfach und das kann man von da aus ja ganz schnell übertragen auf Ich mache eine Brust für die Firma oder oder Was müsste ich tun damit diese Charakter Konsistenz grad habe?
00:05:24: Das ist ja super spannend.
00:05:25: wenn ich sagen kann alles klar Ich will jetzt irgendwie drei vier fünf Storys erzählen, vielleicht auch für Slides.
00:05:30: Wie gehe ich vor?
00:05:31: Also was ist der typische Ablauf wenn ich mit diesem neuen Bildmodell arbeiten will?
00:05:35: Normaler Ablauf ist wirklich so.
00:05:37: wie du es schon gesagt hast bei Bit Journey war das ja erfordertet dass sehr viel Kreativwissen und Detailwissen an Fotografie und Aufnahmen, Objektiv, Brennpunkt, was auch immer und wenn jemand sich damit auskannte konnte oder konnte man nicht diese Bild einstellen.
00:05:53: Der Ablauf ist relativ simpel, das heißt idealerweise würde ich fast schon sogar ChartGBT fragen was muss ich denn prompten?
00:06:00: Das heißt also wirklich die Narrative der Geschichte erzählen.
00:06:02: nehmen wir mal an Wir wollen jetzt den Kinderbruch erstellen und dann die Figuren beschreiben.
00:06:06: Das heißt so, um wem handelt sie sich?
00:06:08: Wie stellt man sich diese Figur vor?
00:06:11: Idealerweise in welcher Handlung passiert das Ganze?
00:06:14: In welche Szene?
00:06:15: In welchem Stil will ich das darstellen?
00:06:18: Soll das zum Beispiel fröhlich sein?
00:06:19: Sollen das vielleicht auch mal einfach sehr bunt sein oder einfach im Wald oder was auch immer?
00:06:25: Ich kann über die Farbenstimmung eine Menge schreiben.
00:06:28: Über Licht- und Kamera.
00:06:29: auch wenn ich jetzt nicht weiß wie ich jetzt gewisse Kamerawinkelung, Licht und Objektive bedienen kann kann ich auch einfach mal meine Vorstellungskraft als Laie sogar zum Ausdruck bringen.
00:06:39: Und dann kann ich Szene für Szene diese Promps erstellen und diese Prompts dann auch einzeln, die Bilder generieren sagen okay lass uns mit dem Handlungsstrang beginnen und behalte diese Charakterkonsistenz, die Figuren, die davor kommen müssen gleich aussehen.
00:06:55: Dann muss man ein bisschen Geduld mitbringen weil das Modell ist im Moment nicht so schnell.
00:06:59: Deshalb kann ich dann wirklich Szene Darstellen und Abbilden.
00:07:04: Und Joel, wir können ja dann in einem Anschluss, ich würde sagen so Anfang nächste Woche spätestens bringe ich dann auch gerne mal eine Empfehlung als Promptstruktur was man da alles beachten kann im Vergleich zu den anderen Modellen.
00:07:18: Kann man denn in der richtung auf was mit gbt's machen?
00:07:20: also es ist ja teilweise so ich gibts um gbt daten mit und sag pass mal auf deine rolle ist grad dies du sollst das und das machen.
00:07:26: Ich kann auch teilweise Dateien hinterlegen wenn ich zum beispiel eine schöne sprache bei meinen inhalten möchte, und sagen wir mal ich bin jetzt jemand der zb ein folie entdeckt bauen möchte für die eine Kampagne.
00:07:34: ich brauche immer wieder so powerpoint folio da soll zwei nedegen kleine avatar von mir drauf sein.
00:07:38: so dann hattest du diese charakter konsistenz ja gerade genannt.
00:07:41: Wie ist es denn möglich, weil normalerweise laufen die Chats ja irgendwann voll.
00:07:44: Also wenn du sehr viele Inhalte erzeugt hast dann ist ja irgendwann Schicht und ich möchte vielleicht aber jetzt so ein Charaktermodell von mir erzeugen oder von einer Figur aus meiner Firma was sich immer wieder ansteuern kann dass ich quasi einen Anlaufpunkt habe.
00:07:55: Geht das über GPT's?
00:07:56: Oder wie würdest du sowas umsetzen?
00:07:57: Ja das geht also zu vereinfachten Modellen.
00:08:00: Das gibt jetzt schon seitdem... Das Bildmodell rauskam, einige die schon coole GPT sogar gepostet haben im LinkedIn.
00:08:08: Da zum Beispiel jemand einfach so einen GPT gebaut was photorealistische Bilder aufstellt und übernimmt dann diese Instruktion.
00:08:15: ich kann auch dem Bilder zur Verfügung stellen als Referenz.
00:08:17: da empfehle ich aber ich habe es gestern am Monomer getestet Im Prompt dann nochmal, dem Modell ein paar Beispiele zu geben.
00:08:24: Aber das geht schon klar auf jeden Fall.
00:08:26: Das heißt, dass ich sage, ich brauche jetzt ein GPT was nur Bilder für LinkedIn erstellt, einen GPT war es nur für Eventsbilder erstellt oder für quasi eine Charakter-Konsistenz auch als fotorealistische Avatare für eine Präsentation.
00:08:40: Kann ich denn eigentlich auch künstliche Bilder von mir erzeugen?
00:08:42: Also kann ich irgendwie fünf oder zehn Fotos von mir hochladen und sagen hier so sehe ich aus machen bitte mehr vom Jahr.
00:08:46: Das geht wirklich mittlerweile ziemlich einfach sogar, das heißt also kannst du Bilder hochladen und sagen ich hätte das was weiß ich im Form von japanischen Comics oder.
00:08:56: Was auch immer das ist schon ziemlich abgefahren knaller.
00:08:59: gut.
00:09:00: nächstes Thema autonome Agenten.
00:09:02: also vielleicht machen wir noch mal einen kleinen Rückschritt und erzählen erstmal den Menschen was es damit auf sich hat bevor wir dann über die unterschiedlichen Anwendungsfälle reden die sich da gerade neu auftun.
00:09:10: Also im Grunde genommen ist ja ein Agent nicht anderes als ein bisschen Instruktion.
00:09:13: Wie ich sagte, einfach was es zu tun hat können wir auch von GPTs.
00:09:16: dann können die halt ein bisschen mehr wenn die zum Beispiel diese Agenten in der Lage sind um Informationen zu bekommen oder halt Feinabstimmung durch Verhalten zu bekommen.
00:09:27: Kennen wir auch von GPTs, dann behalten sie zusätzliches Wissen?
00:09:30: Dann haben manche dieser Agenten ja schon vorher durch AP-Zugriffe Zugriff auf Applikation gehabt und jetzt ist hier.
00:09:36: in den letzten Monaten oder seit einem halben Jahr hat sich da enorm was entwickelt.
00:09:40: das heißt diese Autonomie in Verbindung mit den Reasoning Modellen die ja quasi der Denkschritt ein Stück weit emulieren führt dazu dass man halt diesen Modellen zum einen einen längeren Contextfenster geben kann für die Erledigung der Aufgaben.
00:09:56: Das heißt, man kann den Research-Auftrag geben oder bauen wir eine Applikation oder erstellen mir irgendwie was weiß ich ne Studie oder so.
00:10:05: dann sind diese Modelle in der Lage quasi mehrere Dinge miteinander zu kombinieren das heißt dem Browser zu bedienen auf Tools zuzugreifen Datenbanken öffnen weil im Grunde genommen machen ja auch ein Virtual Machine auf dem Browser Fenster und versuchen erstmal zu erkennen, was auf der Seite los ist.
00:10:23: Dann bedienen Sie diese Elemente, das haben wir bei dem Operator von OpenAI als Demo gesehen.
00:10:28: Das heißt also es ist eine Zusammensetzung aus verschiedenen Tools, aus verschiedenen Möglichkeiten mit einem relativ großen Kontext-Fenster.
00:10:36: Kontextfenster ist nichts anderes.
00:10:38: Also was du gemeint hast, dass der Speicher überläuft.
00:10:41: Das heißt die können meistens längere Aufgaben erledigen und das ist autonomisch halt, nicht permanent gepromptet werden müssen.
00:10:49: Die geben sich Aufgaben, die Brainstorm überlegen was wirklich gefordert ist.
00:10:54: man kann jederzeit eingreifen geben sich vielleicht zehn zwanzig dreißig Aufgaben.
00:10:59: teilweise dauert auch die Erledigung manchmal mehrere Minuten manchmal sogar ein paar Stunden und das ist die Besonderheit die relativ einfach erklärt dass ganz ausmacht.
00:11:08: okay.
00:11:09: also um mal in so Anwendungsfällen zu reden ich nehme jetzt einen Agenten der ist autonomen und gibt ihm zum Beispiel als Aufgabe recherchiert doch mal für mich Target im Sales Bereich, also ich will die Firmen haben.
00:11:20: Mit denen, die ich ansprechen kann und dann kann ich von daß es ja weitertreiben schreibt mir irgendwie eine Kalt-Email oder kontaktiert die Person schon mal auf LinkedIn oder so.
00:11:27: das heißt sie haben dieses reasoning die können den Browser bedienen und die können Tools bedienen.
00:11:32: Jetzt fragen Sie sich sicherlich der eine oder die andere auch, die sich damit noch gar nicht beschäftigt haben.
00:11:36: Wo ist denn die Umgebung dafür?
00:11:38: Also wo kann ich mir so einen autonomen Agenten bauen und wie mache ich das?
00:11:41: Und dann können wir uns von da aus immer weiterhangen und unbedingt auch zu Manus was ja ein spannendes Tool in dem Bereich ist.
00:11:46: Ja klar!
00:11:47: Ich meine es hat man ja schon vor paar Monaten gesehen durch Deep Research von Perplexity oder auch Deep Research vom Google oder auch von Open AI dass hier die Modelle in der Lage sind nicht nur Einsuche auf Trags zu erledigen sondern sie gucken sich mehrere Websites an, vergleichen dann die Inhalte mit der Suchauftrag und da konnte man ja schon etwas ausführlichere Suche oder Suchaufträge ausführen.
00:12:09: Allerdings auch da trotzdem bitte immer Vorsicht ab und zu mal Stichproben machen.
00:12:14: Und diese sind nicht immer noch nicht hundert Prozent perfekt weil sie können teilweise jetzt nicht sich unendlich viele Quellen untersuchen.
00:12:21: aber muss schon sagen das hat sich in den letzten Monaten oder Wochen enorm verbessert also dass man schon bis zum gewisse Miklere und hohe Qualität schon Research Aufträge ausführen kann.
00:12:33: Und wo, wo kann ich das aufsetzen?
00:12:35: Also zum einen die Gengen sind ja einmal der Operator von OpenAI.
00:12:39: Das ist hier quasi nichts anderes als ein Agent in der Lage ist im Virtual Machine Browser zu bedienen.
00:12:45: also das fängt bei einfachen Sachen an wenn ich zb für fürs Wochenende beim Teilender ein Tisch reservieren will Zwei Lieblingsrestaurants haben zu einem bestimmten Zeitfenster und sogar die Reservierung noch nicht mal maschinell läuft, sondern über ein Formular.
00:13:01: Das kann ich zum Beispiel damit machen aber auch nicht nur jetzt für einfache alltägliche Sachen, sondern für berufliche Zwecke kann ich als Beispiel sogar den LinkedIn Sales Navigator damit bedienen.
00:13:11: Ich kann wie du so gerade auch gefragt hast in deinem Auftrag was ja echt cool ist da kann ich zB sagen ok such mir die Top Kunden, die für mich in Frage kommen.
00:13:20: Das segmentiert die Leads und schreibt sogar die Mails wenn ich will Und kann sogar meinen Mail Postfach beantworten.
00:13:27: Was anderes als Alternative neben dem OpenAI ist natürlich Perplexity.
00:13:30: Die haben auch solche Suchagents und Research Agents Ist auch eine ziemlich gute Qualität dahinter.
00:13:37: Da streiten sich manchmal die Leute im LinkedIn sagen mal dies ist besser und das andere besser.
00:13:42: Ich habe jetzt, sagen wir mal nicht nur aufgrund meiner Kontakte zu OpenAI sondern generell bin ich halt von OpenAI derzeit da.
00:13:50: Bisschen mehr überzeugt.
00:13:51: Google macht dann einen guten Job.
00:13:53: die haben auch ein Autonomen Research Agent.
00:13:56: aber wenn es darum geht mehrere Tools und so Dinge wie Programm Code oder Tools zu beginnen noch komplexere Aufgaben auszuführen Da muss man sagen zum Beispiel für Programmierung ist lovable Hört man ja auch immer wieder in den Netz Excelent, das kann so einfache bis Mittel komplexe Applikationen erstellen.
00:14:16: Kann jetzt nicht so SAP Gram machen oder so ja aber schon da aktiv werden und natürlich Manus über dem wir ja schon seit Wochen irgendwie was gehört haben.
00:14:26: Das kann man auch testen und sollte das eigentlich reichen kann man selbst mit Logo etwas bauen.
00:14:33: Und vielleicht nochmal abschließende Frage dazu.
00:14:35: Vielleicht hat der eine oder auch die andere bisschen Sorge, kann ich so ein Ding wirklich auf mein Mailfach zugreifen lassen?
00:14:40: Oder in meinem Namen Sachen raus schicken?
00:14:41: wie zuverlässig fährtest du insgesamt zur Qualität?
00:14:44: Also... Ich kann es ja beobachten, weil ich sehe immer was in den Browser los ist.
00:14:49: Wenn ich zum Beispiel Manus oder auch Operator auf meinen LinkedIn-Postfach oder auch Webpostfach zulasse dann kann ich ja genauso was wir beim Prompting gelernt haben achte bei dem Ton auf das Oder bevor du die Mail sendest warte auf mein Go und das Ding wartet nicht nur wie beim Promping und Promptausgabe sondern wartet wirklich Bevor es dann auf Absenden klickt bis sich dann sage Es ist in Ordnung.
00:15:13: Gut, jetzt hast du eben Manus schon mal erwähnt.
00:15:15: Also da sind ja viele Leute heiß drauf und da werden teilweise auch signifikante Beträge gezahlt dafür dass man da Zugänge bekommt.
00:15:21: Erzähl mal ein bisschen was von dem Tool.
00:15:23: Ja das war ziemlich überraschend ähnlich wie bei DeepSeek, was auf einmal so ein Sprachmodell ist, was gesogen die Ökel kamen, was aber schon vorher auch... Einige Zeit und Jahr in der Entwicklung gebraucht hat war Manus auch nichts anderes als wirklich, da muss man sagen zwei oder einige klüge Köpfe aus China haben sich zusammengetan.
00:15:42: Haben gesagt Moment mal es gibt ja eigentlich viele Tools.
00:15:44: also es gibt Tools wie man quasi durch den Agenten Browser bedient.
00:15:48: Es gibt einen Tool, wo ich auf Datenbanken zugreifen kann.
00:15:51: Es ist ein Tool, bei dem ich Koden kenne und komplexe Suchanfragen durchführen kann.
00:15:56: Also sind die ja auf die Idee gekommen?
00:15:57: Wir haben gesagt, wir nehmen da so sie zwanzig dreißig Tools und packen ihn in einem Gesamt-Tool zusammen unter einem Sprachmodell und bauen daraus Manus.
00:16:06: Und daraus ist Manus entstanden!
00:16:08: Das heißt es benutzt verschiedene Sprachmodelle, verschiedene Tools, Komponenten, über die ich sprach.
00:16:15: Und manus hat sich gab es dann halb drum.
00:16:17: also die fing an wirklich da irgendwie.
00:16:19: fünfhundert bis fünftausend zehntausend Euro wurden die Akkons gehandelt.
00:16:23: Ich habe heute gesehen dass man die mittlerweile abonnieren kann.
00:16:26: Ich vermute das müsste wahrscheinlich schon frei sein und das ist wirklich schon ziemlich gut weil ich hab einige research Aufträge damit erstellt ein paar mini-Applikationen erstellt und das war da muss ich sagen Trotz der Fehler, manchmal die da passieren oder auch Halluzination ist das Modell im Moment wirklich fast schon ein Killer kann man sagen.
00:16:46: Also zum Beispiel Kundenrecherchen, Ansprechpartnerrecherche und zwar sehr gründlich ist alles sehr gut gelungen kleine Applikationen zu erstellen.
00:16:54: Sehr gut gelogen also schon erstaunlich muss ich sagen.
00:16:59: Und sagt man hast ja eben schon erzählt wieder chinesisches Unternehmen.
00:17:03: wir in Deutschland achten auf den Datenschutz.
00:17:05: würdest du mit so einem Tool arbeiten jetzt als deutsches Unternehmen?
00:17:09: Sofern du denn zu dem glücklichen einen mit einem Zugang zählst?
00:17:11: naja es gibt ja im GitHub auch eine ...Source Code, beziehungsweise Open Source Ansatz dazu.
00:17:17: Wenn man das Google findet, dann können wir auch den Link später in der Schreibung mitliefern.
00:17:24: Das heißt also, man kann es auch on-premise laufen lassen.
00:17:26: aber sagen wir mal so für alles was extern ist oder auch Applikationen wo ich dann auch beobachte und den Code sehe... ...oder die Tools die da bedient werden.
00:17:36: Da mache ich mir erstmal keinen Kopf innerhalb einer kritischen Anwendung und Infrastruktur so was einzusetzen.
00:17:42: Ich würde sagen, das bedarf noch in Security Audit und Review ähnlich wie bei DeepSeek.
00:17:48: Viele sagen es ist egal, dass kann man lokal betreiben?
00:17:50: Ich weiß es nicht.
00:17:51: also ich sage mal da sollte man doch ein bisschen vielleicht zumindest Mal ja gucken wir sicher sind diese Modelle wirklich.
00:18:00: So und Speaking about DeepSeak Also China unser Thema heute auch zum großen Teil weil Also, A finde ich mal interessant.
00:18:07: Was hast du noch so für einen Blick auf Diepsik?
00:18:09: Wir haben die sich jetzt so entwickelt nachdem wie Vönigs aus der Asche kamen und dann hat es ja einiges getan weil Alibaba hatten eigentlich das Modell mit rausgebracht.
00:18:16: Tencent.
00:18:16: also da kommt ja ganz schön was hin.
00:18:18: Fangen wir mal mit Diepsic an!
00:18:20: Das ist so dein Blick darauf gerade wo stehen die?
00:18:22: Ja, also ich meine dass ist schon mittlerweile... Ich habe den Eindruck dass sie schon so nach und nach ankommen.
00:18:27: das heißt man sieht immer mehr in dem Umfeld auch Anbieter wie Azure oder Microsoft auch die mittlerweile auf ihrer Plattform anbieten.
00:18:36: Es gibt Applikationsanbietern, die auch das alternatives Modell zur OpenAI anbienen.
00:18:42: Das heißt also ich gehe immer davon aus mit einem gewissen Rest-Risiko bezüglich Sicherheit wird das langsam schon irgendwo ernst zu nehmen.
00:18:51: das Modell was man auch immer im Rahmen der Auswahl von diesen Modellen berücksichtigen muss und spannend ist halt wie du so schon gesagt hast von Alibaba kam ja quen daraus.
00:19:01: aber Ich glaube, was noch viel lustiger ist, ist Tencent.
00:19:05: Also es war fast schon Afranz meiner Sicht.
00:19:07: Die haben zwei Sprachmodelle rausgebracht das Ernie IV-V was ausgerechnet auch die Versionsnummer wie bei Joe Open AI und GPT IV-Fahrt.
00:19:20: Naja, die haben halt behauptet dass sie in einem Evaluation und Bewertung.
00:19:25: Die gleichen Werte wie vier fünf erreicht haben.
00:19:27: ich habe noch kein Paper dazu gesehen.
00:19:29: kann sein das mittlerweile veröffentlicht ist und zusätzlich noch haben die ein Hünnian.
00:19:34: Ich muss es immer aufpassen was ausspricht.
00:19:37: aber ich glaube hundern der eins ist halt auch model.
00:19:42: Was derzeit mit dem O-One-Modell und DeepSync R.Eins-Model aufnehmen, das ist von Tencent also sagen wir von TenCent und Alibaba wird da auch richtig laut gemacht und ich würde fast schon als Kampfansager sowohl innerhalb China als auch international sehen.
00:19:58: Jetzt mal ehrlich es war ja schon bei DeepSieg.
00:20:00: eigentlich darf man als sehr wahrscheinlich dem dass der Wissensteepstall auch stattgefunden hat.
00:20:06: wie ist es bei den beiden?
00:20:07: Also lässt ihr einen irgendwie auch aufhorchen.
00:20:09: gibt's irgendwelche Konsequenzen?
00:20:11: Was vermutet man da?
00:20:12: Weil es ist ja nicht so, dass man solche Modelle aus dem Nichts herstellt zu schnell.
00:20:16: Natürlich nicht!
00:20:16: Also Ernie hat eine lange Historie also Version vier Null oder Vier Fünf nicht so.
00:20:22: das ist wirklich so.
00:20:23: um die Ecke kam.
00:20:24: ich fand's halt nur lustig, dass ihr noch als Affron den ähnlichen Versionsnummer nehmen Die Modelle auch so bezeichnen, also Tencent und Alibaba forschen ja schon länger an solchen Modellen.
00:20:36: Wir hatten ja eine Folge zum Thema die Psyche und bei den Modellen kann man das nicht so richtig sehen oder behaupten weil man merkt schon dass sie teilweise sehr stark sind zb Mathematik und solche Aufgaben aber zum Beispiel in Sprachqualitäten.
00:20:49: wenn man die mal testet dann merkt man schon dass es ein bisschen holprig ist.
00:20:54: ich könnte mir vorstellen dass entweder man aus den anderen Kollegen gelernt hat und versucht nicht die Fehler zu machen, dass das Modell sagt.
00:21:02: Ich bin eigentlich ein GPT-Firmodell, sondern das könnte ich mir vorstellen, dass es schon was gelernt hat.
00:21:08: Und man muss auch wirklich verstehen, dass sowohl Tencent als auch Alibaba, die haben das in Unternehmen, die ja weltweite Ökosysteme betreiben.
00:21:16: Das heißt also so Es liegt auch nahe, dass sie auch ohne möglicherweise einen IP Verstoß sehr gut ihren Job gemacht haben.
00:21:25: Gab's denn eigentlich Stichwort IP-Verstoß, mal irgendwelche Konsequenzen in der ganzen Diepsikangelegenheit?
00:21:30: Weil wir hatten es ja in der letzten Folge auch was wir dazu hatten, die du grad kann mir noch mal die Shownotes packen.
00:21:34: Da haben wir drüber gesprochen dass das teilweise halt auch relativ einfach möglich war kannst dich gar nicht viel großartig gegen wehren.
00:21:39: Du fragst so ein Modell ab.
00:21:40: Was weiß zu dem Thema?
00:21:41: was weißt du da zu?
00:21:42: was weisst du dazu?
00:21:43: Das machst du als sehr lange sehr intensiv und dann hast du quasi einen großen Datenschutz schonmal abgegriffen.
00:21:47: Gabs da eigentlich mal irgendwelschere Konsekvencen?
00:21:49: Also
00:21:49: ich habe das ähnlicherweise nicht so richtig verfolgt.
00:21:52: Ich glaube bis auf einige Dinge, die ich jetzt wahrgenommen habe waren jetzt Parolen und auch ernsthafte Aussagen.
00:22:00: Aber was natürlich als Konsequenz galt war das ob mehr quasi den Saft abgedreht hat und einfach in bestimmten Ländern da die Port zugemacht hat.
00:22:09: und hier ob das jetzt weitere Klagen oder so gab muss man nochmal googeln und schauen.
00:22:15: Na gut, to be continued.
00:22:17: Abschließend möchte ich mit dir gerne noch ein Stück weit über N-achtn reden.
00:22:20: also dieses no code tool fällt ja so in die gleiche Ecke sag' ich mal was wir mit den autonomen Agenten auch schonmal hatten.
00:22:26: Also du bist da sehr begeistert von und macht natürlich einen ganz spannenden Szenario auf in Richtung Automatisierung auch weil viele Menschen machen das ja bis dato mit sowas wie make.com oder vielleicht auch sepia.
00:22:36: Und das Ding macht aber auch nochmal ganz neue Ecken auf die da möglich werden.
00:22:40: erzähl doch mal bisschen was davon.
00:22:41: Ja das ist echt ein guter punktuell.
00:22:44: Viele Firmen, die übrigens CPI einsetzen, sind nicht ganz bewusst, weil sie das im Rahmen von Schutzbedürftigen Daten einsetzen.
00:22:51: Das ist fast schon verstoßt gegen DSGVO.
00:22:55: Das vielleicht mal als kleiner Hinweis am Rande?
00:22:58: Make is ein europäisches Unternehmen.
00:23:00: haben Sie sogar DSGV?
00:23:01: konform kann man sich gar nicht vorstellen ist aber so.
00:23:04: und ähnlich wie bei Power Automate vom Microsofts sind es ja alles quasi Automatisierungstools, die auch Halbwegs und Agent Funktionalitäten jetzt eingebunden haben, Chatbot-Funktionalität und so.
00:23:17: Nacht N ist aus meiner Sicht echt der Knaller weil die verfolgen ganz anderen Ansatzes nicht so ganz leicht zu bedienen.
00:23:25: man muss ein bisschen von den Variablen verstehen, aber da gibt es wirklich sehr viele YouTube Videos im Netz.
00:23:31: Aber was ich daran sehr cool finde ist halt dass vor allem diese Instruktionen und Agent Funktionalitäten im Vordergrund stehen.
00:23:37: das heißt also jetzt nicht nur Workflows und Automatisierung abbilden sondern die legen extrem viel Wert darauf Die Instruktionen und Funktionsweisen von Agents dort abgebildet werden, das hat halt zur Folge dass ich zum Beispiel Automatisierung nicht nur über Workflows abbilden kann sondern zum Beispiel wenn ich sage ich habe hier Mails da hab' ich jetzt irgendwelche Sachen die ich aus dem Transcreeper aus dem Podcast nehmen oder Bilder, dann kann ich verschiedene Agents für diese Automationen erstellen und diese Agents haben ihre eigenen Speicher.
00:24:07: Dann habe ich auch nicht diese Rock-Probleme und die kann ich orchestrieren und diese... Ich kann wirklich Contentfabrikken bauen und das wirklich Park to Lounge sind sehr einfach und verbindlich.
00:24:17: Und was cool ist, dass es Open Source ist.
00:24:20: Also ich kann's auch bei mir im Rechenzentrum betreiben und das ist echt cool!
00:24:24: Ich empfehle da wirklich mal einen Blick reinzuwerfen.
00:24:27: Okay, also dürfen wir uns mal ganz kurz nochmal vergegenwärtigen.
00:24:30: Wir können also mehrere Agenten miteinander kombinieren.
00:24:33: Das ist Open Source frei verfügbar.
00:24:34: ich kann es also on-premise bei mir privat sozusagen anfangs privat betreiben vor Ort und dann quasi diesen ganzen Aspekt mit dem Speicher was du gerade gesagt hast.
00:24:44: sie haben sozusagen sehr hohe Kapazität auch die ich mir da anlegen kann.
00:24:48: Das klingt ja manchmal fast ein bisschen zu gut, um wahrzusehen.
00:24:50: Weil das andere Thema was wir vielleicht da nochmal anschließen könnten ist ja... Was ist denn wenn ich jetzt genau wie du beschrieben hast sage ich mal in hoher Masse mit Datenarbeit?
00:24:58: Weil das ist etwas was ich von dir auch so gelernt habe dass Massen-Daten bei sowas immer so ein bisschen tricky sind und ihr jetzt hier ganz viele sagen ah der hab mich gesagt ich geh mal zur nachtn und schalt mir das mal alles auf.
00:25:09: funktioniert das denn schon zuverlässig?
00:25:11: Ist es gut?
00:25:12: Hast du dann noch Tipps zu?
00:25:13: Also vielleicht schon mal zur Nachtn tatsächlich zu schön um was zu sein, weil die haben auch ein Preismodell dahinter.
00:25:19: Das heißt also je nachdem was man da benutzt auch die on-premise Lösung unterliegt ja auch ein Lizenzmodell und wenn ich das Modell online nutze muss ich natürlich Lizenzgebühren abführen.
00:25:31: bis paar kleinere Geschichten kann ich auch umsonst testen.
00:25:35: Jetzt zu deiner Frage in Bezug auf Datenvolumen.
00:25:37: tatsächlich ist es so dass Aufgrund der Erfahrungen, die wir es vor allem in den letzten anderthalb oder einem Jahr gemacht haben.
00:25:44: Nämlich Umgang mit großvoluminen Daten.
00:25:47: Ich bin so ein bisschen von diesem Rack ansetzen, ich würde fast sagen enttäuscht wenn es in Richtung Gigabyte oder Terabyte von Daten geht.
00:25:55: warum ist das so?
00:25:55: Weil man muss da wirklich mit diesen sogenannten Chancs, das sind Abschnitte von Daten- oder Zusammenfassung sehr viele Dinge versuchen drum herum als Beipass zu bauen und da hat man immer noch keine hundertprozentige Sicherheit wegen Datenverlust, Halluzinationsverlussung, Akkuratheit oder sehr viel Applikation drum herum erstellen.
00:26:19: Und wir stellen halt fest, wenn es in diesem größeren Datenvolumen geht dann gibt's immer Probleme mit dem Context Window.
00:26:26: Da ist im Moment so auch diese ganzen Geschichten mit Vektoren und Grafen.
00:26:30: Ja, weil es sind Vektoren, die elementare Denkmodelle bei den LLMs und Grafens beschreiben.
00:26:36: Die Beziehungen, da kommen auch welche, die neue Theorien entwickeln.
00:26:40: Das ist immer so schön wenn man so diese Post liest und die Studien liest aber die bretharte Realität zeigt Das ist nicht so.
00:26:50: Und da ist meine Empfehlung tatsächlich solche Orchestrationsmodelle anzuwenden, zu überlegen wie viele Anwendungsfälle habe ich kleinere Datenmengen mit einzelnen Agents zu bedienen bis halt das Thema der Speicherverarbeitung und Akkuratheit und Halluzinationsverlust im Kontext Window also Speicherüberlauf bei den Modellen gelöst ist.
00:27:09: Ich baue mir halt eine Army auf Agents und die übernehmen unterschiedliche Aufgaben.
00:27:14: Und dann gibt es irgendwie so eine Führungsstruktur, Teamleiter, Team-Leiterin oder Agentin, die dann unter anderem kommunizieren.
00:27:25: Das bedeutet, dass ich in Grunde genommen fast eine Abteilung oder eine ganze Kampel nicht sogar damit automatisieren kann.
00:27:30: Ich wollte gerade fragen, das ist so.
00:27:31: meine letzte Frage bei dem was wir jetzt alles über Autonomagenten von dir gehört haben klingt es für mich so also wenn ich ganze Vollzeitkräfte mittlerweile dann durch KI abbilden kann?
00:27:40: Na ja solange die jetzt nicht Menschen Kontakt haben und nur Content produzieren ja bis zum gewissen Grad.
00:27:45: und übrigens für die Enterprise Zuhörer, Zuhöhrerin empfehle ich sogar Crew AI.
00:27:51: Das ist dann sogar noch professionell als N-achten und tatsächlich wenn nicht gewisse Jobs wo ich jetzt nicht um den Kundenkontakt Bauhaus gab es kommt aber auch mit dem Voice ansetzen und so das gibt's ja schon bereits einige Agents Dann kann ich schon einen signifikanten Anteil einer Abteilung oder Unternehmen durch diese Agenten komplett laufen lassen.
00:28:11: Krass also Hat sich ja wirklich einiges getan, seitdem ich weg war.
00:28:15: Lieber Hamid, vielen Dank fürs Update und bis zum nächsten Mal!
00:28:44: Bis zum nächsten Mal.
Neuer Kommentar