Die technische Umsetzung eines Data Warehouses | #Software 🦾

Shownotes

EXPERTENGESPRÄCH | In dieser Ausgabe diskutieren Johannes und Joel gemeinsam mit Contiamo-Gründer Michael Franzkowiak über den technischen Aufbau und Betrieb von Data Warehouses. Du erfährst... ...was ein Data Warehouse aus technischer Sicht ist ...was der Unterschied zwischen Data Warehouse und Data Lake ist ...was OLAP-Cubes sind ...wie die Zukunft von Data Warehouses aussieht ➡️ Du konntest dir keine Notizen machen? Unser [digital kompakt+ Newsletter](newsletter.digitalkompakt.de) fasst dir für jede Folge die wichtigsten Punkte zusammen Diese Episode dreht sich schwerpunktmäßig um Technologie: Software und IT sind ja mittlerweile allgegenwärtig geworden und durchdringen als erfolgskritischer Faktor praktisch jeden Geschäftsbereich. Gleichzeitig stellen Software und IT dennoch für viele Entscheider:innen eine Black Box dar, die sie mehr schlecht als recht verstehen. Um diesen Missstand zu beenden spricht Joel regelmäßig mit Johannes Schaback (inzwischen CTO bei SumUp) über IT-Themen und Technologietrends. Regelmäßig werden sie dabei von bekannten, kompetenten Akteuren der Technologiewelt besucht und dabei unterstützt, technische Themen möglichst leicht verständlich und anhand konkreter Praxisbeispiele zu vermitteln. __________________________ ||||| PERSONEN ||||| 👤 Johannes Schaback, CTO SumUp 👤 Joel Kaczmarek, Geschäftsführer digital kompakt 👤 Michael Franzkowiak, __________________________ ||||| SPONSOREN ||||| 🔥 [Übersicht](https://www.digitalkompakt.de/sponsoren/) aller Sponsoren __________________________ ||||| KAPITEL ||||| (00:00:00) Einführung ins Thema und Vorstellung der Teilnehmer (00:03:30) Was ist ein Data Warehouse aus technischer Sicht? (00:04:51) Was ist der Unterschied zwischen Data Warehouse und Data Lake? (00:06:45) Datenauswahl: Das Sammeln von Daten in einem Data Lake (00:10:34) Der ETL-Prozess und worauf es dabei ankommt (00:16:57) Technologie zum richtigen Zusammenführen von Daten in einem Data Warehouse (00:24:32) Eigenbau vs. Off-the-Shelve-Lösung: Wie man heterogene Daten zusammenführt (00:30:00) Was sind OLAP-Cubes? (00:31:42) Die Visualisierung von Daten aus Data Warehouses (00:34:31) Warum sind Data Warehouses langsam und werden oft nicht genutzt? (00:41:57) Security, Datenschutz und Datenverunreinigung (00:45:20) Risiken, die Unternehmen aus einem Data Warehouse erwachsen können (00:46:42) Die Interaktion zwischen Maschinen und einem Data Warehouse (00:49:10) Wie sieht die Zukunft von Data Warehouses aus? __________________________ ||||| WIR ||||| 💛 [Mehr](https://lnk.to/dkompakt) tolle Sachen von uns  👥 Wir von digital kompakt streben die Verwendung einer geschlechtsneutralen Sprache an. In Fällen, in denen dies nicht gelingt, gelten sämtliche Personenbezeichnungen für alle Geschlechter.

Transkript anzeigen

00:00:00: Hallo und herzlich willkommen zu einem neuen Blackbox Tech Podcast von Digital Compact.

00:00:04: Ich bin Joel Gatschmarek und mit mir sitzt wieder der fabulöse Johannes, grüß dich Johannes!

00:00:08: Und wir sind heute nicht allein.

00:00:09: es geht nicht nur mein spannendes Thema sondern wir haben auch einen spannenden Gast dabei.

00:00:12: eigentlich sind die Gäste immer spannend.

00:00:13: das ist Zugangsvoraussetzung.

00:00:15: für mich ist ein ganz besonderer Moment muss ich sagen weil der junge Mann denn neben mir sitzt hat vor mir ich glaube sogar noch deutlich von mir Gründerszene groß gemacht und ich habe mal seine Meritenteile erzählt bekommen.

00:00:23: von daher das finde ich sehr schön stelle ich nochmal ganz kurz vor Ja, hallo mein Name ist Michael Franz Kowjak.

00:00:28: Schön dass ich heute hier sein kann.

00:00:28: vielen Dank für die Einladung!

00:00:30: Ich bin jetzt so seit, ich glaube sieben acht Jahren in der Berliner Start-up Szene unterwegs immer auch mit einem großen Fokus auf technische Themen.

00:00:38: Jetzt seit knapp vier Jahren mit Kontyamo unterwegs unserer Company wo wir eine Datenplattform entwickelt haben und damit unter anderem Unternehmen wie der Telekom und einigen anderen größeren dabei helfen ihre Daten zentral zusammenzubringen und auswertbar zu machen und freue mich sehr heute über diese Thematik auch so ein bisschen zu sprechen.

00:00:57: Genau in diese Richtung soll es gehen, und zwar reden wir heute über Data Warehouses.

00:01:00: der eine oder andere hat ja vielleicht auch unseren Podcast mit Kollegen Heinemann schon dazu gehört.

00:01:03: im Business Building Bereich da ging's ja mehr so'n bisschen was für Marketingzahlen aggregierig.

00:01:07: wie kriege ich das in die Organisation gebracht?

00:01:09: Wie baue ich das ein ins mein eigenes Business Building?

00:01:11: Wir wollen jetzt halt natürlich ein bisschen technisch werden.

00:01:13: Das heißt wir wollen uns ein bisschen gucken.

00:01:14: Was sind teilweise die Unterschiede zwischen verschiedenen Ansätzen?

00:01:17: Was ist zum Beispiel ein Data Lake versus ein Data Warehouse.

00:01:19: Welches Software gibt es, wie baue ich so eine Architektur und so weiter und sofort?

00:01:22: Da bist du natürlich die Nummer eins!

00:01:24: Wir haben uns das so ein bisschen strukturiert in Daten sammeln, Daten zusammenführen, Daten nutzen und wollen nach hinten raus ein bisschen über Best Practices reden... ...und du bist ja glaube ich sehr gut für geeignet.

00:01:32: Du hast einfach ein bisschen unterschlagen, du hast so spannende Daten eigentlich Sachen auch mal nicht nur deine eigene Firma sondern du hast ja auch irgendwie Rocket-Zeiten ein bisschen erlebt bei Lex da was gesehen.

00:01:39: Magst du eigentlich mal ein zwei Sätze dazu sagen?

00:01:40: Ja, ich seh mir natürlich selber in den ersten Rocket Tagen auch einiges mit bekommen, da schon auch immer gesehen wie gut natürlich und wie wichtig es ist eben auch ein Unternehmen sehr datengetrieben zu führen.

00:01:50: Und wie viel davon eigentlich auch davon abhängt wie die Architektur aufgesetzt ist oder welche Infrastruktur man zurückgreifen kann und dass das definitiv ganz wichtiger entscheidender kompetitiver Vorteil ist.

00:02:00: jetzt sitzen wir hier Luftlinie Was ist das?

00:02:02: Knapp tausend Meter von Zalando entfernt, wo ich auch glaube dass man definitiv sagen kann.

00:02:06: Dass ein guter Teil des Erfolges eben daher rührt wie gut dort mit Daten gearbeitet wird und eben auch welche In-House Expertise da seit Tag eins eigentlich aufgebaut wurde.

00:02:15: insofern eigentlich bestes Beispiel dafür.

00:02:17: Danach habe ich dann bisschen eher auf der Investorenseite auch Firmen begleitet und da waren uns natürlich immer wichtig, wenn wir in Firmen investiert haben, dass wir wussten, dass unsere Euros auch gut genutzt wurden Produkte und auch dafür natürlich aus Investoren sich ganz entscheidend, wie gut ist das Unternehmen aufgestellt.

00:02:36: Wie gut kann es da Entscheidungen treffen?

00:02:38: Auch in der Breite über die Organisation hinweg also von den verschiedenen Entscheidern in unterschiedlichen Abteilungen.

00:02:43: Cool!

00:02:44: Also da haben wir ja schon mal so ein bisschen Gefühl dafür bekommen was Data Warehousing eigentlich für Anwendungsgebiete alle hat.

00:02:48: Magst du mal ganz simpel einsteigen als Definition, was ist eigentlich ein Data Warehouse wenn man das eher im technischen Sinne betrachtet?

00:02:54: Ich würde das als meiner Sicht so beschreiben, dass es der Ort ist wo ich Daten für langfristige Speicherungen ablege und insbesondere in einer Art und Weise, dass sie sehr sauber sind.

00:03:05: Also sehr verlässlich.

00:03:06: Verlässlichkeit ist mit Sicherheit eine der wichtigsten Eigenschaften eines guten Data Warehouses und dass die eben in einer Struktur gespeichert sind, die für Abfragen ein großer Mengen aggregierter Daten optimiert ist Und damit eben auch einen definitiven Unterschied zu den operativen Systemen, wo ich hier im Grunde genommen immer Einzeltransaktionen vornehme.

00:03:27: Also wenn eine Bestellung passiert und ein Datensatz aktualisiert wird – wo ich einzelne Aufrufe vielleicht noch weiche, aber auf jeden Fall die Abfrageart eine ganz andere ist.

00:03:38: Manche Leute sprechen ja über Data Warehouses im Sinne der Datensenk.

00:03:43: read multiple times.

00:03:45: Ist das auch eine zulässige Definition eines Data Warehouses?

00:03:47: Dass ich im Grunde historische Daten einfach einmal ablege, sie zwar zigmal lese aber ja nie wieder anfasse?

00:03:53: Genau also auf jeden Fall!

00:03:54: Das zeichnet definitiv ne gute Architektur aus.

00:03:57: Also muss mir definitiv Gedanken machen wenn ich in meinem Data Warehouse auf die Idee komme Aktualisierungen vorzunehmen.

00:04:03: Im Grunde genommen sollte man so schön append only sein.

00:04:06: Ich hänge neue Datensätze an und arbeite dann damit.

00:04:09: Es gibt ja seit kürzerem den Begriff des Data Lakes.

00:04:12: Was ist genau der Unterschied zwischen Data Lake, also im Sinne des Sees und Data Warehouse?

00:04:17: Also für mich habe ich das immer so definiert, dass im Grunde genommen der Data Lake eine Art von Rohdatenspeicher ist.

00:04:23: Wo ich im ersten Schritt mal alles ablege in der granularsten Form wie ich es überhaupt verfügbar habe um einen Ort zu haben, der für mich auch das Interface darstellt Für alle Leute die mit Daten arbeiten wollen zu sagen da kann ich hingehen Da hab' ich auf alle Daten Zugriff.

00:04:39: In der granularisten Form Kann sie von dort aus verarbeiten, kann sie transformieren dann auch in das Data Warehouse schreiben Kann aber jederzeit wieder zurückgehen, kann diese Transformation noch einmal ausführen und weiß einfach dass ich keine unterschiedlichen Schnittstellen zu den einzelnen Tools verstehen muss.

00:04:55: Sondern mich immer an diesen Data Lake wenden kann.

00:04:57: Vielleicht können wir auch nochmal etwas konkreter beschreiben wie sieht ein Data Warehouse eigentlich aus?

00:05:03: Weil zur Zeit ist Data Lake und Data Wire sehr abstrakte Begriffe und ich könnte mir vorstellen das es für viele höhere Interessantes zu verstehen.

00:05:09: was ist denn jetzt eigentlich technisch?

00:05:11: also wenn nicht mehr das jetzt mal räumlich als irgendein Geometrisches Objekt oder als irgendwas was ich mir vorstellen als Programm, was wir laufen lassen.

00:05:17: Was ist denn so ein Data Lake oder Data Warehouse?

00:05:20: Wie kann ich mir das vorstellen als Nicht-Techie um das irgendwie besser zu beschreiben abends beim Bier?

00:05:26: Also es ist definitiv eine Datenbanke sind Tabellen.

00:05:28: Ich habe Datensätze mit Spalten und Verknüpfungen zwischen den unterschiedlichen Tabellen.

00:05:34: Ich habe zum Beispiel Fakten über Besucher auf meiner Seite über Produkte die verkauft wurden bestimmte Transaktionen, die ich durchgeführt habe.

00:05:45: Versendungen all solche Sachen und habe die verknüpft mit den Entitäten also mit den Objekten oder Personen, die für mein Business-Modell relevant sind, die mit jeweils diesen Vorgängen dann zu tun haben.

00:05:57: Also an einer Bestellung hängt der Kunde, der gekauft hat das Produkt was verkauft wurde und solche Sachen.

00:06:03: Wir gehen jetzt auch schon in diesen ersten Track sammeln.

00:06:06: Lass uns noch ein bisschen über die Daten sprechen, die da reingehen.

00:06:09: Im Florian Heidemann Podcast wurde ja schon ein bisschen darüber genannt was es jetzt im Online-Marketing geht insbesondere für Daten.

00:06:13: da reingehen?

00:06:14: Was sind aus deiner Praxiserfahrung heraus häufige Daten, die so ein klassisches Data Warehouse gehen neben Online Marketing Themen?

00:06:20: Ich würde sagen aus meiner Erfahrung sind die beiden ganz wichtigen Quellen, die als erstes in einem Data Warehouse zusammengeführt werden und reinfließen.

00:06:27: Die Daten und die Datenströme, die Nutzerverhalten Bewegungsdaten abbilden, die ich da zusammenführe mit meinen Transaktion-Daten aus meinem Backend-System.

00:06:38: Also zum Beispiel könnte man sich das so vorstellen immer wenn ein Nutzer eine Seite aufruft einen URL auf ruft dann wird ja ein Request sozusagen bearbeitet vom Web Server und dieses Event es ist folgende URL aufgerufen worden mit Demo dem Session Cookie.

00:06:50: Das wäre so ein Datenpunkt und dazu könnte man noch alle möglichen Informationen.

00:06:55: Wie live haben Cookie, wie lange hat es gedauert diesen Datenpunkt zu verarbeiten oder diesen Request zu verarbeiten.

00:07:00: Solche Daten wären so Tracking-Daten auf dem rohen Niveau und soweit unten.

00:07:05: So würde ich sie definitiv in einem Data Lake sammeln und dann gegebenenfalls aggregiert ins Data Warehouse überspielen weil ich im Data Warehouse nicht notwendigerweise alle einzelnen Sessions haben muss.

00:07:17: Weil mein Business Analyst am Ende Leute, die eher auf so Entscheider-Ebenen unterwegs sind ja nicht in die einzelne Session runtergehen müssen sondern sie wollen Entwicklungen sehen darüber.

00:07:26: wenn ich dann allerdings sage Ich möchte Automatisierung vornehmen Recommendation Engines bauen etc.

00:07:31: Dann brauche ich die Rohdaten und würde das eben aus dem Data Lake heraus machen.

00:07:35: Und um nochmal auf deine Frage zurückzukommen, also unter Bewegungsdaten, Nutzungsdarten verstehe ich eigentlich alles was mit Interaktion Kontaktpunkten mit Kunden zu tun hat oder mit Nutzern oder potenziell interessierten.

00:07:47: Also das bezieht sich natürlich ganz stark jetzt auf Businessmodelle die eher so im B to C Bereich angesiedelt sind wo ich sehr viele Kontaktpunkte auch habe.

00:07:55: in btb-Bereich.

00:07:56: wenn ganz hohen Einkaufsvolumen und relativ wenigen Kundenhandiere habe ich ganz, ganz andere Fragestellungen.

00:08:02: Aber dafür ist es möglicherweise Robotik-Sensordaten?

00:08:05: Genau das können Verarbeitungsdaten, Verkleistdaten... Wie ist das eigentlich, wenn man noch ein bisschen über Spudan spricht?

00:08:11: Man will ja – das hast du eingangs gesagt – alle Daten zentral an einem Ort haben für eine Firma.

00:08:15: Zumindest möchte man sie auswerten können und solche Sachen wie HR, also Mitarbeiterzahlen, Churn, Financial Data gehört es auch da rein.

00:08:21: Idealerweise definitiv!

00:08:22: Idealer Weise habe ich natürlich im Data Warehouse ein umfassendes Bild der Gesamtperformance und der Gesamtesundheit des Unternehmens über Bereiche hinweg.

00:08:31: Das ist aber immer ein Ziel, dem man glaube ich ein Stückchen hinterherläuft weil sich Organisationen einfach sie wachsen, noch mal mehr verändern und damit auch die Datenlandschaft sich immer verändert.

00:08:42: Insofern muss da denke ich auch mal ganz stark natürlich priorisiert werden was auch zum jeweiligen Stadium des Unternehmens dann passt.

00:08:48: Aber ist es so ein Fall von viel hilft viel?

00:08:50: Also dass du sagst möglichst viele Rohdaten in so einen Lake reinkippen, damit dich hinterher jeden möglichen irgendwie denkbaren Fall habe den ich analysieren kann oder macht das gar nicht so viel Sinn wenn man sich eigentlich selber überfordert?

00:09:00: Also ich halte das für absolut sinnvoll und relevant, das möglichst früh aufzusetzen.

00:09:04: Und auch für den Fall dass man eigene Backend-Systeme entwickelt sicherzustellen, dass man daraus saubere Daten exportet, saubre Dumps jederzeit in den Data Lake einspielen kann.

00:09:14: Dass man Drittanbieter so auswählt, dass es einen sauberen Zugriff auf die Rohdaten hat damit sich da einfach alle Optionen offen hält für die Zukunft.

00:09:22: Ganz wichtig ist definitiv zu sagen, dass wir schon eine Common Sense... Auswahl trifft von den Daten, die man dort ablegt.

00:09:30: Aber immer wenn es um Bewegungsdaten geht, wenn's um Daten von Tools geht, die irgendwo eine Businessrelevanz haben weil ich darüber Geld ausgebe, weil ich da rüber mein Fulfillmentrack alle solche Sachen.

00:09:40: Dann sollte ich definitiv als Auswahlkriterium auch mit einbeziehen wie gut komme ich an die Daten und die Daten möglichst früh dann auch historisch korrekt ablegen und verfügbar machen.

00:09:49: für weitere Fragestellungen, die sich in der Zukunft ergeben Wie kriege ich meine Daten eigentlich in so ein Data Lake rein?

00:09:54: Also stell mal vor, ich bin jetzt so einen mittelständischer Schraubenhersteller.

00:09:57: Ich habe etliche Daten irgendwie rumliegen teilweise in Excel, teilweise in MySQL-Datenwanken und teilweise in Google Analytics.

00:10:03: Das ist ein wunderbaren Zustand von zentraler Datenverwaltung und Zugriff und Cross-Referencing herstellen.

00:10:09: was mache ich jetzt?

00:10:09: wie krieg ich diese Daten rein?

00:10:11: Ich glaube, das sind natürlich zwei Teile.

00:10:12: Auf der einen Seite muss ich den entsprechenden Data Lake aufgesetzt haben also die Storage.

00:10:15: im Grunde genommen kann man sich das vorstellen wie ein verteiltes Dateisystem was einen fast unendlichen Speicherplatz zur Verfügung steht.

00:10:23: Und auf denen lege ich im Grunde genommen große Dateien.

00:10:26: Dateien, die die Rohdaten aus den entsprechenden Quellen enthalten.

00:10:30: Das kann nicht mehr entweder Innenhaus aufsetzen indem ich mir so ein Hadoop Cluster aufsetze.

00:10:35: Ich kann das auf allen von den großen Cloud-Anbietern tun, die da auch ganz viel investieren um einfach sehr gute Infrastruktur aufzusetzen und wo eine ganz klare Empfehlung von meiner Seite wäre zu sagen wenn man sich da nicht einen definitiv großen Operations Overhead ins Haus holen möchte dann sollte man definitiven Erwägung ziehen auf einen dieser Anbieter zu setzen.

00:10:53: Das ist das eine, also ich brauche den Data Lake diesen Storage in dem ich das ablegen kann und das andere ist natürlich Ich muss die Daten aus den Schnittstellen holen, ich muss sie gegebenfalls transformieren Und ich muss Sie dann ablegen!

00:11:03: Das ist der so schön benannte ETL-Prozess, das ist der dreckigste Teil der ganzen Datapipeline.

00:11:08: Das is' das wo mit Sicherheit am meisten Stunden drauf gehen Wo der meiste Ärger lauert und wo es ganz ganz ganz entscheidend ist dass wenn man kann man auch die richtigen Schnittstellen von vornherein zur Verfügung hat.

00:11:20: Weil wenn das Kind mal in Brunnen gefallen ist, wenn man irgendwelche Legacy-Systeme drin hat... Wenn man einfach Tools hat, die gegebenenfalls sogar für den Datenexport nochmal Rechnung stellen weil man nur mit einem bestimmten Konnektor auch wirklich skalierbar an die Daten kommt dann ist man gefangen.

00:11:35: und dann ist mein Gefangen sowohl in Hinsicht auf Kosten wenn man sich diesen Zugang auf die eigenen Daten eigentlich erst mal kaufen muss, aber auch in Bezug auf wie viel Zeit dann zu investieren ist um das Ganze aufzusetzen und das darf man auch nicht unterschätzen.

00:11:48: In Sachen Aufwand um das ganze zu monitoren und sicherzustellen dass die Datenqualität hoch bleibt Ich habe mal geguckt, wenn man irgendwie Data Warehouse mal bei AdWords checkt auf Such-Cluster.

00:11:58: Also was wird am meisten gesucht?

00:11:59: Dann ist immer Detta Warehouse ETL sehr weit vorne.

00:12:02: Kannst du vielleicht noch einmal für jeden der jetzt nicht so technisch bewandert ist und ein bisschen sagen, was so ein ETL-Prozess genau ist und wie man den dann vielleicht am besten in den Griff bekommt?

00:12:09: Das ist definitiv ein Thema, wo wir auch ganze Nachmittage drüber sprechen könnten.

00:12:13: Insofern versuche ich das relativ einfach zu halten und es gibt keine Patentrezept.

00:12:17: Es ist einfach ein Bereich, wo viel Aufwand an einigen Stellen fachwissen notwendig ist.

00:12:22: ETL steht ja erst mal für Extract Transform Load was wenn man diesen drei Buchstaben folgt bedeutet extrahirn der Daten.

00:12:29: Ich muss erstmal überhaupt herankommen Dann habe ich die Daten in einer Struktur wie sie mir von den Schnittstellen zur Verfügung gestellt werden gar nicht die Struktur ist, in denen ich sie dann auch für die Langzeitspeicherung ablegen möchte.

00:12:42: Ich transformiere die Daten also das ist der T-Bestandteil und dann load.

00:12:47: man könnte hier auch sagen persistieren storage dann lege ich die Daten ab und dafür gibt es Diverse Tools am Markt, es gibt ETL-Tools die das Ganze in einer sehr grafischen Art und Weise abbilden wo ich also Grafen bauen kann.

00:13:00: Und meine Datenflüsse dann auch sehr schön visuell modellieren kann.

00:13:04: Daneben gibt's natürlich so was glaube ich jedem Entwickler als erstes einfallen würde nämlich Skripte zu schreiben Wissen, Scheduling regelmäßig ausführe.

00:13:13: Ganz traditionell laufen solche Sachen dann alle paar Stunden jeweils in der Nacht greifen auf die Daten zu, transformieren sie dann, legen sie irgendwo ab.

00:13:20: und ich glaube was da jeder aus Erfahrung kennt den im Bereich mal aktiv war ist man fasst solche etl-Jobs relativ häufig an nämlich dann immer wenn sich etwas verändert wenn mal die Schnittstelle nicht zur Verfügung stand.

00:13:32: Wenn ich also auf einmal von den letzten paar Tagen nochmal wieder was hinterher importieren muss Und dann fängt er knadisch eigentlich erst so richtig an weil ich dann eben schauen muss was habe ich schon drin was fehlt mir noch.

00:13:42: Wo gab es vielleicht auch mal Daten, die falsch importiert wurden?

00:13:44: Das ist so fast einer der Supergaus wenn ich das erstmal drin habe in meinem Data Warehouse.

00:13:48: also da hängt relativ viel dran.

00:13:50: deshalb die absolut wichtigste Empfehlung aus meiner Sicht ist immer zu schauen von vornherein Wenn man sich neue Sachen anschafft wie gut komme ich an die Daten und wie sauber komme ich dran wenn man erst einmal eingelockt ist?

00:14:01: Es ist ganz schwierig.

00:14:02: Da gibt's auch kein Silver Bullet Wie man so schön sagt.

00:14:04: Bei uns ist das intern benannt mit Datenhomogenisierung.

00:14:08: Eine weitere Herausforderung, die wir immer wieder bei uns bei Lahnzeilentern feststellen, ist dass die Unit oder die Einheit in der die Daten kommen auch gar nicht klar sind.

00:14:16: also... Die klare Definition!

00:14:18: Was ist das eigentlich?

00:14:20: Was ist es genau für einen Datenstrom?

00:14:21: Will jede einzelne Zahl genau zu verstehen?

00:14:24: wie ist sie zu interpretieren?

00:14:25: oder ist die möglicherweise sogar schon voraggregiert?

00:14:27: über welchen Zeitraum wurde diese Zahl, diese Metrik erfasst?

00:14:31: was ist das genau für eine Metrik?

00:14:32: Das ist auch etwas, was immer in diesen ETL-Prozessen mit einspielt.

00:14:35: Wenn da eine ganz klare Definition vorliegt und genaues Verständnis ist, was sind diese Ausgangsdaten?

00:14:40: Dann fange ich an wie ein Wolf zu transformieren und transformiere die eigentlich komplett falsch.

00:14:44: Schreibt sie falsch in mein Data Warehouse, werte sich dann aber auch entsprechend auf einer falschen Ahnung aus.

00:14:49: Und das ist etwas, dass wir auch immer wieder merken, dass Wir haben genau verstanden, wie wurden diese Daten erfasst?

00:14:57: und was ist diese Definition eines einzelnen Datenpunktes.

00:14:59: Es ist nicht endlich auch problematisch, was du gerade gesagt hast wenn man das nur einmal in der Nacht irgendwie einlädt.

00:15:03: also mittlerweile ist man noch eigentlich auf dem Level angekommen wo man data warehousing in echt Zeit machen will so wie ich das mit kriege oder?

00:15:08: Ja, ich würde sagen also in fast Echtzeit.

00:15:10: Ich glaube es macht keinen großen Unterschied in einem Data Warehouse wenn man jetzt wirklich darüber spricht dass sich hier visuelle Reports zur Verfügung stellt und mein Business Nutzern Entscheidungshilfen an die Hand gebe.

00:15:20: da ist das nicht so relevant dass das Ganze innerhalb von unter einer Minute zur Verfügung steht.

00:15:25: für Veränderungen die ich da entdecke habe ich hoffentlich alerting hab ich monitoring auch auf den auf den business Metriken Und für alles was in Richtung Personalization Recommendation geht Da habe ich sowieso hoffentlich andere Pipelines aufgesetzt.

00:15:36: aber klar Ziel muss sein, dass ich diese Reports in sehr kurzem Zeitraum aktualisierbar halte.

00:15:42: Und insofern ist aus meiner Sicht natürlich jetzt auch gerade in den letzten Jahren ganz klar so ein Trend zu erkennen, das viele gute Systeme auch Events-Treams zur Verfügung stellen – grade wenn es eben um die Nutzungsbewegungsdaten Vorfälle im Allgemeinen geht wo ich dann, wenn ich quasi einzelne Events, die bei mir ankommen nacheinander verarbeiten kann, fast immer auf dem aktuellsten Stand bin und damit auch ein anderes Modell habe als dieses nächtliche oder... alle paar Stunden vorgenommen, Batch-Transformation.

00:16:15: Lass uns doch mal so ein bisschen in den Bereich zusammenführen rüberwechseln.

00:16:18: also wir haben jetzt viel über Daten sammeln gesprochen.

00:16:19: vielleicht können wir mal als Brücke das Thema Technologie nehmen weil du eben auch schon gesagt hast es gibt teilweise ETL Software Tools die viele benutzen.

00:16:25: ich weiß die Leute sich das anhören die sind immer heiß drauf zu wissen was empfehlt sie für Tools?

00:16:29: Was für welchen Teil?

00:16:29: Vielleicht können wir da mal ein bisschen irgendwie reintauchen und versuchen was sind so typische Technologien für moderne Data Warehouses?

00:16:35: und dann vielleicht auch was gibt's dafür ganz konkrete Lösungen die sich empfehlen?

00:16:38: Also ich bin definitiv großer Fan von den großen Cloud-Anbietern, wenn es um das Thema Infrastruktur geht.

00:16:45: Weil ich einfach glaube dass man sich da schon sehr viel Zeit sparen kann gerade wenn man intern in House jetzt nicht das ganz große BI und Data Engineering Team zur Verfügung hat.

00:16:56: Und ich würde auch da definitiv an vielleicht etwas höhere Kosten oder gefühlt hohe Kosten am Anfang akzeptieren, einfach um zu sagen man spart sich die Zeit und man kann sich auf das Wichtige konzentrieren.

00:17:08: Also das sind so Amazon Redshift und Google BigQuery?

00:17:11: Genau.

00:17:12: also ich würde jeweils dann sagen wir haben natürlich die Möglichkeit eben Bei Amazon wäre es erst drei, die Rohdaten abzulegen und da einfach... Ich glaube wenn man so ein Terabyte an Daten pro Monat abliegt ist man irgendwo bei knapp vierzig Euro.

00:17:24: Also das ist absolut im grünen Bereich.

00:17:29: Vierzig Euro pro Monatt für einen Terabyte am Storage was eben auch ausfallsicher gut verfügbar für weitere Transformationen dann davor liegt und woraus ich dann eben auch meine Transformation vornehmen kann um sie in eine Datenbank in Data Warehouse zu überführen.

00:17:44: Das wäre im Falle von Amazon dann Redshift als eine verteilte SQL-Datenbank, die im Grunde genommen Postgres als ein Interface von der Natur her ist und damit eben auch sehr schön kompatibel ist für diverse BI Tools.

00:17:56: Die eben darauf aufsetzen und Visualisierung und Reports dann erstellen können.

00:18:00: Und Azure von Microsoft Google haben ähnliche Technologien arbeiten auch genau an den gleichen Equivalenten Angeboten.

00:18:08: Dazu kommt dann die Möglichkeit Streams zu verarbeiten bei Amazon Werder's Kinesis und Firehose, um die Daten direkt weiter ins Data Warehouse zu pipen oder eben gleichzeitig auf S-III im Data Lake abzulegen.

00:18:22: Und da merkt man schon, dass da auch eben sehr ganzheitlich gedacht wird in dem wie diese einzelnen Komponenten zusammenarbeiten.

00:18:31: und häufig denkt man sich glaube ich gerade wenn man aus so einer technischen Seite kommt dieser Service den können wir selber bauen oder selber zumindest aufsetzen.

00:18:38: Es ist ja auch vieles davon als Open Source Technologie verfügbar.

00:18:41: Ich glaube der große Mehrwert kommt dann, wenn man mehrere dieser Angebote nutzt und die eben sehr schön zusammenstecken kann weil da wird es irgendwann schon sehr aufwendig.

00:18:50: diese Ops.

00:18:51: wirklich Gibt es trotzdem Unterschiede, die du benennen kannst?

00:18:54: Also Google zumindest preislich hat den anderen Ansatz als ein Redshift schon noch.

00:18:58: Das ist ja manchmal einen Eindruck, dass auf Google Cloud durchaus versucht wird, preislig Amazon anzugreifen.

00:19:05: Es gibt ja richtige so Religious Wars zwischen diesen zwei Lagern.

00:19:09: Ist das jetzt BigQuery versus Redshift unabhängig von Open Source Community?

00:19:13: Wie würdest Du wenn ich jetzt vor der Entscheidung stehe mich links oder rechts für zu entscheiden, was würdest du sagen?

00:19:18: Was sind so Kriterien die ich prüfen müsste.

00:19:20: Welche Technologie die richtige für mich ist?

00:19:21: Du hast jetzt auch Azure noch vergessen, die gerade in dem Big Data Bereich enorm viel investiert haben und ein ganz, ganz spannendes Angebot glaube ich ehrlich im ganzen Machine Learning-Bereich draufgesetzt haben jetzt wo sie vielleicht sogar an einigen Stellen ein Stück weiter sind das glaubt man nicht.

00:19:36: aber es ist definitiv auch einer der Bereiche wo Microsoft sehr innovativ vorgegangen ist und sehr viele schöne Sachen jetzt verfügbar gemacht hat.

00:19:43: Man kann definitiv sagen Amazon Web Service ist so ein bisschen safe bet.

00:19:47: Das ist mit Sicherheit das, wo ganz viele auch Techies einfach drauf gucken, wo ich auch immer denke ich ganz gute Leute finden kann die sagen habe ich schon mal was mit gemacht hab ich schon Mal gesehen also ganz ein bisschen so ein sicherer Standard geworden Einfach als first mover Als derjenige der auch Ganz viel investiert immer und investiert hat in das ganze Thema developer relations etc.

00:20:08: Und insofern aus meiner Sicht mit Sicherheit das, was ich immer auch als erstes evaluieren würde.

00:20:13: Um dann zu schauen, was kriege ich bei den anderen beiden an Möglichkeiten?

00:20:16: Wenn ich jetzt als Start-up unterwegs bin kann es da definitiv sehr aggressive Programme geben wo ich von Microsoft gegebenenfalls für drei Jahre, dreihundert, vierhunderttausend Dollar an Credits bekomme.

00:20:28: Was dann auch definitiv zu der Entscheidung führen kann zu sagen da gehe ich jetzt erstmal hin und halte mir aber möglichst auch Optionen offen natürlich eines Tages nochmal wechseln zu können.

00:20:37: Ist es wenn man sich einmal verheiratet kommt man nicht mehr zurück?

00:20:39: Ich denke man kann schon noch mal zurückkommen.

00:20:42: das hängt natürlich davon ab wie man das Ganze aufsetzt, wie viel man auch dann bereit ist zu investieren.

00:20:47: Die Hoffnung ist natürlich dass ein starker Lock-in Effekt bleibt und dass einfach der Preisunterschied am Ende nicht so groß ist, dass da nochmal eine Migration stattfindet.

00:20:56: aber es investieren auf jeden Fall alle sehr sehr stark gerade da rein und wenn man sich geschickt anstellt kann man bei Microsoft und Google insbesondere bei Microsoft mit sehr hohen Credits arbeiten und hat damit auch nicht die schlechteste Lösung definitiv.

00:21:08: Aber hat der nicht Techie hier am Tisch?

00:21:09: Also sprich ich, das ist jetzt richtig verstanden.

00:21:11: Dass Amazon, Google, Microsoft eher das Thema Data Lake werden als es, wenn er Softwaregeschichte durch die Daten sozusagen hinlege und der eigentliche Data Warehouse-Prozess wird zu einer anderen Softwareanbieter.

00:21:21: Ich würde im ersten Schritt genau die Daten auf deren jeweilige Roddaten speicherlegen um von dort aus dann Daten zu transformieren und sie in die jeweiligen Data Warehaus Lösungen zu überführen.

00:21:34: Das bedeutet, bei Azure würde ich sie in Azure SQL überführen.

00:21:38: Bei Amazon gegebenenfalls in Redshift und bei Google and BigQuery die jeweils so ein bisschen andere Angle haben.

00:21:45: Ich glaube das geht jetzt vielleicht ein bisschen zu weit ins Detail die einzelnen zu besprechen aber die sehr vergleichbar sind Und es arbeiten auch alle drei daran da wirklich kompetitiv zu bleiben.

00:21:54: Ja und dazu kommt natürlich und dass ist eben auch wirklich wichtig aus meiner Sicht Es verschiebt sich immer mehr in Richtung Stream Processing.

00:22:02: Und insofern dieses Konzept eines Data Lakes, wo ich also statische Daten zusammenführe und so Langzeitspeicher habe das kann man eigentlich mittlerweile erweitern um so eine Art von, ich nenn's mal Data River oder ein Hub, wo eigentlich alles an Streams auch erst einmal zusammen führt sodass ich weiß wenn ich historische Daten anzapfen möchte dann gehe ich zu meinem Data Lake.

00:22:22: da liegt alles alles an Rohdaten da kriege ich alles raus an einzelne Events dran möchte.

00:22:29: Irgendwas, was irgendwo in meiner Firma passiert, irgendwelche Vorfälle.

00:22:32: Ich stelle mir jetzt immer so vor, man steht an einem Fluss oder auf einer Autobahn und sieht eigentlich alles, was im Unternehmen gerade passiert, an sich vorbei fahren.

00:22:38: Dann würde ich das eben in meinem Event-Hub machen.

00:22:40: Und dafür gibt es dann solche Sachen wie Amazon, Kinesis... Das ganz interessante Anzahl hat vor eineinhalb Jahren sich entschieden ein neues DataWire aufzubauen oder eine neue Dateninfrastruktur, so wie wir das nennen Und für uns war es sehr wichtig, dass wir modular geblieben sind.

00:22:52: Also dass wir die einzelnen Komponenten dieses ganzen Konglomerats was nach ein Data Warehouse ausmacht im Grunde ersetzen können und sind weil wir von Haus aus immer unsere eigene Hardware kaufen den Weg gegangen Open Source Lösungen zu verwenden.

00:23:04: also wir verwenden natürlich als Data Mass Storage Hadoop, das Hadoope File System und lassen da drüber verteilt im Parler laufen.

00:23:13: Im Parler ist das Rept Shift equivalent, wenn man so will.

00:23:17: Du hast eine SQL-Interface auf deine statisch abgelegten Daten die du auch nicht mehr schreiben kannst.

00:23:22: Du kannst sie nur noch lesen aber sind indexiert.

00:23:24: Das heißt also es relativ schnell solche beliebigen Abfragen zu schreiben.

00:23:30: der Visualisierungs-Layer, über den wir ja noch jetzt gar nicht gesprochen haben, weil wir erst im Nutzen Track darüber sprechen werden.

00:23:34: Der Visualisierung-Layer ist bei uns dann Spotfire und das ist wirklich ganz interessant!

00:23:39: Wir haben auch diese Kostenkalkulation gemacht und für uns war das schon ein erheblicher Teil.

00:23:43: Ich glaube aber auch, wenn du wirklich von scratch anfängst und noch gar nichts hast.

00:23:46: Dann macht es total Sinn sich so eine Haustetlösung zu nehmen.

00:23:50: zum Thema zusammenführen nochmal.

00:23:51: Also Kontyamu stellt sich dort auf wo viele sehr unterschiedliche kleine Datenflüsschen zusammenkommen.

00:23:57: So habe ich es hoffentlich richtig wiedergegeben korrigieren nicht falsch.

00:24:00: wie schafft das Kontyamo eigentlich diesen ja Totalheterogen die sehr unterliegenden Umgebungen zusammenzuführen eine zentrale Stelle für alle Daten zu werden.

00:24:11: Im Grunde genommen haben wir eine Art von Virtualisierungsschicht entwickelt, die auch über Datensätze hinweg funktioniert, die nicht notwendigerweise physisch an einem Ort zusammenliegen und wir haben also versucht, Daten verfügbar zu machen ohne dass sie notwendiger Weise in einem Data Warehouse zusammengeführt werden.

00:24:30: Man realisieren dann bestimmte Abfragen bei uns ein bisschen von dem Aufwand wegnehmen, der sonst zur ETL- und Datentransformationszeit anfallen würde.

00:24:42: Werden dadurch ein bisschen flexibler natürlich auch mit gewissen Einstrengungen dann was man eben zu Abfragezeit machen kann.

00:24:47: das ist im Grunde genommen unser Ansatz und dass es definitiv auch einen Trend der den man jetzt gerade sehen kann Der sich in der gesamten Industrie vollzieht, wo man an einigen Stellen gemerkt hat gerade wenn es um die ich sage mal nicht absoluten Kerndaten geht.

00:25:01: Die aus Software-Service Tools kommen, die nur bestimmte Abteilungen nutzen.

00:25:06: das ist da teilweise etwas schwerfällt mit den sich veränderten Datenstrukturen zu arbeiten die immer wirklich an einem Ort zusammenzuführen und dieses eine Data Warehouse sauberzuhalten Und insofern auch mit der zur Verfügung stehenden, schnelleren Verbindung zwischen unterschiedlichen Daten-Storages und mehr Computingpower.

00:25:28: zu Abfragezeit ist es eben jetzt auch ein gangbarer Weg an einigen Stellen zu sagen ich frage Daten aus unterschiedlichen Quellen ab und zeige sie dann erst in den Resultaten zusammen an.

00:25:39: Ich glaube aber für Kerndaten, für das was mein Geschäft ausmacht Und für die Bewegungsdaten muss das Ziel immer sein, sie wirklich an einem Ort zusammenzuführen.

00:25:48: Weil nur dann kann ich darauf auch die richtigen Algorithmen laufen lassen und dann habe ich die meisten Möglichkeiten.

00:25:54: Das ist definitiv auch das Ziel.

00:25:56: Da helfen wir auch Unternehmen mit Sicherheit auch dabei unseren Kunden.

00:26:00: Ich glaube es wäre vermessen zu sagen, dass könnte man komplett ersetzen.

00:26:04: Was ist denn eigentlich so generell?

00:26:06: Dein Ratschlag, weil wenn ich jetzt Unternehmer wäre.

00:26:07: Was Johannes gerade gesagt hat, der hat gerade so ein bisschen seine Eigenbaulösung geschrieben.

00:26:10: Wir haben davor ein bisschen geredet über Amazon Google Microsoft Man ist ja immer bei diesem Thema Off the shelf versus Eigenbau Open Source.

00:26:18: Wie geht man daran?

00:26:19: Also so Das ist wahrscheinlich eine epische Diskussion in sich genommen, aber jetzt mal so ein bisschen versuchen abschließen zu sagen.

00:26:25: Diese Mischkalkulation mit mehreren Services versus alles aus einer Hand of the shelf?

00:26:29: Was hast du da das Gefühl, der Weg zu gehen?

00:26:31: und vielleicht ist ja auch so ne Frage ab irgendeiner Phase macht das einen Sinn oder das andere?

00:26:34: Also mein Gefühl ist ganz stark, das finde ich auch ganz interessant.

00:26:36: Ich bin natürlich jetzt also ein bisschen voreingenommen dadurch was ich so aus der Startup-Welt kenne dass ich im Grunde genommen in dem IEI Bereich jetzt so eine Entwicklung vollzieht die man vorher so in einem Systemadministratorenbereich gesehen hat nämlich dass das Ganze mehr und mehr von Entwicklern getrieben wird als von Leuten, die Experten für einzelne Tools sind.

00:26:55: Und in so einem Enterprise-Tool leben und da absolutes Expertenwissen aufgebaut haben.

00:27:01: Insbesondere gilt es für die Schritte Datentransformationen, Datenspeicherung.

00:27:07: Wenn's um die Visualisierung geht, das ist definitiv so oft der Shelf-Tools auch weiterhin absolut relevant weil sie sich eben ganz stark mit Oberflächen Zugänglichkeit beschäftigen.

00:27:17: Insofern würde ich Aus meiner Sicht gesehen auch häufig so ein bisschen als Best Practice beschreiben, dass man in dem Bereich Daten-Extraktion gegebenenfalls auf Tools setzt wie Talent etc.

00:27:32: die einfach auch grafische ETL-Prozesse zulassen.

00:27:35: Wenn man etwas stärker auf der Entwicklungsseite ist, dann kann man das mit Sicherheit auch mit verschiedenen Frameworks machen, die eben auch solche Jobs ausführen und auch monitoring können.

00:27:44: Dann ist es also eher eine Art von wirklich Programmierleistung, die da erbracht wird.

00:27:48: Auf der Data Storage Seite denke ich ... Ist das mittlerweile relativ klar?

00:27:54: Dass wenn ich das in Haus aufsetze als Data Lake, werde ich so wie bei Ladenseile auch, dann ist es Hadoop.

00:28:00: In welchem Format ich's dann drauf speicher?

00:28:02: Ist dann wieder eine andere Frage ob als Avro... Parquet, etc.

00:28:05: Und in Sachen Datenbanken glaube ich gibt es für wenige Unternehmen und ganz ehrlich zu sein die Notwendigkeit zu sagen dass sie In-House da die ganz teuren BI Data Warehouse Datenbunken aufsetzen.

00:28:17: also wenn ich schon den Schritt gegangen bin zu sagen Ich setze mir einen eigenen Hadoop Cluster auf dann kann ich darauf sowies Ladenseile auch macht im Paler laufen.

00:28:26: las heif ist sehr sehr fix geworden gerade über große Datenmengen oder Wenn meine Daten Mengen einfach noch nicht so groß sind die Daten auch hinreichend aggregieren, kombinieren kann bevor ich sie ins Data Warehouse dann schiebe.

00:28:39: Dann funktioniert es auch sich da ein gut Postgres-Datenbank hinzusetzen gegebenenfalls in einen der verteilten Flavors, Cetus TB etc.

00:28:48: und damit kann ich auch sehr schön arbeiten.

00:28:49: Inscheidend ist natürlich auch müssen die Daten on-premise also vorliegen muss ich hundert Prozent Kontrolle physisch über diese Daten haben.

00:28:56: das gibt durchaus Unternehmen Die können das aus Policy gründen, nicht zu Amazon hochladen.

00:29:01: Dann bist du darauf angewiesen, dass du physische Server bei dir im Keller stehen hast auf denen deine Daten liegen.

00:29:06: Grundsätzlich würde ich aber auch sagen wenn du kannst versuch erstmal gerade am Anfang eine oft Schärflösung zu nutzen.

00:29:13: Auch am Anfang sind die Kosten ja eher gesagt gering.

00:29:15: Dass du relativ wenig kaputt machst.

00:29:18: Ein Thema, was immer wieder in dieser Bubble um Data Warehouse und auch Data Science auftaucht sind Olab Cubes.

00:29:25: Was ist das eigentlich?

00:29:26: Also kannst du das beschreiben für nicht technische Personen?

00:29:29: Ja!

00:29:30: Und zwar ist es ja so dass ich wenn wir mal sagen Unternehmen hat jetzt einen schönen Rohdatenspeicher hat die Daten von da aus oder auch direkt ins data warehouse überführt hat also sehr schönes physisches Schema wie man so sagt also von Tabellen die miteinander verknüpft sind Dann bedeutet das ja noch lange nicht, dass sich jetzt ein Business-User einen Tool an die Hand geben kann wo er dann irgendwo den Umsatz zieht.

00:29:51: Den Umsatz vielleicht runtergebrochen nach Produkten, nach Marketingkanälen, woher die Leute kamen etc.

00:29:56: Und insofern brauche ich also als zweites eine Art von logisches Schema was beschreibt?

00:30:01: wie krieg' ich eigentlich aus den verschiedenen Tabellen mit den unterschiedlichen Spalten?

00:30:06: Wo zum Beispiel einer Spalte wenn es die Bestellungen sind die einzelnen Preise drin stehen können Der Warenkorb, also wie viel hat diese Bestellung gekostet?

00:30:14: Wie viele Umsatz hat diese einzelne Bestellungen gebracht.

00:30:16: Dann bräuchte ich im logischen Schema eine Beschreibung davon, wie komme ich jetzt davon zum Umsatz?

00:30:21: Das wäre in dem Fall die Summe dieser Spalte, die ich dann eben runterbrechen kann nach Datum, nach Produkt, Nachnutzer etc.

00:30:28: Und im Grunde genommen beschreibe ich in diesem logischen schema Würfel mehr dimensionale Würfel meiner Daten Die ich dann unterschiedlich man sagt slice und dice'n kann wo ich also sagen kann, ich möchte meine KPIs, meine Metriken runterbrechen nach verschiedenen Attributen.

00:30:46: Im Grunde genommen ist alles was ich im Unternehmen als eine Entity sehe oder als eine Eigenschaft von einer Entity etwas das ich eben als Dimension dann dort auch beschreibe und wonach ich meine Zahlen unterbrechen kann.

00:30:59: Lass uns doch langsam mal zum Nutzen kommen!

00:31:01: Ich glaube wir haben jetzt lang über das Zusammenführen von Daten gesprochen... Also das Nutzen setzt ja voraus, dass man sich die Daten anschauen kann.

00:31:07: Visualisierung ist ein riesen Gebiet oder eine Wissenschaft für sich.

00:31:12: was sind so deine aktuellen Beobachtungen im Visualisierungsbereich?

00:31:16: Was gibt es dafür Tools?

00:31:17: Was ist wichtig?

00:31:19: Wenn ich mich jetzt wieder entscheiden müsste für den Visualisierungstool welches würde ich da nehmen?

00:31:23: Was sind so entscheidende Faktoren?

00:31:24: Also wenn du jetzt fragst, welches würdest du dann eben ein bisschen voreingenommen?

00:31:28: Da würde ich definitiv auch mal mit Kontyamo sprechen.

00:31:31: Ansonsten gibt es natürlich die üblichen Verdächtigen.

00:31:33: Teilweise eben auch vielleicht ein bisschen mehr von der Desktop-Welt stammen, Tablo, ClickView, MicroStrategy, Lumira

00:31:41: etc.,

00:31:42: da gibt's definitiv einige am Markt... beinhaltet aber eben auch immer, dass ich diesen Tools dieses logische Schema in die Hand gebe und erkläre wie ich eben von meinen physischen Tabellen dann zu meinen schönen Reports und Zahlen komme.

00:31:56: Heißt das ist im Grunde hinter jedem Grafen?

00:31:58: Also ein Visualisierungstool ist ja dafür da, dass man sich plottert... Charles sich angucken kann oder grafen, also Linien über Zeit und dass ich die dann idealerweise anklicken kann und rumspielen kann.

00:32:07: Und das ich mir diese Daten lassen mit diesen Daten, dass sie die irgendwie haptisch erfahrbar machen im Idealfall.

00:32:11: Dass ich durch diesen Datenraum laufen kann und merke so entwickelt sich gerade mein Unternehmen.

00:32:16: oder dass ich diese Erkenntnisse, die ich bekomme eigentlich durch explorative Spiele mit diesem Daten bekommen und das ermöglicht mich eine Visualisierungsschicht.

00:32:24: Wie funktioniert das ganz konkret eigentlich?

00:32:26: Also du hast ja gerade beschrieben, dass das Datenmodell muss verstanden werden.

00:32:29: Wie funktioniert es eigentlich?

00:32:30: Ich kaufe mir jetzt off the shelf Software und klemme die an mein Data Warehouse.

00:32:35: Wie genau können wir miteinander sprechen?

00:32:37: wie funktioniert das?

00:32:37: Das ist glaube ich ein ganz wichtiger Punkt!

00:32:39: Das war schon immer und ist aber jetzt die Schnittstelle zwischen allen Zugriffen auf die Daten für Auswertungen und Datenbank.

00:32:47: interessanterweise auch das wo... alle auf Hadoop basierenden Lösungen jetzt seit mehreren Jahren daran arbeiten, dann auch performante SQL-Schnittstellen zur Verfügung stellen zu können.

00:32:59: Also da hast du absolut recht es ist die Schnittstelle und das was am Ende aus so einem Visualisierungstool also einer Schicht rausfällt und an die Datenbank gegeben wird.

00:33:09: Jetzt haben wir ja im Grunde alle Ebenen des Data Warehouse Tools besprochenes.

00:33:13: Visualisierungstools ist das oberste Vielleicht noch so ein Scripting-Interface.

00:33:18: Dann käme eine Olab-Schicht, ich nenne das jetzt mal Homogenisierungsschicht oder vielleicht so ein bisschen so eine Virtualisierungsschicht um die darunter liegen des eigentliche Data Warehouse, nämlich die eigentlichen ersten Daten, die abgespeichert sind in Tabellenform in der Regel zugänglich zu machen.

00:33:32: Das ist dafür, dass die Olapschicht da ist und dann ist da drunter unter dieser Tabellenschicht also unter dem Data Warehouse wenn man so will, also unter der Datenbank ist der Data Lake Genau!

00:33:42: Und diese Stream an Daten, die gegebenenfalls eben aus dem Event hab oder DataRiver oder wie auch immer man es nennt eben auch reinfließen.

00:33:49: Warum sind dann Data Warehouses trotzdem immer noch so langsam wenn eigentlich seit Jahren daran geforscht wird und gearbeitet wird?

00:33:54: Das ist... definitiv einfach auch an vielen Stellen kein einfaches Problem.

00:33:59: Es kommt natürlich auch darauf an, welche Fragestellung ich mir da angucke und am Ende läuft es wirklich drauf hinaus wie groß sind die Joints also die Verknüpfungen zwischen Tabellen?

00:34:07: Und das Teuflische ist immer die sogenannten High Cardinality Dimensions Also die Dimensionen, die Attribute, die sehr viele unterschiedliche Werte haben.

00:34:16: Das bedeutet wenn ich also etwas versuche mehr anzuschauen wie Unique User über einen bestimmten Zeitraum.

00:34:23: Dann brauche ich ja die einzelnen Unique User IDs und muss sicherstellen, dass ich die innerhalb des Zeitraums wirklich nur einmal zähle... Und wenn ich dann auch solche Daten, die ich eben in sehr granularer Form brauche für die Auswertungen noch mit einem ganz anderen Datensatz und einer anderen Tabelle verknüpfen möchte auf dieser granulären Ebene.

00:34:40: Dann werden die Abfragen einfach sehr, sehr aufwendig.

00:34:42: Das ist eben auch ein ganz großer Unterschied zu transaktionalen Datenbanken wo ich einzelne Records verändere.

00:34:48: Wo ich sage jetzt speichere ich einzelnen Bestellung an Jetzt zeige ich dem Kunden seine drei vier fünf letzten Bestellungen an das sind ganz andere Abfragten die gesamte Datenbank dann berühren, wo ich also keinen Scan über Tausende oder Millionen oder Milliarden von Records machen muss.

00:35:04: Und insofern ist das ein Thema, wo einfach immer weiter daran gearbeitet geforscht werden wird, wo aber auch die Problemstellung an sich vorgibt, dass gewisse Abfragen immer aufwendig sein werden und mit Sicherheit was an Zuwachs auf der Computing-Seite verfügbar ist, wie auch das, was gegebenenfalls noch an Optimierungen auf der Software Seite vorgenommen wird und wenig ausgeglichen wird dadurch dass einfach die Menge an Daten weiter zunimmt.

00:35:29: Und die Komplexität im Data Warehouse wächst!

00:35:33: Was würdet ihr bei denen eigentlich sagen, das geht ja so ein bisschen in den Bereich Best Practice?

00:35:36: Warum meckern eigentlich immer so viele Leute über Detta Warehouses und benutzen sie nicht.

00:35:39: Weil wenn du so mal eine Organisation guckst was ich mitbekommen habe ist der wird teilweise eher Axel benutzt als sowas, was ja irgendwie massive Nachteile hat.

00:35:46: Das heißt woran liegt das und wie kann ich eigentlich so ne Firma dazu bringen, more data driven zu werden?

00:35:51: Also aus meiner Erfahrung ist ganz wichtig dass die Value Proposition stimmt Und die is einfach an vielen Stellen nicht einfach.

00:35:59: Ich glaube, da müssen sich teilweise eben BI-Abteilungen.

00:36:02: Da müssen sich die Leute in diesen entsprechenden Abteilungen arbeiten ein bisschen an die eigene Nase fassen und sagen wie können wir das noch besser verkaufen?

00:36:08: Was fehlt noch?

00:36:09: Weil am Endeffekt muss man da wirklich konkurrenzfähig sein!

00:36:14: Das geht von der Einfachheit, die Reports anzupassen und eben auch ein bisschen mit den Daten spielen zu können über die Qualität der Visualisierung.

00:36:25: Und wie schön das Ganze ausschaut über nicht nur Daten abzuliefern sondern sie gegebenenfalls noch mit Beschreibungen und Informationen zu versehen.

00:36:33: Das ist ganz wichtig!

00:36:35: Es ist absolut notwendig, dass das was am Ende dem Business User verfügbar gemacht wird konkurrenzfähig ist zu dem was er selber machen kann.

00:36:43: Was er mit Excel hinbekommt, was er ebenfalls auch als tagtäglicher Nutzer in seinen Tools sieht.

00:36:50: im Marketing Bereich, in allen anderen Bereichen wo viele Tools eben eigene Dashboards etc.

00:36:55: mitbringen und da muss ganz viel Feinschliff vorgenommen werden ist immer so eine kleine Gefahr zu sagen, die Business User wollen ja nicht.

00:37:04: Und dann würde ich sagen es an vielen Stellen vielleicht auch das Angebot noch nicht ganz da wo sein muss.

00:37:08: Absolut!

00:37:09: Ich finde das beschreibst du super.

00:37:11: Das ist im Grunde ein Produkt was du vermarkten musst intern und ich glaube dass du auch nicht nur ein geiles Produkt ermitteln musst mit einem guten Product Market Fit intern sondern dass du zusätzlich deine Kollegen schulen muss, dass sie wissen wie ist es zu verwenden.

00:37:30: und wie kann ich dieses wahnsinnige Werkzeug diesen riesen Hammer der wieder eine Hand gegeben ist eigentlich benutzen.

00:37:35: Wie kann ich diesem Porsche?

00:37:36: Wie kann man den Motor anlassen und das ist häufig gar nicht so einfach wenn die Tools natürlich nicht gut sind oder das Produkt nicht gut ist.

00:37:43: aber man muss auch ein bisschen verstehen und lernen Daten, Banken und Datenmengen umzugehen ist.

00:37:49: Also was gibt es für Grafen?

00:37:51: Was gibt es mit Visualisierungsmethoden?

00:37:53: wenn ich eine bestimmte Fragestellung habe, wenn ich etwas etwas suche wie kann ich solche Drilldowns machen?

00:37:58: teilweise kennen das die Leute schon aus Excel aber dass man eben noch viel mehr machen kann Dass man eben eine viel größere Flexibilität hat und auch viel viel größeren Datenraum erfassen kann Das ist etwa so was ein Education Problem ist was häufig auch gar nicht so sehr da ist weil Ich mit den Tools die ich hatte immer eine vorgefertigte View hatte Und ich benutze zwar zig unterschiedlich tausend Tools, aber diesen Wert der entsteht in dem ich diese Daten zusammenführe was ein Data Warehouse kann.

00:38:21: Das erfordert sehr viel Bildung und Hintergrundwissen über die Verwendung von Data Warehouses.

00:38:27: Und einen ganz starken Austausch auch mit den Business-Usern, die auf der einen Seite auch mit Sicherheit sehr wertvolles Feedback geben, auch gute Ideen haben wo aber auch immer dann das Ganze abgeglichen werden muss mit dem Wissen eben in der BI-Abteilung, mit den Leuten die sie mir den Daten beschäftigen und wo daraus dann entwickelt werden muss.

00:38:49: was müssen wir.

00:38:50: Wie sollten wir Sachen wirklich als Reports darstellen?

00:38:52: Also da kann es an beiden Stellen glaube ich auch einfach Misskommunikation geben, die zu Problemen führt.

00:38:57: Sowohl dass sich Data Science BI-Bereich Leute Themen ausdenken oder Reports ausdenkt, die ein bisschen eine Business Fragestellung vorbeigehen als auch das Business User durch eigene Ideen aber auch gegebenfalls durch Anregungen von Big Data kann jetzt dies, Big Data können jetzt das Anforderungen stellen, die am Ende in keinen sinnvollen Reports und Zahlen münden.

00:39:17: Also ich glaube, das ist ganz wichtig.

00:39:18: Dass man diesen Diskussionskanal sehr gut aufrecht erhält und da wirklich in einem Strang zieht.

00:39:24: Top-Down glaube auch, dass man viel tun kann!

00:39:26: Wir haben bei uns intern eine Deadline festgelegt ab wann wir alle internen Reports über unser neues Data Warehouse laufen lassen wollen.

00:39:31: Das hat natürlich den Druck erhöht aber es hat natürlich auch den Zuch zum Tor verstärkt.

00:39:35: Dass alle Leute angefangen sind damit zu beschäftigen und diese push bekommen haben.

00:39:39: okay ich muss jetzt wechseln.

00:39:40: Ganz viele Schulungen gemacht und es ist auch angeboten und die Leuten immer geholfen supportet.

00:39:44: Aber da kann man auch sozusagen als Manager wirken, dass du von einer Seite bottom absaust.

00:39:49: Ist das ein geiles Produkt?

00:39:50: Es zieht mich an.

00:39:51: gleichzeitig zwinge ich euch aber auch es zu nutzen.

00:39:54: Das ist glaube ich beides wichtig grundsätzlich in dem Moment wo man die Daten nicht mehr vertraut und wo man sie nicht mehr versteht, das ist manchmal eine Mischung aus Beidem, ist es aus...das ist auch immer wichtig.

00:40:04: also man muss die Daten verstehen können und man muss diese muss eigentlich relativ einfach sein und uns nachvollziehbar sein und es muss Konsistenz sein, es muss Kohärenz sein darauf verlassen kann, was er dort sieht und das wirklich auch für Business entscheidende Vorgänge verwenden kann.

00:40:21: Dann leidet natürlich so ein Data Warehouse als Produkt massiv.

00:40:25: Hast du noch mal einen Tipp wie man so ein Detta Warehouse generell einführen sollte?

00:40:28: Weil man sagt ja immer so no second chance for first impression.

00:40:31: Und wenn die Leute einmal lieber sagen oh nee jetzt mache ich weiter mit meiner Analytics Excel Selbstbaumaschine ist vielleicht irgendwie der Zug abgefahren.

00:40:37: also nochmal die Randschritte schwierig.

00:40:38: Wie würdest du etwas machen?

00:40:39: Ich denke ganz gut funktioniert da so ein sehr iterativer Ansatz sich einzelne Fragestellungen, die auch einen sehr hohen Nutzenstiften rauszugreifen.

00:40:49: Vielleicht Sachen, die momentan noch nicht gut abgedeckt sind und zu sagen da hat man ein Leuchtturmprojekt intern was gut funktioniert dann arbeitet man sich zum nächsten vor und das also so zu spielen dass man idealerweise eigentlich viele Sachen testen kann mit Zusammenarbeit, BI, Business User, Infrastruktur und im Grunde genommen sich Schritt für Schritt auch nach Prioritäten durch die unterschiedlichen Aktivitäten arbeitet.

00:41:14: Was ist denn eigentlich so mit dem ganzen Thema Security?

00:41:16: Ich meine wir reden viel davon dass wir ganz viele Daten, Daten, Datendaten alle in einem Lake zusammenschmeißen dann irgendwie Olap-Geschichten drüber liegen uns in ein Data Warehaus pumpen über River man kann am Fluss stehen und alles Sachen zusammen sehen.

00:41:27: das ist ja aus Unternehmersicht ein Traum.

00:41:28: jetzt sind wir hier irgendwie im Datenschutz Standort Nummer eins Was sagt dir das Thema Security?

00:41:33: Also was sollte man da beachten und wie relevant ist so etwas.

00:41:35: Das ist definitiv sehr relevant, je größer das Unternehmen ist und je mehr Leute dann am Ende auch mit den Daten arbeiten sollen, desto wichtiger ist es eben da auch glaube ich sehr gute Prozesse und auch sehr gute Mechanismen zu haben.

00:41:50: Da gibt es eine ganze Reihe von Tools und Möglichkeiten das zu tun.

00:41:54: Ich glaube am Anfang ist es etwas, was man sehr stark über die Abfrageschicht regeln kann wo man für die Leute, die sowieso Rohdatenzugriff brauchen weil sie damit umgehen können auch entsprechende Freigaben und Mechanismen, NDAs etc.

00:42:09: einfach abgebildet haben muss sowieso für alle Leute die auf eher agagierte Daten zugreifen.

00:42:14: dann über die Abfrageschicht und die Art der Auswertungen die Sie benutzen können wo eine Zugangskontrolle sich erstellt.

00:42:20: Erkling ist sehr plausibel, ich meine ich überleg gerade wenn du im Prinzip internes Marketing für so ein Tool machst die du grade gesagt hast gar nicht mal dass sie jetzt Daten klauen oder die irgendwie nach draußen liegen oder so.

00:42:28: das kann ja manchmal einfach abschreckend sein wenn du nicht weißt was du mit Rohdaten anfangen solltest.

00:42:31: Wenn du eigentlich sozusagen den relativ simplen Gedanken hast bist du bei Johannes Gefühl wenn die kein Vertrauen haben.

00:42:37: also es mag ja auf solche Sachen sich auch auswirken.

00:42:39: Mathe Security Drone ist natürlich auch dieses Interaktionsproblem.

00:42:42: wenn wir in einem Bild das Flusses bleiben und du verunreinigst diesen Fluss kannst du natürlich auch massiv Einfluss nehmen auf die Entscheidung von Unternehmen.

00:42:52: Das ist dann gar nicht mal so sehr das Problem, dass die falschen Leute die richtigen Daten sehen sondern da sind eigentlich die richten Leuten die falsche Daten sehen.

00:42:58: Ich glaube jetzt kein signifikant großes Problem.

00:43:01: aber in der ganzen Security-Welt ist eigentlich der Mensch immer der Schwachpunkt.

00:43:03: Es ist auch nochmal ein Thema was es immer wieder kommt und was gerade so in solchen Amazon Bereichen immer die Sorge ist.

00:43:09: noch je wenn ich das jetzt auf s III speichere dann werden mir meine Daten geklaut oder manipuliert sogar im Gotteswillen in den allermeisten Fällen unnötig diese Sorge, aber das kommt noch damit rein.

00:43:18: Wenn ich nicht ein DAX-Unternehmen bin muss ich da schon zumindest darauf achten und dann habe ich da Themen.

00:43:23: Ich glaube was man definitiv sagen muss ist dass es etwas was man managen kann und die Vorteile das ganze so aufzusetzen überwiegen bei weitem auch die Risiken die sich daraus ergeben insbesondere dann wenn man sie eben sehr gut unter Kontrolle hat und darauf auch entsprechendes Augenmerk legt.

00:43:41: Was man natürlich ganz klar sieht ist dass notwendigerweise größere Unternehmen, Konzerne eben auch mit einer gewissen Historie.

00:43:50: Damit sehr viel mehr Zeit nehmen müssen, vielmehr auch intern mit Hierarchien dann arbeiten müssen und gegebenenfalls auch mit etwas weniger Vertrauen in das was die Leute auch jeweils sehen sollten.

00:44:01: Da spreche ich jetzt gar nicht über wirklich auf den einzelnen Kunden oder auf Personenmerkmale zugreifen zu dürfen sondern welche Zahlen dürfen die denen?

00:44:09: Welche Transparenz dürfen sie überhaupt haben über Vorfälle unternehmen Gesamtperformance des Unternehmens.

00:44:15: Das ist natürlich was, was in einem Start-up im jungen Unternehmen, in einem nativ digitalen Unternehmen ganz anders gehadent wird und womit Sicherheit auch ein gewisser Wettbewerbsvorteil dann liegt zu sagen wir haben eine sehr offene Kultur Wir geben das erst mal sehr demokratisch man spricht ja von Demokratisierung des Zugriffs auf die Daten vielen Leuten frei weil wir glauben dass es sie eben motiviert um die Lage versetzt bessere Entscheidungen zu treffen.

00:44:38: Was siehst du denn für Risiken?

00:44:39: Für Unternehmen die jetzt einen Data Warehouse einführen.

00:44:41: Es ist ja grundsätzlich Sehr sehr positiv.

00:44:44: Du kannst alle wirklich zusammenführen, hast du Erfahrungen gemacht wo ein Data Warehouse eigentlich für das Geschäft gefährlich wurde möglicherweise.

00:44:53: Siehst du da irgendwelche Risiken?

00:44:55: Ich sehe persönlich keine aber es ist halt immer so eine Frage.

00:44:59: ich glaube es ist wie jedes große IT Projekt was sich über Monate und Jahre zieht immer eine Gefahr eines Kostengerabs.

00:45:06: Es gibt immer die Gefahr einer Diskrepanz dessen, was auf der IT und Engineering-Seite gebaut wird.

00:45:11: Und was auch auf der Businessseite gebraucht wird.

00:45:13: Das sind glaube ich Sachen, die hat man bei all diesen Projekten.

00:45:17: Da gelten dann auch die gleichen Mechanismen und das gleiche Vorgehen um das möglichst unter Kontrolle zu halten.

00:45:22: Nämlich iterativ vorgehen, immer wieder Bestandsaufnahme zu machen.

00:45:25: Mit Sicherheit ist es ganz wichtig glaub' ich heutzutage jemandem relativ hoch angesiedelt zu haben gegebenenfalls sogar in der Geschäftsführung abgibt und sagt, ihr macht mal.

00:45:37: Sondern sich auch das als Teil der Unternehmensstrategie und auch als möglicher kompetitiven Vorteil wirklich intensiv anschaut und sich daran beteiligt.

00:45:48: Und versucht auch entweder selbst oder mit jemandem anderen zusammen mittler zu sein zwischen was machen wir auf der Engineering-Seite?

00:45:55: Was brauchen wir auf die Businessseite?

00:45:57: Das ist definitiv ein ganz wichtiger Erfolgsfaktor!

00:46:00: Ich würde gerne noch mal über ein bisschen andere Interface sprechen.

00:46:02: Wir haben über die Visualisierung gesprochen, das heißt also Mensch-Data Warehouse Interaktion.

00:46:07: Was ist mit Maschine Data Warehouse interaktion?

00:46:09: Also zumindest bei Ladenseile benutzen wir viel R, also diese Sprache R um unsere Abfragen unserer Modelle zu trainieren auf Daten, die letztendlich aus dem Data Warehouse kommen.

00:46:21: Die kommen aus Impala bei euch?

00:46:22: Exakt!

00:46:24: Ist das gängig?

00:46:25: ist das etwas was immer mehr passiert?

00:46:26: weil für uns ist einfach der Vorteil ne es ist ein ganz klares Interface es ist ganz einheitlich ganz homogen und es sind hundertprozentig sichere Daten also korrekte Daten.

00:46:35: ist es aber natürlich eigentlich Data Warehouses nicht dafür gebaut worden letztendlich.

00:46:39: Wir missbrauchen es ein Stück weit dafür, aber ist das ein Trend?

00:46:42: Oder ist das eher eine Insel-Lösung von uns jetzt?

00:46:45: Ich glaube, dass ist definitiv etwas was auch andere machen auf jeden Fall.

00:46:48: Das kommt eben auch darauf an welche Daten komme ich auch in welcher skalierbaren Art und Weise dann im Data Warehouse dran und schaffe ich es da?

00:46:56: wenn eben mit ganz, ganz vielen Records arbeiten möchte.

00:46:59: Mit großen Datenmengen die ich dann nochmal verarbeite und transformiere, dann werde ich die vielleicht nicht über meinen SQL-Schnittstelle daraus ziehen.

00:47:05: Sollte eigentlich ziehe mir jetzt mal ein paar hundert Millionen Records da raus sondern dann gehe ich vielleicht gerade wenn ich sowas wie Impala nutze eher an die Storage da drunter kann ja direkt auch auf HDFS zugreifen oder habe meine Daten eben in meinem Data Lake wo ich da eben mitarbeiten kann ziehe das dann in meine Hadoop Jobs oder in Spark als Puting Engine.

00:47:26: Also, insofern glaube ich das ist ein gangbarer Weg wenn das Data Warehouse so wie bei euch dass auch für der Skalierbarkeit hergibt.

00:47:33: ansonsten kann man solche Sachen eben auch sehr schön wirklich mit den Rohdaten aus dem Data Lake regeln.

00:47:39: was aber man definitiv sagen kann ist natürlich Thema Visualisierung, Reporting, Self-Service, wie sagt man, Exploration nur so auch immer den ersten Schritt darstellt.

00:47:50: Und wenn ich dann wirklich tiefer in die Daten reingehe, dann gibt es eben Sachen, die ich irgendwann nicht mehr mit Drag and Drop machen kann und die ich auch nicht mehr als einfache simple Visualisierung lösen kann oder wo irgendwann dann auch... Es gibt ja teilweise solche Guis, die ein bisschen durch solche Prozesse führen.

00:48:04: Es ist am Ende relativ kompliziert wird, solche Modelle zu bauen und wo der Switch kommt zu sagen okay jetzt brauche Hintergrundwissen und B auch so viel Flexibilität, dass es dann Sinn macht in Code umzusteigen.

00:48:17: Und da ist natürlich dann R, Python, Scala gegebenenfalls einfach das Tool der Wahl, um mit den Daten zu arbeiten.

00:48:24: Das sind dann eben nicht mehr die Business-Anwendungen, die jetzt machen.

00:48:27: Wir haben noch nicht über die Zukunft von Data Warehouse gesprochen.

00:48:29: Was mich sehr interessiert?

00:48:31: Was glaubst du, wie sehen die Data Warehouses in fünf, sechs Jahren aus?

00:48:34: Wohin geht die Entwicklung?

00:48:35: Ich glaube also im Streambereich passiert ganz viel... zu sagen, gerade dann wenn ich auf Grundlage von Daten automatisierte Aktionen vornehmen möchte.

00:48:45: Wenn ich Personalisierte... Feedback, Aktionen durchführen.

00:48:50: All solche Sachen, Fraud Detection

00:48:52: etc.,

00:48:52: das muss einfach und funktioniert viel besser wenn ich mit Event Streams arbeite.

00:48:57: insofern wird da auch einfach sehr sehr viel passieren.

00:49:00: es werden immer mehr Event Interface zur Verfügung gestellt werden auch von gängigen Software Lösungen um genau solche Fragestellungen abbilden zu können.

00:49:09: im Data Warehouse selbst und auch in der Zugriff darauf Denke ich, ein Trend den man jetzt gerade sieht ganz stark so in Richtung da nochmal eine Art von Virtualisierung drauf zu packen.

00:49:20: Also zur Abfragezeit oder im Abfrage- und Visualisierungs-Tool Daten aus verschiedenen Quellen zusammenzuführen um eben... Da hatten wir ja eben schon mal drüber gesprochen.

00:49:29: Ein bisschen auch Aufwand der sonst zur Transformationszeit anfällt zu sparen.

00:49:34: Dann denke ich ganz ganz großes Thema das ist natürlich auch schon seit vielen Jahren so im Gespräch Es muss eine Bewegung Pull hin zu Push geben.

00:49:43: Dass ich also als Business Nutzer nicht notwendigerweise mich immer davor setzen muss, sagen muss jetzt habe ich die und die Fragestellungen, jetzt kauke ich mir die mal genau an suche es ein bisschen nach der Nadel im Heuhaufen hab bestimmte Hypothesen die ich teste sondern so wie sich das jetzt eigentlich ja auch in vielen anderen Bereichen durchsetzt wird eben nach Intelligenz gefragt kann.

00:50:04: nicht mein Tool können nicht Software Lösungen mehr helfen Sachen zu entdecken Entwicklungen aufzuzeigen, die so nicht erwartbar waren und wo die Software vielleicht so viel verstanden hat über mein Business oder gewisse Business-Logik, die ich hinterlegt habe.

00:50:20: Dass sie mir da Hilfe an die Hand geben kann und Entwicklungen aufgezeichnen

00:50:24: können.".

00:50:24: Das heißt ja auch immer dass der Biiler, der klassische Biiler ist das erste Opfer von Artificial Intelligence weil es schon so eine hundert Prozent digitalisierte und durch quantifizierte Welt ist vermeintlichen Artificial Intelligence Methoden oder Machine Learning eher sehr viel diese Prozesse automatisieren kann, die sozusagen dem BI zugerechnet werden.

00:50:45: Würdest du das unterschreiben?

00:50:47: Ich glaube im Bereich Datenintegration ist es ganz schwierig dass einfach so individuell ist und so viel, auch jetzt gerade von den einzelnen Fragestellungen und Gegebenheiten abhängt.

00:50:59: Im Bereich Auswertung denke ich gegebenenfalls wird da genau durch diesen Von-Pull zu Push Trend an einigen Stellen das ersetzt was eben Data Scientist vorher gemacht hat oder ein Business Analyst der eben gesagt hat Ich gucke mir die Zahlen an, ich teste überprüfe regelmäßig Hypothesen wo das gegeben falls der Software dann irgendwann gemacht wird und auch an die entsprechenden Leute kommuniziert wird.

00:51:23: Ich glaube aber, dass in dem Bereich ganz viel Platz ist noch dafür als Data Scientist aktiv zu werden und das sich natürlich der Trend auch dahingehend fortsetzt, dass es eben nicht mehr nur um die Regierung von Daten geht sondern eben auch das Anwenden von immer ausgefeilteren Analysen, die eben auch mehr nach den Zusammenhängen in den Daten fragen.

00:51:44: Hervorragend!

00:51:44: Ich danke euch beiden ganz herzlich, das war ein sehr spannendes und ein sehr vielschichtiges Gespräch.

00:51:48: Alle Zuhörer übrigens wenn euch das auch gefallen hat schenkt uns gerne fünf Sterne Bewertungen bei iTunes.

00:51:52: wir freuen uns um.

00:51:53: das hilft uns höher zu ranken und mehr Leute zu erreichen mit solchen wichtigen Sachen.

00:51:56: Wenn ihr schon dabei seid uns Feedback zu unseren Inhalten zu geben geht gerne auch mal auf podstars.de slash digitalkompakt Und füllt unsere Umfrage aus.

00:52:03: Wir verlosen drei spannende signierte Samba Bücher.

00:52:05: Das hilft uns bessere Inhalte zu machen.

00:52:07: Euch beiden kann ich nur danken.

00:52:08: soviel Zeit Soviel Wissen das muss man erstmal verarbeiten.

00:52:10: ich danke euch da ganz ganz herzlich für Und natürlich auch besonders dir, dass du die Zeit hergefunden hast.

00:52:14: Aber auch Johannes das der für mich mal den Übersetzer spielt Technik non technik.

00:52:18: also ich danke euch.

00:52:19: vielen Dank sehr gern.

Neuer Kommentar

Dein Name oder Pseudonym (wird öffentlich angezeigt)
Mindestens 10 Zeichen
Durch das Abschicken des Formulars stimmst du zu, dass der Wert unter "Name oder Pseudonym" gespeichert wird und öffentlich angezeigt werden kann. Wir speichern keine IP-Adressen oder andere personenbezogene Daten. Die Nutzung deines echten Namens ist freiwillig.