Weißt Du, wie Künstliche Intelligenzen funktionieren, die GPT oder BERT im Namen tragen?
Obwohl wir uns an der ein oder anderen Stelle mit dem Themenbereich Künstliche Intelligenz beschäftigt und der Art wie diese lernt (z.B. maschinelles Lernen, Reinforcement Learning, Deep Learning), weiß ich bis heute nicht was die Abkürzung GPT in ChatGPT, einer der zur Zeit bekanntesten Künstlichen Intelligenzen, bedeutet.

Zum Glück gibt es Autoren wie
die wissen was solche Abkürzungen bedeuten und ihr Wissen mit den Menschen, die ihre Bücher lesen teilen.
„Sprachmodelle wie GPT (generative Pre-trained Transformer) oder BERT (Bidirectional Encoder Representation from Transformers) spielen eine zentrale Rolle bei der Entwicklung von KI Agenten. Sie ermöglichen es den Agenten, natürliche Sprache zu verstehen, zu verarbeiten und darauf zu antworten. Diese Fähigkeit ist essenziell für die Interaktion mit Menschen sowie mit anderen Systemen.“
S. 214.
Da ich vor kurzem gelernt habe, was KI Agenten sind, verstehe ich das Zitat von Julian. KI Agenten sind Künstliche Intelligenzen, die einer ganz bestimmten Aufgabenstellung folgen. Sie können zum Beispiel ein Bewerbungsgespräch auf Basis einer Stellenanzeige und eines Lebenslaufes simulieren. Wobei es aus Datenschutzgründen keine gute Idee ist den eigenen Lebenslauf in eine Künstliche Intelligenz zu füttern, die Du im Internet findest, da diese die Daten aus Deinem Lebenslauf lernt und vielleicht an anderer Stelle bei einem User ausgibt.
Wir wissen nun dank Julian, dass KI Agenten Sprachmodelle wie GPT und BERT brauchen. Wir wissen auch wofür die beiden Abkürzungen stehen
- GPT – generative Pre-trained Transformer
- BERT – Bidirectional Encoder Representation from Transformers

Was ich dagegen noch nicht weiß, ist wie die beiden Sprachmodelle funktionieren und wann ich welches Sprachmodell nutze. Ich bin gespannt, ob wir im Internet verständliche Erklärungen finden.
Was ist ein GPT?
Es gibt Themen, in denen ich über so wenig Wissen verfüge, dass mir Definitionen von Begriffen nicht weiterhelfen, weil ich die Begriffe, die darin vorkommen nicht verstehe. GPT ist genau so ein Thema. Mein Vorwissen reicht nicht, um die beiden Definitionen zu verstehen, die IBM und Wikipedia zur Verfügung stellen.
Die Erklärung von IBM lautet:
„GPTs (Generative Pre-Trained Transformers) sind eine Familie von Large Language Models (LLMs), die auf einer Transformer-Deep-Learning-Architektur basieren.“
Die Erklärung von Wikipedia lautet:
„In der künstlichen Intelligenz (KI) ist ein generativer vortrainierter Transformer (englisch generative pre-trained transformers, GPT) ein großes Sprachmodell (englisch large language model, LLM). GPT-Modelle basieren auf künstlichen neuronalen Netzwerken unter Anwendung generativer Modelle und von Transformer-Architektur, die auf großen Datensätzen unmarkierter Texte vorab trainiert werden und in der Lage sind, neue Inhalte zu generieren; sie werden oft allgemein als GPTs bezeichnet.“
Zu meiner großen Freude habe ich im dritten Anlauf eine Definition von Google gefunden, die ich verstehe:
„GPT, ein generativer, vortrainierter Transformer, ist ein Large Language Model (LLM), das Deep Learning nutzt, um Texte zu generieren, die wie von Menschen geschrieben aussehen.“
Ein GPT ist also eine Software, die Texte generiert, die so aussehen, als ob sie von Menschen erstellt wurden. Die Fähigkeit hierzu erlangt die Software dank Deep Learning.
Wie funktioniert ein generative Pre-trained Transformer?
Dieses YouTube Video beantwortet die Frage in einer für mich verständlichen Form. Es erklärt, dass große Sprachmodelle wie ChatGPT mit öffentlich zugänglichen Texten trainiert werden. Im Rahmen des Trainings lernt das Sprachmodell unter anderem, dass Begriffe unterschiedliche Bedeutungen haben können. Eine Bank kann ein Möbelstück oder ein Dienstleistungsunternehmen sein. Dabei lernt das Modell auch, dass das Wort „Rom“ in Texten mit den Begriffen Hauptstadt und Italien häufiger vorkommt als das Wort „Berlin“. Es ist also wahrscheinlicher, dass Rom die Hauptstadt von Italien ist, als Berlin. Ob das richtig ist, weiß ChatGPT nicht, das Sprachmodell rät einfach anhand der Wahrscheinlichkeiten, die ihm in den Texten begegnet sind. Es agiert also ein bisschen so wie ein Mensch, der sich durch einen Multiple Choice Test mogelt.
Weil das Sprachmodell nur auf Wahrscheinlichkeiten basiert, generiert es auch immer wieder falsche Antworten. Das kann daran liegen, dass die gestellte Frage zu komplex war, oder aber daran, dass die Datenbasis über die das Sprachmodell verfügt in diesem Bereich zu dünn ist.
GPTs funktionieren also, indem sie Texte analysieren und Daten aus diesen speichern und Wahrscheinlichkeiten aus diesen ableiten. Bei einer Anfrage an eine GPT werden die gespeicherten Daten durchsucht und Antworten aufgrund von Wahrscheinlichkeiten generiert.
Was ist ein BERT?
Zu meiner großen Freude verstehe ich die erste Definition von BERT, die ich auf datacamp.com gefunden habe. Sie lautet:
„BERT (steht für Bidirectional Encoder Representations from Transformers) ist ein Open-Source-Modell, das 2018 von Google entwickelt wurde. Es war ein ehrgeiziges Experiment, um die Leistung des sogenannten Transformers – einer innovativen neuronalen Architektur, die von Google-Forschern 2017 in dem berühmten Paper Attention is All You Need vorgestellt wurde – bei natürlichsprachlichen (NLP) Aufgaben zu testen.“
Wie funktioniert ein Bidirectional Encoder Representation from Transformers?
Dieses englischsprachige YouTube Video erklärt im Detail, was Google da 2018 entwickelt hat. Im Rahmen des Trainings lernt BERT was Sprache und Kontext ist. Nachdem BERT diese Hürde genommen hat, kann es darauf trainiert werden bestimmte Aufgaben zu lösen. Eine Aufgabe wäre zum Beispiel:
„Beantworte die häufigsten Fragen zu einem bestimmten Produkt.“
In dieser Phase des Trainings kann BERT zum Beispiel die häufigsten Fragen zu Honig lernen und die jeweils passenden Antworten.
Das Video geht noch mehr ins Detail, doch ich habe an irgendeinem Punkt den Faden verloren und bin mit dem, was ich verstanden habe, vollkommen zufrieden
Wann nutze ich GPT und wann BERT?
Nachdem wir nun wissen, was GPT und BERT sind und wie diese funktionieren, wissen wir auch, dass die Frage, die ich mir vorhin gestellt habe, quatsch ist. Denn wenn ich es richtig verstanden habe (ich bin mir zu 80% sicher, dass ich das habe) nutze ich automatisch einen BERT, wenn ich ein GPT nutze. Denn ohne BERT gäbe es kein GPT. Dank BERT versteht GPT menschliche Sprache. GPT ist also in gewisser Art und weise einfach eine Weiterentwicklung von BERT. Die beiden verhalten sich zueinander wie Buchstaben und Worte. Gäbe es keine Buchstaben, könnte ich keine Worte schreiben. BERT ist in diesem Gleichnis der Buchstabe und GPT das Wort.
Fazit
Ich weiß nicht, wie es Dir geht, aber ich habe das Gefühl, dass ich heute eine Menge gelernt habe. Dennoch habe ich noch immer nicht das Gefühl, dass ich das Thema Künstliche Intelligenz nun endlich durchsteige, doch ich habe das Gefühl, dass ich heute einen weiteren kleinen Schritt in die richtige Richtung gemacht habe.
An dieser Stelle bin ich neugierig: Welche Künstlichen Intelligenzen nutzt Du in Deinem Alltag?
Lesedauer & Kategorie
Schnellnavigation
Buchcover zum Beitrag

Werbung
Das Buch, das diesen Beitrag inspiriert hat, habe ich als Rezensionsexemplar vom Verlag erhalten. Das bedeutet, ich habe das Buch kostenlos zur Verfügung gestellt bekommen, um darüber zu schreiben.
Schlagwörter
Autor

Schnellnavigation
Buchcover zum Beitrag

Schlagwörter
Datum & Autor
Kommentiere den Beitrag
Was passiert nach Deinem Kommentar?
Nachdem Dein Kommentar durch uns geprüft wurde, wird er freigegeben* und erscheint unter diesem Beitrag zusammen mit dem von Dir angegebenen Namen. Deine E-Mail-Adresse wird nicht veröffentlicht. Sie dient uns an dieser Stelle in erster Linie zum Schutz vor Spam. Wenn Du Deine E-Mail-Adresse nicht hier angeben möchtest, kannst Du den Kommentar auch gern auf einem unserer Social Media Profile posten.
*Spam und Kommentare, die nur einen Backlink für die eigene Seite zum Ziel haben, werden einfach gelöscht. Nimm gern Kontakt mit uns auf und lass uns die Möglichkeiten eines Sponsored Post besprechen, wenn Du gern einen thematisch passenden Backlink unter einem bestimmten Beitrag platzieren möchtest.




Die Wrong Answers zu diesem Beitrag findest Du auf
https://x.com/steinbg/status/2099710449621037443?s=20
https://www.linkedin.com/posts/maria-steinberg_raeutsel-activity-7505475765543538689-Czvv?utm_source=share&utm_medium=member_desktop&rcm=ACoAACVAe9YBahWEE6HZAh6bY-V7JfVNza5APCM