Google baut den Sprachmodus Gemini Live und die tiefgehende Denkfähigkeit der KI aus.
Entdecken Sie neue Technologien, künstliche Intelligenz, Drohnen, Mobilität, Elektronik, Navigation und digitale Innovationen

Google baut die Fähigkeiten seiner Flaggschiff-KI-Reihe Gemini 2.0 weiter aus und setzt dabei auf die Kombination von natürlicher Sprachinteraktion und tiefgehender logischer Analyse. Die neuesten Funktionen des Ökosystems ermöglichen es der KI, komplexe, mehrstufige Berechnungen direkt während des Dialogs mit dem Nutzer durchzuführen.
Der interaktive Sprachmodus Gemini Live ermöglicht Gespräche in Echtzeit mit minimaler Verzögerung. Nutzer können den Algorithmus mitten im Satz unterbrechen, das Gesprächsthema wechseln oder den Videostream ihrer Gerätekamera übertragen. Das System passt Intonation und Emotionen an und erzeugt so den Eindruck natürlicher menschlicher Sprache.
Parallel dazu entwickeln die Entwickler die Technologie „Extended Thinking“ weiter, die im Modell Gemini 2.0 Flash Thinking vorgestellt wurde. Mithilfe von „Chain-of-Thought“-Mechanismen (Gedankenketten) erstellt das Modell einen internen Antwortplan, überprüft Hypothesen und korrigiert eigene Fehler. Dies reduziert die Anzahl der Halluzinationen bei der Lösung von Aufgaben in den Bereichen Programmierung, Mathematik und Analytik erheblich.
Die Synergie von Algorithmen für die Sprachinteraktion und tiefgehenden Schlussfolgerungsfähigkeiten markiert eine neue Entwicklungsstufe der KI. Nutzer können nun präzise Antworten auf analytische Fragen erhalten – ohne Verzögerungen und ohne komplexe Texteingaben.
Quelle: Google-Blog