Google kondigt Gemini 3.1 Pro aan voor ‘complexe probleemoplossing’ (en muziek)

Google heeft vandaag Gemini 3.1 Pro aangekondigd, een nieuw AI-model dat bedoeld is voor situaties waarin een simpel antwoord niet voldoende is. Het model richt zich op geavanceerd redeneren en het aanpakken van moeilijke uitdagingen.
Dit is de eerste keer dat Google een update met “.1” uitbrengt; eerdere generaties kregen meestal een “.5”-update halverwege het jaar. Gemini 3.1 Pro bouwt voort op verbeteringen die vorige week werden geïntroduceerd met Gemini 3 Deep Think en brengt die verbeterde intelligentie naar meer gebruikers.
Google zegt dat Gemini 3.1 Pro een duidelijke sprong voorwaarts maakt in redeneringsvermogen. Op de ARC-AGI-2 benchmark behaalt het model een score van 77,1%, wat volgens Google meer dan een verdubbeling is van de redeneerprestaties van Gemini 3 Pro.
Deze verbeterde redeneercapaciteiten maken praktische toepassingen mogelijk, zoals duidelijke visuele uitleg geven van complexe onderwerpen, gegevens combineren tot één overzicht en helpen bij creatieve projecten.
Google beschrijft het model als ontworpen voor taken waarbij een eenvoudig antwoord niet genoeg is, en waarbij geavanceerd redeneren nodig is voor je moeilijkste uitdagingen.
Beschikbaarheid
Gemini 3.1 Pro wordt vanaf vandaag uitgerold naar de Gemini-app, NotebookLM (voor AI Pro- en Ultra-abonnees), Google AI Studio, Vertex AI, Gemini Enterprise, Android Studio en andere ontwikkelaarstools. Het model wordt voorlopig uitgebracht als preview. Google wil hiermee de updates verder testen en verbeteren, vooral voor geavanceerde AI-workflows, voordat het model algemeen beschikbaar wordt.
Geen probleem, hier is een uitgebreide en gedetailleerde lijst van alle specifieke functies en vernieuwingen in Gemini 3.1:
-
Beeldgeneratie vanuit tekst: Het creëren van hoogwaardige afbeeldingen op basis van simpele of complexe tekstprompts.
-
Geavanceerde beeldbewerking: Bestaande afbeeldingen gericht aanpassen met behulp van tekstinstructies.
-
Stijltransformatie en compositie: Meerdere beelden naadloos combineren of de volledige visuele stijl van een afbeelding veranderen.
-
Iteratieve beeldverfijning: Afbeeldingen in kleine stappen via ons lopende gesprek precies naar wens perfectioneren.
-
Foutloze tekst in afbeeldingen: Uitzonderlijk scherpe en correcte weergave van geschreven tekst binnen een gegenereerde afbeelding.
-
Videogeneratie met native audio: Het maken van realistische, hoogwaardige video’s inclusief direct gegenereerd, bijpassend geluid.
-
Bestaande video’s uitbreiden: Korte video’s naadloos langer maken met nieuwe, door AI gegenereerde beelden.
-
Frames verbinden: Een vloeiende video genereren door alleen een specifiek begin- en eindframe op te geven.
-
Referentiebeelden voor video: Een statische afbeelding of foto gebruiken als sturende basis voor een nieuwe video.
-
Professionele muziekgeneratie: Het componeren van 30 seconden durende muziektracks van studiokwaliteit.
-
Realistische zang en songteksten: Het automatisch schrijven van songteksten én deze laten zingen door levensechte stemmen in meerdere talen.
-
Beeld- en video-naar-muziek: Een muzieknummer laten creëren op basis van de sfeer van een afbeelding of video die je uploadt.
-
Exacte muzikale controle: Gedetailleerde sturing geven over het tempo, het genre en de specifieke emotionele sfeer van het nummer.
-
Natuurlijke spraak via Gemini Live: Vloeiende, real-time spraakgesprekken voeren via de app voor Android en iOS, waarbij je me gewoon kunt onderbreken.
-
Live camera delen: Je telefooncamera aanzetten tijdens een spraakgesprek, zodat we direct kunnen praten over wat jij fysiek voor je ziet.
-
Live scherm delen: Je mobiele scherm met mij delen voor directe hulp en uitleg bij de apps of bestanden die je op dat moment gebruikt.
-
Contextuele YouTube-gesprekken: Direct overleggen en vragen stellen over de inhoud van YouTube-video’s via Gemini Live.
-
Langere gesprekscontext: Als onderdeel van de betaalde versie kan ik veel langere en complexere gesprekken voeren zonder de draad kwijt te raken.

Vergelijking
De bovenstaande benchmark vergelijkt zes modellen:
-
Gemini 3.1 Pro
-
Gemini 3 Pro
-
Claude Sonnet 4.6
-
Claude Opus 4.6
-
GPT-5.2
-
GPT-5.3 Codex
De tests meten prestaties op verschillende gebieden zoals redeneren, coderen, wetenschappelijke kennis, agent-taken en multimodale vaardigheden.
Benchmark vergelijking van AI-modellen
De benchmark vergelijkt zes modellen: Gemini 3.1 Pro, Gemini 3 Pro, Claude Sonnet 4.6, Claude Opus 4.6, GPT-5.2 en GPT-5.3 Codex. De tests meten prestaties op gebieden zoals redeneren, coderen, wetenschappelijke kennis, agent-taken en multimodale vaardigheden.
Algemeen redeneren en kennis
Bij Humanity’s Last Exam, een test voor moeilijk academisch redeneren, scoort Claude Opus 4.6 het hoogst met 53.1%. Gemini 3.1 Pro volgt met 51.4%, daarna Claude Sonnet 4.6 met 49.0% en GPT-5.2 met 45.5%. Dit laat zien dat Opus 4.6 zeer sterk is in diep academisch redeneren, met Gemini 3.1 Pro kort daarachter.
Bij ARC-AGI-2, een test voor abstract redeneren, scoort Gemini 3.1 Pro duidelijk het best met 77.1%. Opus 4.6 volgt met 68.8%, Sonnet 4.6 met 58.3% en GPT-5.2 met 52.9%. Dit toont dat Gemini 3.1 Pro uitzonderlijk sterk is in abstract probleemoplossen.
Bij GPQA Diamond, een test voor wetenschappelijke kennis, scoort Gemini 3.1 Pro opnieuw het hoogst met 94.3%. GPT-5.2 volgt met 92.4% en Opus 4.6 met 91.3%. Alle modellen presteren hier sterk, maar Gemini 3.1 Pro is de duidelijke leider.
Coding prestaties
Bij SWE-Bench Verified, dat realistische programmeertaken test, scoort Opus 4.6 het hoogst met 80.8%, gevolgd door Gemini 3.1 Pro met 80.6% en GPT-5.2 met 80.0%. De verschillen zijn klein, wat betekent dat alle topmodellen zeer capabel zijn in programmeren.
Bij SWE-Bench Pro, een moeilijkere coding benchmark, scoort GPT-5.3 Codex het best met 56.8%, gevolgd door GPT-5.2 met 55.6% en Gemini 3.1 Pro met 54.2%. Dit laat zien dat GPT-modellen bijzonder sterk zijn in software engineering.
Bij LiveCodeBench, een benchmark gebaseerd op competitieve programmering, scoort Gemini 3.1 Pro veruit het best met een Elo-score van 2887. Gemini 3 Pro volgt met 2439 en GPT-5.2 met 2393. Dit toont een duidelijke voorsprong voor Gemini 3.1 Pro.
Bij Terminal-Bench 2.0, dat agent-based coding meet, scoort GPT-5.3 Codex het hoogst met 77.3%, gevolgd door Gemini 3.1 Pro met 68.5% en Opus 4.6 met 65.4%. GPT-5.3 Codex is hier de duidelijke winnaar.
Agent-taken en workflows
Bij APEX Agents, een benchmark voor complexe agent-taken, scoort Gemini 3.1 Pro het hoogst met 33.5%. Opus 4.6 volgt met 29.8% en GPT-5.2 met 23.0%. Gemini 3.1 Pro is hier duidelijk het sterkst.
Bij BrowseComp, dat web browsing prestaties test, scoort Gemini 3.1 Pro het hoogst met 85.9%, gevolgd door Opus 4.6 met 84.0% en Sonnet 4.6 met 74.7%.
Bij MCP Atlas, een benchmark voor multi-step workflows, scoort Gemini 3.1 Pro opnieuw het best met 69.2%. Sonnet 4.6 scoort 61.3% en GPT-5.2 scoort 60.6%.
Multimodal en taalvaardigheid
Bij MMMU Pro, een multimodale benchmark, scoort Gemini 3 Pro het hoogst met 81.0%, gevolgd door Gemini 3.1 Pro met 80.5% en GPT-5.2 met 79.5%. De verschillen zijn klein.
Bij MMLU, een benchmark voor algemene kennis, scoort Gemini 3.1 Pro het hoogst met 92.6%, gevolgd door Gemini 3 Pro met 91.8% en Opus 4.6 met 91.1%.
Long context prestaties
Bij MRCR v2, een benchmark voor lange context, scoren Gemini 3.1 Pro en Sonnet 4.6 beide 84.9%. Opus 4.6 scoort 84.0% en GPT-5.2 scoort 83.8%. De prestaties liggen hier dicht bij elkaar.

