Turing Station
PODCAST · AFL. 12

AGI is er volgens Nvidia CEO, Astra componeert Bach en wie was Alan Turing?

Door Bart Mol6 min leestijd

"AGI has arrived," zegt Jensen Huang na de lancering van GPT-6 Astra. Wij duiken in wat AGI eigenlijk is, van de Einstein-test tot ARC-AGI-3, luisteren naar een Bach-benchmark, delen tips voor het tijdelijk uitschakelen van AI-geheugen en komen aan op Turing Station: wie was Alan Turing?

Beluister Turing Station op Spotify | Apple Podcasts | YouTube.

TL;DR

  • [00:06:45] In het kort: China onderzoekt humanoids voor het slagveld, Mistral haalt € 3 miljard op, Kenia's essay-industrie stort in door ChatGPT, geruchten over VS-China-gesprekken over AI-veiligheid en een AI doom loop op de arbeidsmarkt.
  • [00:17:00] "AGI has arrived" volgens Jensen Huang: Astra scoort 99,9% op ARC-AGI-3 en is in 96% van de levels efficiënter dan mensen — maar of dit AGI is, hangt volledig af van welke definitie je hanteert.
  • [00:46:00] De Bach-benchmark: van GPT-4o dat klinkt als een peuter op een keyboard naar Astra dat een koraal zonder stemvoeringfouten componeert, inclusief doorgangsnoten.
  • [01:02:00] Praktische tip: gebruik temporary chats, incognito of project-only memory om te voorkomen dat het geheugen van je AI je onderzoek besmet.
  • [01:11:00] Turing Line: we komen aan op Turing Station — wie was Alan Turing, van de universele machine en de Turingtest tot child machines als blauwdruk voor machine learning.

Vijf nieuwtjes: van humanoids op het slagveld tot een AI doom loop op de arbeidsmarkt

"AGI has arrived," schreef Nvidia-CEO Jensen Huang na de lancering van GPT-6 Astra. Voorbarig? Of heeft hij een punt? Voordat we daarin duiken, eerst een rondje langs de wereld. Journalisten van Reuters spitten meer dan honderd Chinese militaire documenten door en ontdekten dat China serieus onderzoekt hoe humanoids op het slagveld ingezet kunnen worden — denk aan robots die samen met soldaten gebouwen leegvegen. Nog geen paniek: de stroomvoorziening en trainingsdata schieten daarvoor flink tekort. Wel relevant: volgens Bank of America kwam 95% van alle geleverde humanoids uit China.

In Europa haalde Mistral € 3 miljard op bij onder meer Samsung en het Scaleup Europe Fund, goed voor een waardering van € 21 miljard — fors, maar een factor dertig à veertig kleiner dan de laatste rondes van OpenAI en Anthropic. In Kenia stortte de industrie in van duizenden mensen die essays schreven voor westerse studenten; een deel verdient nu geld als humanizer, die AI-geschreven essays menselijker maakt zodat detectiesoftware ze niet herkent. Verder gaan er geruchten over gesprekken tussen de VS en China over AI-veiligheid — een goede zaak, vindt Bert: je wilt diplomatieke kanalen hebben om ooit gezamenlijk het tempo te kunnen matigen. En op de arbeidsmarkt ontstond een AI doom loop: sollicitanten tunen hun cv met AI, werkgevers zetten AI-agents in om te filteren, en zo maken beide kanten elkaars probleem groter.

"AGI has arrived" — maar wat is AGI eigenlijk?

Jensen Huang riep het na de lancering van GPT-6 Astra, en hij is niet de enige. Bert legt uit waarom: Astra en Fable hebben een duidelijke stap gemaakt in generalisatie, de G van AGI. Op de ARC-AGI-3 benchmark — interactieve puzzelspellen die meten hoe snel een model nieuwe vaardigheden leert — scoorde Astra 62,7% in het standaard harnas en maar liefst 99,9% met een speciaal harnas, waarbij het in 96% van de opdrachten zelfs efficiënter was dan mensen. Ter vergelijking: Opus 4.8 haalde 1,5%. Grondlegger François Chollet noemt het een grote doorbraak, al claimt hij nadrukkelijk niet dat Astra AGI is. Interessant detail: Astra bouwt voor zichzelf een symbolic world model per spel — een mooi voorbeeld van het huwelijk tussen symbolisten en connectionisten, oftewel neurosymbolische AI.

Peter neemt ons mee langs de definities, want daar zit het probleem: AGI heeft er geen breed geaccepteerde. Aan het strenge uiteinde staat de Einstein-test van Demis Hassabis: geef een model alleen de kennis die Einstein rond 1900 had en kijk of het zelf op de relativiteitstheorie komt. Hassabis zegt dan ook nee op de vraag of AGI er al is, maar mikt zelf wel op 2030. Aan het andere uiteinde staat Huang, voor wie het simpelweg draait om AI die nuttig, productief en winstgevend werk doet. Daartussen zit OpenAI's oprichtingsdefinitie: systemen die mensen overtreffen in het meeste economisch waardevolle werk. Onze conclusie: per definitie begint het antwoord langzaam ja te worden, en uiteindelijk vegen steeds slimmere modellen alle definities mee.

Bert werkte zelf een week met Astra en is niet onverdeeld enthousiast: voor agentic work en programmeren zit er geen speld tussen te krijgen, maar in onderzoekende gesprekken vindt hij het model lauwer en minder sprankelend dan 5.6 Sol — "beaten into submission". Wel indrukwekkend: op de no-CoT time horizon ging Astra van 3,6 naar 30,9 minuten werk in één denkstap. Les daaruit, met Stephen Heidel: "Measure your costs per task, not per token."

Gekke benchmarks en een koraal van Bach

Naast Simon Willisons pelikaan op een fiets en Ethan Mollicks otter in een vliegtuig heeft Bert een nieuwe favoriet: de Bach-benchmark van Auggie (The Augmented Fifth). De prompt: schrijf in LilyPond een vierstemmig koraal in de stijl van Bach, in driekwartsmaat en g mineur. Astra levert volgens Auggie het beste resultaat tot nu toe: geen stemvoeringfouten, een Napolitaans sextakkoord en als eerste model doorgangsnoten.

Bert bouwde met Codex een pipeline om de partituren als audio te vergelijken, en dan hoor je de evolutie: 5.6 Sol klinkt rommeliger en staccato, Terra verliest de ritmische variatie, Luna wordt filmmuziek in plaats van een koraal, GPT 5.2 vertoont drift waarbij stemmen eindeloos omhoog kruipen, en GPT-4o uit mei 2024 klinkt alsof een peuter op een keyboard staat te hengsten. Bij Anthropic zie je hetzelfde patroon, en GLM en Mistral ontspoorden compleet. Andersom geredeneerd: in anderhalf à twee jaar is er muzikale integriteit, structuur en betekenis bijgekomen. Nog lang geen Bach — maar ook geen hengstende kleuter meer.

Praktische tip: geheugen tijdelijk uitschakelen

ChatGPT en Claude zijn de afgelopen maanden veel slimmer geworden in het onthouden van eerdere gesprekken. Handig, maar soms wil je juist een onbesmet gesprek. Peter zette tot nu toe meerdere vensters tegelijk klaar; Bert zocht het netter uit. Optie één: een temporary chat (ChatGPT) of incognito (Claude), waarbij ChatGPT zo'n gesprek nu ook kan opslaan. Optie twee: projecten. Bij Claude zijn die altijd al geïsoleerd, en ChatGPT heeft nu project-only memory. Handig bij bijvoorbeeld gevoelige gezondheidsvragen die je gescheiden wilt houden van de rest.

Turing Line: eindelijk aangekomen op Turing Station

Peter neemt ons mee naar het station waar alle eerdere haltes samenkomen: Alan Turing, de naamgever van onze podcast. In 1950 veegde hij de eindeloze discussie "kunnen machines denken?" van tafel met een publicatie in Mind: kijk niet naar de binnenkant, maar naar het gedrag. Zijn imitatiespel werd wereldberoemd als de Turingtest — pas in 2014 hield chatbot Eugene Goostman een derde van de juryleden voor de gek, al werd daar meteen over doorgekibbeld.

Maar Turings status rust op meer. Al in 1936 bewees hij op papier het bestaan van een universele computer: één lege machine die elke denkbare machine kan simuleren, zolang je de juiste instructies geeft — software dus. En datzelfde Mind-artikel beschreef ook child machines: machines die leren als een kind, door feedback. Hoogleraar Stephen Muggleton noemt het het eerste grote academische paper over machine learning. Turing was bovendien een wonderkind: op zijn vijftiende schreef hij voor zijn moeder een uitleg van Einsteins ideeën, inclusief een wet die Einstein zelf niet had uitgeschreven. Zijn levenseinde kent een zwart randje: chemische castratie door de overheid en een dood op 41-jarige leeftijd door cyanidevergiftiging. Volgende keer stappen we over naar de Intelligence Line, richting Dartmouth Station: de officiële geboorte van de term Artificial Intelligence.

Bronnen

In het kort

“AGI has arrived”

Gekke benchmarks & een koraal van Bach

Timestamps

[00:00:00] - Intro
[00:06:45] - In het kort
[00:17:00] - “AGI has arrived”
[00:46:00] - Gekke benchmarks & een koraal van Bach
[01:02:00] - Praktische tip: Geheugen tijdelijk uitschakelen
[01:11:00] - Turing Line - Turing Station