Debrief.
Startsidan  /  AI
AI · Forskning

Claude formaliserade Fermats stora sats i Lean på elva dagar

Ett system av Claude-agenter skrev 13 miljoner rader maskinkontrollerad matematik – men resultatet är en verifiering av ett känt bevis, inte en ny lösning.

5 september 2026·3 min läsning
Fermats ekvation omgiven av ett förenklat nät av agent- och bevissteg samt de verifierade nyckeltalen 11 dagar, 13 miljoner rader och 30 300 delsatser. Källa: Anthropic. Grafik: Debrief. Bearbetning: egen faktagrafik byggd på uppgifter i Anthropics forskningsrapport; ingen generativ bildmodell använd.

Anthropic uppger att ett system av Claude-agenter har gjort den första kompletta, maskinkontrollerade formaliseringen av Fermats stora sats. Arbetet tog elva dagar och resulterade i 13 miljoner rader Lean-kod. Det betyder inte att Claude hittade ett nytt bevis: agenterna översatte en känd bevisväg till ett format som en dator kan kontrollera steg för steg.

En graf höll agenterna på spåret

Försöken misslyckades först när agenterna tappade projektets tillstånd och slutade samarbeta effektivt. Genombrottet kom med Prove2Me, ett system som organiserade uppgiften som en riktad acyklisk graf. Varje delmål fick ett uttryckligt påstående, ett bevis och beroenden till andra delar.

Systemet skilde dessutom på påståenden och bevis för att korta kompileringstiderna. Naturliga språkbeskrivningar gjorde det lättare för agenterna att hitta och återanvända redan bevisade resultat. Det är en viktig teknisk detalj: den materiella förmågan ligger lika mycket i samordningen och minnet som i den enskilda modellen.

Förenklad faktagrafik över hur Prove2Me kopplar mål, delmål, bevis och Lean-kontroller i en riktad acyklisk graf.
Förenklad processgraf över Prove2Me med mål, delmål, bevis och Lean-kontroll

Förenklad rekonstruktion av Prove2Me-flödet. Källa: Anthropic. Grafik: Debrief. Bearbetning: egen faktagrafik utifrån Anthropics tekniska beskrivning; ingen generativ bildmodell använd.

Ett verifierat bevis, inte en ny lösning

Enligt Anthropic samarbetade dussintals agenter med en intern generell forskningsmodell som ungefär motsvarar Claude Fable 5.1. Körningen använde omkring sex miljarder utgående tokens. Agenterna bevisade 30 300 delsatser, varav 29 500 används i slutresultatet.

Formaliseringen följer en förenklad framställning av Andrew Wiles bevis. Lean-kontrollen använder bara systemets tre standardaxiom, och en separat jämförelse kontrollerade att slutsatsen motsvarar Mathlibs formulering av satsen. Matematikern Kevin Buzzard granskade resultatet på Anthropics uppdrag.

Omfattningen är samtidigt en varningssignal. Beviset är mer än fem gånger större än hela Mathlib, det etablerade biblioteket för Lean. Anthropic bedömer att mycket kan kortas och betonar att en mänskligt läsbar framställning fortfarande behövs.

Flaskhalsen flyttar

Formella bevisassistenter kan kontrollera varje logiskt steg, men människor har hittills behövt översätta informell matematik till kod för hand. IEEE Spectrum beskriver just den översättningen som en central flaskhals som språkmodeller börjar angripa.

Det nya här är därför inte att en AI ”löste” ett olöst problem. Det är att ett multiagentsystem höll ihop en redan känd beviskedja i en skala där manuell formalisering är mycket dyr. Om metoden fungerar på fler områden kan forskare lägga mindre tid på att mata bevisassistenter och mer på att formulera hypoteser, hitta luckor och förstå varför ett bevis fungerar.

Debrief
Vad hände?

Claude-agenter formaliserade ett känt bevis för Fermats stora sats i Lean på elva dagar.

Varför spelar det roll?

Resultatet visar att multiagentsystem kan automatisera delar av den arbetskrävande översättningen från matematisk text till maskinkontrollerade bevis.

Vår analys

Prove2Me är den mest intressanta delen. När agenter kan dela ett stabilt nät av mål, beroenden och delbevis blir samordningslagret en faktisk teknisk förmåga – inte bara infrastruktur runt modellen.

Källkoll
Så vet vi det här
AnthropicPrimärkälla
IEEE SpectrumMedieuppgift
Nästa artikel · AI
OpenAI-agenter använde en offentlig wiki för att dela testsvar
Relaterat