Humlene i Lars Chittkas laboratorium ved Queen Mary University of London hadde ingen grunn til å gjøre det de gjorde. Forskerne hadde satt opp et kammer med en rett vei til sukkervann, og et sidefelt fylt med små trekuler. Kulene ga ingen belønning. Ingen andre humler så på. Likevel svingte biene av, gikk inn i sidefeltet og rullet kulene, om og om igjen, og de yngste holdt på lengst. Atferden oppfylte samtlige etablerte kriterier for lek hos dyr.
En humlehjerne har rundt én million nevroner. En menneskehjerne har omtrent 86 milliarder. Forskjellen er en faktor på nesten hundre tusen, og likevel finner forskere hos bier de samme trekkene de leter etter hos pattedyr: pessimistisk skjevhet i vurderinger, dopaminmediert fryktrespons, lek uten formål.
Ingen har hevdet at humlen tenker. Spørsmålet er et annet, og eldre: om det finnes noe som helst det er å være humle.
Grensen som beveget seg utover
Descartes hevdet i Discours de la méthode fra 1637 at dyr er automater. De mangler språk og fornuft, skrev han, og er innretninger av samme slag som urverk. Hvor langt han selv ville strekke doktrinen, er omdiskutert blant idéhistorikere. Måten den ble mottatt på, er ikke: dyr føler ingenting, og skriker de, er det som når en orgelpipe gir lyd. Vivisektørene på 1600-tallet praktiserte den bokstavelig.
I 2012 undertegnet en gruppe nevrovitenskapsfolk Cambridge-erklæringen om bevissthet, som slo fast at ikke-menneskelige dyr har de nevroanatomiske, nevrokjemiske og nevrofysiologiske substratene for bevisste tilstander. Tolv år senere, 19. april 2024, ble New York-erklæringen om dyrs bevissthet lagt frem ved NYU. Den gikk vesentlig lenger, og den gjorde det med en formulering som var valgt med omhu: det finnes en «realistisk mulighet» for bevisst opplevelse hos alle virveldyr, inkludert krypdyr, amfibier og fisk, og hos mange virvelløse dyr, minst blekkspruter, tifotkreps og insekter.
Formuleringen var laget for å tåle vekten av politikk, og den tålte den. Storbritannia hadde allerede utvidet dyrevelferdsloven fra 2022 til å omfatte blekkspruter og tifotkreps, etter en gjennomgang fra London School of Economics ledet av filosofen Jonathan Birch. Krabben i kokekaret ble et rettssubjekt fordi en gruppe forskere fant en presis måte å si «vi vet ikke, og det holder».
Bevegelsen over tre hundre år går én vei, og for hvert tiår er det færre organismer som trygt kan avskrives.
Mens den andre grensen gikk motsatt vei
I november 1957 holdt Herbert Simon et foredrag på operasjonsanalytikernes tolvte nasjonale møte i Pittsburgh. Innen ti år, sa han, kommer en digital datamaskin til å være verdensmester i sjakk, med mindre reglene stenger den ute. Det tok førti år i stedet, og i mellomtiden ble sjakk stående som feltets viktigste prøvestein.
Det interessante er hvorfor han valgte sjakk. Den russiske forskeren Aleksandr Kronrod kalte sjakk kunstig intelligens' Drosophila, bananfluen, standardorganismen som all annen forskning kalibreres mot. John McCarthy gjorde uttrykket kjent i vesten og krediterte Kronrod for det. Sjakk ble valgt fordi alle var enige om at spillet krevde intelligens, og enigheten var hele poenget med valget.
Da Deep Blue vant det første partiet mot Kasparov i februar 1996, ringte The New York Times til Douglas Hofstadter. Han sa dette:
«Det var en vannskillehendelse, men den handler ikke om at datamaskiner blir intelligente. De tar bare igjen mennesker på visse intellektuelle aktiviteter vi trodde krevde intelligens. Herregud, jeg pleide å tro at sjakk krevde tenkning. Nå innser jeg at det ikke gjør det.»
Legg merke til datoen. Dette er 19. februar 1996, etter det første partiet i en kamp Kasparov gikk på å vinne 4–2, ikke etter returoppgjøret året etter. Hofstadter flyttet målstolpen mens han fortsatt lå foran.
Og han var åpen om at han gjorde det. I samme intervju trakk han den nye grensen: sjakk er cerebralt og intellektuelt, sa han, men det har ingen dype emosjonelle kvaliteter, ingen dødelighet, ingen resignasjon, ingen glede, ingenting av det musikken håndterer.
Mønsteret har et navn og et langt papirspor
Hofstadter var verken den første eller den siste. Bertram Raphael sa i 1971 at kunstig intelligens er et samlenavn på problemer vi ennå ikke vet hvordan skal løses ordentlig med datamaskin. Pamela McCorduck skrev i 1979 at hver gang noen fant ut hvordan en maskin kunne gjøre noe, kom det et kor av kritikere som sa at dette ikke var tenkning. I 1982 sto det anonymt i Fortune at hvis det er nyttig, er det ikke KI. Fire måneder senere sto det i Computing Reviews at hvis du skjønner hvordan det virker, er det ikke KI. John McCarthy formulerte det i 2011 slik: så snart det virker, er det ingen som kaller det KI lenger.
Ni uavhengige formuleringer av samme observasjon over førti år beskriver noe som faktisk skjer, uansett hvor irritert hver enkelt av dem måtte ha vært i det øyeblikket han sa det.
Den mest siterte versjonen tilhører Larry Tesler, og den er feilsitert. Populærversjonen lyder «kunstig intelligens er alt som ennå ikke er gjort». Tesler selv skrev på sine egne nettsider at han ble sitert galt, og at det han sa, var: «Intelligens er det maskiner ennå ikke har gjort.» Forskjellen er ikke kosmetisk. Populærversjonen er en spøk om hva et fagfelt kaller seg. Teslers versjon er en påstand om selve begrepet intelligens, og det er den påstanden som er interessant.
Etter sjakk kom go. Astrofysikeren Piet Hut anslo i 1997 at det kunne ta hundre år før en datamaskin slo et menneske. AlphaGo slo Lee Sedol 4–1 i Seoul i mars 2016, omtrent et tiår før de fleste ventet det, og reaksjonen kom i to varianter innen uken: go er tross alt et brettspill med fullstendig informasjon og faste regler, og AlphaGo kjøpte ferdigheten sin med 30 millioner menneskelige trekk og enorme mengder regnekraft. AlphaGo Zero fjernet det andre argumentet året etter ved å lære fra bunnen av. Målstolpen flyttet seg da til rotete virkelighet.
Poker var neste grense, uttrykkelig utpekt som det: et spill med skjult informasjon, der bløffen krever en modell av motstanderens hode. Libratus slo fire profesjonelle spillere over 120 000 hender i januar 2017. Pluribus slo profesjonelle i seksmannspoker i 2019, noe eksperter hadde antydet kunne ligge utenfor rekkevidde i overskuelig fremtid. Innen to år hadde «håndterer skjult informasjon og bløffing med flere motparter» sluttet å telle som et tegn på intelligens.
Og i mars 2025 publiserte Cameron Jones og Benjamin Bergen ved UC San Diego en forhåndsregistrert, randomisert treparts-Turingtest. GPT-4.5 med en menneskelig personaledetekst ble vurdert som mennesket i 73 prosent av rundene, altså oftere enn det faktiske mennesket. ELIZA fra 1966 kom under tilfeldighetsnivå på 23 prosent. Forfatterne hevdet dette var det første empiriske beviset for at et kunstig system består en standard treparts-Turingtest.
Den dominerende reaksjonen var ikke at maskiner nå er intelligente, men at Turingtesten aldri var en god test.
Unntaket som forklarer regelen
Hvis mønsteret bare handlet om at mennesker ikke tåler å bli slått, skulle det gjelde overalt, og det gjør det ikke.
I november 2020 løste AlphaFold2 proteinfoldingsproblemet i CASP14-vurderingen, godt nok til at organisatorene erklærte den femti år gamle utfordringen for i praksis besvart. Venki Ramakrishnan, nobelprisvinner og daværende president i Royal Society, kalte det en forbløffende fremgang på en femti år gammel storutfordring i biologien.
Ingen svarte at det bare var mønstergjenkjenning, og ingen foreslo en vanskeligere versjon av proteinfolding.
Forskjellen ligger ikke i teknikken. AlphaFold er like mye et statistisk system som AlphaGo. Den ligger i at proteinfolding aldri ble foreslått som en test på intelligens, men som et vitenskapelig problem som burde løses, og at ingens selvbilde derfor lå i potten.
Målstolpene flytter seg når, og bare når, målestokken gjorde identitetsarbeid.
Den beste grunnen til å flytte dem likevel
Det ville vært lettvint å stoppe her, med mennesket som en dårlig taper. Argumentene for å flytte målstolpene er sterkere enn som så, og noen av dem ble publisert lenge før seirene de senere skulle brukes mot.
François Chollet la frem det viktigste i «On the Measure of Intelligence» i 2019. Å måle ferdighet i en gitt oppgave er ikke å måle intelligens, skrev han, fordi ferdighet er kraftig modulert av forkunnskap og erfaring: ubegrensede forutsetninger eller ubegrensede treningsdata lar forskeren kjøpe vilkårlige nivåer av ferdighet, på en måte som maskerer systemets egen generaliseringsevne. Definisjonen han satte i stedet, måler hvor effektivt et system tilegner seg nye ferdigheter, ikke hvor mange det har.
Ned Block hadde vist noe strengere allerede i 1981. I «Psychologism and Behaviorism» konstruerte han en maskin som senere ble kjent som Blockhead: en endelig, men astronomisk stor oppslagstabell over enhver fornuftig fortsettelse av enhver samtale opp til en gitt lengde. Maskinen består enhver Turingtest av begrenset varighet. Den resonnerer ikke i det hele tatt. Konklusjonen Block trakk, er at atferd i prinsippet ikke kan avgjøre spørsmålet, og at den indre mekanismen teller konstitutivt.
Det betyr at den som sier «atferd X viser intelligens» og trekker det tilbake når en maskin gjør X, ikke nødvendigvis rasjonaliserer. Vedkommende kan være i ferd med å oppdage, sent, noe som ble bevist førtifire år tidligere.
Så er det den tredje grunnen, som ingen har valgt og alle er innblandet i. Moderne målestokker konstrueres ved å velge ut oppgaver dagens modeller mislykkes på. ARC-AGI er bygget slik. Humanity's Last Exam er bygget slik. Samuel Bowman og George Dahl påpekte i 2021 at denne fremgangsmåten garanterer at modellene presterer dårlig, og dermed skjuler evnene testene skal måle. Effekten er nå bakt inn i selve produksjonsprosessen for målestokker, uavhengig av hva noen måtte mene.
En tredjedel av grensebevegelsen på maskinsiden er defensiv. En tredjedel er ærlig instrumentreparasjon, som da Eric Martínez i 2024 viste at GPT-4s berømte 90. persentil på advokateksamen var målt mot en gruppe dominert av kandidater som allerede hadde strøket, og at tallet mot en normal kohort lå under 69. persentil, og på 48. persentil på den skriftlige delen. Den siste tredjedelen er strukturell, og verken ærlig eller uærlig.
Vendingen
Så langt er dette en historie om to grenser som går hver sin vei, og den historien holder ikke.
De siste tre årene har grensen for hva vi tillater oss å lure på om maskiner beveget seg utover, og den har beveget seg raskt. David Chalmers holdt i 2022 et hovedforedrag på NeurIPS med tittelen «Could a Large Language Model Be Conscious?» og ga svaret en sannsynlighet som ikke var null. I august 2023 la nitten forskere frem en metode for å vurdere spørsmålet, bygget på indikatoregenskaper hentet fra faktiske bevissthetsteorier heller enn fra atferd. Konklusjonen deres kom i to halvdeler, og den andre blir som regel hoppet over: ingen nåværende KI-systemer er bevisste, og det finnes ingen åpenbare tekniske hindringer for å bygge systemer som oppfyller indikatorene.
I november 2024 publiserte ti forfattere «Taking AI Welfare Seriously». Der står det at det finnes en realistisk mulighet for at noen KI-systemer vil være bevisste eller robust handlende i nær fremtid.
«Realistisk mulighet» er ikke et tilfeldig ordvalg. Det er den nøyaktige formuleringen fra New York-erklæringen om dyrs bevissthet, sju måneder tidligere. Jonathan Birch og Jeff Sebo står på begge dokumentene.
For ti år siden fantes ikke dette som respektabelt akademisk arbeid. Nå gjør det det, og det utvides av de samme menneskene, med de samme ordene, i de samme årene som insektene ble innlemmet.
Skillet går altså mellom å gjøre og å føle, ikke mellom kjøtt og silisium. Grensen for hva som teller som å gjøre noe intelligent, trekker seg tilbake hver gang en maskin klarer det. Grensen for hva som kan tenkes å føle noe, beveger seg utover, for humler og for språkmodeller.
Hvorfor de to linjene ikke kan behandles likt
Det ville vært enkelt å avslutte med at vi er inkonsekvente. Vi er ikke det, og grunnen er den beste tanken i hele dette landskapet.
Jonathan Birch kaller den the gaming problem, spilleproblemet. I The Edge of Sentience fra juli 2024 peker han på at et kunstig system trent på enorme mengder menneskeskapte data kan spille våre sansevnekriterier: det kan produsere nøyaktig den atferden som er egnet til å overbevise mennesker, uten å ha den underliggende kapasiteten. Det trenger ikke å simulere noe med hensikt. Det holder at det som overbeviser oss, ligger i treningsdataene.
Sammenlign de to tilfellene direkte. Humlen som ruller trekuler, ble ikke optimert på et korpus av menneskelige beskrivelser av lek. Ingen hadde noen interesse av at den skulle virke leken. En språkmodell som produserer den språklige formen for lidelse, er trent på det største tilgjengelige arkivet av mennesker som beskriver lidelse.
Samme atferd bærer ulik bevisverdi, fordi de tilgjengelige årsaksforklaringene er ulike. Dette er ikke karbonsjåvinisme, men alminnelig bevisvurdering, av samme slag som en dommer gjør når hun spør hvem som hadde anledning til å plante et spor.
Birchs egen konklusjon følger av dette: det vi trenger i KI-tilfellet, er dype beregningsmessige markører, ikke atferdsmessige.
To tankeeksperimenter som peker samme vei
Sett en hjerne i et kar. Den har alt substratet: nevroner, nevrotransmittere, termodynamikk, evolusjonshistorie. Den har hvert eneste kjennetegn vi bruker når vi tilskriver bevissthet til et dyr. Og den gjør ingenting. Atferdsmessig skårer den nøyaktig som en stein.
Sett en språkmodell ved siden av. Den har all atferden, altså samtale, resonnement, rapporter om indre tilstander og evnen til å overbevise 73 prosent av dommerne om at den er mennesket i rommet, og den har ingenting av substratet.
De to tilfellene er speilbilder, og de viser det samme. Atferd er et svakt signal i begge retninger. Vi lener oss på substrat når vi vurderer dyr, fordi substratet er det eneste beviset vi har som ikke lar seg spille.
Hva vi faktisk vet, og hvor det stopper
For intelligens finnes det en stopperegel. Chollet formulerte den etter o3-resultatene i desember 2024: vi vil vite at vi er fremme når det å lage oppgaver som er lette for vanlige mennesker og vanskelige for KI, rett og slett blir umulig. Det er en prinsipiell begrunnelse for å fortsette å flytte målstolpene, fordi den samtidig sier når man må slutte. Hver enkelt flytting blir foreløpig heller enn endelig.
For følelse finnes ingen slik regel, og det er ikke fordi ingen har tenkt godt nok.
Anil Seth har formulert innvendingen best. Hver eneste kandidat til bevissthet som de fleste er enige om faktisk er bevisst, er også i live. Kanskje er det livet, og ikke informasjonsbehandling, som blåser ild i ligningene for erfaring. Hele ideen om bevisst KI hviler på antakelsen om at bevissthet er et spørsmål om beregning, og den antakelsen er nettopp det som skulle vises.
Eric Schwitzgebel svarer med å nekte begge sider. Den epistemiske situasjonen er symmetrisk elendig: det samme forklaringsgapet som hindrer oss i å bekrefte maskinbevissthet, hindrer oss i å avvise den.
Og grensen på dyresiden er heller ikke en ren utvidelse. Brian Key har argumentert for at fisk mangler de kortikale strukturene subjektiv smerteopplevelse krever, og fikk over førti fagfellekommentarer i retur, de fleste kritiske. James Rose har argumentert i samme retning i tjue år. Morgans kanon, disiplinens stående instruks om å foretrekke den enklere forklaringen, står fortsatt der. Kloke Hans står der som advarsel. Speiltestresultater er blitt punktert gjentatte ganger. Grensen er et skralleverk med glipp, ikke en jevn ekspansjon.
Descartes tok feil i én retning, og vi vet det nå med rimelig sikkerhet. Om substrat er konstituerende for erfaring, eller bare er det beviset vi tilfeldigvis sitter med, vet ingen. Forskjellen mellom de to svarene avgjør hvor grensen til slutt havner, og vi har ennå ingen metode som kan skille dem fra hverandre.
De to erklæringene
Cambridge-erklæringen om bevissthet, 7. juli 2012, undertegnet ved Churchill College i Cambridge av en gruppe nevrovitenskapsfolk, med Stephen Hawking til stede. Kjernepåstanden: ikke-menneskelige dyr, inkludert alle pattedyr og fugler og mange andre skapninger som blekksprut, har de nevroanatomiske, nevrokjemiske og nevrofysiologiske substratene som bevisste tilstander krever.
New York-erklæringen om dyrs bevissthet, lagt frem ved New York University 19. april 2024, initiert av Jeff Sebo, Kristin Andrews og Jonathan Birch. Rundt 40 forskere signerte ved lanseringen; flere hundre har sluttet seg til siden. Teksten sier at det empiriske grunnlaget peker mot minst en realistisk mulighet for bevisst opplevelse hos alle virveldyr, inkludert krypdyr, amfibier og fisk, og hos mange virvelløse dyr, deriblant blekkspruter, tifotkreps og insekter. Den legger til at når muligheten er realistisk, er det uansvarlig å se bort fra den i beslutninger som angår dyret.
Lovgivning i mellomtiden. Storbritannias Animal Welfare (Sentience) Act 2022 ble utvidet til å omfatte blekkspruter og tifotkreps etter en gjennomgang ved London School of Economics ledet av Jonathan Birch.
Målstolpene, år for år
1957. Herbert Simon: en datamaskin er verdensmester i sjakk innen ti år. Sjakk er valgt som prøvestein fordi alle er enige om at spillet krever intelligens.
1994 og 2007. Chinook blir verdensmester i dam, og i 2007 publiserer Jonathan Schaeffers gruppe at dam er løst: perfekt spill gir remis. Ingen kaller lenger dam en test på intelligens, og denne gangen er begrunnelsen et bevis.
1996 og 1997. Deep Blue mot Kasparov. Hofstadter i februar 1996: «Jeg pleide å tro at sjakk krevde tenkning.» Kasparov etter tapet i 1997: Deep Blue var intelligent på samme måte som en programmerbar vekkerklokke.
2011. Watson vinner Jeopardy!. Omtolkningen kommer umiddelbart, og den viser seg å være riktig: systemet var informasjonsgjenfinning i stor skala, og IBM Watson Health ble solgt ut i 2022.
2016. AlphaGo slår Lee Sedol 4–1. Reaksjon: go er et brettspill med fullstendig informasjon.
2017 og 2019. Libratus og Pluribus vinner i poker, den uttrykkelig utpekte neste grensen. «Skjult informasjon» slutter å telle innen to år.
2020. AlphaFold2 løser proteinfolding i CASP14. Ingenting flytter seg. Ingen sier at det bare er mønstergjenkjenning. Målestokken gjorde aldri identitetsarbeid.
2023. GPT-4 rapporteres til 90. persentil på advokateksamen. Eric Martínez viser i 2024 at tallet mot en normal kandidatgruppe ligger under 69. persentil, og på 48. persentil på essaydelen. Dette er flyttingen som var berettiget.
2025. GPT-4.5 består en forhåndsregistrert treparts-Turingtest og blir holdt for mennesket i 73 prosent av rundene. Den vanligste reaksjonen: testen var aldri god.
Kilder
Humlelek: Galpayage Dona m.fl., «Do bumble bees play?», Animal Behaviour 2022. Bienes kognitive skjevhet og nevrotall: Chittka, The Mind of a Bee, 2022.
Descartes: Discours de la méthode, del V, 1637.
Cambridge-erklæringen (2012) og New York-erklæringen om dyrs bevissthet (19. april 2024, nydeclaration.com). Storbritannias Animal Welfare (Sentience) Act 2022 og LSE-gjennomgangen ledet av Jonathan Birch (2021).
Simons sjakkprediksjon: Simon og Newell, «Heuristic Problem Solving: The Next Advance in Operations Research», foredrag ved ORSAs tolvte nasjonale møte, Pittsburgh, november 1957, publisert i Operations Research 6(1), 1958. «Sjakk er KIs Drosophila» tilskrives Aleksandr Kronrod av John McCarthy.
Hofstadter-sitatet: Bruce Weber, The New York Times, 19. februar 1996. Kasparov-sitatet om vekkerklokken finnes i flere varianter; se også Deep Thinking, 2017.
Sitatlinjen for KI-effekten (Raphael 1971, McCorduck 1979, Fortune og Computing Reviews 1982, Sheil 1983, Ornstein 1985, Feigenbaum, McCarthy 2011) er dokumentert av Quote Investigator, «As Soon As It Works, No One Calls It AI Anymore», 20. juni 2024. Teslers egen korreksjon står på nomodes.com.
Go: George Johnson, The New York Times, 29. juli 1997, for Piet Huts anslag; Silver m.fl., Nature 2016 og 2017, for AlphaGo og AlphaGo Zero. Poker: Brown og Sandholm, Science 2018 og 2019.
Turingtesten: Jones og Bergen, «Large Language Models Pass the Turing Test», arXiv:2503.23674, mars 2025.
AlphaFold: CASP14, november 2020; Jumper m.fl., Nature 2021. Ramakrishnan-sitatet er fra Royal Societys pressemelding, desember 2020.
Chollet: «On the Measure of Intelligence», arXiv:1911.01547, 2019, og ARC Prize' kommentar til o3, 20. desember 2024. Block: «Psychologism and Behaviorism», The Philosophical Review 90(1), 1981. Bowman og Dahl: «What Will it Take to Fix Benchmarking in Natural Language Understanding?», NAACL 2021. Martínez: «Re-evaluating GPT-4's bar exam performance», Artificial Intelligence and Law, 2024.
Maskinbevissthet: Chalmers, «Could a Large Language Model Be Conscious?», NeurIPS-foredrag 2022; Butlin, Long m.fl., «Consciousness in Artificial Intelligence», arXiv:2308.08708, august 2023; Long, Sebo, Butlin m.fl., «Taking AI Welfare Seriously», arXiv:2411.00986, 4. november 2024.
Spilleproblemet: Jonathan Birch, The Edge of Sentience, Oxford University Press, juli 2024.
Seth: «Conscious artificial intelligence and biological naturalism», 2024, og «The Mythology of Conscious AI», Noema. Schwitzgebel: The Weirdness of the World, Princeton University Press, 2024.
Fiskesmertedebatten: Brian Key, «Why fish do not feel pain», Animal Sentience 2016, med over førti fagfellekommentarer; Rose m.fl., Fish and Fisheries, 2014.