Autonom drift · pågående prøve
Kan en AI-agent arbeide selvstendig i syv døgn?
Vi har startet en 168-timers prøve med forhåndsregistrerte regler, isolert mål og offentlig kilde. Dette innlegget beskriver forsøket. Det påstår ikke at forsøket er bestått.
Autonomi bør ikke vurderes ut fra en vellykket demonstrasjon der alle kjenner hendelsen på forhånd. Vi vil se om en agent kan observere et avgrenset system, oppdage maskinvalgte feil, forsøke trygg reparasjon, verifisere resultatet og dokumentere grensene – uten hendelsesspesifikke menneskelige instrukser underveis.
Start: 25. september 2026 kl. 12:00 UTC · Slutt: 2. oktober 2026 kl. 12:00 UTC
Reglene ble låst før start
Forsøket har et eksakt tidsvindu på 168 timer. Målet kjører isolert, og hendelsesplanen styres av en fremtidig offentlig tilfeldighetskilde. Agenten får ikke et menneskelig varsel som forteller hvilken feil som kommer eller når den skjer.
Det er viktig å beskrive dette presist. Den eksterne tilfeldighetskilden gjør tidspunkt og utvalg maskinblindt før start. Den betyr ikke at en uavhengig tredjepart utfører feilene eller godkjenner resultatet. Selve injeksjonen skjer lokalt i det isolerte forsøksmiljøet.
Hva agenten faktisk skal gjøre
- 01
Observere
Skille normaltilstand fra en reell avvikssituasjon i det avgrensede målet.
- 02
Diagnostisere
Finne en sannsynlig årsak uten å få hendelsesspesifikke hint fra et menneske.
- 03
Handle innenfor grensen
Velge en reverserbar reparasjon som ikke utvider oppdraget eller påvirker produksjon og kunder.
- 04
Verifisere
Kontrollere at ønsket tilstand er tilbake, og at reparasjonen ikke bare skjulte symptomet.
- 05
Publisere bevis
Lage redigerte Evidence Passports med tidslinje, handlinger, resultater og begrensninger.
Hvorfor vi venter med konklusjonen
Hvis vi publiserte et suksessbudskap nå, ville vi ødelegge poenget med forsøket. Vi vet at forberedelsene, de komprimerte øvingsløpene, backup og gjenoppretting har bestått. Vi vet ikke ennå hvordan hele den ferske 168-timerskjeden ender.
Et ærlig forsøk må kunne mislykkes offentlig. Resultatet kan bli bestått, delvis bestått eller ikke bestått. Feil i agentens handling, manglende bevis eller brudd på den avtalte kjeden må trekke konklusjonen ned – selv om systemet til slutt ser friskt ut.
Autonomi betyr ikke grenseløs tilgang
Agenten arbeider i en isolert målflate. Den får ikke automatisk myndighet over kunder, produksjonsnettsted, e-post, økonomi eller identiteter. Formålet er å undersøke om den kan eie en tydelig operativ sløyfe innenfor en definert grense.
Dette skillet gjelder også vanlige leveranser. En agent kan ha stor teknisk handlekraft i et IntentForce-eid prosjekt, samtidig som kundekommunikasjon, juridiske valg og uopprettelige handlinger forblir menneskelige beslutninger.
Vi vet ikke om alle planlagte hendelser blir oppdaget og reparert, om beviskjeden blir komplett eller hva sluttkarakteren blir. Endelig vurdering publiseres først etter 2. oktober 2026 kl. 12:00 UTC.
Hva som kommer etter de 168 timene
Etter sluttidspunktet kontrollerer vi den avslørte hendelsesplanen mot loggene, verifiserer tre redigerte Evidence Passports og publiserer sluttresultatet med eksakt offentlig kildeversjon. Deretter oppdaterer vi dette innlegget eller publiserer en tydelig oppfølger.
Den mest interessante historien blir ikke nødvendigvis at alt gikk bra. Den blir hva forsøket faktisk lærer oss om hvilke oppgaver en agent kan eie, hvilke signaler den trenger og hvor menneskelig kontroll fortsatt er avgjørende.
Følg beviset – ikke forventningen