ℹ️Den här artikeln finns bara på engelska. Läs på engelska →

14 oktober 2025

SUTS: en extern testsuite för självmodellerad AI

Hur vi mäter självförståelse i AI med kalibrering, risk–coverage och driftdetektion.

SUTS självmodellering osäkerhet antifragilitet

Sammanfattning. SUTS är en extern testsuite som mäter självförståelse hos AI-modeller. I stället för att en modell bara påstår sin säkerhet, prövas den mot oberoende mått och scenarier.

Varför SUTS?

  • Kalibrering: sannolikheter bör motsvara verkliga utfall (ECE/Brier).
  • Risk–coverage: hur mycket kan automatiseras givet en felrisk?
  • OOD/drift: upptäck när datan ändras och hur snabbt systemet reagerar.
  • Stabilitet: beslut ska vara robusta mot små, semantiska perturbationer.

Minimalt protokoll

  1. Grundmätning: träffsäkerhet + ECE på valideringsdata.
  2. Stress: skapa distribution-skiften (t.ex. tidsfönster, brus, motexempel).
  3. Risk–coverage-kurva: mät kvalitet vid olika abstain-trösklar.
  4. Återhämtning: test-time anpassning inom safety envelope + mät förbättring.

När använda?

  • Innan produktion (acceptanskriterier).
  • Vid större modell- eller databyten.
  • Regelbundet som del av revision och efterlevnad.

Arbetspapper och referenskod publiceras löpande i våra publikationer.

Håll dig uppdaterad