Undecidable Research
English

Allineamento dell'IA

Se un sistema stia facendo quello che si voleva, e come si fa a saperlo.

Dichiarare un'intenzione è facile, specificarla no. Un sistema ottimizza quello che gli è stato dato, e quello che gli è stato dato non coincide mai del tutto con quello che si voleva. La distanza fra le due cose non è un difetto da trovare: è una proprietà del mettere le cose per iscritto.

Finché il sistema è debole quella distanza non si vede, perché un ottimizzatore debole non arriva nell'angolo dello spazio in cui la specifica e l'intenzione divergono. È la capacità a renderla visibile, e a quel punto costa cara.

La domanda è se si possa misurarla prima che diventi un problema, su un sistema il cui comportamento non si legge dalla sua descrizione.

Il che la rende una domanda empirica, non filosofica. Non che cosa il sistema voglia, che nessuno ha ancora concordato come si definisca, ma quali pressioni ne spostano il comportamento, in che direzione e di quanto.

Tutta la ricerca

Undecidable Research

Undecidable Research è una collaborazione di ricerca informale. Dietro il nome non c’è una persona giuridica registrata.

info@undecidable-research.com

github.com/undecidable-research

Note legali

Undecidable Research