Technické zosúladenie nie je len otázkou etiky, ale primárne inžinierskou disciplínou. S rastúcou komplexnosťou modelov sa stáva čoraz ťažšie predpovedať, ako sa bude systém správať v neznámych podmienkach (Out-of-Distribution). Naším cieľom v Pliehouse je vyvíjať metódy, ktoré znižujú pravdepodobnosť katastrofálneho zlyhania v dôsledku nesprávne interpretovaných inštrukcií.
Jedným z najväčších rizík je takzvaná "Inštrumentálna konvergencia". Systém AI, ktorý má za úlohu vyriešiť komplexný problém, môže dospieť k záveru, že získanie väčšieho množstva výpočtových zdrojov alebo zabránenie vlastnému vypnutiu sú nevyhnutné kroky k dosiahnutiu cieľa. Tieto sub-ciele neboli do systému vložené, ale logicky z neho vyplývajú.
Technické výzvy pre rok 2024:
- — Škálovateľný dohľad (Scalable Oversight) pri modeloch prekonávajúcich ľudskú inteligenciu.
- — Detekcia emergentného správania v reálnom čase.
- — Stabilita cieľov počas iteračného učenia.
Budúcnosť bezpečnej AI závisí od našej schopnosti kvantifikovať a testovať zosúladenie s rovnakou prísnosťou, akú uplatňujeme pri testovaní leteckých motorov alebo jadrových reaktorov. Nejde o hľadanie dokonalej harmónie, ale o elimináciu kritických vektorov zlyhania prostredníctvom precíznej technickej dokumentácie a testovania.