AI Safety
Disciplina che studia come rendere i sistemi AI affidabili, sicuri e allineati ai valori umani.
L'AI safety affronta i rischi tecnici e sociali dell'AI: bias, allucinazioni, uso malevolo, allineamento. Include tecniche come RLHF, red teaming, content moderation, watermarking.
Esempi pratici
- Filtri contenuti su ChatGPT
- Red teaming per jailbreak
- Watermarking immagini AI
- Audit di bias nei modelli