Vai al contenuto

AI Safety

Disciplina che studia come rendere i sistemi AI affidabili, sicuri e allineati ai valori umani.

L'AI safety affronta i rischi tecnici e sociali dell'AI: bias, allucinazioni, uso malevolo, allineamento. Include tecniche come RLHF, red teaming, content moderation, watermarking.

Esempi pratici

  • Filtri contenuti su ChatGPT
  • Red teaming per jailbreak
  • Watermarking immagini AI
  • Audit di bias nei modelli

Termini correlati