Per fornire le migliori esperienze, utilizziamo tecnologie come i cookie per memorizzare e/o accedere alle informazioni del dispositivo. Il consenso a queste tecnologie ci permetterà di elaborare dati come il comportamento di navigazione o ID unici su questo sito. Non acconsentire o ritirare il consenso può influire negativamente su alcune caratteristiche e funzioni.
L'archiviazione tecnica o l'accesso sono strettamente necessari al fine legittimo di consentire l'uso di un servizio specifico esplicitamente richiesto dall'abbonato o dall'utente, o al solo scopo di effettuare la trasmissione di una comunicazione su una rete di comunicazione elettronica.
L'archiviazione tecnica o l'accesso sono necessari per lo scopo legittimo di memorizzare le preferenze che non sono richieste dall'abbonato o dall'utente.
L'archiviazione tecnica o l'accesso che viene utilizzato esclusivamente per scopi statistici.
L'archiviazione tecnica o l'accesso che viene utilizzato esclusivamente per scopi statistici anonimi. Senza un mandato di comparizione, una conformità volontaria da parte del vostro Fornitore di Servizi Internet, o ulteriori registrazioni da parte di terzi, le informazioni memorizzate o recuperate per questo scopo da sole non possono di solito essere utilizzate per l'identificazione.
L'archiviazione tecnica o l'accesso sono necessari per creare profili di utenti per inviare pubblicità, o per tracciare l'utente su un sito web o su diversi siti web per scopi di marketing simili.
Al solito, premetto che sono un ascoltatore di lunga data, quasi sempre in accordo coi vostri punti di vista, e che nel caso di specie condivido senz’altro che la multa del Garante sia non solo stupida ma soprattutto imbarazzante.
Non concordo però con le motivazioni.
È vero che normalmente i dati di training sono “distillati” nel modello. Ma sono stati dimostrati modi per far ripetere ai modelli i dati di training verbatim:
https://www.zdnet.com/article/chatgpt-can-leak-source-data-violate-privacy-says-googles-deepmind/
Ma in ogni caso, fosse anche impossibile riottenere rigurgitati i dati di training, ho tutto il diritto di sapere se/che le mie interazioni sono usate per training. Per esempio, se uso ChatGPT per aiutarmi ad analizzare un bug in un pezzo di codice della mia azienda, posso non volere che certi pattern/metodi/soluzioni che usiamo siano poi suggeriti all’esterno. Se sono un artista con un mio stile molto particolare ed unico, posso non volere che ChatGPT inizi a generare immagini che seguono il mio stile. Eccetera.
OpenAI paga lautamente per convenzioni con editori ecc., Reddit è ultimamente invaso da pubblicità che offrono compensi per qualche task di training per traduzione: i dati di training sono preziosi. È bene che la gente lo sappia e decida a ragion veduta se e come rendere disponibili i propri.
Infine, il robots.txt citato è per *limitare* le pagine accessibili ai crawler, non per permetterle (forse pensava ai sitemap?). E oggi sono usati appunto anche per bloccare specificamente il training da AI: https://github.com/ai-robots-txt/ai.robots.txt/blob/main/robots.txt
Abbasso l’intelligenza artificiale, evviva la stupidità naturale.