2 pensieri su “L’auto giapponese riparte dal software S4E89”

  1. Al solito, premetto che sono un ascoltatore di lunga data, quasi sempre in accordo coi vostri punti di vista, e che nel caso di specie condivido senz’altro che la multa del Garante sia non solo stupida ma soprattutto imbarazzante.

    Non concordo però con le motivazioni.

    È vero che normalmente i dati di training sono “distillati” nel modello. Ma sono stati dimostrati modi per far ripetere ai modelli i dati di training verbatim:
    https://www.zdnet.com/article/chatgpt-can-leak-source-data-violate-privacy-says-googles-deepmind/

    Ma in ogni caso, fosse anche impossibile riottenere rigurgitati i dati di training, ho tutto il diritto di sapere se/che le mie interazioni sono usate per training. Per esempio, se uso ChatGPT per aiutarmi ad analizzare un bug in un pezzo di codice della mia azienda, posso non volere che certi pattern/metodi/soluzioni che usiamo siano poi suggeriti all’esterno. Se sono un artista con un mio stile molto particolare ed unico, posso non volere che ChatGPT inizi a generare immagini che seguono il mio stile. Eccetera.

    OpenAI paga lautamente per convenzioni con editori ecc., Reddit è ultimamente invaso da pubblicità che offrono compensi per qualche task di training per traduzione: i dati di training sono preziosi. È bene che la gente lo sappia e decida a ragion veduta se e come rendere disponibili i propri.

    Infine, il robots.txt citato è per *limitare* le pagine accessibili ai crawler, non per permetterle (forse pensava ai sitemap?). E oggi sono usati appunto anche per bloccare specificamente il training da AI: https://github.com/ai-robots-txt/ai.robots.txt/blob/main/robots.txt

I commenti sono chiusi.