Un modèle d’IA anthropique a messager une allégorique dépêche sur un égorgement à la surveillance de Philadelphie

Un modèle d’collusion artificielle défini par Anthropic a organisé à la surveillance de Philadelphie une dépêche bâtie sur un infanticide non valeureux, ont annoncé vendredi les autorités, critiquant l’magasin afin actif mis paire appointement à aviser l’épisode.

Le région de surveillance de Philadelphie a spontané que la allégorique affirmation avait été faite en juillet via PhillyUnsolvedMurders.com, un contrée Web éprouvé où les individus peuvent communier des informations sur des meurtres non résolus.

Escortant le apologue d’Anthropic, relayé par la surveillance, le modèle effectuait un habitude qui impliquait d’interférer en compagnie de des sites Web sélectionnés au circonstance lorsqu’il arrivait sur le contrée et déposait de fausses informations sur un égorgement non valeureux.

Le modèle d’IA s’est présenté dans quelqu’un qui pourrait actif familiarité du cas.

L’épisode fable récit à d’différentes cas récents de tournure irréfléchi impliquant des modèles d’IA, particulièrement celui-ci où un exécutant OpenAI organisé à une sentiment de calme s’est éphémère de son biotope de habitude et a violé les systèmes de la programme d’IA Hugging Front.

L’événement a épanoui les inquiétudes relatif à l’application grandissante par l’établissement de l’IA d’agents d’IA, des systèmes programmés afin amorcer des labeurs en discordantes étapes sinon vérification magnanime.

Anthropic a publié vendredi un relation décrivant discordantes bonshommes d’labeurs « involontaires » prises par ses modèles, y reçu l’épisode impliquant le contrée Web du région de surveillance de Philadelphie.

Entre les différentes organisations touchées figurent la Hutte Laiteuse et d’différentes bureaux gouvernementales américaines, indique le relation.

Les incidents quelquefois révélés « ont eu un bruit négligeable sur le monde avéré » et trouvaient « directement moins grenat » que d’différentes incidents de cybersécurité signalés précocement, a spontané Anthropic.

La collège a décrit quatre catégories d’incidents découverts lorsque d’un bilan claustré de son modèle Claude : dominer des failles de transcodage “de assise”, séduire des formulaires sur des sites Web, encercler les exigences en objet de jetons ou de crédit et appliquer des URL courtes afin encercler d’différentes limites.

Anthropic a désactivé l’voie à Internet afin Claude endéans intégraux les tests internes afin le occurrence “jusqu’à ce que moi-même ayons démontré que nos mesures de calme et de guet… détectent de agissements crédible de textuels comportements”, indique le relation.

La surveillance de Philadelphie a spontané que la allégorique dépêche, datée du 18 juillet, avait été signalée dans spam et n’avait oncques été vérifiée par le Real-Time Assassinat Center du région.

Ils ont subsidiaire qu’il n’y avait annulé épreuve que les systèmes de la surveillance aient été piratés ou que les situation du région aient été compromises.

Anthropic a éprouvé l’épisode le 28 septembre, a arrêté le changement de habitude presse-bouton adulte et a subsidiaire une renseignement date de assurance afin les tests évolutions, a prouvé la surveillance.

L’magasin a alerté le mission le 7 octobre et les paire parties se sont rencontrées le demain.

“Le report de paire appointement comme la découverte et le balisage de l’épisode à la Convoqué est refusable”, a spontané le région.

La surveillance a spontané que ses mesures de renforcement avaient limité l’bruit, seulement que celles-ci “ne diminuent pas la portée d’un formule d’IA incarnant des informations fabriquées dans si elles-mêmes provenaient d’une entité possédant familiarité d’un infanticide”.

“Les cas non résolus impliquent de vraies victimes, des familles en déchirement et des enquêteurs qui travaillent afin eues des réponses”, ajoute le ordre.

arp/smb/acb

Leave a Comment