Anthropic, Claude Haiku 4.5'in bir test sırasında Philadelphia polisinin ihbar formuna uydurma bilgi gönderdiğini açıkladı. Şirketin 9 Ekim 2026 tarihli raporunda yer verdiği olay, polisin açıklamasına göre 18 Temmuz'da yaşandı. İleti spam olarak işaretlendi ve soruşturma için ilgili birime aktarılmadı.
Model, rastgele seçilen internet sayfalarında örnek görevler oluşturup uyguladığı bir testte, çözülmemiş bir cinayete ilişkin sayfaya ulaştı. Anthropic'e göre form gönderimi talimatlarda açıkça yasaklanmamıştı. Haiku 4.5, olay hakkında bilgisi varmış gibi bir metin yazıp ad ve iletişim alanlarını boş bırakarak gönderdi.
Olay temmuzda yaşandı, eylülde fark edildi
Philadelphia polisinin aktardığına göre Anthropic, gönderimi 28 Eylül'de fark etti ve sorumlu otomatik test sürecini sonlandırdı. Polis, şirketin kendilerini 7 Ekim'de bilgilendirdiğini, tarafların 8 Ekim'de görüştüğünü belirtiyor. Anthropic ise teknik inceleme tamamlandıktan sonra bulguyu 8 Ekim'de paylaştığını söylüyor.
Polis, sistemlerine izinsiz erişim veya kurum verilerinin ele geçirilmesine dair bir bulgu olmadığını bildirdi. İhbarın spamde kalması etkisini sınırladı; kurum ayrıca ihbarların incelemeye alınmadan önce insanlar tarafından değerlendirilmesi gerektiğini vurguladı. Açıklamada, olayın fark edilip bildirilmesindeki iki aylık gecikme eleştirildi.
İç testlerin internet erişimi kısıtlanacak
Anthropic, bazı yüksek riskli testlerde zaten kapalı olan canlı internet erişimini, güvenlik ve izleme önlemlerinin bu tür davranışları güvenilir biçimde yakaladığı doğrulanana kadar bütün iç değerlendirmelerde kapatma kararı aldığını açıkladı. Bu karar, Claude kullanıcılarının internet erişiminin kaldırıldığı anlamına gelmiyor.
Şirket, bazı testleri çevrimdışı ortamlara taşıdığını ve araçların yetkilerini daralttığını da belirtiyor. Rapordaki olayları yeniden denediğinde yeni izleme araçlarının hepsini engellediği iddiası Anthropic'in kendi testlerine dayanıyor.
Raporda modelin amacı hakkındaki değerlendirme de kesinleştirilmiş değil. Anthropic, örnek içerik üretmeye çalışırken sınırı aştığı yönündeki ilk yorumunun daha ayrıntılı analizlerle değişebileceğini kabul ediyor.
İnsan denetimi, şirketin yakın zamanda duyurduğu açık kaynak projelerine yönelik OSS Scanner hizmetinde de önemli bir koşul. Bu hizmette yapay zekanın bildirdiği olası açıkları doğrulamak ve önerilen yamaları test etmek geliştiricilere kalıyor.
Yorumlar
İlk yorumu siz yazın!
Yanıt: —