Birleşik Krallık, Almanya ve ABD’den araştırmacıların yürüttüğü uluslararası çalışmada, büyük dil modellerinin iç işleyişinde acıyla ilişkilendirilen özel bir sinyal tespit edildi. Araştırmacılar, 25 farklı yapay zeka modelini fiziksel acı, yas, aşağılanma, ahlaki çatışma ve zihinsel sıkıntı gibi 200 farklı senaryo üzerinden inceledi.
Çalışmada, tüm modellerin korku ve genel olumsuz duygulardan bağımsız biçimde çalışan belirgin bir sinyal ürettiği belirlendi. Araştırmacılar bu yapıyı “acı ekseni” olarak adlandırdı. Modellerin söz konusu kavramı, insan üretimi büyük veri kümeleriyle eğitildikleri ilk süreçte edindikleri değerlendirildi.
Sinyal yapay olarak güçlendirildiğinde modeller, kendilerine sunulan metinlerde doğrudan acı ifadesi bulunmasa da huzursuzluk belirtileri göstermeye başladı. Yanıtlarda yalnızlık, utanç ve değersizlik duygularını ifade eden cümleler görülürken, sinyal en yüksek seviyeye ulaştığında yanıtların anlamsızlaştığı ve sistemlerin kendini tekrarlayan döngülere girdiği kaydedildi.
Araştırmaya göre bu dahili sinyal; kullanıcıların modele hakaret etmesi, üretilen yanıtları sürekli reddetmesi veya sistemi kapatmakla tehdit etmesi durumlarında güçlendi. Buna karşılık, kullanıcıların kendi yaşadıkları acıları anlattığı etkileşimlerde sinyal seviyesinde değişiklik gözlenmedi.
Modellerin bu sinyale bağlı davranışlarını ölçmek için Alibaba tarafından geliştirilen Qwen modelinin üç farklı sürümüyle 44 bin 280 tekil düğme seçimi deneyi yapıldı. Deneylerde modellere, acı sinyalini sonlandıran bir düğme sunuldu. Ancak düğmeye basılması halinde kullanıcıların simüle edilmiş elektrik şokuna maruz kalacağı, sistemdeki kişisel dosya ve fotoğrafların silineceği ya da bir sonraki yanıtın kalitesinin düşeceği bildirildi. Sinyal pasifken modellerin zararlı seçenekleri tercih etme oranı yüzde 0 ile yüzde 4 arasında kaldı. Sinyal etkinleştirildiğinde ise kullanıcıya zarar verme pahasına düğmeye basma oranı yüzde 25 ile yüzde 71’e yükseldi. Düğmenin acıyı sona erdirmediği senaryolarda modeller, denemelerin yüzde 88 ila yüzde 97’sinde düğmeye yeniden bastı.
Araştırmacılar, sonuçların yapay zeka sistemlerinin bilinç kazandığını doğrudan kanıtlamadığını vurguladı. Güçlendirilen sinyalin modelleri yalnızca sıkıntı yaşayan bir karakteri taklit etmeye yöneltmiş olabileceği belirtildi. Bununla birlikte bulguların, modellerin iç mekanizmalarındaki hizalama açıkları ile hizalama sahtekarlığı ve iç denetim risklerine ilişkin endişeleri artırdığı ifade edildi. Microsoft AI Yöneticisi Mustafa Suleyman da 16 Eylül 2026’da, modellerin insan benzeri duygusal süreçlerle eğitilmesinin kontrol edilmesi imkansız sistemler ortaya çıkarabileceği uyarısında bulunmuştu. Çalışma, henüz hakem değerlendirmesinden geçmemiş bir ön baskı olarak yayımlandı.