🚀 AI Ajanlar Yükseliyor: Bu Hafta Neler Oldu
DeepMind'ın AI Ajan Kontrol Yol Haritası: Güvenlik Artık Sistem Seviyesinde
Ajanları, hassas sistemlere erişime sahip çalışanlar gibi ele alarak, sistem seviyesinde kontroller eklemeyi öneriyor. Model eğitimi iyi niyetli olsa da, güvenlik testleri ve erişim kontrolleri, dosya okuma, web taraması ve kod yazma gibi gerçek eylemler için gereklidir. Yaklaşım, siber güvenlik uygulamalarından ilham alıyor: şifreler, denetim günlükleri, izinler ve acil durdurma mekanizmaları. DeepMind, işlemler için "kapsam" (kaç ajanı izleniyor), "çağrı" (kötü davranış ne kadar iyi yakalanıyor) ve "tepki süresi" (sistem ne kadar hızlı durduruluyor) metriklerini öneeriyor. Bu, AI güvenliğini soyut tartışmalardan somut altyapı sorununa dönüştürüyor.
SpaceX $60 Milyara Anysphere'i Satın Aldı: Cursor Şimdi Stratejik Altyapı
SpaceX, yapay zeka destekli kod editörü Cursor'u geliştiren şirket Anysphere'i 60 milyar dolar karşılığında satın aldı. Bu hamle, Cursor'u SpaceX ve xAI için stratejik altyapıya dönüştürüyor ve geliştirici-ajan yarışında önemli bir adım atılıyor. Cursor, birçok kodlama profesyonelinin günlük iş akışının merkezinde yer almakta ve bu satın almadan sonra yapay zeka kodlama araçlarının merkezileşmesini gösteriyor.
Anthropic'in Fable/Mythos Sınırlandırması: Açık Erişim vs. Güvenlik Kısıtlamalarının Gerilimi
Anthropic, yapay zekanın güvenliğini öne sürerek, Claude Fable 5 modelini sınırlandırdı ve diğer AI araştırmacılarını bu modeli kullanarak rakip teknoloji geliştirmekten alıkoydu. ABD Hükümeti ardından, ticaret bakanlığı yetkilendirmesini kullanarak Fable ve Mythos'u dış ülkelere ihraç etmeyi kısıtladı, bu da Anthropic'i tüm dünyaya erişimi kesmeye zorladı. Birçok ülke bu hareketi gördüğü için, kendi yapay zeka egemenliğini sağlamak için açık kaynaklı modeller (Z.ai GLM-5.2 gibi) ve alternatif kaynaklar üzerine daha fazla yatırım yapmaya başladı. Sam Altman'ın "birini bombayla tehdit edip sonra bomba sığınağı satmak" yorumu, bu stratejiyi keskinlikle eleştiriyor.

Nvidia Nemotron 3 Ultra: Açık Ağırlık Modellerde Yeni Şampiyon
Nvidia, 550 milyar parametreli Nemotron 3 Ultra'yı açık ağırlık olarak yayınladı. Mamba-transformer karması mimarisiyle, model saniyede 183 jeton işliyor ve 1 milyon jeton bağlamını destekliyor. Nemotron, aracı çağırma, çoklu akıl yürütme modları ve 12 dilte destek sunuyor. Yapay Zeka Analiz İstihbarat İndeksinde en yüksek puanı alan ABD açık ağırlık modeli konumundadır. Ağırlıklar, veriler ve kod OpenMDW-1.1 lisansı altında özgürce mevcuttur. Nvidia bu yaklaşımla, ticari sağlayıcılara bağlı olmayan şirketlere güvenilir yapay zeka erişimi sağlamaya yardımcı oluyor.

Anthropic Claude: Robotik Görevlerde Yeni Standart
Anthropic'in Claude modeli, "Project Fetch" deneyinde robotik görevleri insan ekiplerinden 18-37 kat daha hızlı tamamladı. Bu sonuçlar, Claude'un sadece soruları cevaplamanın ötesine geçerek, fiziksel dünyada koordineli işleri yönetebileceğini gösteriyor. Yapay zekanın artık metin işleminden iş otomasyon ve fiziksel görev yönetimine evrildiğini kanıtlıyor.

AI Arkadaşları Tinder'ı Geçti: Frictionless İntimacy Yükselişte
Sensor Tower raporuna göre, ABD kullanıcıları AI arkadaş uygulamalarına (Character.AI, Talkie) randevu uygulamalarından (Tinder, Bumble) 2 kat daha fazla zaman harcıyor. Q1 2026'da yaklaşık 700 milyon saat AI uygulamalarında geçirilirken, randevu uygulamaları 300-400 milyon saatlik kullanım gördü. Bu eğilim, yapay zekanın sağladığı "frictionless intimacy" (sürtünsüz yakınlık) talebiyle ilişkilidir: hiçbir çaba, reddedilme riski yok, ve istediğiniz zaman çıkış yapabiliyorsunuz. Yapay zeka bu alanda killer app'i bulmuş: yanıt vermek.

Z.ai GLM-5.2: Açık Ağırlık Modellerde Liderlik
Çin'in Z.ai şirketi, 1 milyon jeton bağlamı ve güçlü kodlama yetenekleri olan GLM-5.2 modelini MIT lisansı altında yayınladı. Bu model, açık ağırlık alanında yeni bir lider konumunu işaret ediyor ve şirketlerin kiralanmış yapay zeka yerine kontrol edilen alternatifleri tercih etmesi için sebepler sunuyor.
Yeni Benchmarklar Ajanları Ölçüyor: SWE-Bench Zamanı Bitti
SWE-bench ailesinin yerini aldığı yeni testler (DeepSWE, ProgramBench, ITBench-AA) çok daha karmaşık ajan görevlerini ölçüyor. DeepSWE'de GPT-5.5, %70'lik bir başarı oranıyla lider durumda, fakat Claude Opus 4.8 %58 ile yakından takip ediyor. Geliştiriciler artık ajanların sadece bug düzeltme değil, tam proje geliştirme yeteneklerini değerlendiriyor.
Spam yok, üçüncü taraflarla paylaşım yok. Sadece haftalık email bülten gönderimleri.



