🚀 AI Ajanlar Yükseliyor: Bu Hafta Neler Oldu

DeepMind'ın AI Ajan Kontrol Yol Haritası: Güvenlik Artık Sistem Seviyesinde

📰
DeepMind, güçlü yapay zeka ajanlarını korumak için yeni bir güvenlik yaklaşımı sundu.

Ajanları, hassas sistemlere erişime sahip çalışanlar gibi ele alarak, sistem seviyesinde kontroller eklemeyi öneriyor. Model eğitimi iyi niyetli olsa da, güvenlik testleri ve erişim kontrolleri, dosya okuma, web taraması ve kod yazma gibi gerçek eylemler için gereklidir. Yaklaşım, siber güvenlik uygulamalarından ilham alıyor: şifreler, denetim günlükleri, izinler ve acil durdurma mekanizmaları. DeepMind, işlemler için "kapsam" (kaç ajanı izleniyor), "çağrı" (kötü davranış ne kadar iyi yakalanıyor) ve "tepki süresi" (sistem ne kadar hızlı durduruluyor) metriklerini öneeriyor. Bu, AI güvenliğini soyut tartışmalardan somut altyapı sorununa dönüştürüyor.

Google DeepMind
Build AI responsibly to benefit humanity

SpaceX $60 Milyara Anysphere'i Satın Aldı: Cursor Şimdi Stratejik Altyapı

SpaceX, yapay zeka destekli kod editörü Cursor'u geliştiren şirket Anysphere'i 60 milyar dolar karşılığında satın aldı. Bu hamle, Cursor'u SpaceX ve xAI için stratejik altyapıya dönüştürüyor ve geliştirici-ajan yarışında önemli bir adım atılıyor. Cursor, birçok kodlama profesyonelinin günlük iş akışının merkezinde yer almakta ve bu satın almadan sonra yapay zeka kodlama araçlarının merkezileşmesini gösteriyor.

SpaceX locks in $60 billion Cursor deal to close gap with rivals in AI ...
Elon Musk's SpaceX is buying the startup behind the popular AI coding agent Cursor, Anysphere, for $60 billion in an all-stock deal

Anthropic'in Fable/Mythos Sınırlandırması: Açık Erişim vs. Güvenlik Kısıtlamalarının Gerilimi

Anthropic, yapay zekanın güvenliğini öne sürerek, Claude Fable 5 modelini sınırlandırdı ve diğer AI araştırmacılarını bu modeli kullanarak rakip teknoloji geliştirmekten alıkoydu. ABD Hükümeti ardından, ticaret bakanlığı yetkilendirmesini kullanarak Fable ve Mythos'u dış ülkelere ihraç etmeyi kısıtladı, bu da Anthropic'i tüm dünyaya erişimi kesmeye zorladı. Birçok ülke bu hareketi gördüğü için, kendi yapay zeka egemenliğini sağlamak için açık kaynaklı modeller (Z.ai GLM-5.2 gibi) ve alternatif kaynaklar üzerine daha fazla yatırım yapmaya başladı. Sam Altman'ın "birini bombayla tehdit edip sonra bomba sığınağı satmak" yorumu, bu stratejiyi keskinlikle eleştiriyor.

Claude Fable 5 and Claude Mythos 5
Today we’re launching Claude Fable 5: a Mythos-class model that we’ve made safe for general use.

Nvidia Nemotron 3 Ultra: Açık Ağırlık Modellerde Yeni Şampiyon

Nvidia, 550 milyar parametreli Nemotron 3 Ultra'yı açık ağırlık olarak yayınladı. Mamba-transformer karması mimarisiyle, model saniyede 183 jeton işliyor ve 1 milyon jeton bağlamını destekliyor. Nemotron, aracı çağırma, çoklu akıl yürütme modları ve 12 dilte destek sunuyor. Yapay Zeka Analiz İstihbarat İndeksinde en yüksek puanı alan ABD açık ağırlık modeli konumundadır. Ağırlıklar, veriler ve kod OpenMDW-1.1 lisansı altında özgürce mevcuttur. Nvidia bu yaklaşımla, ticari sağlayıcılara bağlı olmayan şirketlere güvenilir yapay zeka erişimi sağlamaya yardımcı oluyor.

NVIDIA Nemotron 3 Ultra Powers Faster, More Efficient Reasoning for Long-Running Agents | NVIDIA Technical Blog
Single-turn chatbots are evolving into long-running agents that can reason, maintain context, use tools, and run efficiently across many turns to complete complex workflows. However…

Anthropic Claude: Robotik Görevlerde Yeni Standart

Anthropic'in Claude modeli, "Project Fetch" deneyinde robotik görevleri insan ekiplerinden 18-37 kat daha hızlı tamamladı. Bu sonuçlar, Claude'un sadece soruları cevaplamanın ötesine geçerek, fiziksel dünyada koordineli işleri yönetebileceğini gösteriyor. Yapay zekanın artık metin işleminden iş otomasyon ve fiziksel görev yönetimine evrildiğini kanıtlıyor.

When AI builds itself
Our progress toward recursive self-improvement, and its implications.

AI Arkadaşları Tinder'ı Geçti: Frictionless İntimacy Yükselişte

Sensor Tower raporuna göre, ABD kullanıcıları AI arkadaş uygulamalarına (Character.AI, Talkie) randevu uygulamalarından (Tinder, Bumble) 2 kat daha fazla zaman harcıyor. Q1 2026'da yaklaşık 700 milyon saat AI uygulamalarında geçirilirken, randevu uygulamaları 300-400 milyon saatlik kullanım gördü. Bu eğilim, yapay zekanın sağladığı "frictionless intimacy" (sürtünsüz yakınlık) talebiyle ilişkilidir: hiçbir çaba, reddedilme riski yok, ve istediğiniz zaman çıkış yapabiliyorsunuz. Yapay zeka bu alanda killer app'i bulmuş: yanıt vermek.

AI lovers and the dangers of frictionless intimacy: How AI companions can induce AI psychosis
AI mirrors us so well it feels like intimacy - but it often just amplifies our existing beliefs. Without friction or challenge, our self-stories harden into unquestioned “truths.” AI simulates empathy, but lacks the embodied otherness that real relationships require. Relying on AI for intimacy risks trapping us in personalised emotional echo chambers.

Z.ai GLM-5.2: Açık Ağırlık Modellerde Liderlik

Çin'in Z.ai şirketi, 1 milyon jeton bağlamı ve güçlü kodlama yetenekleri olan GLM-5.2 modelini MIT lisansı altında yayınladı. Bu model, açık ağırlık alanında yeni bir lider konumunu işaret ediyor ve şirketlerin kiralanmış yapay zeka yerine kontrol edilen alternatifleri tercih etmesi için sebepler sunuyor.

- YouTube
Enjoy the videos and music that you love, upload original content and share it all with friends, family and the world on YouTube.

Yeni Benchmarklar Ajanları Ölçüyor: SWE-Bench Zamanı Bitti

SWE-bench ailesinin yerini aldığı yeni testler (DeepSWE, ProgramBench, ITBench-AA) çok daha karmaşık ajan görevlerini ölçüyor. DeepSWE'de GPT-5.5, %70'lik bir başarı oranıyla lider durumda, fakat Claude Opus 4.8 %58 ile yakından takip ediyor. Geliştiriciler artık ajanların sadece bug düzeltme değil, tam proje geliştirme yeteneklerini değerlendiriyor.

SWE-bench Leaderboards
mini-SWE-agent scores up to 74% on SWE-bench Verified in 100 lines of Python code. Click here to learn more. Verified Multilingual Lite Full Multimodal.

Turkce.ai haber bültenine kayıt ol.

Spam yok, üçüncü taraflarla paylaşım yok. Sadece haftalık email bülten gönderimleri.