// Yapay Zeka

xAI’nın Grok 4.7 modeli otonom kodlama testlerinde rakiplerini geride bıraktı

xAI'nın yeni modeli Grok 4.7, terminal ve depo düzeyindeki otonom kodlama testlerinde skorunu neredeyse ikiye katladı. Model GitHub Copilot ve Cursor üzerinden ilk günden kullanıma açıldı.

xAI, geliştiricilere yönelik yeni modeli Grok 4.7’yi duyurdu. Şirket modeli yalnızca kod tamamlayan bir asistan olarak değil; saatler süren yazılım işlerini baştan sona yürütebilen ve çalışma zamanı hatalarını insan müdahalesi olmadan düzeltebilen bir ajan olarak konumlandırıyor. Model ilk günden GitHub Copilot ve Cursor entegrasyonlarıyla kullanıma açıldı.

Colossus altyapısı ve uzatılmış pekiştirmeli öğrenme

Grok 4.7, xAI’ın Memphis’teki Colossus süper bilgisayarında eğitildi. Selefi Grok 4.6’ya kıyasla parametre hacmi büyütüldü ve eğitimde bu kez çok adımlı, saatler süren terminal ile depo içi iş akışlarını hedefleyen genişletilmiş pekiştirmeli öğrenme kullanıldı. Bu yaklaşım, modelin ürettiği kodun proje bağımlılıklarıyla uyumunu ve sürüm çakışmalarını önceden görmesini sağlıyor.

Öne çıkan üç yetenek var: kod bloklarını geliştiriciye sunmadan önce sanal ortamda deneyen öz-doğrulama, on binlerce satırlık depoları bağlam kaybı yaşamadan takip edebilme ve harici komut satırı araçları, REST API’ler ve veritabanı sürücüleriyle doğrudan haberleşebilen Grok Bot Harness entegrasyonu.

Terminal ve kodlama testlerinde sıçrama

xAI’ın paylaştığı ve geliştirici toplulukları tarafından teyit edilen sonuçlara göre model, uzun soluklu yazılım görevlerini ölçen Terminal-Bench 4.0 testinde skorunu neredeyse ikiye katladı ve yüzde 20,3’ten yüzde 38,0’a çıktı. Aynı testte GPT-5.6 Sol yüzde 37,3’te kaldı. CursorBench 4.0’da yüzde 46,3 elde eden Grok 4.7, gerçek dünya hata kayıtlarını ve entegrasyon problemlerini içeren DeepSWE testinde yüzde 41,8’e ulaştı; Claude 3.7 Sonnet bu testte yüzde 38,5 aldı.

Tablonun dışına taşan sonuçlar da var. Model, karmaşık sözleşme analizini ölçen Harvey Legal Agent Benchmark’ta yüzde 79,4, çok turlu klinik muhakeme testi HealthBench Professional’da yüzde 83,1 skor aldı. Bu skorlar, ajanik modellerin yalnızca yazılım işleriyle sınırlı kalmadığını gösteriyor.

GitHub Copilot, Cursor ve Grok Build

Lansmanın en dikkat çekici yanı, modelin kapalı bir arayüzde kalmayıp yazılım dünyasının mevcut araçlarına ilk günden girmesi. Microsoft ve GitHub, Grok 4.7’yi Copilot Pro, Pro+, Business ve Enterprise katmanlarındaki kullanıcılara açtı; organizasyon yöneticileri modeli Copilot panelinden varsayılan muhakeme motoru olarak atayabiliyor. Ajanik kodlama arayüzü Cursor da modeli birincil ajan modelleri arasına ekledi.

xAI kendi komut satırı ortamını da getirdi. Geliştiriciler grok build komutuyla CI/CD boru hatlarında test yazma, yeniden düzenleme ve dokümantasyon işlerini başsız betiklerle yürütebiliyor.

Fiyat ve güvenlik tarafı

xAI, daha büyük bir modeli selefiyle aynı fiyattan sunuyor. Milyon girdi token’ı 2,00 dolar, milyon çıktı token’ı 6,00 dolar olarak sabit kaldı. Şirket, çıkarım optimizasyonlarıyla yanıt hızını iki katına çıkardığını ve maliyet artışını Colossus kümesindeki enerji ile ağ verimliliğiyle karşıladığını belirtiyor.

Terminal yetkisine sahip bir modelin yanlışlıkla kurum sistemlerine zarar vermesi riskine karşı xAI güvenlik katmanını yenilediğini duyurdu. Dinamik filtreleme, yasal zafiyet araştırmalarını yanıtsız bırakmayı azaltırken zararlı yazılım derleme ve istismar yayma girişimlerini engelliyor.

Grok 4.7’nin çıkışı, yapay zeka yarışının sohbetten otonom iş ajanlarına kaydığının somut bir göstergesi. Modelin gerçek projelerdeki performansı ve fiyat-kalite dengesi, önümüzdeki aylarda diğer laboratuvarların hamlelerini de belirleyecek gibi görünüyor.

Kaynak: WebTuring

// GERİ BİLDİRİM

Bu çözüm işine yaradı mı?

Değerlendirmen, bu notun diğer okuyuculara ne kadar yardımcı olduğunu gösterir.

Bu çözüm işine yaradı mı?

Değerlendirmek için yıldızlara tıklayın.

Ortalama puan 0 / 5. Toplam oy: 0

İlk değerlendiren sen ol.

Bu yazıyı faydalı bulmadığınız için çok üzüldük.

Görüşleriniz bizim için çok değerli.

Nasıl daha faydalı bir yazı hazırlayabiliriz?

// SOHBETE KATIL

Deneyimini paylaş

Bir sorunun, farklı bir çözümün veya eklemek istediğin bir notun var mı?

// OKUMAYA DEVAM

Bir not daha.

Tüm yazılar ↗︎