• Home
  • Technology
  • Gaming
  • Entertainment
  • World & Business
  • Science
  • Sports
  • AI
HomeTechnologyGamingEntertainmentWorld & BusinessScienceSportsAI
Science
Report

Google DeepMind introduced Gemini 4 Argon with a limited rollout to testers

Sundar Pichai said Google teams were using Argon for coding and quantum computing, and claimed frontier performance in complex workflows, cyber defense and software engineering.

VN
MK
EK
3 Sources, 5h ago, first seen 5h ago

TLDR

On September 30, Google DeepMind introduced Gemini 4 Argon as a model for complex coding, enterprise knowledge work and cybersecurity defense. It said the model was rolling out to a set of trusted testers through its Fairwind Program. Sundar Pichai said Google teams were already using it for coding and quantum computing.

Combined views

14.3K

3 Sources, first seen 5h ago

401 likes28 comments20 saves24 reposts
Featured Source

Combined views

14.3K

3 Sources, first seen 5h ago

401 likes28 comments20 saves24 reposts

Sentiment

Positive——Negative

Summary

Not enough discussion yet.

No sentiment analysis available yet.

Sentiment

Positive——Negative

Summary

Not enough discussion yet.

No sentiment analysis available yet.

3 Sources

@vivnatthis is the most fun I have had with a model in a long, long time. gemini 4 argon is a true leap across many axes spanning capabilities and safety. as always, super excited about the progress we will make on science and medicine with this. more to come very very soon :)
@mark_kBREAKING: @GoogleDeepMind just announced Gemini 4 Argon, its most powerful model yet! Google says it matches or beats leading OpenAI and Anthropic models across coding and cybersecurity benchmarks, with strong results in science, maths and professional work. The focus is on complex tasks that require sustained reasoning: working through large codebases, debugging, and handling extended workflows in finance and law. Google is already using Argon internally for coding, quantum computing research and data centre optimisation. This is the kind of capability jump I've been waiting for from Gemini. Access is initially limited to selected companies and governments through Google's "Fairwind" programme, focused on finding and fixing cybersecurity vulnerabilities. No public release date yet. Now I want to get my hands on it!
@ersinkocGemini 4 Argon gerçekte ne kadar iyi? Google’ın açıkladığı sonuçlar ciddi. Özellikle uzun süren, çok adımlı mühendislik işlerinde güçlü bir model geliyor gibi görünüyor. Google’ın bildirdiği skorlar: gerçek yazılım mühendisliği görevlerini ölçen DeepSWE v1.1’de %77,9 ile liderlik, güvenlik açıklarını giderme benchmark’ı CWE-bench v1’de %68 ile ortak birincilik, uçtan uca iş otomasyonunu ölçen AutomationBench’te %51,3 ile birincilik. Uzun video anlama testi LVBench’te de %91,7. Ama benim asıl dikkatimi çeken, Google’ın kendi sistemlerinde anlattığı işler. Argon ajanlarının uyguladığı optimizasyonlarla veri merkezlerinde 300 TiB’den fazla bellek boşaltılmış. C/C++ → Rust dönüşümleri, 800 bin satırı aşan Zircon çekirdeğine kadar uzanıyor. Bunlar üretime alınmadan önce otomatik ve manuel denetimlerden, testlerden geçiyor. libgav1 örneğinde ajanlar, mevcut Rust sürümündeki 32 bin satırlık SIMD kodunu profil ölçümleri ve derleyici çıktıları üzerinden yeniden çalışmış. Aynı video çıktısını veren, bellek güvenli ve önceki Rust sürümünden 2,7 kat hızlı bir sonuç elde edilmiş. Dikkat: Optimize C++ sürümünden 2,7 kat hızlı olduğu söylenmiyor. Bir önemli ayrıntı daha: 1 milyon token çıktı limiti var. Bu, bağlam penceresiyle aynı şey değil. Uzun akıl yürütme ve üretim süreçlerine alan açıyor; tek başına doğruluk veya verimlilik garantisi vermiyor. Başlangıç API fiyatı milyon token başına 2 dolar girdi, 10 dolar çıktı; cache’den okunan girdide %95 indirim. Ancak dipnotu atlamayın: Tanıtım dönemi sonrasında fiyat 4/20 dolar olacak. Benim değerlendirmem: Argon, açıklanan sonuçlara göre özellikle uzun mühendislik görevlerinde ve siber güvenlikte en güçlü modellerle yarışacak kadar iddialı. Ama buradan “OpenAI ve Claude’u her işte geçti” sonucu çıkmaz. Benchmark’taki birincilik de her görevi başarıyla bitirdiği anlamına gelmiyor. Gerçek hükmü, aynı araçlar ve benzer bütçeyle büyük projelerde çalıştırınca vereceğiz: Kaç işi doğru bitiriyor, kaç regresyon çıkarıyor, ne kadar insan müdahalesi istiyor ve tamamlanan işin toplam maliyeti ne? Şimdilik erişim seçili siber güvenlik ortaklarıyla sınırlı. Ücretli API müşterileri ve Google AI Ultra aboneleriyle genişleme planlanıyor; kesin genel erişim tarihi açıklanmamış. Çok güçlü sinyaller var. Herkesin kendi projesinde sınayabildiği kanıt ise henüz yok.
  • HomeTechnologyGamingEntertainmentWorld & BusinessScienceSportsAI
    • Home
    • Technology
    • Gaming
    • Entertainment
    • World & Business
    • Science
    • Sports
    • AI

    3 Sources

    @vivnatthis is the most fun I have had with a model in a long, long time. gemini 4 argon is a true leap across many axes spanning capabilities and safety. as always, super excited about the progress we will make on science and medicine with this. more to come very very soon :)
    @mark_kBREAKING: @GoogleDeepMind just announced Gemini 4 Argon, its most powerful model yet! Google says it matches or beats leading OpenAI and Anthropic models across coding and cybersecurity benchmarks, with strong results in science, maths and professional work. The focus is on complex tasks that require sustained reasoning: working through large codebases, debugging, and handling extended workflows in finance and law. Google is already using Argon internally for coding, quantum computing research and data centre optimisation. This is the kind of capability jump I've been waiting for from Gemini. Access is initially limited to selected companies and governments through Google's "Fairwind" programme, focused on finding and fixing cybersecurity vulnerabilities. No public release date yet. Now I want to get my hands on it!
    @ersinkocGemini 4 Argon gerçekte ne kadar iyi? Google’ın açıkladığı sonuçlar ciddi. Özellikle uzun süren, çok adımlı mühendislik işlerinde güçlü bir model geliyor gibi görünüyor. Google’ın bildirdiği skorlar: gerçek yazılım mühendisliği görevlerini ölçen DeepSWE v1.1’de %77,9 ile liderlik, güvenlik açıklarını giderme benchmark’ı CWE-bench v1’de %68 ile ortak birincilik, uçtan uca iş otomasyonunu ölçen AutomationBench’te %51,3 ile birincilik. Uzun video anlama testi LVBench’te de %91,7. Ama benim asıl dikkatimi çeken, Google’ın kendi sistemlerinde anlattığı işler. Argon ajanlarının uyguladığı optimizasyonlarla veri merkezlerinde 300 TiB’den fazla bellek boşaltılmış. C/C++ → Rust dönüşümleri, 800 bin satırı aşan Zircon çekirdeğine kadar uzanıyor. Bunlar üretime alınmadan önce otomatik ve manuel denetimlerden, testlerden geçiyor. libgav1 örneğinde ajanlar, mevcut Rust sürümündeki 32 bin satırlık SIMD kodunu profil ölçümleri ve derleyici çıktıları üzerinden yeniden çalışmış. Aynı video çıktısını veren, bellek güvenli ve önceki Rust sürümünden 2,7 kat hızlı bir sonuç elde edilmiş. Dikkat: Optimize C++ sürümünden 2,7 kat hızlı olduğu söylenmiyor. Bir önemli ayrıntı daha: 1 milyon token çıktı limiti var. Bu, bağlam penceresiyle aynı şey değil. Uzun akıl yürütme ve üretim süreçlerine alan açıyor; tek başına doğruluk veya verimlilik garantisi vermiyor. Başlangıç API fiyatı milyon token başına 2 dolar girdi, 10 dolar çıktı; cache’den okunan girdide %95 indirim. Ancak dipnotu atlamayın: Tanıtım dönemi sonrasında fiyat 4/20 dolar olacak. Benim değerlendirmem: Argon, açıklanan sonuçlara göre özellikle uzun mühendislik görevlerinde ve siber güvenlikte en güçlü modellerle yarışacak kadar iddialı. Ama buradan “OpenAI ve Claude’u her işte geçti” sonucu çıkmaz. Benchmark’taki birincilik de her görevi başarıyla bitirdiği anlamına gelmiyor. Gerçek hükmü, aynı araçlar ve benzer bütçeyle büyük projelerde çalıştırınca vereceğiz: Kaç işi doğru bitiriyor, kaç regresyon çıkarıyor, ne kadar insan müdahalesi istiyor ve tamamlanan işin toplam maliyeti ne? Şimdilik erişim seçili siber güvenlik ortaklarıyla sınırlı. Ücretli API müşterileri ve Google AI Ultra aboneleriyle genişleme planlanıyor; kesin genel erişim tarihi açıklanmamış. Çok güçlü sinyaller var. Herkesin kendi projesinde sınayabildiği kanıt ise henüz yok.
    Today's Rank

    #12

    Today's Rank

    #12