Claude’u Bırakın. ChatGPT Work’e Geçin. Sonra Opus 5 Geldi.
Beş ay önce ChatGPT’yi bırakın dedim ve bütün ajanlarımı Claude’da kurdum. GPT-5.6 beni geri getirdi. Opus 5 tablosu ise kararı yeniden test etmem gerektiğini gösterdi.
Beş ay önce “Claude Opus 4.6 geldi. ChatGPT’yi artık bırakın.” diye yazdım.
Söylediğimi yaptım. Yazılarımı Claude’a taşıdım. Araştırmalarımı orada yapmaya başladım. Marka sesimi, dosyalarımı, e-postamı, takvimimi Claude’a bağladım.
Sonra kişisel Yapay Zeka asistanımı kurup adını Victor koydum. Birkaç gün sonra terfi ettirdim.
Haziran ayında dokuz ajanlı Yapay Zeka CMO ekibimi Claude Code’da kurdum. Biri araştırıyor, biri blog yazıyor, biri LinkedIn’e bakıyor, biri SEO fırsatlarını çıkarıyor. Başlarında da hepsini koordine eden bir yönetici ajan var.
Yani Claude’u iki hafta deneyip “güzelmiş” demedim.
Bildiğiniz taşındım.
Şimdi geri döndüm.
Beni geri getiren şey GPT-5.6’dan çok ChatGPT Work oldu
“ChatGPT Work geldi ve Claude’da olmayan bir şey yaptı” dersem doğru olmaz.
Claude Cowork da dosya okuyor, e-postaya ve takvime bağlanıyor, tarayıcıda çalışıyor, görev kuruyor. Üstelik bunların çoğunu önce Claude’da kullandım.
O halde neden ChatGPT’ye döndüm?
Mesele Work ile Cowork değildi. Mesele, aynı ajan sistemini hangi modelle ne kadar uzun ve ne kadara çalıştırabildiğimdi.
ChatGPT 5.6 çıktığında, işim gereği Claude’a karşı test etmek için en çok kullandığım becerileri (skill), yerel .md dosyalarımı ChatGPT’ye taşıdım. Geçiş inanılmaz kolay oldu.
Beni geri getiren şey ChatGPT Work’ün Cowork’tan daha fazla özellik sunması değil.
GPT-5.6 Sol’un uygulama işlerinde Claude’a yeterince yaklaşması ve aynı sistemi daha geniş kullanım alanı, daha düşük token tüketimi ile çalıştırabilmem.
Claude hâlâ daha iyi düşündüğü işlerde masada. ChatGPT ise şu anda üretim yükünün daha büyük kısmını alıyor.
Sonra bu tablo geldi
Ben ChatGPT’ye dönmüşüm. Masamı yeniden kurmuşum. Tam o sırada Anthropic Opus 5’i çıkardı.
Ve paylaştığı tabloda Opus 5 sütunu neredeyse baştan aşağı önde.
Görseldeki 14 ölçümün 9’unda en yüksek sonuç Opus 5’e ait. Bilgi işinde 1.861 puan alıyor. GPT-5.6 Sol 1.736’da.
Yeni problem çözmeyi ölçen ARC-AGI-3’te fark daha da can sıkıcı. Opus 5 yüzde 30,2. GPT-5.6 Sol yüzde 7,8.
Aramada neredeyse başa başlar: yüzde 90,8’e yüzde 90,4.
Benim özellikle baktığım iki satır ise bilgisayar kullanımı ve iş akışlarıydı. Çünkü GPT-5.6 Sol’a dönüş nedenim uygulama işi ve üretim yüküydü.
Bilgisayar kullanımında Opus 5 yüzde 70,6, GPT-5.6 Sol yüzde 62,6.
AutomationBench’te Opus 5 yüzde 26,0, GPT-5.6 Sol yüzde 18,1.
İtiraf edeyim, o iki satırı birkaç kez okudum.
“Claude düşünür, ChatGPT yapar” diye çok kolay bir yazı yazabilirdim. Hatta başlığı bile hazırdı.
Tablo izin vermedi.
Opus 5 düşünmede güçlü olduğu kadar işi yapma testlerinde de güçlü görünüyor.
Kod tarafı daha karışık. Terminal kodlama testinde Opus 5 önde. FrontierCode’da Fable 5 az farkla önde. DeepSWE’de ise GPT-5.6 Sol yüzde 72,7 ile tablonun lideri.
Buradan “kod için kesin Claude” ya da “kod için kesin ChatGPT” sonucu çıkaran kişi tabloyu fazla hızlı okumuştur. Kod yazmak tek bir iş değil. Terminalde görev bitirmekle büyük bir kod tabanında günlerce çalışmak aynı beceri değil.
Ben ikisine de aynı işi vermeden karar vermiyorum.
Peki tablo Opus 5’e geri dönmem gerektiğini mi söylüyor?
Hayır.
Ama bazı işleri tekrar denemem gerektiğini söylüyor.
Arada önemli bir fark var.
Bu tablo Anthropic’in kendi lansman tablosu. Bu, rakamların yanlış olduğu anlamına gelmiyor. Ama elbette Anthropic kendi modelinin güçlü olduğu testleri gösterecek. OpenAI da aynısını yapıyor.
Üstelik tabloda boş hücreler var. GPT-5.6 Sol’un çok disiplinli muhakeme ve biyoloji sonuçları görünmüyor. Eksik sonuç, sıfır demek değil.
Bir de tabloda benim için çok önemli iki şey yok: süre ve maliyet.
Bir model işi yüzde 3 daha iyi yapıp beş kat pahalıya ve iki kat sürede bitiriyorsa, kazanan gerçekten o mu? Bazen evet. Çoğu rutin işte hayır.
Asıl eksik ise benim bilgisayarım.
OSWorld benim Gmail izinlerimi bilmiyor. AutomationBench benim dosya isimlerimi, müşteri klasörlerimi, takvim düzenimi ve bir işi kaç kere düzeltmek zorunda kaldığımı görmüyor.
Benchmark genel yeteneği ölçer. Ben pazartesi sabahı biten işe bakarım.
Claude’u bırakmış değilim
Victor hâlâ Claude’da.
Dokuz ajanlı ekibim hâlâ Claude Code’da. Hatta on yedi ajan oldular.
Uzun bir metnin mantığını kuracaksam, bir stratejiyi analiz edeceksem veya marka sesimde zor bir yazı hazırlayacaksam ilk açtığım araç çoğu zaman hâlâ Claude.
Ama artık her işe otomatik olarak orada başlamıyorum.
Gelen kutusu, takvim, Drive, tarayıcı ve zamanlanmış görev birbirine girecekse ChatGPT Work’ü açıyorum. Büyük bir kod işi varsa GPT-5.6 ve Codex’i Claude Code ile karşılaştırıyorum.
Yani Claude’u terk edip ChatGPT ile barıştığım romantik bir hikâye yok burada.
Daha dağınık bir gerçek var: iki aracı da kullanıyorum.
Zaten beş ay önceki yazımda yaptığım hata Claude’u seçmek değildi. Bir araç seçimini boşanma kararı gibi anlatmaktı. Gerçi sonra “ChatGPT’den Claude’a geçmek, sevgilini terk etmeye benzer” diye ayrıca yazdım.
Bu hafta üç işi yeniden çalıştıracağım
ChatGPT Work’e daha önce verdiğim üç gerçek iş seçtim.
Birincisi e-posta, takvim ve dosya içeren çok adımlı bir görev.
İkincisi tarayıcıda en az on adım gerektiren bir iş.
Üçüncüsü araştırma yapıp karar vermeyi ve sonunda bir dosya üretmeyi gerektiren bir müşteri işi.
Her birini Opus 5 ve GPT-5.6 ile üçer kez çalıştıracağım. Sadece son dosyaya bakmayacağım. Ne kadar sürdü, ne kadara mal oldu, kaç kere müdahale ettim, nerede hata yaptı ve ertesi hafta aynı işi tekrar yapabilir mi?
Benim tablom bu olacak.
Siz de araç değiştirmeyi düşünüyorsanız bütün düzeninizi bir gecede taşımayın. Tek bir gerçek iş seçin. İki araca da aynı dosyayı ve aynı talimatı verin. Bir kere değil, üç kere çalıştırın.
Sonra hangisinin daha zeki olduğuna değil, hangisinin işi bitirdiğine bakın.
Beş ay önceki yazıyı şu cümleyle bitirmiştim:
“Yapay Zeka dünyasında sadakatin yeri yok. Sonuçların yeri var.”
Fikrimi değiştirdim.
O cümleyi değiştirmedim.




Claude desktop ve ChatGPT work ile aynı klasörde çalışacak 3 ajanlı iş verdiğimde ChatGPT hem çok daha şık ve ayrıntılı panellerle takip etmemi sağlıyor, hem de çıkan son ürün daha kapsamlı. Claude ise hala ChatGPT’nin bulamadığı incelikli noktalar bulmayı başarıyor ama diğerine göre daha ham ve primitif cevaplar veriyor. Sağlık alanında nerdeyse her iş fable opus 4.8’e dönüyor, opus 5 için görevi baştan öyle kurmak gerekiyor. Ben Claude çok sevmeme rağmen ciddi ciddi son 2 haftadır chatgpt ile işlerimi hallediyorum.