Floatboat, DeepSeek V4 Flash’ın yalnızca yürütme altyapısı değiştirilerek beş agent benchmark’ının tamamında Claude Opus 4.8 karşılaştırmalarını geçtiğini bildirdi; iddia henüz bağımsız olarak tekrarlanmadı. 3:1 girdi çıktı oranında raporlanan harmanlanmış API token maliyeti DeepSeek için milyon token başına 0,175 d...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did AOE Tech Labs’ Floatboat team’s August 7, 2026 single-variable Harness benchmark experiment show that DeepSeek-V4-Flash—the $0.14 mo. Article summary: Floatboat’s August 7 result is best understood as a vendor-reported ablation: it held the DeepSeek-V4-Flash model constant and replaced the execution harness. Its claim is not that model capability ceased to matter, but . Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Floatboat’un 7 Ağustos 2026’da açıkladığı benchmark sonucu, DeepSeek-V4-Flash’ın doğası gereği Claude Opus 4.8’den daha yetenekli olduğunun kanıtı olarak okunmamalı. Daha doğru tanım şu: Bu, model sabit tutulurken yalnızca yürütme altyapısının değiştirildiği, şirket tarafından raporlanan bir ablasyon deneyi. Floatboat, bu değişikliğin düşük maliyetli aynı modeli beş açık agent benchmark’ında yayımlanmış Opus 4.8 karşılaştırmalarının önüne taşıdığını söylüyor. 3
Deneyin asıl önemli sonucu daha dar ama pratik açıdan daha değerli: Uzun süren agent görevlerinde modelin çevresindeki sistem, başarı üzerinde modelin kendisi kadar, hatta bazı durumlarda daha fazla etkili olabilir. Bununla birlikte sonuçlar henüz bağımsız bir ekip tarafından tekrarlanmış değil.
Floatboat, resmi DeepSeek-V4-Flash-0731 sürümünü aynı girdiler ve parametrelerle kullandığını belirtiyor. Karşılaştırmada DeepSeek’in minimalist resmi yürütme altyapısı ile Floatboat’un kendi değerlendirme altyapısı karşı karşıya getirildi. 3
Floatboat’un sistemi; izole bir fiziksel sandbox, yani deney sırasında diğer sistemlerden ayrılmış güvenli bir çalışma alanı, sürekli kullanılabilen dosya ve çalışma alanı erişimi, araçlar ve korunmuş durum bilgisi sağladı. Agent ayrıca sonuçları inceleyebiliyor, hatalarını düzeltebiliyor ve görevi tamamlamak için çalışmaya devam edebiliyordu. 3
Bu ayrım önemli. Bir agent yalnızca tek seferde iyi bir yanıt üretmez; ortamda tekrar tekrar işlem yapar, sonuçları gözlemler, planını günceller ve daha önce tamamladığı işleri bozmamaya çalışır.
Floatboat’un yürütme altyapısında DeepSeek-V4-Flash için açıklanan skorlar şöyleydi:
Şirket, bu beş sonucun da yayımlanmış Claude Opus 4.8 karşılaştırmalarını aştığını bildirdi. 3
Ancak manşetin önemli bir şartı var. Kamuya açık benchmark karşılaştırmaları farklı harness’ler, prompt’lar, araç yapılandırmaları, örnekleme ayarları ve değerlendirme yöntemleriyle üretilmiş skorları bir araya getirebilir. Bu nedenle en kontrollü bölüm, farklı sistemleri doğrudan aynı tabloya koymak değil; aynı modelin, yalnızca farklı bir harness ile nasıl değiştiğini görmek.
Yine de bu sonuçlar hâlâ şirketin kendi raporuna dayanıyor. “Beşinde de kazandı” ifadesi, bağımsız tekrarlar yapılmadan yerleşik bir sektör sonucu olarak kabul edilemez.
Floatboat’un verdiği fiyatlara göre DeepSeek’in maliyeti milyon input token başına 0,14 dolar, milyon output token başına ise 0,28 dolar. Girdi-çıktı oranı 3:1 kabul edildiğinde harmanlanmış fiyat şöyle hesaplanıyor:
(3 × 0,14 + 0,28) ÷ 4 = 0,175 dolar / milyon token
Claude Opus 4.8 için kullanılan fiyatlar milyon input token başına 5 dolar, milyon output token başına 25 dolar olarak verildi. Aynı oranla hesaplandığında:
(3 × 5 + 25) ÷ 4 = 10 dolar / milyon token
Bu hesap, harmanlanmış API token fiyatında Opus’un yaklaşık 57,1 kat daha pahalı olduğunu gösteriyor. 3
Fakat bu, tamamlanan her görevin 57,1 kat daha pahalı olduğu anlamına gelmez. Araç ücretleri, hesaplama maliyeti, önbellekleme, bağlam uzunluğu, başarısız denemeler, yeniden çalıştırmalar, mühendislik giderleri ve harness’in işletme maliyeti hesaba katılmıyor. Dolayısıyla bu, toplam sahip olma maliyeti değil; yalnızca model token fiyatlarının karşılaştırması.
Floatboat, beş benchmark kısa görevlerden uzun soluklu görevlere doğru sıralandığında görece kazanımların yüzde 1,9, yüzde 9,6, yüzde 12,6, yüzde 19,9 ve yüzde 23,6 olduğunu bildirdi. Şirket bu diziyi azalmayan bir eğilim olarak sunuyor: Görev sınırları kısa olduğunda harness’in etkisi daha düşük, birbirine bağlı adımlar arttığında ise etkisi daha yüksek. 3
Uzun soluklu bir agent, tek tek kararları makul görünse bile görevin tamamında başarısız olabilir. Örneğin şunları güvenilir biçimde yapması gerekir:
Zayıf bir yürütme döngüsü, doğru muhakemeyi bile kaybolan bağlama, geçersiz araç çağrılarına, erken sonlandırmaya veya geri döndürülemeyen değişikliklere çevirebilir. Daha güçlü bir model yerel kararları iyileştirebilir; ancak ortam durumu korumuyor, yararlı geri bildirim sunmuyor veya güvenli bir kurtarma imkânı sağlamıyorsa model tek başına açığı kapatamaz.
Bu nedenle deney, tek bir model karşılaştırmasının ötesine geçiyor. Soru artık yalnızca “En zeki model hangisi?” değil; “Hangi model ve çalışma ortamı birlikte görevi güvenilir biçimde tamamlayabiliyor?”
Floatboat, harness değişikliğinin değerini model yükseltmesiyle karşılaştırmak için Harness Leverage Ratio, kısaca HLR, adını verdiği yeni bir ölçüm sundu:
HLR = yalnızca harness değişikliğinden elde edilen kazanım
────────────────────────────────────────────────
daha güçlü referans sisteme geçişten elde edilen kazanım
HLR’nin 1’den büyük olması, seçilen benchmark ve karşılaştırmada yalnızca harness değişikliğinin, daha güçlü referans sisteme geçişten ölçülen skor artışından daha büyük bir artış sağladığı anlamına geliyor. HLR bir sektör standardı değil; değeri seçilen başlangıç sistemi, referans model, benchmark sürümü ve değerlendirme kontrollerine bağlı. 2
4
Floatboat, DeepSWE benchmark’ında Flash’ın DeepSeek harness’indeki 54,4 skordan kendi harness’indeki 67,25 skora çıktığını bildirdi. Bu, 12,85 puanlık artış demek. Cited Opus 4.8 skoru ise 58,0 olarak verildi; bu da DeepSeek’in başlangıç skoruna göre 3,6 puanlık bir fark anlamına geliyor. Sonuçta raporlanan HLR yaklaşık 3,57 oldu. 3
Şirket ayrıca HLR’nin en kısa görevde 0,78 seviyesinden en uzun görevde 3,57 seviyesine yükseldiğini açıkladı. Bu eğilim bağımsız testlerde de görülürse, görevler daha fazla durum bilgisi, araç çağrısı ve hata kurtarma gerektirdikçe çalışma ortamındaki iyileştirmelerin orantısız biçimde daha değerli hâle geldiği fikrini destekleyebilir.
Ancak bu oran evrensel bir yasa değil. Referans sistemin, benchmark sürümünün veya değerlendirme düzeninin değiştirilmesi HLR değerini de değiştirebilir.
Benchmark, Floatboat’un daha geniş ürün konumlandırmasıyla uyumlu görünüyor. Kamuya açık tanımlamalarda şirket; dosyaları, web taramasını, yapay zekâ etkileşimlerini, planlamayı, iletişimi ve yeniden kullanılabilir beceri veya iş akışlarını bir araya getiren, tek başına çalışan kişiler için agent odaklı bir çalışma ortamı olarak sunuluyor. 1
27 Mayıs 2026 tarihli lansman duyurusunda Floatboat’un takvim merkezli ve proaktif agent iş akışlarına odaklandığı, şirketin Sequoia ve Welight Capital tarafından desteklendiği belirtildi. 18
Bu yaklaşımda çalışma ortamı, dil modelinin üzerine eklenmiş ince bir arayüz değil; ürünün temel katmanlarından biri. Agent’ın farklı uygulamalar arasında bağlamı koruması, doğru zamanda harekete geçmesi, izinlere uyması ve kullanıcının her adımı elle yeniden kurmasına gerek bırakmadan ilerleme kaydetmesi bekleniyor.
Sonuç bağımsız testlerde de doğrulanırsa, günlük kullanılan agent’larda rekabet avantajı yalnızca modelin ham zekâsında değil, yürütme altyapısında aranabilir. Güvenli durum yönetimi, gözlemlenebilirlik, doğrulama, hata sonrası kurtarma, izinler ve kullanıcı kontrolü daha merkezi hâle gelebilir.
Bu durum daha esnek bir model stratejisi de yaratabilir. Düşük maliyetli modeller, güvenilir ve iyi yapılandırılmış bir çalışma ortamında rutin işleri üstlenebilir. Daha pahalı modeller ise gerçekten derin muhakeme veya yargı gerektiren görevlere ayrılabilir.
Başka bir deyişle en iyi ürün, ne yalnızca en ucuz modeli ne de tek başına en güçlü modeli kullanan ürün olabilir. Avantaj, her modeli en etkili olduğu yerde kullanan model-çalışma ortamı kombinasyonuna geçebilir.
Temel uyarı ise değişmiyor: 7 Ağustos deneyine ilişkin en güçlü kanıt Floatboat’un kendi teknik dokümanı. Şirket de geniş model karşılaştırmalarında farklı harness ve değerlendirme yapılandırmalarının kullanıldığını kabul ediyor. Aynı model üzerinde yapılan kontrollü harness deneyi, “beş galibiyet” manşetinden daha anlamlı; ancak iddianın yerleşik bir sektör bulgusuna dönüşmesi için bağımsız tekrarlar, yayımlanmış değerlendirme çıktıları ve prompt’lar, bütçeler, araçlar, yeniden denemeler ile veri sürümleri üzerinde daha sıkı kontroller gerekiyor. 3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Floatboat, DeepSeek V4 Flash’ın yalnızca yürütme altyapısı değiştirilerek beş agent benchmark’ının tamamında Claude Opus 4.8 karşılaştırmalarını geçtiğini bildirdi; iddia henüz bağımsız olarak tekrarlanmadı.
Floatboat, DeepSeek V4 Flash’ın yalnızca yürütme altyapısı değiştirilerek beş agent benchmark’ının tamamında Claude Opus 4.8 karşılaştırmalarını geçtiğini bildirdi; iddia henüz bağımsız olarak tekrarlanmadı. 3:1 girdi çıktı oranında raporlanan harmanlanmış API token maliyeti DeepSeek için milyon token başına 0,175 dolar, Opus için 10 dolar oldu.
Bildirilen kazanımlar kısa görevlerdeki yüzde 1,9’dan uzun görevlerde yüzde 23,6’ya yükseldi; bu da durum takibi, araç kullanımı, doğrulama ve hatalardan kurtarmanın uzun soluklu agent görevlerinde önem kazandığını dü...