Floatboat podał, że ten sam model DeepSeek V4 Flash przekroczył wyniki porównawcze Claude Opus 4.8 we wszystkich pięciu testowanych benchmarkach po zmianie wyłącznie środowiska wykonawczego; wynik jest obiecujący, ale... Przy proporcji 3:1 między tokenami wejściowymi i wyjściowymi deklarowany uśredniony koszt API wy...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did AOE Tech Labs’ Floatboat team’s August 7, 2026 single-variable Harness benchmark experiment show that DeepSeek-V4-Flash—the $0.14 mo. Article summary: Floatboat’s August 7 result is best understood as a vendor-reported ablation: it held the DeepSeek-V4-Flash model constant and replaced the execution harness. Its claim is not that model capability ceased to matter, but . Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Wynik opublikowany przez Floatboat 7 sierpnia najlepiej odczytywać nie jako dowód, że DeepSeek-V4-Flash jest z natury bardziej zdolny od Claude Opus 4.8. To raczej deklarowany przez dostawcę eksperyment ablation: model pozostał ten sam, a zmieniono środowisko wykonawcze, czyli harness agenta. Floatboat twierdzi, że sama ta zmiana wystarczyła, by tani model wyprzedził opublikowane wyniki porównawcze Opusa 4.8 w pięciu publicznych benchmarkach agentowych. 3
Wniosek jest węższy, ale dla rozwoju agentów prawdopodobnie ważniejszy: przy długotrwałych zadaniach system otaczający model może mieć na wynik równie duży wpływ jak sam model. To sugestia, a nie rozstrzygnięcie — eksperyment nie doczekał się jeszcze niezależnej replikacji.
Według firmy wykorzystano oficjalne wydanie DeepSeek-V4-Flash-0731, te same dane wejściowe i te same parametry. Porównano jednak minimalistyczny oficjalny harness DeepSeek z własnym harnessiem ewaluacyjnym Floatboat. Ten drugi działał w odizolowanym fizycznym środowisku testowym i oferował bardziej trwałą pętlę pracy: dostęp do przestrzeni roboczej i plików, narzędzia, zachowywanie stanu oraz możliwość sprawdzania rezultatów, poprawiania błędów i kontynuowania zadania. 3
To istotna różnica. Agent nie wygrywa zadania, generując jedną dobrą odpowiedź. Musi wielokrotnie działać w środowisku, obserwować skutki swoich działań, aktualizować plan i nie niszczyć wcześniej wykonanej pracy.
W harnessie Floatboat model DeepSeek-V4-Flash miał uzyskać następujące rezultaty:
Floatboat twierdzi, że wyniki te przewyższyły opublikowane porównania z Claude Opus 4.8 we wszystkich pięciu benchmarkach. 3
Nagłówek wymaga jednak doprecyzowania. Publiczne zestawienia benchmarków mogą łączyć wyniki uzyskane przy użyciu różnych harnessów, promptów, konfiguracji narzędzi, ustawień próbkowania i procedur oceny. Najbardziej informacyjna część eksperymentu Floatboat to kontrolowane porównanie tego samego modelu w dwóch środowiskach. Nie zmienia to faktu, że nadal mamy do czynienia z wynikiem opublikowanym przez samą firmę.
Floatboat przyjęło dla DeepSeek ceny 0,14 dol. za milion tokenów wejściowych i 0,28 dol. za milion tokenów wyjściowych. Przy proporcji 3:1 koszt uśredniony wynosi:
(3 × 0,14 + 0,28) ÷ 4 = 0,175 dol. za milion tokenów
W przypadku Claude Opus 4.8 firma wykorzystała ceny 5 dol. za milion tokenów wejściowych i 25 dol. za milion tokenów wyjściowych. Przy tej samej proporcji:
(3 × 5 + 25) ÷ 4 = 10 dol. za milion tokenów
Oznacza to, że według tego sposobu liczenia Opus był około 57,1 raza droższy na poziomie uśrednionej ceny tokenów API. 3
Nie oznacza to jednak, że ukończenie konkretnego zadania kosztuje dokładnie 57,1 raza więcej. Wyliczenie nie obejmuje opłat za narzędzia, mocy obliczeniowej, cache’owania, długości kontekstu, ponowień, pracy inżynieryjnej ani kosztu utrzymania samego harnessu. To porównanie cen tokenów modelu, a nie analiza całkowitego kosztu posiadania.
Floatboat podał względne wzrosty na poziomie 1,9 proc., 9,6 proc., 12,6 proc., 19,9 proc. i 23,6 proc., gdy benchmarki uporządkowano od zadań o krótszym do dłuższego horyzoncie działania. Firma przedstawia tę sekwencję jako niemalejącą: harness miał mniejsze znaczenie przy zadaniach ograniczonych do kilku kroków, a większe wtedy, gdy rosła liczba zależnych od siebie działań. 3
Agent działający przez wiele etapów może przegrać nawet wtedy, gdy jego pojedyncze decyzje wyglądają rozsądnie. Musi między innymi:
Słaba pętla wykonawcza może zamienić poprawne rozumowanie w utratę kontekstu, nieprawidłowe wywołania narzędzi, zbyt wczesne zakończenie albo zmiany, których nie da się bezpiecznie cofnąć. Mocniejszy model może poprawiać lokalne decyzje, ale nie zastąpi środowiska, które zachowuje stan, dostarcza użytecznych informacji zwrotnych i pozwala bezpiecznie odzyskać kontrolę po błędzie.
Dlatego eksperyment ma znaczenie wykraczające poza jedno zestawienie modeli. Przesuwa pytanie z „który model jest najmądrzejszy?” na „które połączenie modelu i środowiska potrafi niezawodnie doprowadzić zadanie do końca?”.
Floatboat zaproponował wskaźnik Harness Leverage Ratio, w skrócie HLR, który ma porównywać korzyść ze zmiany harnessu z korzyścią z ulepszenia modelu:
HLR = wzrost wynikający wyłącznie ze zmiany harnessu
─────────────────────────────────────────────
wzrost wynikający z przejścia na silniejszy system referencyjny
HLR powyżej 1 oznacza, że w danym benchmarku i przy wybranym sposobie porównania zmiana harnessu podniosła wynik bardziej niż zmiana systemu na wskazany, silniejszy model referencyjny. Nie jest to standard branżowy, a wartość wskaźnika zależy od wybranej bazy, modelu referencyjnego, wersji benchmarku i kontroli ewaluacji. 2
4
W benchmarku DeepSWE Floatboat podał, że wynik Flasha wzrósł z 54,4 w harnessie DeepSeek do 67,25 w harnessie Floatboat, czyli o 12,85 punktu. Przywołany wynik Opusa 4.8 wynosił 58,0, a więc był o 3,6 punktu wyższy od bazowego rezultatu DeepSeek. Daje to HLR na poziomie około 3,57. 3
Firma podała również, że HLR wzrósł z 0,78 przy najkrótszym zadaniu do 3,57 przy najdłuższym. Jeśli wynik zostanie powtórzony, taki wzorzec wspierałby tezę, że poprawa środowiska wykonawczego staje się nieproporcjonalnie cenna, gdy zadanie wymaga większej liczby kroków, wywołań narzędzi i mechanizmów naprawczych. Nie należy jednak traktować tego jako uniwersalnego prawa — zmiana systemu referencyjnego albo konfiguracji testu może zmienić wartość wskaźnika.
Benchmark jest zgodny z szerszym pozycjonowaniem produktu Floatboat. Publiczne opisy przedstawiają go jako natywne środowisko pracy dla agentów, kierowane przede wszystkim do osób pracujących samodzielnie. Platforma łączy pliki, przeglądanie internetu, interakcje z AI, planowanie, komunikację oraz wielokrotnego użytku umiejętności i przepływy pracy. 1 W komunikacie z maja 2026 r. firma opisała koncentrację na proaktywnych agentach uruchamianych zgodnie z kalendarzem oraz wskazała Sequoię i Welight Capital jako inwestorów.
18
Takie podejście traktuje środowisko wykonawcze jako podstawową warstwę produktu, a nie cienką nakładkę na model językowy. Agent musi utrzymywać kontekst między aplikacjami, działać we właściwym momencie, respektować uprawnienia i robić postępy bez zmuszania użytkownika do ręcznego odtwarzania każdego kroku.
Jeśli wynik Floatboat przetrwa niezależne testy, przewaga konkurencyjna w agentach używanych na co dzień może przesunąć się w stronę warstwy wykonawczej: bezpiecznego zarządzania stanem, obserwowalności, weryfikacji, odzyskiwania po błędach, uprawnień i kontroli użytkownika.
Taki model rozwoju pozwoliłby elastyczniej dobierać modele. Tańsze systemy mogłyby obsługiwać rutynowe, dobrze przygotowane zadania w niezawodnym środowisku, a droższe modele byłyby rezerwowane dla problemów wymagających głębszego rozumowania lub oceny sytuacji. Najlepszym produktem nie musi więc być ani najtańszy model, ani najmocniejszy model działający w izolacji. Może nim zostać system, który wykorzystuje każdy model tam, gdzie sprawdza się najlepiej.
Najważniejsze zastrzeżenie pozostaje bez zmian: najsilniejszym dowodem na eksperyment z 7 sierpnia jest brief techniczny Floatboat, a sama firma przyznaje, że szersze porównania między modelami korzystają z różnych harnessów i konfiguracji ewaluacyjnych. Niezależne powtórzenia, udostępnione artefakty testowe oraz ściślejsza kontrola promptów, budżetów, narzędzi, ponowień i wersji danych są potrzebne, zanim „pięć zwycięstw” będzie można uznać za ustalony wynik całej branży. 3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Floatboat podał, że ten sam model DeepSeek V4 Flash przekroczył wyniki porównawcze Claude Opus 4.8 we wszystkich pięciu testowanych benchmarkach po zmianie wyłącznie środowiska wykonawczego; wynik jest obiecujący, ale...
Floatboat podał, że ten sam model DeepSeek V4 Flash przekroczył wyniki porównawcze Claude Opus 4.8 we wszystkich pięciu testowanych benchmarkach po zmianie wyłącznie środowiska wykonawczego; wynik jest obiecujący, ale... Przy proporcji 3:1 między tokenami wejściowymi i wyjściowymi deklarowany uśredniony koszt API wynosił 0,175 dol.
Zgłaszana przewaga rosła od 1,9 proc. przy najkrótszych zadaniach do 23,6 proc.