Proč Hermes pořád padá na fallback? Vysvětlení rate limitu a jak ho opravit
Nejde o chybu fallback systému, ale o primární model, který naráží na rate limit. Protože fallback v Hermesu funguje per turn, při každé nové zprávě se systém znovu pokusí o primární model.
Nejde o chybu fallback systému, ale o primární model, který naráží na rate limit.
Protože fallback v Hermesu funguje per turn, při každé nové zprávě se systém znovu pokusí o primární model.
Pokud primární i fallback model sdílí stejný backend nebo pool API klíčů, může dojít k situaci, kdy jsou rychle vyčerpány oba, a chyba se tváří jako nefunkční fallback.[6][8]
Problém se nejčastěji řeší v konfiguraci – kontrolou souboru config.yaml, ověřením API klíčů, případně přidáním nezávislého fallback providera.[2][3]
⚠️ Rate limited — switching to fallback providerAI-generated editorial hero image for ⚠️ Rate limited — switching to fallback provider... 🔄 Primary model failed — switching to fallback: sg claude opus 4.7 via custom Sao cứ bị.
AI Prompt
Create a landscape editorial hero image for this Studio Global article: ⚠️ Rate limited — switching to fallback provider... 🔄 Primary model failed — switching to fallback: sg claude opus 4.7 via custom Sao cứ bị. Article summary: Đây không hẳn là “bug fallback”, mà là model chính của Sếp đang bị rate limit nên Hermes tự nhảy sang fallback sg claude opus 4.7 via custom đúng như thiết kế.[8] Vì fallback của Hermes là per turn, nên mỗi tin nhắn mới . Topic tags: general web, openai, llm, ai, workflow. Reference image context from search candidates: Reference image 1: visual subject "# Fallback Providers. ## Primary Model Fallback. When your main LLM provider encounters errors — rate limits, server overload, auth failures, connection drops — Hermes can automat" source context "Fallback Providers | Hermes Agent - nous research" Reference image 2: visual subject "March 18, 2026 - (rate_limit
openai.com
Když při práci s Hermes Agentem neustále vídáte hlášení o přepnutí na fallback model sg-claude-opus-4.7 via custom, nepříjemně to narušuje práci. Dobrá zpráva je, že to není nevyzpytatelná chyba – je to přesně definované chování s jasnou příčinou a řešením.
Proč se to děje: Není to bug, ale feature
Základní princip je jednoduchý. Hermes má vestavěný mechanismus, který při výpadku primárního modelu automaticky přepne na záložní. Spouští se při několika typech chyb: rate limit, přetížení serveru, chyba autentizace, ztráta spojení.
Ve vašem případě je viníkem rate limit – primární model (nebo provider) odmítá další požadavky kvůli překročení kvóty. Hermes na to reaguje přesně podle návrhu a sahá po modelu sg-claude-opus-4.7, který máte nastavený přes custom endpoint.
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "Proč Hermes pořád padá na fallback? Vysvětlení rate limitu a jak ho opravit"?
Nejde o chybu fallback systému, ale o primární model, který naráží na rate limit.
What are the key points to validate first?
Nejde o chybu fallback systému, ale o primární model, který naráží na rate limit. Protože fallback v Hermesu funguje per turn, při každé nové zprávě se systém znovu pokusí o primární model.
What should I do next in practice?
Pokud primární i fallback model sdílí stejný backend nebo pool API klíčů, může dojít k situaci, kdy jsou rychle vyčerpány oba, a chyba se tváří jako nefunkční fallback.[6][8]
Klíčová informace z dokumentace Hermesu: fallback se aplikuje vždy jen pro dané kolo konverzace (per-turn). Při dalším požadavku se systém znovu pokusí oslovit primární model, a pokud je pořád pod limitem, znovu failuje a znovu přepíná. Proto vidíte hlášení opakovaně, dokola.
Proč to vypadá, že je problém i ve fallbacku
Tady přichází na řadu podezřelá část vašeho setupu – via custom. To znamená, že fallback model nepoužívá standardního providera, ale vlastní endpoint definovaný v config.yaml.
Pokud primární model a fallback model sdílejí stejný backend, stejnou API bránu (gateway) nebo stejný pool API klíčů, může se stát, že rate limit zasáhne oba současně. Systém sice přepne, ale "záložní" model je ve skutečnosti napojený na stejné přetížené zdroje. Proto se může zdát, že fallback "nefunguje" nebo že se chyba opakuje i po přepnutí.
Co konkrétně způsobuje rate limit
Podle dokumentace OpenClaw (který může být podkladovou vrstvou) a obecných patternů mohou být na vině tyto faktory:
Překročení kvóty providera – prostě jste vyčerpali limit požadavků/tokenů za dané období.
HTTP 429 specificky pro dlouhý kontext – OpenClaw dokumentace výslovně zmiňuje HTTP 429: rate_limit_error: Extra usage is required for long context requests. Pokud pracujete s dlouhými konverzacemi nebo velkými prompty, upstream provider vás může limitovat přísněji.
Problém na úrovni gateway – chyba může pocházet z OpenClaw gateway, ne přímo od AI providera. I když je API klíč funkční jinde, gateway může mít vlastní cooldown mechaniku.
Jak problém vyřešit: Praktický postup
1. Zjistěte, co je primární model a kam míří fallback
Otevřete konfigurační soubor Hermese – obvykle ~/.hermes/config.yaml. Hledejte:
Nastavení primárního providera a modelu
Sekci fallback_providers (případně starší klíč fallback_model pro zpětnou kompatibilitu)
Konfiguraci custom endpointu pro sg-claude-opus-4.7
2. Ověřte nezávislost primárního a fallback modelu
Pokud oba používají stejného providera nebo stejnou gateway, jste zranitelní vůči společnému výpadku. Ideálně by fallback měl být na úplně jiném providerovi (např. primárně Anthropic, fallback OpenRouter).
3. Proveďte diagnostiku gateway
Pokud používáte OpenClaw gateway:
openclaw gateway probe
Tento příkaz ověří dostupnost, schopnosti a úroveň autentizace gateway.
Následně zkontrolujte celkový stav:
openclaw gateway status --deep
openclaw doctor --deep
Sledujte, zda neběží staré (stale) klientské procesy, které mohou způsobovat konflikty.
4. Ověřte API klíče a jejich limity
API klíč musí být dostupný na stroji, kde běží gateway. Pokud používáte systemd/launchd, dejte klíč do ~/.openclaw/.env a restartujte službu.
Přímo otestujte klíč mimo Hermes/OpenClaw (např. přes curl nebo oficiálního klienta) – ověřte, že rate limit je skutečně na straně providera, ne jen v chybové hlášce.
5. Upravte konfiguraci fallbacku
Přidejte další, nezávislý fallback provider. Hermes podporuje celý řetězec fallback providerů (fallback_providers v config.yaml). Například:
Pokud chyba souvisí s "Extra usage is required for long context requests", zkraťte konverzaci, rozdělte úkol do menších celků, nebo použijte modely optimalizované pro dlouhý kontext.
Shrnutí
Opakované přepínání na fallback model sg-claude-opus-4.7 via custom není chyba v Hermesu, ale důsledek přetrvávajícího rate limitu na primárním modelu. Řešení spočívá v:
Identifikaci zdroje rate limitu (provider, gateway, kvóta)
Zajištění skutečné nezávislosti fallback modelu
Rozšíření fallback řetězce o další providery
Optimalizaci práce s kontextem, pokud narážíte na limity pro dlouhé požadavky
Pokud si nejste jisti konfigurací, exportujte obsah ~/.hermes/config.yaml (bez citlivých údajů, jako jsou API klíče) a podle struktury bude hned jasné, kde je slabé místo.