Concepts
Tiers
Come funzionano priorità di coda, limiti di frequenza e moltiplicatore di prezzo.
Last updated: 2026-07-26
Tier
Un tier governa due cose:
- Dove state in coda quando c'è contesa
- Quante richieste al minuto potete fare
E ne influenza una terza: il moltiplicatore applicato al prezzo del modello.
I tier
| Tier | Tipico impiego | Moltiplicatore |
|---|---|---|
slow |
Lavori di sottofondo, indicizzazioni, riassunti a lotti | 0.85× |
medium |
Chat standard, sviluppo, prototipi | 1.00× |
fast |
Richieste in produzione con un utente che aspetta | 1.25× |
ludicrous |
Latenza critica, priorità massima | 1.60× |
company |
Contratto aziendale | 1.00× |
Lo sconto su slow non è un saldo: paga chi accetta bassa priorità, e a noi riempie i buchi di utilizzo. company resta a 1.00× perché quella priorità è già pagata nel contratto, non con un sovrapprezzo sui token.
Perché qui non c'è una colonna «richieste al minuto»
C'era, e prometteva 60, 120, 240 e 1000 richieste al minuto per tier. Non
corrispondeva a niente: il limite applicato su /v1/chat/completions era —
ed è — uno solo, uguale per tutti, e chi pagava il tier più alto riceveva un
sedicesimo di quanto scritto qui.
Non l'abbiamo corretta con quattro numeri nuovi, perché sarebbe un'altra promessa fissa su una capacità che fissa non è. La capacità di calcolo viene allocata da GigaKube in modo dinamico, in base alle richieste in corso: il tier stabilisce la priorità con cui la vostra richiesta entra in coda, non una quota garantita.
Cosa vuol dire in pratica:
- Il limite tecnico corrente lo trovate nell'intestazione
X-RateLimit-Limitdella risposta, e vale più di qualunque tabella: è quello che il sistema applica adesso. - Se ricevete
429, l'intestazioneRetry-Afterdice quanto aspettare. - Se vi serve una soglia garantita per contratto — perché avete un carico
noto e non volete dipendere dalla coda — è esattamente ciò che il tier
companymette per iscritto. Scriveteci il volume e ve lo quotiamo.
Preferiamo una tabella in meno che un numero che non manteniamo.
I valori sono letti dal database: quelli aggiornati stanno in Pricing.
Come funziona l'instradamento
Ogni sistema che serve modelli ha un peso per tier. Per una richiesta (tier, model):
- Si considerano solo i sistemi che servono quel modello, che sono in salute e che hanno un peso maggiore di zero per quel tier.
- Si ordina per peso decrescente, poi per coda più corta, poi per carico più basso.
- La richiesta va al primo, con la priorità corrispondente al tier.
Se nessun sistema serve il vostro modello al tier richiesto, ricevete 503: non vi dirottiamo silenziosamente su qualcosa di diverso da quello che avete chiesto.
Cosa cambia in pratica
- Senza contesa i tier si assomigliano. La differenza si vede sotto carico, ed è lì che serve.
- Tier più alto significa posto garantito in coda, utile quando conta il tempo di risposta del 95° percentile e non la media.
- I limiti di frequenza sono per tier, e superarli dà
429con l'indicazione di quando ritentare.
Come si imposta
Per chiave (predefinito)
Area riservata → Chiavi API → modifica → Tier predefinito.
Per singola richiesta
curl https://api.siati.ai/v1/chat/completions \
-H "Authorization: Bearer $SIATI_API_KEY" \
-H "X-Siati-Tier: fast" \
-H "Content-Type: application/json" \
-d '{ "model": "apertus-70b-instruct", "messages": [...] }'
Se vi serve una garanzia, non una priorità
Il tier più alto vi mette davanti in coda, ma la coda esiste. Per chi ha bisogno di prestazioni prevedibili riserviamo capacità a uso esclusivo, a canone mensile: la vostra richiesta non fa coda dietro a nessuno. Non è listinata perché il prezzo si costruisce sul caso concreto — scriveteci.
Se venite da OpenAI
Da loro i tier sono livelli di accesso legati alla spesa, non priorità per singola richiesta. L'equivalenza è approssimativa:
| OpenAI | Da noi |
|---|---|
Tier 1-2 (predefinito) |
slow / medium |
Tier 3-4 |
fast |
Tier 5 (enterprise) |
ludicrous |
| Servizio prioritario | Compreso in ludicrous |