siati.ai docs

Concepts

Tiers

Come funzionano priorità di coda, limiti di frequenza e moltiplicatore di prezzo.

Last updated: 2026-07-26

Tier

Un tier governa due cose:

  1. Dove state in coda quando c'è contesa
  2. Quante richieste al minuto potete fare

E ne influenza una terza: il moltiplicatore applicato al prezzo del modello.

I tier

Tier Tipico impiego Moltiplicatore
slow Lavori di sottofondo, indicizzazioni, riassunti a lotti 0.85×
medium Chat standard, sviluppo, prototipi 1.00×
fast Richieste in produzione con un utente che aspetta 1.25×
ludicrous Latenza critica, priorità massima 1.60×
company Contratto aziendale 1.00×

Lo sconto su slow non è un saldo: paga chi accetta bassa priorità, e a noi riempie i buchi di utilizzo. company resta a 1.00× perché quella priorità è già pagata nel contratto, non con un sovrapprezzo sui token.

Perché qui non c'è una colonna «richieste al minuto»

C'era, e prometteva 60, 120, 240 e 1000 richieste al minuto per tier. Non corrispondeva a niente: il limite applicato su /v1/chat/completions era — ed è — uno solo, uguale per tutti, e chi pagava il tier più alto riceveva un sedicesimo di quanto scritto qui.

Non l'abbiamo corretta con quattro numeri nuovi, perché sarebbe un'altra promessa fissa su una capacità che fissa non è. La capacità di calcolo viene allocata da GigaKube in modo dinamico, in base alle richieste in corso: il tier stabilisce la priorità con cui la vostra richiesta entra in coda, non una quota garantita.

Cosa vuol dire in pratica:

  • Il limite tecnico corrente lo trovate nell'intestazione X-RateLimit-Limit della risposta, e vale più di qualunque tabella: è quello che il sistema applica adesso.
  • Se ricevete 429, l'intestazione Retry-After dice quanto aspettare.
  • Se vi serve una soglia garantita per contratto — perché avete un carico noto e non volete dipendere dalla coda — è esattamente ciò che il tier company mette per iscritto. Scriveteci il volume e ve lo quotiamo.

Preferiamo una tabella in meno che un numero che non manteniamo.

I valori sono letti dal database: quelli aggiornati stanno in Pricing.

Come funziona l'instradamento

Ogni sistema che serve modelli ha un peso per tier. Per una richiesta (tier, model):

  1. Si considerano solo i sistemi che servono quel modello, che sono in salute e che hanno un peso maggiore di zero per quel tier.
  2. Si ordina per peso decrescente, poi per coda più corta, poi per carico più basso.
  3. La richiesta va al primo, con la priorità corrispondente al tier.

Se nessun sistema serve il vostro modello al tier richiesto, ricevete 503: non vi dirottiamo silenziosamente su qualcosa di diverso da quello che avete chiesto.

Cosa cambia in pratica

  • Senza contesa i tier si assomigliano. La differenza si vede sotto carico, ed è lì che serve.
  • Tier più alto significa posto garantito in coda, utile quando conta il tempo di risposta del 95° percentile e non la media.
  • I limiti di frequenza sono per tier, e superarli dà 429 con l'indicazione di quando ritentare.

Come si imposta

Per chiave (predefinito)

Area riservata → Chiavi API → modifica → Tier predefinito.

Per singola richiesta

bash
curl https://api.siati.ai/v1/chat/completions \
  -H "Authorization: Bearer $SIATI_API_KEY" \
  -H "X-Siati-Tier: fast" \
  -H "Content-Type: application/json" \
  -d '{ "model": "apertus-70b-instruct", "messages": [...] }'

Se vi serve una garanzia, non una priorità

Il tier più alto vi mette davanti in coda, ma la coda esiste. Per chi ha bisogno di prestazioni prevedibili riserviamo capacità a uso esclusivo, a canone mensile: la vostra richiesta non fa coda dietro a nessuno. Non è listinata perché il prezzo si costruisce sul caso concreto — scriveteci.

Se venite da OpenAI

Da loro i tier sono livelli di accesso legati alla spesa, non priorità per singola richiesta. L'equivalenza è approssimativa:

OpenAI Da noi
Tier 1-2 (predefinito) slow / medium
Tier 3-4 fast
Tier 5 (enterprise) ludicrous
Servizio prioritario Compreso in ludicrous