siati.ai docs

Concepts

Models

Come scegliamo cosa servire, cosa significa \"pesi aperti\" da noi, e quale modello serve per quale lavoro.

Last updated: 2026-07-26

Modelli

Serviamo modelli a pesi aperti sulla nostra infrastruttura in Svizzera. Nessuna API chiusa di terzi nel mezzo, nessun costo opaco: sapete quale modello risponde, e potete verificarne provenienza e licenza.

Il catalogo

L'elenco sempre aggiornato sta in Models catalog, letto direttamente dal database. Quello qui sotto è lo stesso, in forma commentata.

Modello model_id A cosa serve Origine
Apertus 70B Instruct apertus-70b-instruct Predefinito per la conversazione e per le risposte sui vostri documenti. Italiano, tedesco, francese, inglese, romancio 🇨🇭 Swiss AI Initiative — EPFL, ETH Zurigo, CSCS
Gemma 4 26B gemma-4-26b Accetta immagini in input. Buono nel restituire dati strutturati da un testo libero: estrazione di campi da documenti 🇺🇸 Google DeepMind
Qwen 2.5 32B qwen2.5:32b Il più capace di taglia media: analisi che richiedono più passaggi di ragionamento 🇨🇳 Alibaba
Qwen 2.5 14B qwen2.5:14b Compromesso fra qualità e rapidità. La scelta per il volume: classificazione, riassunti, bozze 🇨🇳 Alibaba
Qwen 2.5 1.5B qwen2.5:1.5b Compiti semplici e ripetitivi dove conta il tempo di risposta 🇨🇳 Alibaba
BGE-M3 bge-m3 Vettori per la ricerca semantica, 1024 dimensioni, multilingua 🇨🇳 BAAI
BGE-reranker-v2-m3 bge-reranker-v2-m3 Riordino dei risultati di una ricerca, seconda passata 🇨🇳 BAAI

Per l'audio: whisper-1 e whisper-1-hd per la trascrizione, le voci paola, riccardo, amy, ryan, thorsten, siwis per la sintesi. Sono documentati in Audio API e non compaiono in /v1/models, come nell'API di OpenAI.

Immagini in input

Solo gemma-4-26b, fino a 2 immagini per richiesta. Il badge vision nel catalogo segnala quali modelli le accettano; mandarne una a un modello che non le accetta ritorna un errore 400 con l'elenco di quelli che le accettano — non un errore generico di backend.

Formati: PNG, JPEG, WebP, GIF. Massimo 8 MB e 40 megapixel per immagine. Il formato della richiesta è in Chat completions.

Come scegliamo cosa servire

Tre criteri:

  1. Licenza: utilizzabile commercialmente senza sorprese.
  2. Qualità: al vertice della sua categoria di dimensione al momento dell'inserimento.
  3. Sostenibilità: deve girare in modo efficiente sulla capacità che abbiamo. Non aggiungiamo un modello se peggiora il servizio per tutti gli altri.

Escludiamo i modelli che comunicano verso l'esterno durante l'inferenza, quelli il cui accesso è vincolato in modi che non possiamo verificare, e quelli il cui ecosistema raccoglie dati degli utenti.

Quantizzazione

I modelli grandi vengono serviti quantizzati: una rappresentazione numerica più compatta, che riduce la memoria necessaria e aumenta la capacità di servizio a fronte di una perdita di qualità minima e misurata.

È invisibile a chi chiama l'API: il model_id è lo stesso indipendentemente da come il modello è caricato, e se cambiamo la quantizzazione non cambia il vostro codice.

Quale scegliere

Se dovete Usate
Conversazione in italiano, caso generale apertus-70b-instruct
Leggere un'immagine o una scansione gemma-4-26b
Estrarre campi strutturati da un testo gemma-4-26b
Analizzare un documento complesso qwen2.5:32b
Classificare o riassumere a volume qwen2.5:14b
Rispondere in pochi millisecondi a compiti banali qwen2.5:1.5b
Cercare per significato nei vostri testi bge-m3 via /v1/embeddings
Migliorare l'ordine dei risultati bge-reranker-v2-m3 via /v1/rerank

Ogni richiesta indica un model_id. Dove eseguirla lo decidiamo noi.

Tier e modelli

Il tier non determina quale modello potete usare, né quanto costa: governa la priorità con cui la richiesta entra in coda. Il prezzo dipende dal modello. Il dettaglio è in Tiers e nel listino live.

Se vi serve un modello che non abbiamo

Scrivetecelo. Aggiungere un modello a pesi aperti è un'operazione meccanica e la facciamo su richiesta per i clienti aziendali. Se invece serve un modello addestrato sulla vostra terminologia, è un progetto a sé: parliamone.