Concepts
Models
Come scegliamo cosa servire, cosa significa \"pesi aperti\" da noi, e quale modello serve per quale lavoro.
Last updated: 2026-07-26
Modelli
Serviamo modelli a pesi aperti sulla nostra infrastruttura in Svizzera. Nessuna API chiusa di terzi nel mezzo, nessun costo opaco: sapete quale modello risponde, e potete verificarne provenienza e licenza.
Il catalogo
L'elenco sempre aggiornato sta in Models catalog, letto direttamente dal database. Quello qui sotto è lo stesso, in forma commentata.
| Modello | model_id |
A cosa serve | Origine |
|---|---|---|---|
| Apertus 70B Instruct | apertus-70b-instruct |
Predefinito per la conversazione e per le risposte sui vostri documenti. Italiano, tedesco, francese, inglese, romancio | 🇨🇭 Swiss AI Initiative — EPFL, ETH Zurigo, CSCS |
| Gemma 4 26B | gemma-4-26b |
Accetta immagini in input. Buono nel restituire dati strutturati da un testo libero: estrazione di campi da documenti | 🇺🇸 Google DeepMind |
| Qwen 2.5 32B | qwen2.5:32b |
Il più capace di taglia media: analisi che richiedono più passaggi di ragionamento | 🇨🇳 Alibaba |
| Qwen 2.5 14B | qwen2.5:14b |
Compromesso fra qualità e rapidità. La scelta per il volume: classificazione, riassunti, bozze | 🇨🇳 Alibaba |
| Qwen 2.5 1.5B | qwen2.5:1.5b |
Compiti semplici e ripetitivi dove conta il tempo di risposta | 🇨🇳 Alibaba |
| BGE-M3 | bge-m3 |
Vettori per la ricerca semantica, 1024 dimensioni, multilingua | 🇨🇳 BAAI |
| BGE-reranker-v2-m3 | bge-reranker-v2-m3 |
Riordino dei risultati di una ricerca, seconda passata | 🇨🇳 BAAI |
Per l'audio: whisper-1 e whisper-1-hd per la trascrizione, le voci paola, riccardo, amy, ryan, thorsten, siwis per la sintesi. Sono documentati in Audio API e non compaiono in /v1/models, come nell'API di OpenAI.
Immagini in input
Solo gemma-4-26b, fino a 2 immagini per richiesta. Il badge vision nel catalogo segnala quali modelli le accettano; mandarne una a un modello che non le accetta ritorna un errore 400 con l'elenco di quelli che le accettano — non un errore generico di backend.
Formati: PNG, JPEG, WebP, GIF. Massimo 8 MB e 40 megapixel per immagine. Il formato della richiesta è in Chat completions.
Come scegliamo cosa servire
Tre criteri:
- Licenza: utilizzabile commercialmente senza sorprese.
- Qualità: al vertice della sua categoria di dimensione al momento dell'inserimento.
- Sostenibilità: deve girare in modo efficiente sulla capacità che abbiamo. Non aggiungiamo un modello se peggiora il servizio per tutti gli altri.
Escludiamo i modelli che comunicano verso l'esterno durante l'inferenza, quelli il cui accesso è vincolato in modi che non possiamo verificare, e quelli il cui ecosistema raccoglie dati degli utenti.
Quantizzazione
I modelli grandi vengono serviti quantizzati: una rappresentazione numerica più compatta, che riduce la memoria necessaria e aumenta la capacità di servizio a fronte di una perdita di qualità minima e misurata.
È invisibile a chi chiama l'API: il model_id è lo stesso indipendentemente da come il modello è caricato, e se cambiamo la quantizzazione non cambia il vostro codice.
Quale scegliere
| Se dovete | Usate |
|---|---|
| Conversazione in italiano, caso generale | apertus-70b-instruct |
| Leggere un'immagine o una scansione | gemma-4-26b |
| Estrarre campi strutturati da un testo | gemma-4-26b |
| Analizzare un documento complesso | qwen2.5:32b |
| Classificare o riassumere a volume | qwen2.5:14b |
| Rispondere in pochi millisecondi a compiti banali | qwen2.5:1.5b |
| Cercare per significato nei vostri testi | bge-m3 via /v1/embeddings |
| Migliorare l'ordine dei risultati | bge-reranker-v2-m3 via /v1/rerank |
Ogni richiesta indica un model_id. Dove eseguirla lo decidiamo noi.
Tier e modelli
Il tier non determina quale modello potete usare, né quanto costa: governa la priorità con cui la richiesta entra in coda. Il prezzo dipende dal modello. Il dettaglio è in Tiers e nel listino live.
Se vi serve un modello che non abbiamo
Scrivetecelo. Aggiungere un modello a pesi aperti è un'operazione meccanica e la facciamo su richiesta per i clienti aziendali. Se invece serve un modello addestrato sulla vostra terminologia, è un progetto a sé: parliamone.