Skip links

Velvet-2B

Un modello linguistico compatto, bilingue e ad alta efficienza, progettato per applicazioni in tempo reale, in grado di offrire potenti capacità di IA anche in contesti con risorse limitate o in ambienti edge. 

L’essenza di Velvet-2B

Velvet-2B è un modello instruction fine-tuned a partire da Velvet-2B-base, utilizzando una combinazione di dataset open source per istruzioni con licenza permissiva e dataset sintetici raccolti internamente, progettato per gestire attività testuali basate su istruzioni. 

Lingue

Italiano e inglese. Per garantire prestazioni multilingue di alta qualità, il dataset è stato curato in modo da bilanciare la rappresentazione linguistica, riducendo i bias dovuti all’overfitting. 

Architettura

Modello linguistico autoregressivo con decoder causale basato su transformer, costruito su 28 layer transformer. 

Parametri

2 miliardi di parametri. 

Specialization

Oltre 1 milione di esempi annotati da esseri umani e sintetici per il supervised fine-tuning (SFT). 

Safety

Oltre 50.000 esempi generati da esseri umani per istruzioni di sicurezza. 

Vocabulary

127.000 token. 

Data Freshness

I dati di pre-training hanno un cutoff compreso tra agosto 2024 e ottobre 2024. 

Licenza

Pesi aperti con licenza Apache 2.0. 

Infrastruttura di training

Costruito da zero su un’architettura densa, è stato addestrato sul supercomputer italiano Leonardo, ospitato da CINECA.

Capabilities

Question
Answering
Machine
Translation
Information Extraction
Common Sense Reasoning
Text
Classification
Textual
Entailment
Text
Completion
Natural Language
Interface
RAG
Summarization
Paraphrasing

Valutazione  delle prestazioni

Un comitato di valutazione indipendente ha confrontato Velvet con altri modelli sotto i 30 miliardi di parametri costruiti da zero, utilizzando diverse metriche per valutare il ragionamento logico del modello, le capacità di problem solving e l’abilità di andare oltre semplici correlazioni statistiche. 

Lingua italiana
CategoriaBenchmarkVelvet-2B
GeneraleMMLU (5-shot)39.6
CommonsenseHellaswag (0-shot)54.3
WinoGrande ITA-bench (0-shot)61.9
PIQA ITA-bench (0-shot)67.3
SciQ ITA-bench (0-shot) with p.86.6
RagionamentoARC-Challenge (0-shot)41.7
English language
CategoriaBenchmarkVelvet-2B
GeneraleMMLU (5-shot)43.4
Instruction FollowingIFEval (0-shot)53.2
CommonsenseHellaswag (10-shot)65.0
WinoGrande (0-shot)60.9
RagionamentoARC-Challenge (25-shot)50.6

Queste metriche valutano il ragionamento scientifico, la capacità di generare risposte plausibili e contestualmente pertinenti basate sul senso comune, e la comprensione complessiva su più discipline, con particolare attenzione alla fornitura di risposte accurate e informate. 

Perché Velvet-2B

Velvet-2B è progettato per un fine-tuning efficiente su compiti specialistici, rendendolo una soluzione flessibile per diversi casi d’uso. Non tutte le sfide richiedono lo stesso approccio: alcuni scenari richiedono velocità e scalabilità, mentre altri devono affrontare vincoli legati ai costi o alla capacità hardware.

1
Volumi elevati

Velvet-2B offre una soluzione reattiva e agile per le organizzazioni che gestiscono grandi quantità di dati in tempo (quasi) reale, mantenendo un equilibrio ottimale tra velocità e prestazioni. 

2
Ambito più ristretto

Velvet-2B offre risultati efficienti e convenienti, su misura per le esigenze specifiche di organizzazioni più piccole con risorse computazionali limitate. 

3
Compiti mirati

Grazie alla sua capacità di essere facilmente sottoposto a fine-tuning con hardware minimo, Velvet-2B è ideale per attività altamente specifiche con obiettivi ben definiti. 

Scopri tutti i modelli Velvet

Cercalosu Hugging Face

Scopri e scarica i modelli Velvet AI.