Velvet-14B
Un LLM fondamentale bilanciato, disponibile in 6 lingue, pensato per una gamma più ampia di applicazioni e con una forte focalizzazione su ragionamento e comprensione del testo.
L’essenza di Velvet-14B
Velvet-14B è un modello instruction-tuned, ottimizzato a partire da Velvet-14B-base utilizzando una combinazione di dataset open source per istruzioni con licenza permissiva e dataset sintetici raccolti internamente, progettati specificamente per risolvere problemi legati a contesti lunghi.
Lingue
Italiano, inglese, spagnolo, portoghese brasiliano, tedesco, francese.
Sono stati compiuti sforzi specifici per bilanciare tutte le lingue, con particolare enfasi sull’italiano, che rappresenta circa il 23% dei dati di addestramento.
Architettura
Modello linguistico auto-regressivo con decoder causale basato su transformer, composto da 50 livelli transformer.
Training Dataset
Il processo di addestramento è iniziato con oltre 10 trilioni di token e si è concluso con oltre 4 trilioni di token.
Context Window
128K token.
Questo garantisce la capacità di elaborare documenti estesi, anche superiori a 400 pagine.
Parametri
14 miliardi di parametri.
Vocabulary
127K token.
Safety
50K istruzioni.
Specialization
2 miliardi di esempi.
Coding
Più di 400 miliardi di token che comprendono più di 100 diversi linguaggi di programmazione per facilitare un tipo di inferenza più strutturato.
Data Freshness
I dati di pre-training hanno un cutoff compreso tra agosto e ottobre 2024.
Licenza
Open-weights con licenza Apache 2.0.
Infrastruttura di training
Costruito da zero su un’architettura densa, è stato addestrato sul supercomputer italiano Leonardo, ospitato da CINECA.
Capabilities
Natural Language Inference
Information Extraction
Multistep Reasoning
Common Sense Reasoning
Function
Calling
Machine Translation
Textual
Entailment
Text
Classification
Question Answering
Multiturn Conversation
Text
Completion
Summarization
Paraphrasing
RAG
Valutazione delle prestazioni
Un comitato di valutazione indipendente ha confrontato Velvet con altri modelli sotto i 30 miliardi di parametri costruiti da zero, utilizzando diverse metriche per valutare il ragionamento logico del modello, le sue capacità di problem solving e la sua capacità di andare oltre le semplici correlazioni statistiche.
Lingua italiana
| Categoria | Benchmark | Velvet-14B |
|---|---|---|
| Generale | MMLU (5-shot) | 58.6 |
| Commonsense | Hellaswag (0-shot) | 72.7 |
| WinoGrande ITA-bench (0-shot) | 73.2 | |
| PIQA ITA-bench (0-shot) | 71.7 | |
| SciQ ITA-bench (0-shot) with p. | 91.9 | |
| Ragionamento | ARC-Challenge (0-shot) | 55.2 |
Lingue UE
| Categoria | Benchmark | Velvet-14B |
|---|---|---|
| Generale | MMLU (5-shot) | 56.4 |
| Instruction Following | IFEval (0-shot) - en | 65.4 |
| Commonsense | Hellaswag (10-shot) | 72.8 |
| WinoGrande (0-shot) - en | 72.5 | |
| Ragionamento | ARC-Challenge (25-shot) | 57.3 |
| MUSR (0-shot) - en | 12.3 | |
| Function Calling | BFCL (AST summary) - en | 67.5 |
Queste metriche valutano il suo ragionamento scientifico, la capacità di generare risposte plausibili e contestualmente pertinenti basate sul senso comune, nonché la comprensione complessiva su più argomenti, con particolare attenzione alla fornitura di risposte accurate e informate.
