Velvet-2B
Um modelo de linguagem compacto, bilíngue e de alta eficiência, construído para aplicações em tempo real, entregando IA poderosa mesmo em ambientes com recursos limitados ou na borda.
A essência de Velvet-2B
Velvet-2B é um modelo instrutor ajustado a partir da base Velvet-2B usando uma combinação de conjuntos de dados de instruções de código aberto com licença permissiva e conjuntos de dados sintéticos coletados internamente, projetado para lidar com tarefas textuais baseadas em instruções.
Idiomas
Italiano e inglês. Para garantir um desempenho multilíngue de alta qualidade, o conjunto de dados foi selecionado para equilibrar a representação linguística, reduzindo vieses de sobreajuste.
Arquitetura
Modelo de linguagem auto-regressivo com um design causal baseado apenas em transformadores, construído sobre 28 camadas de transformador.
Parâmetros
2 bilhões de parâmetros.
Especialização
Mais de 1 milhão de exemplos humanos e sintéticos para SFT.
Segurança
Mais de 50 mil exemplos gerados por humanos para instruções de segurança.
Vocabulário
127K tokens.
Frescura dos Dados
Os dados de pré-treinamento têm um limite entre agosto de 2024 e outubro de 2024.
Licença
Open Weights com licença Apache 2.0.
Infraestrutura de treinamento
Construído do zero sobre uma arquitetura densa, foi treinado no supercomputador Leonardo da Itália, hospedado pela CINECA.
Capacidades
Resposta a perguntas
Tradução automática
Extração de informações
Raciocínio de senso comum
Classificação de texto
Implicação textual
Completação de texto
Interface de linguagem natural
RAG
Sumarização
Paráfrase
Avaliação
Um Conselho de Avaliação Independente comparou o Velvet com outros modelos sob parâmetros 30B construídos do zero, utilizando várias métricas para avaliar o raciocínio lógico, as capacidades de resolução de problemas e a capacidade de ir além das correlações estatísticas.
Língua italiana
| Categoria | Referência | Velvet-2B |
|---|---|---|
| Geral | MMLU (5 tiros) | 39.6 |
| Bom senso | Hellaswag (0 tiros) | 54.3 |
| WinoGrande no banco ITA (0 tacadas) | 61.9 | |
| PIQA ITA - Banco (0-shot) | 67.3 | |
| SciQ ITA-supino (0-shot) com p. | 86.6 | |
| Raciocínio | ARC-Challenge (0-shot) | 41.7 |
Língua inglesa
| Categoria | Referência | Velvet-2B |
|---|---|---|
| Geral | MMLU (5 tiros) | 43.4 |
| Seguindo a Instrução | IFEval (0-shot) | 53.2 |
| Bom senso | Hellaswag (10 tiros) | 65.0 |
| WinoGrande (0 de tiro) | 60.9 | |
| Raciocínio | ARC-Challenge (25 tiros) | 50.6 |
Essas métricas avaliam seu raciocínio científico, capacidade de gerar respostas plausíveis e contextualmente relevantes baseadas no bom senso e compreensão geral em múltiplos assuntos, focando em fornecer respostas precisas e informadas.
Por que Velvet-2B
O Velvet-2B foi projetado para ajuste fino eficiente em tarefas especializadas, tornando-se uma solução flexível para diferentes casos de uso. Nem todos os desafios exigem a mesma abordagem; Alguns cenários exigem velocidade e escalabilidade, enquanto outros enfrentam restrições relacionadas ao custo ou à capacidade de hardware.
Volumes Altos
O Velvet-2B oferece uma solução ágil e responsiva para organizações que lidam com grandes volumes de dados em tempo (quase) tempo real, mantendo um equilíbrio ótimo entre velocidade e desempenho.
Escopo mais restrito
A Velvet-2B entrega resultados eficientes e econômicos, adaptados às necessidades específicas de organizações menores com recursos computacionais limitados.
Tarefas Restritas
Devido à sua capacidade de ser facilmente ajustado com hardware mínimo, o Velvet-2B é ideal para tarefas altamente específicas com objetivos bem definidos.
