Skip links

Velvet-14B

Um LLM fundamental e equilibrado, com 6 idiomas, para uma gama mais ampla de aplicações e com forte foco em raciocínio e compreensão de texto.

A essência do  Velvet-14B

Velvet-14B é um modelo instrutor ajustado a partir da base Velvet-14B usando uma combinação de conjuntos de dados de instruções de código aberto com licença permissiva e conjuntos de dados sintéticos coletados internamente voltados para resolver problemas de contexto longo.

Idiomas

Italiano, inglês, espanhol, português brasileiro, alemão, francês.
Foram feitos esforços específicos para equilibrar todas as línguas, com ênfase particular no italiano, que representa aproximadamente 23% dos dados de treinamento.

Arquitetura

Modelo de linguagem auto-regressivo com um design causal baseado apenas em transformador, com 50 camadas de transformador.

Conjunto de Dados de Treinamento

O processo de treinamento começou com mais de 10 trilhões de tokens e terminou com mais de 4 trilhões de tokens.

Janela de Contexto

128K tokens.
Isso garante a capacidade de processar documentos extensos, ultrapassando até 400 páginas.

Parâmetros

14 bilhões de parâmetros.

Vocabulário

127K tokens.

Segurança

Instruções de 50K.

Especialização

Exemplos 2B.

Codificação

Mais de 400 bilhões de tokens de mais de 100 linguagens de programação para facilitar inferências mais estruturadas.

Frescura dos Dados

Os dados de pré-treinamento têm um limite entre agosto e outubro de 2024.

Licença

Peso aberto com licença Apache 2.0.

Infraestrutura de treinamento

Construído do zero sobre uma arquitetura densa, foi treinado no supercomputador Leonardo da Itália, hospedado pela CINECA.

Capacidades

Inferência de linguagem natural
Extração de informações
Raciocínio em múltiplas etapas
Raciocínio de senso comum
Function Calling
Tradução automática
Implicação textual
Classificação de texto
Resposta a perguntas
Conversação multiturno
Completação de texto
Sumarização
Paráfrase
RAG

Avaliação de Desempenho

Um Conselho de Avaliação Independente comparou o Velvet com outros modelos sob parâmetros 30B construídos do zero, utilizando várias métricas para avaliar o raciocínio lógico, as capacidades de resolução de problemas e a capacidade de ir além das correlações estatísticas.

Língua italiana
CategoriaReferênciaVelvet-14B
GeralMMLU (5 tiros)58.6
Bom sensoHellaswag (0 tiros)72.7
WinoGrande no banco ITA (0 tacadas)73.2
PIQA ITA - Banco (0-shot)71.7
SciQ ITA-supino (0-shot) com p.91.9
RaciocínioARC-Challenge (0-shot)55.2
Línguas da UE
CategoriaReferênciaVelvet-14B
GeralMMLU (5 tiros)56.4
Seguindo a InstruçãoIFEval (0-shot) - en65.4
Bom sensoHellaswag (10 tiros)72.8
WinoGrande (0-shot) - en72.5
RaciocínioARC-Challenge (25 tiros)57.3
MUSR (0-shot) - en12.3
Chamada de FunçãoBFCL (resumo AST) - en67.5

Essas métricas avaliam seu raciocínio científico, capacidade de gerar respostas plausíveis e contextualmente relevantes baseadas no bom senso e compreensão geral em múltiplos assuntos, focando em fornecer respostas precisas e informadas.

Descubra Modelos de IA Velvet

Confira  em Hugging Face

Descubra e baixe modelos de IA Velvet