Skip links

Velvet-2B

Un modelo de lenguaje compacto, bilingüe y de alta eficiencia, diseñado para aplicaciones en tiempo real, que ofrece una IA potente incluso en entornos con recursos limitados o en la periferia.

La esencia de Velvet-2B

Velvet-2B es un modelo de instrucciones ajustado a partir de Velvet-2B-base utilizando una combinación de conjuntos de datos de instrucciones de código abierto con licencia permisiva y conjuntos de datos sintéticos recogidos internamente, diseñado para manejar tareas textuales basadas en instrucciones.

Idiomas

Italiano e inglés. Para garantizar un rendimiento multilingüe de alta calidad, el conjunto de datos fue seleccionado para equilibrar la representación lingüística y reducir los sesgos asociados al sobreajuste.

Arquitectura

Modelo de lenguaje auto-regresivo con un diseño causal basado solo en transformadores, construido sobre 28 capas de transformadores.

Parámetros

2.000 millones de parámetros.

Especialización

Más de 1 millón de ejemplares anotados por humanos y sintéticos para SFT.

Seguridad

Más de 50.000 ejemplos generados por humanos para instrucciones de seguridad.

Vocabulario

127K tokens.

Actualización de los datos

Los datos de preentrenamiento tienen un corte entre agosto de 2024 y octubre de 2024.

Licencia

Open weights con licencia Apache 2.0.

Infraestructura de formación

Construido desde cero sobre una arquitectura densa, fue entrenado en el superordenador italiano Leonardo, alojado por CINECA.

Capacidades

Respuesta a preguntas
Traducción automática
Extracción de información
Razonamiento de sentido común
Clasificación de texto
Implicación textual
Completado de texto
Interfaz de lenguaje natural
RAG
Resumen automático
Paráfrasis

Evaluación

Un Comité de Evaluación Independiente comparó Velvet con otros modelos bajo parámetros 30B construidos desde cero, utilizando varias métricas para evaluar el razonamiento lógico, las capacidades de resolución de problemas y la capacidad de ir más allá de las correlaciones estadísticas.  

Idioma italiano
CategoríaÍndice de referenciaVelvet-2B
GeneralMMLU (5 disparos)39.6
Sentido comúnHellaswag (0 disparos)54.3
WinoGrande ITA-banquillo (0-shot)61.9
PIQA ITA-press (0-shot)67.3
SciQ ITA-press (0-shot) con p.86.6
RazonamientoARC-Challenge (0-disparo)41.7
Idioma inglés
CategoríaÍndice de referenciaVelvet-2B
GeneralMMLU (5 disparos)43.4
Seguimiento de la instrucciónIFEval (0-shot)53.2
Sentido comúnHellaswag (10 disparos)65.0
WinoGrande (0 disparos)60.9
RazonamientoARC-Challenge (25 disparos)50.6

Estas métricas evalúan su razonamiento científico, su capacidad para generar respuestas plausibles y contextualmente relevantes basadas en el sentido común y su comprensión general en múltiples materias, centrándose en proporcionar respuestas precisas e informadas.

Por qué Velvet-2B

Velvet-2B está diseñado para un ajuste fino eficiente en tareas especializadas, lo que lo convierte en una solución flexible para diferentes casos de uso. No todos los desafíos exigen el mismo enfoque; Algunos escenarios requieren velocidad y escalabilidad, mientras que otros enfrentan limitaciones relacionadas con el coste o la capacidad del hardware. 

1
Altos volúmenes

Velvet-2B ofrece una solución ágil y sensible para organizaciones que manejan grandes cantidades de datos en tiempo (casi) real, manteniendo un equilibrio óptimo entre velocidad y rendimiento.

2
Alcance más reducido

Velvet-2B ofrece resultados eficientes y rentables adaptados a las necesidades específicas de organizaciones más pequeñas con recursos computacionales limitados.

3
Tareas Limitadas

Debido a su capacidad de ajustarse fácilmente con hardware mínimo, Velvet-2B es ideal para tareas muy específicas con objetivos bien definidos.

Descubre  Modelos de IA de Velvet

Échale un vistazo  sobre Abrazando la Cara

Descubre y descarga modelos de IA de terciopelo