Velvet-2B
Un modelo de lenguaje compacto, bilingüe y de alta eficiencia, diseñado para aplicaciones en tiempo real, que ofrece una IA potente incluso en entornos con recursos limitados o en la periferia.
La esencia de Velvet-2B
Velvet-2B es un modelo de instrucciones ajustado a partir de Velvet-2B-base utilizando una combinación de conjuntos de datos de instrucciones de código abierto con licencia permisiva y conjuntos de datos sintéticos recogidos internamente, diseñado para manejar tareas textuales basadas en instrucciones.
Idiomas
Italiano e inglés. Para garantizar un rendimiento multilingüe de alta calidad, el conjunto de datos fue seleccionado para equilibrar la representación lingüística y reducir los sesgos asociados al sobreajuste.
Arquitectura
Modelo de lenguaje auto-regresivo con un diseño causal basado solo en transformadores, construido sobre 28 capas de transformadores.
Parámetros
2.000 millones de parámetros.
Especialización
Más de 1 millón de ejemplares anotados por humanos y sintéticos para SFT.
Seguridad
Más de 50.000 ejemplos generados por humanos para instrucciones de seguridad.
Vocabulario
127K tokens.
Actualización de los datos
Los datos de preentrenamiento tienen un corte entre agosto de 2024 y octubre de 2024.
Licencia
Open weights con licencia Apache 2.0.
Infraestructura de formación
Construido desde cero sobre una arquitectura densa, fue entrenado en el superordenador italiano Leonardo, alojado por CINECA.
Capacidades
Respuesta a preguntas
Traducción automática
Extracción de información
Razonamiento de sentido común
Clasificación de texto
Implicación textual
Completado de texto
Interfaz de lenguaje natural
RAG
Resumen automático
Paráfrasis
Evaluación
Un Comité de Evaluación Independiente comparó Velvet con otros modelos bajo parámetros 30B construidos desde cero, utilizando varias métricas para evaluar el razonamiento lógico, las capacidades de resolución de problemas y la capacidad de ir más allá de las correlaciones estadísticas.
Idioma italiano
| Categoría | Índice de referencia | Velvet-2B |
|---|---|---|
| General | MMLU (5 disparos) | 39.6 |
| Sentido común | Hellaswag (0 disparos) | 54.3 |
| WinoGrande ITA-banquillo (0-shot) | 61.9 | |
| PIQA ITA-press (0-shot) | 67.3 | |
| SciQ ITA-press (0-shot) con p. | 86.6 | |
| Razonamiento | ARC-Challenge (0-disparo) | 41.7 |
Idioma inglés
| Categoría | Índice de referencia | Velvet-2B |
|---|---|---|
| General | MMLU (5 disparos) | 43.4 |
| Seguimiento de la instrucción | IFEval (0-shot) | 53.2 |
| Sentido común | Hellaswag (10 disparos) | 65.0 |
| WinoGrande (0 disparos) | 60.9 | |
| Razonamiento | ARC-Challenge (25 disparos) | 50.6 |
Estas métricas evalúan su razonamiento científico, su capacidad para generar respuestas plausibles y contextualmente relevantes basadas en el sentido común y su comprensión general en múltiples materias, centrándose en proporcionar respuestas precisas e informadas.
Por qué Velvet-2B
Velvet-2B está diseñado para un ajuste fino eficiente en tareas especializadas, lo que lo convierte en una solución flexible para diferentes casos de uso. No todos los desafíos exigen el mismo enfoque; Algunos escenarios requieren velocidad y escalabilidad, mientras que otros enfrentan limitaciones relacionadas con el coste o la capacidad del hardware.
Altos volúmenes
Velvet-2B ofrece una solución ágil y sensible para organizaciones que manejan grandes cantidades de datos en tiempo (casi) real, manteniendo un equilibrio óptimo entre velocidad y rendimiento.
Alcance más reducido
Velvet-2B ofrece resultados eficientes y rentables adaptados a las necesidades específicas de organizaciones más pequeñas con recursos computacionales limitados.
Tareas Limitadas
Debido a su capacidad de ajustarse fácilmente con hardware mínimo, Velvet-2B es ideal para tareas muy específicas con objetivos bien definidos.
Descubre Modelos de IA de Velvet
Velvet-25B
Velvet-14B
Velvet-2B
Velvet-2B-1.5
Velvet Speech-2B
Échale un vistazo sobre Abrazando la Cara
Descubre y descarga modelos de IA de terciopelo
