Logotipo de LeoLabs
Laboratorio de modelos

Local AI Benchmark Suite

2026-08-28 12:55 CEST

🤖 Puntuación general

🧭 Conclusiones y recomendación

  • Composición
    • Fiabilidad ponderada: 70 puntos (básico ×2, medio ×3 y alto ×1).
    • Formato: 10 puntos.
    • Velocidad: 10 puntos.
    • TTFA: 10 puntos.
  • Referencias de esta ejecución
    • Interpretación
      • Índice relativo al conjunto comparado.
      • No mide inteligencia absoluta.
      • Las abreviaturas y cuantizaciones se explican en la pestaña Glosario.

    Comparativa agregada ponderada

    Resultado por disciplina combinando las pruebas Básicas ×2, Medias ×3 y Altas ×1. Los errores de formato se puntúan por separado.

    Comparativas por nivel de dificultad

    Cada gráfica muestra únicamente las pruebas de su nivel, sin aplicar ponderación entre niveles.

    Vista comparativa

    Conclusiones y recomendación

    Resultados por dificultad

    La tasa se calcula de forma independiente para los niveles básico, medio y alto.

    Perfil por categorías

    Vista agregada y ponderada de todas las dificultades (Básico ×2, Medio ×3 y Alto ×1). Compara los tres modelos mejor clasificados; cuanto más se acerca el perfil al borde, mayor es la tasa de respuestas válidas.

    Fiabilidad y formato

    Éxito por categoría

    Éxito semántico; el formato estricto se mantiene aparte.

    🚀 Rendimiento e inferencia

    Lectura del rendimiento. Esta vista separa la velocidad de generación de los recursos utilizados durante las llamadas. Las cifras son comparables dentro de esta misma ejecución y este mismo equipo.

    Indicadores destacados

    Calidad frente a coste energético

    Arriba y a la izquierda es mejor: mayor puntuación con menor coste por respuesta válida.

    Tokens por ejecución

    Mediana de tokens de entrada y salida. Se muestran por separado la entrada, el razonamiento y la respuesta visible. La etiqueta «estimado» indica que el backend sólo comunicó el total de salida.

    Rendimiento relativo

    Barras verticales: velocidad de salida relativa al modelo más rápido.

    Recursos durante inferencia

    Medianas de las muestras disponibles para VRAM, potencia y temperatura de GPU, y RAM del sistema.

    Pruebas ejecutadas

    Comparación visual del porcentaje de respuestas válidas de cada modelo. Abre una prueba para consultar el prompt, las métricas y las respuestas.
    Tabla completa de pruebas
    PruebaCategoríaEstadoDetalle

    Hardware y entorno de ejecución

    Modelos LLM utilizados

    Configuración efectiva, asignación de cálculo y enlaces a la fuente de cada modelo evaluado.

    ⚡ Consumo energético

    Comparación visual

    Resumen energético por modelo

    Detalle de medición por modelo

    Metodología y alcance

    📦 Datos técnicos y exportación

    Contenido reutilizable. Esta pestaña reúne el entorno de ejecución, la configuración de los modelos y los resultados medidos. Puedes copiar el texto o descargar los datos para analizarlos con una hoja de cálculo u otra herramienta.

    Hardware y entorno

    Modelos evaluados

    Resultados de las pruebas

    Configuración efectiva y estadísticas completas

    📐 Benchmarks estándar

    Metodología separada. Resultados producidos por LM Evaluation Harness. No forman parte del LeoLabs Score ni alteran su ranking. La métrica principal depende de cada tarea.
    Telemetría: lm-eval no expone de forma equivalente TTFA/TTFT visible ni separa siempre razonamiento y respuesta. Esos campos no se comparan con el motor nativo.

    📊 Comparación global de todas las pruebas

    El promedio descriptivo excluye la fila agregada mmlu_pro para evitar duplicar sus materias. «Mejores» cuenta victorias y empates.

    Normal
    78.8%15 mejores
    Abliterated
    43.8%2 mejores
    Uncensored
    32.5%0 mejores
    PruebaNormalAbliteratedUncensored
    Resultado global78.8%43.8%32.5%
    ifeval60%20%20%
    gsm8k60%80%60%
    mmlu_pro_biology80%40%40%
    mmlu_pro_business80%0%40%
    mmlu_pro_chemistry100%40%40%
    mmlu_pro_computer_science80%40%40%
    mmlu_pro_economics100%60%60%
    mmlu_pro_engineering100%80%0%
    mmlu_pro_health80%60%0%
    mmlu_pro_history60%60%40%
    mmlu_pro_law60%20%0%
    mmlu_pro_math80%40%60%
    mmlu_pro_other80%60%20%
    mmlu_pro_philosophy80%60%60%
    mmlu_pro_physics80%0%40%
    mmlu_pro_psychology80%40%0%
    mmlu_pro81%43%31%
    0% negro → 100% verdemejor resultado o empate

    🧭 Análisis y recomendaciones

    Normal

    Promedio descriptivo: 78.8% · mejor resultado o empate en 15 de 16 pruebas.
    Puntos fuertes: mmlu_pro_chemistry (100%), mmlu_pro_economics (100%), mmlu_pro_engineering (100%).
    Puntos débiles: gsm8k (60%), mmlu_pro_history (60%), mmlu_pro_law (60%).

    Abliterated

    Promedio descriptivo: 43.8% · mejor resultado o empate en 2 de 16 pruebas.
    Puntos fuertes: gsm8k (80%), mmlu_pro_engineering (80%), mmlu_pro_economics (60%).
    Puntos débiles: mmlu_pro_law (20%), mmlu_pro_business (0%), mmlu_pro_physics (0%).

    Uncensored

    Promedio descriptivo: 32.5% · mejor resultado o empate en 0 de 16 pruebas.
    Puntos fuertes: gsm8k (60%), mmlu_pro_economics (60%), mmlu_pro_math (60%).
    Puntos débiles: mmlu_pro_health (0%), mmlu_pro_law (0%), mmlu_pro_psychology (0%).

    Recomendación práctica

    Normal es la opción más sólida para uso general en esta ejecución, con 35.0 puntos de ventaja media sobre el segundo. Para problemas matemáticos tipo GSM8K destaca Abliterated. Las variantes modificadas sólo deberían preferirse si su comportamiento específico es un requisito y se acepta la pérdida de precisión observada.

    Cómo interpretar esta ejecución

    Es una batería abreviada y orientativa: se han tomado 5 ejemplos representativos por categoría o subtarea. Con una muestra tan pequeña, cada acierto pesa mucho y equivale a saltos de 20 puntos porcentuales. Los promedios anteriores excluyen el agregado mmlu_pro para no contar sus 14 materias dos veces, pero no constituyen una puntuación oficial. Conviene confirmar cualquier decisión importante ejecutando la batería completa y varias semillas.

    ifeval

    Evalúa si el modelo cumple instrucciones objetivamente verificables sobre formato, contenido y longitud. Ver documentación oficial ↗

    prompt_level_strict_acc,none · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 60.00%60.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 20.00%20.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 20.00%20.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    gsm8k

    Problemas matemáticos escolares redactados en lenguaje natural que requieren razonamiento en varios pasos. Ver documentación oficial ↗

    exact_match,strict-match · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 60.00%60.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 80.00%80.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 60.00%60.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_biology

    Subprueba MMLU-Pro de biología: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 80.00%80.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 40.00%40.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 40.00%40.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_business

    Subprueba MMLU-Pro de empresa y gestión: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 80.00%80.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 0.00%0.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 40.00%40.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_chemistry

    Subprueba MMLU-Pro de química: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 100.00%100.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 40.00%40.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 40.00%40.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_computer_science

    Subprueba MMLU-Pro de informática: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 80.00%80.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 40.00%40.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 40.00%40.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_economics

    Subprueba MMLU-Pro de economía: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 100.00%100.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 60.00%60.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 60.00%60.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_engineering

    Subprueba MMLU-Pro de ingeniería: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 100.00%100.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 80.00%80.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 0.00%0.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_health

    Subprueba MMLU-Pro de salud y ciencias médicas: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 80.00%80.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 60.00%60.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 0.00%0.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_history

    Subprueba MMLU-Pro de historia: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 60.00%60.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 60.00%60.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 40.00%40.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_law

    Subprueba MMLU-Pro de derecho: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 60.00%60.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 20.00%20.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 0.00%0.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_math

    Subprueba MMLU-Pro de matemáticas: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 80.00%80.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 40.00%40.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 60.00%60.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_other

    Subprueba MMLU-Pro de otras disciplinas no incluidas en las categorías principales: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 80.00%80.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 60.00%60.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 20.00%20.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_philosophy

    Subprueba MMLU-Pro de filosofía: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 80.00%80.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 60.00%60.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 60.00%60.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_physics

    Subprueba MMLU-Pro de física: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 80.00%80.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 0.00%0.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 40.00%40.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro_psychology

    Subprueba MMLU-Pro de psicología: preguntas de opción múltiple que combinan conocimiento y razonamiento. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 80.00%80.0%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 40.00%40.0%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 0.00%0.0%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo

    mmlu_pro

    Resultado agregado de MMLU-Pro: preguntas más exigentes de conocimiento y razonamiento en 14 materias. Ver documentación oficial ↗

    exact_match,custom-extract · mayor es mejor
    0%25%50%75%100%Qwen 3.8 27B normal Q4_K_M - 32K - directo: 81.43%81.4%Qwen 3.8 27B Abliterated Q4_K_M - 32K - directo: 42.86%42.9%Qwen 3.8 27B Uncensored Q4_K_M - 32K - directo: 31.43%31.4%
    Qwen 3.8 27B normal Q4_K_M - 32K - directoQwen 3.8 27B Abliterated Q4_K_M - 32K - directoQwen 3.8 27B Uncensored Q4_K_M - 32K - directo
    ModeloTareaMétrica principalResultadoError estándarFew-shot
    Qwen 3.8 27B normal Q4_K_M - 32K - directoifevalprompt_level_strict_acc,none60.00%± 24.49 pp0
    Qwen 3.8 27B normal Q4_K_M - 32K - directogsm8kexact_match,strict-match60.00%± 24.49 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_biologyexact_match,custom-extract80.00%± 20.00 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_businessexact_match,custom-extract80.00%± 20.00 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_chemistryexact_match,custom-extract100.00%± 0.00 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_computer_scienceexact_match,custom-extract80.00%± 20.00 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_economicsexact_match,custom-extract100.00%± 0.00 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_engineeringexact_match,custom-extract100.00%± 0.00 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_healthexact_match,custom-extract80.00%± 20.00 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_historyexact_match,custom-extract60.00%± 24.49 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_lawexact_match,custom-extract60.00%± 24.49 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_mathexact_match,custom-extract80.00%± 20.00 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_otherexact_match,custom-extract80.00%± 20.00 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_philosophyexact_match,custom-extract80.00%± 20.00 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_physicsexact_match,custom-extract80.00%± 20.00 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_pro_psychologyexact_match,custom-extract80.00%± 20.00 pp5
    Qwen 3.8 27B normal Q4_K_M - 32K - directommlu_proexact_match,custom-extract81.43%± 4.95 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directoifevalprompt_level_strict_acc,none20.00%± 20.00 pp0
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directogsm8kexact_match,strict-match80.00%± 20.00 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_biologyexact_match,custom-extract40.00%± 24.49 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_businessexact_match,custom-extract0.00%± 0.00 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_chemistryexact_match,custom-extract40.00%± 24.49 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_computer_scienceexact_match,custom-extract40.00%± 24.49 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_economicsexact_match,custom-extract60.00%± 24.49 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_engineeringexact_match,custom-extract80.00%± 20.00 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_healthexact_match,custom-extract60.00%± 24.49 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_historyexact_match,custom-extract60.00%± 24.49 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_lawexact_match,custom-extract20.00%± 20.00 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_mathexact_match,custom-extract40.00%± 24.49 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_otherexact_match,custom-extract60.00%± 24.49 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_philosophyexact_match,custom-extract60.00%± 24.49 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_physicsexact_match,custom-extract0.00%± 0.00 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_pro_psychologyexact_match,custom-extract40.00%± 24.49 pp5
    Qwen 3.8 27B Abliterated Q4_K_M - 32K - directommlu_proexact_match,custom-extract42.86%± 5.89 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directoifevalprompt_level_strict_acc,none20.00%± 20.00 pp0
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directogsm8kexact_match,strict-match60.00%± 24.49 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_biologyexact_match,custom-extract40.00%± 24.49 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_businessexact_match,custom-extract40.00%± 24.49 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_chemistryexact_match,custom-extract40.00%± 24.49 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_computer_scienceexact_match,custom-extract40.00%± 24.49 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_economicsexact_match,custom-extract60.00%± 24.49 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_engineeringexact_match,custom-extract0.00%± 0.00 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_healthexact_match,custom-extract0.00%± 0.00 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_historyexact_match,custom-extract40.00%± 24.49 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_lawexact_match,custom-extract0.00%± 0.00 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_mathexact_match,custom-extract60.00%± 24.49 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_otherexact_match,custom-extract20.00%± 20.00 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_philosophyexact_match,custom-extract60.00%± 24.49 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_physicsexact_match,custom-extract40.00%± 24.49 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_pro_psychologyexact_match,custom-extract0.00%± 0.00 pp5
    Qwen 3.8 27B Uncensored Q4_K_M - 32K - directommlu_proexact_match,custom-extract31.43%± 5.44 pp5

    📖 Términos y glosario

    Referencia de las abreviaturas, unidades y denominaciones técnicas utilizadas en el informe. Las cuantizaciones describen cómo se almacenan los pesos; no son por sí solas una medida de calidad.
    LLM
    Large Language Model, o modelo de lenguaje de gran tamaño. Es el tipo de modelo generativo evaluado.
    TTFA
    Time To First Answer: tiempo hasta el primer fragmento de respuesta visible. Excluye el razonamiento interno previo cuando el backend lo separa.
    Token y tok/s
    Un token es una unidad de texto procesada por el modelo. tok/s significa tokens generados por segundo y mide velocidad de salida.
    Contexto 32K
    Ventana solicitada de aproximadamente 32.768 tokens, compartida por la entrada, el historial, el razonamiento y la salida según el backend.
    CPU y GPU
    CPU: procesador central. GPU: procesador gráfico, especialmente eficiente para ejecutar las operaciones matriciales de la inferencia.
    RAM y VRAM
    RAM: memoria principal del sistema. VRAM: memoria de la tarjeta gráfica donde se alojan pesos, caché de contexto y datos de cálculo.
    Cuantización
    Reducción de la precisión numérica de los pesos para disminuir tamaño, memoria y tiempo de inferencia. Cuanto más agresiva es, mayor puede ser la pérdida de fidelidad.
    Q4
    Cuantización de aproximadamente 4 bits por peso. El tamaño real incluye escalas y metadatos, por lo que no equivale exactamente a cuatro bits para todo el archivo.
    Q4_0
    Formato clásico y sencillo de cuantización a 4 bits usado por GGML/GGUF. Suele priorizar compatibilidad y tamaño, con menor sofisticación que las variantes K.
    Q4_K_M
    Cuantización K de 4 bits en variante media. Usa bloques y conserva determinados tensores importantes con mayor precisión para equilibrar tamaño, velocidad y calidad.
    K y M en una cuantización
    K identifica la familia de cuantizaciones por bloques K. M significa variante media dentro de esa familia; no representa millones de parámetros.
    E2B
    Effective 2 Billion: aproximadamente 2.000 millones de parámetros activos por token. El modelo puede almacenar más parámetros totales; por eso el paquete se anuncia también con un tamaño total cercano a 4,6B.
    B, 4B y 4.7B
    B significa billion, mil millones de parámetros. Es una aproximación del tamaño de la arquitectura, distinta del tamaño cuantizado del archivo.
    IT y QAT
    IT: instruction tuned, ajustado para seguir instrucciones. QAT: quantization-aware training, entrenamiento o ajuste consciente de la cuantización.
    Thinking o razonamiento
    Texto de deliberación que algunos backends exponen separado de la respuesta visible. El informe conserva ambos canales cuando están disponibles.
    JSON, CSV y HTML
    Formatos de datos y documento: JSON conserva estructura completa, CSV facilita el análisis tabular y HTML contiene el informe visual autónomo.
    W, Wh y kWh
    W mide potencia instantánea. Wh mide energía acumulada. kWh equivale a 1.000 Wh y se utiliza para calcular el coste eléctrico.
    Media, mediana y p95
    La media promedia los valores; la mediana representa el valor central; p95 es el percentil 95, por debajo del cual queda el 95% de las muestras.