LeoLabs Forge

AI Benchmarks

Comparativas reproducibles de modelos de IA ejecutados en hardware local. Cada publicación conserva su metodología, telemetría y resultados completos.

1 informe publicado

Publicaciones

Solo aparecen comparativas seleccionadas para publicación.

Actualizado el 28 de agosto de 2026
Motor LeoLabs LM Evaluation Harness 32K · Q4_K_M · 100% GPU

Qwen 3.8 27B: normal frente a Abliterated y Uncensored

Tres variantes del mismo modelo, con cuantización y contexto igualados, ejecutadas íntegramente en una RTX 3090 de 24 GB.

Qwen 3.8 27B normalQ4_K_M · 32K · directo
Qwen 3.8 27B AbliteratedQ4_K_M · 32K · directo
Qwen 3.8 27B UncensoredQ4_K_M · 32K · directo

Resultado resumido

Qwen 3.8 normal fue la opción más sólida: superó 21 de 26 pruebas LeoLabs y lideró MMLU‑Pro con 81,4%. Uncensored quedó cerca en fiabilidad nativa (20/26), mientras Abliterated destacó en GSM8K con 80%.

Ejecución

Pruebas LeoLabs
78 · 13 min 15 s
Estándares
IFEval · GSM8K · MMLU‑Pro
Sesión completa
55 min 28 s
Los resultados estándar usan una muestra equilibrada reducida y deben interpretarse como orientativos. Abrir informe completo