3 min read
KIMI K3: Un modelo MoE de 256 expertos que redefine la eficiencia en código abierto
KIMI K3, con arquitectura Mixture of Experts (256 expertos, 8 activos) y contexto de 128K tokens, supera a GPT-4o y DeepSeek-V2 en benchmarks como MMLU y GSM8K, con eficiencia 7.7x respecto a modelos densos. Optimizado para hardware doméstico mediante cuantización.