.investigacion · método, papers y código abierto

La ciencia detrás de Tulú, abierta.

Cómo se construyó Tulú, qué publicamos, y cómo puedes replicarlo o construir encima. Sin cajas negras: el método, el código y el modelo, a la vista.

cat metodo.txt

No es magia. Es método.

Cada componente de Tulú fue una decisión justificada, no una copia. Un tokenizador propio de 32.768 unidades entrenado sobre español. Una arquitectura diseñada pieza por pieza, no descargada. Más de 200 papers revisados para elegir cada una. Y una regla que no negociamos: nada se da por bueno hasta que un test reproducible lo demuestra.

Un ejemplo de cómo se decide algo acá. Tulú combina dos tipos de capa: ocho usan una memoria recurrente, que es barata de correr, y solo dos usan atención clásica, que cuesta más pero recuerda con exactitud lo que se dijo mucho antes. Esa proporción no se escogió por gusto: en nuestras pruebas, la mezcla resultó mejor que usar solo una o solo la otra.

  • Desde cero, de verdad

    Tokenizador propio, arquitectura propia, pre-entrenamiento completo. Ni un peso heredado de otro modelo.

  • Respaldado por la literatura

    Cada decisión de diseño rastreable a papers publicados. Más de 200 referencias, no intuición.

  • Reproducible por diseño

    La misma entrada, con la misma semilla, produce exactamente la misma salida en cualquier máquina. Esa es la base del certificado de cada respuesta.

Bajo el capó: modelo decoder-only de 399,7M de parámetros, de los que 231,9M se activan por token. Mixer híbrido, 8 capas de recurrencia lineal con estado constante y 2 de atención GQA. Mezcla de canales por expertos, 4 por capa con enrutamiento top-2. Pesos ternarios y activaciones int8, tokenizador propio SentencePiece unigram de 32.768 unidades. La ruta de despliegue es reproducible bit a bit entre CPU y GPU.

cat papers.txt

Papers

Estamos documentando el proceso en papers abiertos. Los enlaces definitivos llegan con cada publicación.

  • Tulú: un LLM colombiano entrenado desde cero Reporte técnico · 2026 · próximamente
  • Inferencia verificable: certificados reproducibles de respuesta Preprint · 2026 · próximamente
  • Adaptación dialectal del español colombiano: valluno y paisa Preprint · 2026 · próximamente

cat abierto.txt

Todo abierto: código y modelo.

Publicamos el código y el modelo bajo Apache 2.0: cualquiera puede usarlos, estudiarlos, modificarlos y construir encima (incluso comercialmente), dando crédito. Sin permisos, sin candados. La soberanía tecnológica solo tiene sentido si es colectiva.

cat colabora.txt

¿Investigas o enseñas? Colaboremos.

Si estás en una universidad o grupo de investigación y quieres replicar nuestros resultados, usar Tulú en tu trabajo o construir algo juntos, escríbenos.

hola@tulu.lat →