Ollama Beta
5 min de lectura
La integración con Ollama permite que el modelo se ejecute en una máquina que controlas, en lugar de usar un proveedor cloud. A cambio de mantener el procesamiento dentro de tu infraestructura, te encargas de los recursos, la disponibilidad y la seguridad de esa máquina.
Experimental
La integración con Ollama está en pruebas y puede cambiar. Úsala primero en un entorno controlado.
Antes de conectarlo
Si todavía no tienes Ollama instalado, descárgalo para tu sistema operativo desde ollama.com/download.
Necesitas una instalación de Ollama con el modelo descargado y una dirección alcanzable desde el contenedor del agente. Comprueba los modelos disponibles con:
ollama listPor defecto, Ollama solo escucha conexiones locales. Cuando el agente deba acceder desde otro contenedor o equipo, configúralo para escuchar en una interfaz de red y protege el acceso con tu red privada, una VPN o un cortafuegos.
OLLAMA_HOST=0.0.0.0 ollama serveNo expongas Ollama sin protección
Ollama no añade autenticación por sí mismo. No publiques el puerto de Ollama directamente en internet: utiliza una VPN o un proxy con autenticación y HTTPS.
Crear una conexión
En Ajustes > Modelos > Ollama, pulsa Añadir conexión. Una conexión representa una combinación concreta de máquina y modelo, no una cuenta de proveedor: si tienes tres equipos con Ollama, son tres conexiones y ninguna sobra.
Nombra la conexión
El nombre es obligatorio y es lo único que distingue una máquina de otra en la lista y en la ficha de cada agente. Usa algo que permita reconocerla, por ejemplo, “Ollama de desarrollo”.
Indica la dirección
Introduce la URL desde la que el agente puede alcanzar Ollama. Para un modelo que se ejecuta en el mismo servidor que el agente, suele utilizarse http://host.docker.internal:11434.
Declara dónde está el servidor
En Ubicación del servidor, elige Red privada si está en la misma máquina, en tu red local o en una VPN, o Acceso público si llegas a él por un túnel, un dominio propio o DNS dinámico. El acceso público exige HTTPS.
Elige el modelo y su contexto
Escribe el nombre exacto que devuelve ollama list e indica la ventana de contexto real que soporta ese modelo.
Asigna la conexión al agente
En Configuración > Modelo del agente, elige esa conexión en el desplegable Conexión. Como la conexión trae su propio modelo, es el que correrá. Si el agente está en marcha, se reinicia solo al guardar.
Elegir la dirección correcta
| Situación | Dirección habitual | Recomendación |
|---|---|---|
| Mismo servidor | http://host.docker.internal:11434 | Comprueba que el modelo está instalado en ese servidor. |
| Red local | http://192.168.x.x:11434 | Limita el acceso al servidor de Kujira. |
| Red privada o VPN | URL o IP privada | Es la opción recomendada para otra ubicación. |
| Internet | URL HTTPS protegida | Úsala solo detrás de autenticación y un proxy seguro. |
Atención con varios servidores
host.docker.internal apunta al servidor donde se ejecuta cada agente. Si tienes varios, todos deben disponer del mismo modelo con el mismo nombre, o debes crear conexiones separadas para cada máquina.
Varias máquinas, varias conexiones
Cada equipo con Ollama es una conexión con su nombre, su dirección y su modelo. Una de ellas queda marcada como predeterminada —la que heredan los agentes que no eligen ninguna—, pero con máquinas distintas lo normal es fijarle a cada agente la suya por su nombre en vez de heredar.
Si quieres retirar una conexión que ya usan agentes, Kujira te pide antes a cuál pasan: elígela en Pasar los agentes a y confirma con Mover y quitar. Si solo vas a apagar la máquina un rato, apaga la conexión en lugar de quitarla.
Contexto y rendimiento
La ventana de contexto debe coincidir con la capacidad real del modelo. Una cifra demasiado alta puede provocar errores durante una conversación larga; una demasiado baja compactará antes de lo necesario.
Para saber cuál es, pulsa Probar en la conexión: la comprobación te enseña las dos cifras juntas —lo que el modelo admite y lo que tu servidor está sirviendo de verdad— y te avisa en ámbar cuando la segunda es menor. Ollama sirve 4.096 tokens por defecto, aunque el modelo admita muchos más; se sube con OLLAMA_CONTEXT_LENGTH en la máquina donde corre. Detalle en Comprobar un motor local.
El coste por token no aparece en Kujira porque no interviene un proveedor cloud. Aun así, el consumo existe: depende de la GPU, CPU, memoria y electricidad de tu infraestructura. Los modelos grandes requieren más recursos y pueden responder más lentamente.
Errores frecuentes
El agente no puede conectar
Revisa la dirección, el puerto, el cortafuegos y que Ollama esté escuchando fuera de localhost cuando el agente se ejecute en otro contenedor o servidor.
Falla el primer mensaje
Comprueba que el nombre configurado coincide exactamente con el que devuelve ollama list, incluidos la etiqueta y la versión del modelo.
Funciona en un agente y no en otro
Los agentes pueden ejecutarse en servidores distintos. Verifica que todos tengan acceso a la misma instancia o que cada servidor disponga del modelo con el mismo nombre.
El agente arranca con otra máquina
Comprueba qué conexión tiene fijada en Configuración > Modelo. Con Heredar de la organización usa la predeterminada, que puede ser la de otro equipo.
Falla en conversaciones largas
La ventana de contexto configurada no coincide con la capacidad real del modelo. Ajusta ese valor y vuelve a iniciar el agente.
Consulta Modelos si prefieres gestionar modelos y credenciales desde un proveedor externo.