Skip to content

Ollama Beta ​

5 min de lectura

La integración con Ollama permite que el modelo se ejecute en una máquina que controlas, en lugar de usar un proveedor cloud. A cambio de mantener el procesamiento dentro de tu infraestructura, te encargas de los recursos, la disponibilidad y la seguridad de esa máquina.

Experimental

La integración con Ollama está en pruebas y puede cambiar. Úsala primero en un entorno controlado.

Antes de conectarlo ​

Si todavía no tienes Ollama instalado, descárgalo para tu sistema operativo desde ollama.com/download.

Necesitas una instalación de Ollama con el modelo descargado y una dirección alcanzable desde el contenedor del agente. Comprueba los modelos disponibles con:

bash
ollama list

Por defecto, Ollama solo escucha conexiones locales. Cuando el agente deba acceder desde otro contenedor o equipo, configúralo para escuchar en una interfaz de red y protege el acceso con tu red privada, una VPN o un cortafuegos.

bash
OLLAMA_HOST=0.0.0.0 ollama serve

No expongas Ollama sin protección

Ollama no añade autenticación por sí mismo. No publiques el puerto de Ollama directamente en internet: utiliza una VPN o un proxy con autenticación y HTTPS.

Crear una conexión ​

En Ajustes > Modelos > Ollama, pulsa Añadir conexión. Una conexión representa una combinación concreta de máquina y modelo, no una cuenta de proveedor: si tienes tres equipos con Ollama, son tres conexiones y ninguna sobra.

Nombra la conexión

El nombre es obligatorio y es lo único que distingue una máquina de otra en la lista y en la ficha de cada agente. Usa algo que permita reconocerla, por ejemplo, “Ollama de desarrollo”.

Indica la dirección

Introduce la URL desde la que el agente puede alcanzar Ollama. Para un modelo que se ejecuta en el mismo servidor que el agente, suele utilizarse http://host.docker.internal:11434.

Declara dónde está el servidor

En Ubicación del servidor, elige Red privada si está en la misma máquina, en tu red local o en una VPN, o Acceso público si llegas a él por un túnel, un dominio propio o DNS dinámico. El acceso público exige HTTPS.

Elige el modelo y su contexto

Escribe el nombre exacto que devuelve ollama list e indica la ventana de contexto real que soporta ese modelo.

Asigna la conexión al agente

En Configuración > Modelo del agente, elige esa conexión en el desplegable Conexión. Como la conexión trae su propio modelo, es el que correrá. Si el agente está en marcha, se reinicia solo al guardar.

Elegir la dirección correcta ​

SituaciónDirección habitualRecomendación
Mismo servidorhttp://host.docker.internal:11434Comprueba que el modelo está instalado en ese servidor.
Red localhttp://192.168.x.x:11434Limita el acceso al servidor de Kujira.
Red privada o VPNURL o IP privadaEs la opción recomendada para otra ubicación.
InternetURL HTTPS protegidaÚsala solo detrás de autenticación y un proxy seguro.

Atención con varios servidores

host.docker.internal apunta al servidor donde se ejecuta cada agente. Si tienes varios, todos deben disponer del mismo modelo con el mismo nombre, o debes crear conexiones separadas para cada máquina.

Varias máquinas, varias conexiones ​

Cada equipo con Ollama es una conexión con su nombre, su dirección y su modelo. Una de ellas queda marcada como predeterminada —la que heredan los agentes que no eligen ninguna—, pero con máquinas distintas lo normal es fijarle a cada agente la suya por su nombre en vez de heredar.

Si quieres retirar una conexión que ya usan agentes, Kujira te pide antes a cuál pasan: elígela en Pasar los agentes a y confirma con Mover y quitar. Si solo vas a apagar la máquina un rato, apaga la conexión en lugar de quitarla.

Contexto y rendimiento ​

La ventana de contexto debe coincidir con la capacidad real del modelo. Una cifra demasiado alta puede provocar errores durante una conversación larga; una demasiado baja compactará antes de lo necesario.

Para saber cuál es, pulsa Probar en la conexión: la comprobación te enseña las dos cifras juntas —lo que el modelo admite y lo que tu servidor está sirviendo de verdad— y te avisa en ámbar cuando la segunda es menor. Ollama sirve 4.096 tokens por defecto, aunque el modelo admita muchos más; se sube con OLLAMA_CONTEXT_LENGTH en la máquina donde corre. Detalle en Comprobar un motor local.

El coste por token no aparece en Kujira porque no interviene un proveedor cloud. Aun así, el consumo existe: depende de la GPU, CPU, memoria y electricidad de tu infraestructura. Los modelos grandes requieren más recursos y pueden responder más lentamente.

Errores frecuentes ​

El agente no puede conectar

Revisa la dirección, el puerto, el cortafuegos y que Ollama esté escuchando fuera de localhost cuando el agente se ejecute en otro contenedor o servidor.

Falla el primer mensaje

Comprueba que el nombre configurado coincide exactamente con el que devuelve ollama list, incluidos la etiqueta y la versión del modelo.

Funciona en un agente y no en otro

Los agentes pueden ejecutarse en servidores distintos. Verifica que todos tengan acceso a la misma instancia o que cada servidor disponga del modelo con el mismo nombre.

El agente arranca con otra máquina

Comprueba qué conexión tiene fijada en Configuración > Modelo. Con Heredar de la organización usa la predeterminada, que puede ser la de otro equipo.

Falla en conversaciones largas

La ventana de contexto configurada no coincide con la capacidad real del modelo. Ajusta ese valor y vuelve a iniciar el agente.

Consulta Modelos si prefieres gestionar modelos y credenciales desde un proveedor externo.