Ante todo, desearía aclarar que este post es un apunte para mostrar la facilidad y eficiencia de trabajar con software de código abierto.
El equipo sobre el que ha funcionado (un poco lento, eso sí que es verdad, pero bien) tiene las siguientes características:
- Intel(R) Core(TM) i5-8500 CPU @ 3.00GHz (3.00 GHz)
- RAM 32,0 GB
- Intel(R) UHD Graphics 630 (128 MB)
- Descargar el archivo llamafile-0.10.1 (no lo he probado con versiones posteriores):
https://github.com/mozilla-ai/llamafile/releases/download/0.10.1/llamafile-0.10.1
- Renombrarlo como «llamafile-0.10.1.exe»
- Descargar el modelo qwen3-4b-thinking-2507.Q4_K_M.gguf
https://huggingface.co/pramodlohra/Qween3_4B_thinking_finetune/resolve/main/qwen3-4b-thinking-2507.Q4_K_M.gguf?download=true
- Lanzar el programa desde la linea de comandos:
.\llamafile-0.10.1.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
- Alternativamente se pueden usar modelos específicos, como por ejemplo, el modelo de manejo de SQL
.\llamafile-0.10.1.exe --server --model SS-350M-SQL-Strict.Q8_0.gguf
Una vez cargado el modelo nos mostrará la ip del localhost y el puerto por el que se puede lanzar el navegador para interactuar con la IA.
https://127.0.0.1:8080/
Voilà!

0 comments:
Publicar un comentario
Sé educado, por favor.