Nice, a rust tool wrapping llama.cpp
how does it differ from llama-server?
and from llama-swap?
how does it differ from llama-server?
and from llama-swap?
Key differences:
- Architecture: llama-swap = proxy + multiple servers, Shimmy = single server
- Resource usage: llama-swap runs multiple processes, Shimmy = one 50MB process
- Use case: llama-swap for managing many models, Shimmy for simplicity