[tools] "llama.cpp" = { version = "latest", prerelease = "true", version_prefix = "b" } [tasks.serve] run = "llama serve --model ./llm/model2.gguf --port 8080 -ngl 99 --ctx-size 16384"