{"version":"1.0","type":"card","id":"fec45330-6677-46d1-bef1-3b7aa947aa7c","url":"https://stacklist.com/card/fec45330-6677-46d1-bef1-3b7aa947aa7c","title":"LLM Engineer's Almanac - Advisor | Modal","source_url":"https://modal.com/llm-almanac/advisor?filters=model%3DLlama+3.1+8B%2Ctokens%3D128%3B1024%2Cframework%3Dvllm","note":"A simple tool for estimating the throughput and latency of LLM engines. This page provides insights and metrics to help users optimize their LLM models effectively.","image":{"url":"https://ucarecdn.com/5d97deb9-11b3-404e-85d5-12b051d1a466/","alt":"LLM Engineer's Almanac - Advisor | Modal","width":1800,"height":945},"stack":{"id":"4aae218c-38d7-4c05-b7ae-f2db0029a2e8","title":"Local AI & GPUs","url":"https://stacklist.com/stack/4aae218c-38d7-4c05-b7ae-f2db0029a2e8"},"created_at":"2026-07-18T14:39:06.457Z","updated_at":null,"aco":{"summary":"Llama 3.1 8B Model Advisor is an interactive benchmarking tool that measures per-replica throughput and client-side latency for open-weight language models running on inference engines like vLLM, SGLang, and TensorRT-LLM. Users can select from various models and workload configurations to compare performance metrics and identify optimal deployment strategies.","tags":["llm-benchmarking","inference-engines","model-performance","latency-throughput","quantization","open-source"],"key_entities":[{"name":"Llama 3.1 8B","type":"technology","confidence":0.95},{"name":"vLLM","type":"technology","confidence":0.92},{"name":"SGLang","type":"technology","confidence":0.92},{"name":"TensorRT-LLM","type":"technology","confidence":0.92},{"name":"Qwen 2.5 7B","type":"technology","confidence":0.88},{"name":"DeepSeek-V3","type":"technology","confidence":0.88},{"name":"Modal","type":"organization","confidence":0.9},{"name":"Gemma 3","type":"technology","confidence":0.85},{"name":"quantization-formats","type":"concept","confidence":0.87},{"name":"time-to-first-token","type":"concept","confidence":0.85}],"classification":"reference","language":"en","confidence":0.85,"provenance":{"model":"claude-haiku-4-5","tool":"@stacklist/be@0.1.0","confidence":0.85,"timestamp":"2026-07-18T14:39:12.766Z"},"token_counts":{"approximate":2066,"cl100k":1832},"content_hash":"sha256:20f229196e092d80078d0983a280cc4c82cf84dc78592ae578f54a757f995b46","acp_version":"0.2","body_available":true,"body_tokens":2066,"visibility":"public","agent_accessible":true,"status":"final"},"_links":{"self":"/api/public/card/fec45330-6677-46d1-bef1-3b7aa947aa7c.json","html":"https://stacklist.com/card/fec45330-6677-46d1-bef1-3b7aa947aa7c","md":"/api/public/card/fec45330-6677-46d1-bef1-3b7aa947aa7c.md","stack_json":"/api/public/stack/4aae218c-38d7-4c05-b7ae-f2db0029a2e8.json"}}