{"version":"1.0","type":"card","id":"16639b59-945a-4bcc-918b-69432443258a","url":"https://stacklist.com/card/16639b59-945a-4bcc-918b-69432443258a","title":"CUDA-LLM: A GitHub Repository for Development","source_url":"https://github.com/MagicCoding2006/CUDA-LLM","note":"This GitHub repository hosts the CUDA-LLM project, which focuses on leveraging CUDA for large language model implementations. Users can contribute to the development and collaborate on enhancing the project's capabilities.","image":{"url":"https://ucarecdn.com/93b54cf2-bc8a-43f1-a25c-d6c37928bde3/","alt":"CUDA-LLM: A GitHub Repository for Development","width":1280,"height":800},"stack":{"id":"4aae218c-38d7-4c05-b7ae-f2db0029a2e8","title":"Local AI & GPUs","url":"https://stacklist.com/stack/4aae218c-38d7-4c05-b7ae-f2db0029a2e8"},"created_at":"2026-07-17T12:31:19.173Z","updated_at":null,"aco":{"summary":"CUDA LLM is a GPU-optimized decoder-only language model implementation featuring custom C++/CUDA attention kernels, INT8/INT4 quantization, and a complete training and serving stack designed to run on laptop GPUs. The 496M parameter model achieves 230 tok/s on laptop INT4 decode and includes advanced features like sparse attention, RAG integration, and production-grade deployment capabilities.","tags":["cuda","llm","gpu-optimization","transformer","quantization","inference","flashattention"],"key_entities":[{"name":"CUDA","type":"technology","confidence":0.99},{"name":"PyTorch","type":"technology","confidence":0.95},{"name":"FlashAttention","type":"technology","confidence":0.92},{"name":"HuggingFace","type":"technology","confidence":0.88},{"name":"Modal","type":"technology","confidence":0.9},{"name":"Safetensors","type":"technology","confidence":0.85},{"name":"RoPE","type":"technology","confidence":0.88},{"name":"RMSNorm","type":"technology","confidence":0.85},{"name":"SwiGLU","type":"technology","confidence":0.85},{"name":"BPE tokenizer","type":"technology","confidence":0.87},{"name":"LLaMA","type":"technology","confidence":0.9},{"name":"quantization","type":"concept","confidence":0.95},{"name":"sparse-attention","type":"concept","confidence":0.92},{"name":"RAG","type":"concept","confidence":0.9},{"name":"instruction-fine-tuning","type":"concept","confidence":0.88},{"name":"laptop-gpu","type":"location","confidence":0.85}],"classification":"reference","language":"en","confidence":0.85,"provenance":{"model":"claude-haiku-4-5","tool":"@stacklist/be@0.1.0","confidence":0.85,"timestamp":"2026-07-17T12:31:25.564Z"},"token_counts":{"approximate":9428,"cl100k":9042},"content_hash":"sha256:d0d612a7e299f9e380f20479c2b6bd40d063344a91df1156a6537330c622dbae","acp_version":"0.2","body_available":true,"body_tokens":9428,"visibility":"public","agent_accessible":true,"status":"final"},"_links":{"self":"/api/public/card/16639b59-945a-4bcc-918b-69432443258a.json","html":"https://stacklist.com/card/16639b59-945a-4bcc-918b-69432443258a","md":"/api/public/card/16639b59-945a-4bcc-918b-69432443258a.md","stack_json":"/api/public/stack/4aae218c-38d7-4c05-b7ae-f2db0029a2e8.json"}}