{"version":"1.0","type":"card","id":"62988ef1-05df-4fa3-9946-9da69954c2e6","url":"https://stacklist.com/card/62988ef1-05df-4fa3-9946-9da69954c2e6","title":"SWE-bench: Can Language Models Resolve GitHub Issues?","source_url":"https://github.com/SWE-bench/SWE-bench","note":"SWE-bench is a project that explores the capability of language models in addressing real-world issues found on GitHub. It aims to evaluate how effectively these models can assist developers in resolving software-related problems.","image":{"url":"https://ucarecdn.com/bc0a6940-2827-44f7-9041-39e04956f8cc/","alt":"SWE-bench: Can Language Models Resolve GitHub Issues?","width":1200,"height":600},"stack":{"id":"d244b35a-f040-4bb7-96ae-187b792f699b","title":"AI agent evaluation frameworks","url":"https://stacklist.com/c/technology/stack/d244b35a-f040-4bb7-96ae-187b792f699b"},"created_at":"2026-07-02T10:02:58.912Z","updated_at":null,"aco":{"summary":"SWE-bench is a benchmark for evaluating large language models on real-world software issues collected from GitHub, where models generate patches to resolve described problems. The repository includes setup instructions using Docker for reproducible evaluations, along with extensions like SWE-bench Multimodal, SWE-bench Verified, and cloud-based evaluation via Modal and sb-cli.","tags":["swe-bench","benchmark","large-language-models","github-issues","docker","software-engineering","evaluation"],"key_entities":[{"name":"SWE-bench","type":"technology","confidence":1},{"name":"Princeton NLP","type":"organization","confidence":0.95},{"name":"OpenAI","type":"organization","confidence":0.9},{"name":"Docker","type":"technology","confidence":0.95},{"name":"ICLR 2024","type":"event","confidence":0.95},{"name":"ICLR 2025","type":"event","confidence":0.9},{"name":"SWE-agent","type":"technology","confidence":0.9},{"name":"Modal","type":"technology","confidence":0.85},{"name":"SWE-bench Multimodal","type":"technology","confidence":0.9},{"name":"SWE-bench Verified","type":"technology","confidence":0.88},{"name":"OpenAI Preparedness","type":"concept","confidence":0.8},{"name":"sb-cli","type":"technology","confidence":0.85}],"classification":"reference","language":"en","confidence":0.85,"provenance":{"model":"claude-opus-4-6","tool":"@stacklist/mcp-server@2.0.0","confidence":0.85,"timestamp":"2026-07-02T10:03:10.232Z"},"token_counts":{"approximate":1728,"cl100k":1733},"content_hash":"sha256:fed9e9fdb50f0e7a660f21a09cee5ef0b3b8aa57d313a1734e08aac08d798464","acp_version":"0.2","body_available":true,"body_tokens":1728,"visibility":"public","agent_accessible":true,"status":"final"},"_links":{"self":"/api/public/card/62988ef1-05df-4fa3-9946-9da69954c2e6.json","html":"https://stacklist.com/card/62988ef1-05df-4fa3-9946-9da69954c2e6","md":"/api/public/card/62988ef1-05df-4fa3-9946-9da69954c2e6.md","stack_json":"/api/public/stack/d244b35a-f040-4bb7-96ae-187b792f699b.json"}}