{"version":"1.0","type":"card","id":"6aa80af3-cff3-41d8-8f2e-6f69fa1dcc2d","url":"https://stacklist.com/card/6aa80af3-cff3-41d8-8f2e-6f69fa1dcc2d","title":"GitHub - THUDM/AgentBench: A Comprehensive Benchmark","source_url":"https://github.com/THUDM/AgentBench","note":"THUDM/AgentBench is a comprehensive benchmark designed to evaluate large language models (LLMs) as agents. This resource aims to facilitate research and development in the field of artificial intelligence by providing standardized evaluation metrics and datasets.","image":{"url":"https://ucarecdn.com/f06f9373-3f1b-4e53-bd4c-e52adc16ce5c/","alt":"GitHub - THUDM/AgentBench: A Comprehensive Benchmark","width":1200,"height":600},"stack":{"id":"29e01ac8-6202-4abf-ab14-a0613026186b","title":"AI Agent Evaluation Frameworks and Benchmarks","url":"https://stacklist.com/c/technology/stack/29e01ac8-6202-4abf-ab14-a0613026186b"},"created_at":"2026-07-02T09:48:55.382Z","updated_at":null,"aco":{"summary":"AgentBench is a comprehensive benchmark framework for evaluating LLMs as autonomous agents across diverse environments including OS interaction, databases, knowledge graphs, web shopping, and more. The latest version (AgentBench FC) introduces function-calling style prompts integrated with AgentRL, featuring fully-containerized Docker deployment for five task environments.","tags":["agentbench","llm-agents","benchmark","reinforcement-learning","function-calling","docker","evaluation"],"key_entities":[{"name":"AgentBench","type":"technology","confidence":0.99},{"name":"AgentRL","type":"technology","confidence":0.95},{"name":"VisualAgentBench","type":"technology","confidence":0.9},{"name":"Docker Compose","type":"technology","confidence":0.85},{"name":"LLM-as-Agent","type":"concept","confidence":0.95},{"name":"function-calling","type":"concept","confidence":0.9},{"name":"ALFWorld","type":"technology","confidence":0.85},{"name":"WebShop","type":"technology","confidence":0.85},{"name":"Mind2Web","type":"technology","confidence":0.8},{"name":"Redis","type":"technology","confidence":0.75}],"classification":"framework","language":"en","confidence":0.85,"provenance":{"model":"claude-opus-4-6","tool":"@stacklist/mcp-server@2.0.0","confidence":0.85,"timestamp":"2026-07-02T09:49:05.463Z"},"token_counts":{"approximate":2274,"cl100k":2109},"content_hash":"sha256:83e72a6bc7ecf099156fcbc237ac6b859afa663b139b1311cd8558132c1d863b","acp_version":"0.2","body_available":true,"body_tokens":2274,"visibility":"public","agent_accessible":true,"status":"final"},"_links":{"self":"/api/public/card/6aa80af3-cff3-41d8-8f2e-6f69fa1dcc2d.json","html":"https://stacklist.com/card/6aa80af3-cff3-41d8-8f2e-6f69fa1dcc2d","md":"/api/public/card/6aa80af3-cff3-41d8-8f2e-6f69fa1dcc2d.md","stack_json":"/api/public/stack/29e01ac8-6202-4abf-ab14-a0613026186b.json"}}