{"version":"1.0","type":"card","id":"f3337bc5-d81e-4896-b326-dcfb36f2a2ab","url":"https://stacklist.com/card/f3337bc5-d81e-4896-b326-dcfb36f2a2ab","title":"Inspect: Open-source Framework for LLM Evaluations","source_url":"https://inspect.aisi.org.uk/","note":"Inspect is an open-source framework designed for evaluating large language models. It provides tools and methodologies to assess the performance and capabilities of various language models effectively.","image":{"url":"https://ucarecdn.com/ccf4369b-4387-4926-8a60-afa0c9948b06/","alt":"Inspect: Open-source Framework for LLM Evaluations","width":2400,"height":1258},"stack":{"id":"d244b35a-f040-4bb7-96ae-187b792f699b","title":"AI agent evaluation frameworks","url":"https://stacklist.com/c/technology/stack/d244b35a-f040-4bb7-96ae-187b792f699b"},"created_at":"2026-07-02T10:02:54.416Z","updated_at":null,"aco":{"summary":"Inspect is an AI evaluation framework developed by the UK AI Security Institute and Meridian Labs, offering composable building blocks, over 200 pre-built evaluations, and support for 20+ model providers. The framework enables coding, reasoning, knowledge, and agentic task evaluations with features including sandboxing, tool calling, multi-agent primitives, and a web-based visualization tool.","tags":["ai-evaluation","inspect","framework","llm-benchmarks","agentic-tasks","model-testing","python"],"key_entities":[{"name":"Inspect","type":"technology","confidence":1},{"name":"UK AI Security Institute","type":"organization","confidence":0.95},{"name":"Meridian Labs","type":"organization","confidence":0.9},{"name":"SimpleQA","type":"technology","confidence":0.85},{"name":"Claude Code","type":"technology","confidence":0.8},{"name":"VS Code Extension","type":"technology","confidence":0.75},{"name":"OpenAI","type":"organization","confidence":0.9},{"name":"Anthropic","type":"organization","confidence":0.9},{"name":"Google","type":"organization","confidence":0.85},{"name":"Docker","type":"technology","confidence":0.7},{"name":"Kubernetes","type":"technology","confidence":0.7},{"name":"HuggingFace","type":"technology","confidence":0.8},{"name":"AI evaluation","type":"concept","confidence":0.95},{"name":"MCP tools","type":"technology","confidence":0.7}],"classification":"framework","language":"en","confidence":0.85,"provenance":{"model":"claude-opus-4-6","tool":"@stacklist/mcp-server@2.0.0","confidence":0.85,"timestamp":"2026-07-02T09:48:54.955Z"},"token_counts":{"approximate":2105,"cl100k":1781},"content_hash":"sha256:c91a7f94527cea3c006158a99487070fb4ddcca74c2e96206ea25c1fb84f9d52","acp_version":"0.2","body_available":true,"body_tokens":2105,"visibility":"public","agent_accessible":true,"status":"final"},"_links":{"self":"/api/public/card/f3337bc5-d81e-4896-b326-dcfb36f2a2ab.json","html":"https://stacklist.com/card/f3337bc5-d81e-4896-b326-dcfb36f2a2ab","md":"/api/public/card/f3337bc5-d81e-4896-b326-dcfb36f2a2ab.md","stack_json":"/api/public/stack/d244b35a-f040-4bb7-96ae-187b792f699b.json"}}