{"version":"1.0","type":"card","id":"65a259a7-1ea6-4f48-ba11-489d4d139141","url":"https://stacklist.com/card/65a259a7-1ea6-4f48-ba11-489d4d139141","title":"Evals: Framework for Evaluating LLMs and Benchmarks","source_url":"https://github.com/openai/evals","note":"Evals is a framework for evaluating LLMs and LLM systems, and an open-source registry of benchmarks. It provides tools and resources for assessing the performance of language models effectively.","image":{"url":"https://ucarecdn.com/2f636057-c341-4265-a9c6-8da495313021/","alt":"Evals: Framework for Evaluating LLMs and Benchmarks","width":1200,"height":600},"stack":{"id":"29e01ac8-6202-4abf-ab14-a0613026186b","title":"AI Agent Evaluation Frameworks and Benchmarks","url":"https://stacklist.com/c/technology/stack/29e01ac8-6202-4abf-ab14-a0613026186b"},"created_at":"2026-07-02T09:48:47.710Z","updated_at":null,"aco":{"summary":"OpenAI Evals is a framework for evaluating large language models (LLMs) and LLM-based systems, offering a registry of existing evals and the ability to create custom evaluations. The documentation covers setup, installation via pip and Git-LFS, running and writing evals, including support for advanced use cases like prompt chains, tool-using agents, and logging results to Snowflake.","tags":["openai","evals","llm-evaluation","framework","python","model-testing","custom-evals"],"key_entities":[{"name":"OpenAI","type":"organization","confidence":1},{"name":"OpenAI Evals","type":"technology","confidence":1},{"name":"Greg Brockman","type":"person","confidence":0.95},{"name":"Git-LFS","type":"technology","confidence":0.9},{"name":"Python","type":"technology","confidence":0.85},{"name":"Snowflake","type":"technology","confidence":0.8},{"name":"Weights & Biases","type":"technology","confidence":0.8},{"name":"LLM evaluation","type":"concept","confidence":0.95},{"name":"Completion Function Protocol","type":"concept","confidence":0.8}],"classification":"framework","language":"en","confidence":0.85,"provenance":{"model":"claude-opus-4-6","tool":"@stacklist/mcp-server@2.0.0","confidence":0.85,"timestamp":"2026-07-02T09:48:56.388Z"},"token_counts":{"approximate":1352,"cl100k":1162},"content_hash":"sha256:ef31f15304b62eb6c223292614c401cfee761d0dde9b823e61deab6969736458","acp_version":"0.2","body_available":true,"body_tokens":1352,"visibility":"public","agent_accessible":true,"status":"final"},"_links":{"self":"/api/public/card/65a259a7-1ea6-4f48-ba11-489d4d139141.json","html":"https://stacklist.com/card/65a259a7-1ea6-4f48-ba11-489d4d139141","md":"/api/public/card/65a259a7-1ea6-4f48-ba11-489d4d139141.md","stack_json":"/api/public/stack/29e01ac8-6202-4abf-ab14-a0613026186b.json"}}