https://github.com/openai/evals
- 总 Star 数量
- 19k
- 最近更新时间
- 2026-04-14
- 开源时间
- 2023-01-23
项目描述
OpenAI开源的框架,用于评估大语言模型(LLM)及LLM系统,提供基准测试注册表,支持创建自定义和私有评估,帮助开发者衡量模型版本对用例的影响,可通过仪表板或本地运行。
2026.07.22–2026.07.28
OpenAI开源的框架,用于评估大语言模型(LLM)及LLM系统,提供基准测试注册表,支持创建自定义和私有评估,帮助开发者衡量模型版本对用例的影响,可通过仪表板或本地运行。