你是否好奇:当前热门的法律大模型助手,真的能帮律师审合同、写意见书、分析判例吗?Harvey LAB 正是为此而生——它不是一款法律应用,而是一套严谨、开放、可复现的“法律AI能力测评体系”,专为检验和提升AI代理(Agent)在真实法律工作中的表现而设计。项目基于上千个来自执业律师、法务专家和律所合作的真实任务构建,让法律AI的研发与评估不再停留在“问答对答”,而是真正走进合同审查、合规分析、诉讼策略等高价值场景。
核心功能
- 覆盖24+法律领域的真实任务库:包含并购尽调、劳动纠纷应对、GDPR合规检查、知识产权许可起草等实务场景,拒绝虚构案例,全部源自一线法律实践
- 结构化任务三件套:每个任务均提供明确指令(如“识别该NDA中对我方不利的单方义务条款”)、配套法律文档(扫描件/PDF/Word原文)及精细化评分细则(Rubric),支持多维度人工+自动双轨评估
- 轻量级执行测试框架(Execution Harness):Python原生实现,支持一键接入自研或第三方法律Agent,自动完成任务调度、输入注入、输出解析与结果比对,5分钟即可跑通首测
- 细粒度能力拆解评测:不仅判断“答对与否”,更评估法律逻辑链完整性、条款引用准确性、风险提示充分性、语言专业性等6类核心能力维度
- 持续演进的开放生态:所有任务Schema经严格验证(CI自动化校验),社区可提交新任务、修订Rubric、贡献领域扩展包,已获多家国际律所匿名案例授权支持
- MIT协议完全开源:无商用限制、无数据回传、无闭源组件,企业法务团队可本地部署,高校研究者可自由用于论文实验与课程教学
适合哪些人用
法律科技创业者可借此快速验证产品在真实业务中的短板;AI研发团队(尤其是专注法律垂直领域的LLM厂商)能精准定位模型优化方向;法学院教师可用作《法律人工智能》课程的实操评测平台;律所技术采购负责人则能借助LAB报告客观对比不同供应商Agent的实际效能——它不取代律师,而是成为衡量“AI能否真正上手干活”的第一把标尺。
快速上手
只需三步即可启动本地评测:
- 安装依赖:
pip install harvey-labs(支持Python 3.9+) - 下载任务集:
harvey-labs download --subset corporate --limit 50(支持按领域/难度筛选) - 运行测试:
harvey-labs run --agent my_legal_agent.py --task-dir ./tasks/corporate,框架将自动生成含得分、错误定位与改进建议的HTML报告
详细文档与任务样例见项目 Docs目录,零基础用户也可通过提供的Jupyter Notebook交互式教程15分钟入门。
项目信息
A benchmark built to evaluate and improve agent capabilities for supporting legal work.
873
今日 +47 stars today
Stars
180
Forks
Python
MIT
编程语言:Python|Star 数:873|开源协议:MIT|GitHub 项目地址
如果你正在开发、选型或研究法律AI,Harvey LAB 就是那个帮你避开“纸上谈兵”陷阱、直击真实业务能力的关键评测基础设施。



