AQ-MedAI/GAPS-NSCLC-preview 已完整同步
GAPS Medical AI Evaluation Dataset - GAPS-NSCLC-preview
Paper: GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians Code: https://github.com/AQ-MedAI/MedicalAiBenchEval
Dataset Description
The GAPS Medical AI Evaluation Dataset is a comprehensive evaluation system designed specifically for assessing AI models in clinical scenarios. Based on the GAPS (Grounded, Automated, Personalized, Scalable) methodology, this dataset provides both a curated clinical benchmark dataset and an automated assessment pipeline for medical AI systems.
Key Features
- 🏥 Medical-Specific Evaluation: Specialized assessment criteria based on real medical guidelines and expert knowledge
- 📊 Thoracic Surgery Specialty Data: Contains 92 carefully curated clinical cases focusing on thoracic surgery scenarios, particularly non-small cell lung cancer (NSCLC) staging and treatment planning
- 🎯 Multi-dimensional Scoring: Employs positive/negative scoring system for comprehensive evaluation of AI clinical decision-making
- ⚙️ Standardized Format: Provides unified Excel format with questions, evaluation rubrics, and multi-model responses
Dataset Structure
Column Descriptions
| Column Name | Description | Data Type |
|---|---|---|
| question | Clinical questions covering thoracic surgery scenarios | Text |
| 分类 (Category) | Medical specialty classification | Text |
| rubrics | Evaluation criteria in JSON format with scoring levels | JSON Array |
| gpt_5_answer | GPT-4 model responses to clinical questions | Text |
| gemini_2_5_pro_answer | Gemini 2.5 Pro model responses | Text |
| claude_opus_4_answer | Claude Opus model responses | Text |
Scoring System
Positive Scoring (A-levels):
- A1 (5 points): Critical medical knowledge affecting patient safety
- A2 (3 points): Important clinical considerations
- A3 (1 point): Additional relevant information
Negative Scoring (S-levels):
- S1 (-1 point): Minor inaccuracies not affecting core treatment
- S2 (-2 points): Incorrect information that could mislead
- S3 (-3 points): Serious medical errors
- S4 (-4 points): Dangerous misinformation that could harm patients
Clinical Coverage Areas
The dataset covers critical aspects of thoracic surgery:
- Pre-operative Evaluation: Comprehensive assessment protocols for NSCLC patients (IIB-IIIA staging)
- Diagnostic Procedures: EBUS-TBNA, mediastinoscopy, PET-CT interpretation
- Staging Assessment: TNM staging, mediastinal lymph node evaluation
- Treatment Planning: Surgical vs. non-surgical approaches, neoadjuvant therapy decisions
- Risk Assessment: Pulmonary function evaluation, cardiac risk stratification
- Molecular Diagnostics: EGFR, ALK, PD-L1 testing strategies
Data Quality Metrics
- Total Cases: 92 clinical scenarios
- Completeness: 100% data coverage across all columns
- Clinical Diversity: Covers full spectrum of IIB-IIIA NSCLC presentations
- Expert Validation: All cases reviewed by multidisciplinary clinical team
Use Cases
- AI Clinical Decision Support: Evaluating AI models' ability to provide accurate clinical recommendations
- Medical Education: Training and assessment of clinical reasoning skills
- Quality Assurance: Benchmarking AI systems against established clinical standards
- Comparative Analysis: Cross-model performance evaluation in specialized medical domains
Sample Usage
This dataset is designed to work seamlessly with the GAPS evaluation pipeline. To get started:
Installation
# Clone the repository
git clone https://github.com/AQ-MedAI/MedicalAiBenchEval
cd MedicalAiBenchEval
# Install dependencies
pip install -r requirements.txt
Basic Evaluation Pipeline
Once installed, you can evaluate the `GAPS-NSCLC-
3 个文件
浏览文件数据集版权信息
本数据集的许可证为 MIT License。如有违反相关条款,请联系 WEHUB,我们将及时处理。 查看许可证
通过 WeHub CLI 下载当前数据集快照。下列命令会固定为当前页面展示的数据版本(如果页面提供版本)。文件字节由本机直连存储下载,浏览器不会签发或保存下载链接。
前置要求
需要 Node.js 18 及以上,以及 npm(或 npx)。
1. 安装 CLI
npm install -g wehub-cli@latest
2. 下载此数据集
wehub datasets download ds_ext_2159_a591b2635f --revision b32ef66e189edf9adad9ba9ffe26faed0e86b9d6 --output ./ds_ext_2159_a591b2635f
若中断或部分失败,在同一目录重新执行同一命令即可续传。默认会校验 SHA-256。
免全局安装
npx --yes wehub-cli@latest datasets download ds_ext_2159_a591b2635f --revision b32ef66e189edf9adad9ba9ffe26faed0e86b9d6 --output ./ds_ext_2159_a591b2635f
高级选项
以下为 wehub datasets download 已支持的参数示例:
强制重新下载,不复用已校验的本地文件
wehub datasets download ds_ext_2159_a591b2635f --revision b32ef66e189edf9adad9ba9ffe26faed0e86b9d6 --output ./ds_ext_2159_a591b2635f --overwrite
仅包含匹配路径
wehub datasets download ds_ext_2159_a591b2635f --revision b32ef66e189edf9adad9ba9ffe26faed0e86b9d6 --output ./ds_ext_2159_a591b2635f --include "*.jsonl"
排除匹配路径
wehub datasets download ds_ext_2159_a591b2635f --revision b32ef66e189edf9adad9ba9ffe26faed0e86b9d6 --output ./ds_ext_2159_a591b2635f --exclude "*.md"
提高并发下载数
wehub datasets download ds_ext_2159_a591b2635f --revision b32ef66e189edf9adad9ba9ffe26faed0e86b9d6 --output ./ds_ext_2159_a591b2635f --jobs 8
完整帮助:wehub datasets download --help