数据集导航
医疗数据集导航 - 全部数据集(第 109 页)
汇集 20 大疾病系统 5035 个医疗数据集,支持搜索与分类筛选,助力医疗AI研发选型
全部 5035
肿瘤 579
神经系统疾病 507
心血管系统疾病 462
耳鼻咽喉疾病 451
眼病 412
皮肤与结缔组织疾病 399
泌尿生殖系统疾病 362
内分泌系统疾病 352
医学文本与大模型 285
呼吸道疾病 245
口颌系统疾病 219
消化系统疾病 200
免疫系统疾病 137
通用医学数据集 136
血液与淋巴系统疾病 106
感染 96
创伤与损伤 66
肌肉骨骼疾病 14
化学诱发性障碍 4
环境因素所致疾病 3
共 5035 个数据集 · 第 109 / 168 页
| 数据集名称 | 系统分类 | 病种 | 数据模态 | 任务类型 | 描述 | 来源 | 原始地址 | 操作 |
|---|---|---|---|---|---|---|---|---|
| 医学代码映射 | 医学文本与大模型 | 其他 | 文本 | 医学代码映射数据集,用于不同医学编码系统之间的对应关系。 | mozay22 | https://huggingface.co/datasets/mozay22/medical_code_mapping | 访问 | |
| MedQuad医学问答数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 医学问答数据集,包含16407条问答对,覆盖多种疾病主题。 | HoangHa | https://huggingface.co/datasets/HoangHa/MedQuad-MedicalQnADataset | 访问 |
| medical_qa_meds | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于患者信息改编的医学问答数据集,适配llama-2指令格式,用于问答和文本生成。 | s200862 | https://huggingface.co/datasets/s200862/medical_qa_meds | 访问 |
| 专家医学问答数据集 | 医学文本与大模型 | 其他 | 文本 | 问答 | 医学专家问答数据集,包含458个问题及其元数据,用于医学问答任务。 | katielink | https://huggingface.co/datasets/katielink/expertqa_medical | 访问 |
| HEAD-QA多选医疗问答数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | HEAD-QA是一个多选医疗问答数据集,问题来自西班牙医疗考试,涵盖多个医学领域,提供西班牙语和英语版本。 | dvilares | https://huggingface.co/datasets/dvilares/head_qa | 访问 |
| MOCHA | 医学文本与大模型 | 其他 | 文本 | 评价指标 | MOCHA是一个用于训练和评估生成式阅读理解指标的数据集,包含40K人类评分和最小对,支持开发更准确的自动评估指标。 | anthonychen | https://huggingface.co/datasets/anthonychen/mocha | 访问 |
| ChatDoctor-50k | 医学文本与大模型 | 其他 | 文本 | 对话 | 包含50,000条医疗对话样本的文本数据集,用于训练医疗聊天机器人。 | GGYIMAH1031 | https://huggingface.co/datasets/GGYIMAH1031/ChatDoctor-50k | 访问 |
| DDXPlus | 通用医学数据集 | 其他 | 表格 | 表格 | DDXPlus是一个大规模合成患者数据集,专为自动症状检测和自动诊断系统设计,包含鉴别诊断和非二分类症状。 | aai530-group6 | https://huggingface.co/datasets/aai530-group6/ddxplus | 访问 |
| ICDCM代码描述数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含ICDCM代码与描述对应的文本数据集,共22.6万条,用于疾病编码和分类。 | jilp00 | https://huggingface.co/datasets/jilp00/icdcm-code-desc | 访问 |
| SBS_V2代码列表 | 通用医学数据集 | 其他 | 表格 | 表格 | 包含SBS医疗代码及其详细描述的表格数据集,用于健康保险编码和理赔处理。 | TachyHealth | https://huggingface.co/datasets/TachyHealth/SBS_V2_Code_list | 访问 |
| Trial7 | 医学文本与大模型 | 其他 | 文本 | 对话 | 包含10个样本的文本数据集,用于疾病预测,包含对话和推理过程。 | Dstycoon | https://huggingface.co/datasets/Dstycoon/Trial7 | 访问 |
| 英国NHS全科医生诊所评论(2022-2024) | 医学文本与大模型 | 其他 | 文本 | 全科医生 | 英格兰NHS全科医生诊所患者评论数据集,包含2022-2024年超过6.1万条评论,用于分析患者体验和服务质量。 | janduplessis886 | https://huggingface.co/datasets/janduplessis886/england-nhs-gp-reviews | 访问 |
| 增强临床笔记 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含3万组真实临床笔记、合成对话和结构化患者信息,用于训练临床笔记生成模型。 | AGBonnet | https://huggingface.co/datasets/aisc-team-a1/augmented-clinical-notes | 访问 |
| 医疗领域输入输出数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 医疗领域文本输入输出数据集,包含输入文本和多个带标签分数的输出,适用于文本生成或分类任务。 | HoangHa | https://huggingface.co/datasets/HoangHa/medical-domain_inout | 访问 |
| 医疗转录测试输入输出数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 医疗转录指令跟随数据集,包含6173条训练样本和325条测试样本,用于医疗文本生成任务。 | HoangHa | https://huggingface.co/datasets/HoangHa/MedicalTranscriptions_test_inout | 访问 |
| 华佗医疗问答ShareGPT格式数据集 | 医学文本与大模型 | 其他 | 文本 | 问答 | 华佗GPT医疗问答数据集的ShareGPT格式,包含约27.6万条医生-患者对话,用于医疗对话模型训练。 | shibing624 | https://huggingface.co/datasets/shibing624/huatuo_medical_qa_sharegpt | 访问 |
| 医疗音频数据集 | 通用医学数据集 | 其他 | 音频 | 音频 | 医疗音频数据集,包含49个训练样本、1个验证样本和7个测试样本,用于医疗音频分析。 | sahilkadge | https://huggingface.co/datasets/sahilkadge/medical_audio_dataset | 访问 |
| ChatDoctor 50%预处理版本 | 医学文本与大模型 | 其他 | 文本 | 文本 | 约9.8万条医患对话文本数据,用于医学对话系统训练。 | typosonlr | https://huggingface.co/datasets/typosonlr/ChatDoctor_50percent_preprocessed | 访问 |
| 美国国家提供者标识符数据集(2024年1月7日) | 通用医学数据集 | 其他 | 表格 | 表格 | 包含美国医疗提供者NPI、地址、许可证等详细信息的结构化表格数据集。 | awacke1 | https://huggingface.co/datasets/awacke1/NPI-20240107 | 访问 |
| Wish-QA-ASQA-Llama数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含问答对和文本段落的问答数据集,共3460个训练样本。 | ibm-research | https://huggingface.co/datasets/ibm-research/Wish-QA-ASQA-Llama | 访问 |
| Wish-QA-MED-Llama | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含10000个医学问答样本的文本数据集,用于训练医学问答模型。 | ibm-research | https://huggingface.co/datasets/ibm-research/Wish-QA-MED-Llama | 访问 |
| ChatDoctor 200k精简嵌入版 | 医学文本与大模型 | 其他 | 文本 | 文本 | ChatDoctor 200k精简嵌入版数据集,含约20万条医疗对话样本,用于训练医疗对话AI模型。 | dkshjn | https://huggingface.co/datasets/dkshjn/chatdoctor-200k-stripped-embedded | 访问 |
| ChatDoctor-200k-精简嵌入版v2 | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于ChatDoctor-200k的医疗对话数据集,包含输入、指令、输出及嵌入向量,共10个示例。 | dkshjn | https://huggingface.co/datasets/dkshjn/chatdoctor-200k-stripped-embedded-v2 | 访问 |
| hindiDoctor | 医学文本与大模型 | 其他 | 文本 | 文本 | 推测为印地语医疗文本数据集,具体内容未提供。 | bharathnaik | https://huggingface.co/datasets/bharathnaik/hindiDoctor | 访问 |
| AllUSPhysiciansNPIbyStateandCountry | 通用医学数据集 | 其他 | 表格 | 表格 | 包含美国医生NPI及专业代码的表格数据集,用于医疗研究和患者匹配。 | awacke1 | https://huggingface.co/datasets/awacke1/AllUSPhysiciansNPIbyStateandCountry | 访问 |
| 合成临床笔记(带嵌入) | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于Asclepius合成临床笔记,转换为Alpaca格式并添加嵌入,原始数据来自PubMed Central和MIMIC 3,用于临床文本生成。 | Technoculture | https://huggingface.co/datasets/Technoculture/synthetic-clinical-notes-embedded | 访问 |
| HealthCareMagic-100k | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含约11.2万条医疗问答样本的文本数据集,用于训练医疗对话模型。 | ruslanmv | https://huggingface.co/datasets/ruslanmv/HealthCareMagic-100k | 访问 |
| Gold-alpaca-医疗-小 | 医学文本与大模型 | 其他 | 文本 | 指令微调 | 医疗指令微调数据集,含27360个训练样本,用于训练医疗问答模型。 | hemanth955 | https://huggingface.co/datasets/hemanth955/Gold-alpaca-med-small | 访问 |
| Gold-alpaca-med-small-final | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于Alpaca的医学指令微调数据集,包含27360条文本样本,用于训练医学问答模型。 | hemanth955 | https://huggingface.co/datasets/hemanth955/Gold-alpaca-med-small-final | 访问 |
| OpusMemat医疗机器翻译数据集 | 医学文本与大模型 | 其他 | 文本 | 翻译 | 科萨语-英语医学领域平行语料库,用于医疗机器翻译任务。 | Helsinki-NLP | https://huggingface.co/datasets/Helsinki-NLP/opus_memat | 访问 |