数据集导航
医疗数据集导航 - 全部数据集(第 108 页)
汇集 20 大疾病系统 5035 个医疗数据集,支持搜索与分类筛选,助力医疗AI研发选型
全部 5035
肿瘤 579
神经系统疾病 507
心血管系统疾病 462
耳鼻咽喉疾病 451
眼病 412
皮肤与结缔组织疾病 399
泌尿生殖系统疾病 362
内分泌系统疾病 352
医学文本与大模型 285
呼吸道疾病 245
口颌系统疾病 219
消化系统疾病 200
免疫系统疾病 137
通用医学数据集 136
血液与淋巴系统疾病 106
感染 96
创伤与损伤 66
肌肉骨骼疾病 14
化学诱发性障碍 4
环境因素所致疾病 3
共 5035 个数据集 · 第 108 / 168 页
| 数据集名称 | 系统分类 | 病种 | 数据模态 | 任务类型 | 描述 | 来源 | 原始地址 | 操作 |
|---|---|---|---|---|---|---|---|---|
| menuwriter_alimentos_dt_1.2k | 医学文本与大模型 | 其他 | 文本 | 文本 | 约1.2k条西班牙语医疗文本数据集,涉及食物主题,用于文本生成和问答任务。 | Isaac45 | https://huggingface.co/datasets/Isaac45/menuwriter_alimentos_dt_1.2k | 访问 |
| HealthCareMagic-llama2-5k | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含5000条医疗相关文本样本,用于训练语言模型。 | mmaak | https://huggingface.co/datasets/mmaak/HealthCareMagic-llama2-5k | 访问 |
| MIMIC分词平衡子集数据集 | 医学文本与大模型 | 其他 | 文本 | 文本分类 | MIMIC临床文本数据的分词平衡子集,用于文本分类任务。 | passionMan | https://huggingface.co/datasets/passionMan/mimic_tokenized_dataset_balanced_frac_0.1 | 访问 |
| 临床笔记与ICD-10编码数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含临床笔记和对应ICD-10编码序列的文本数据集,用于疾病分类任务。 | ricardosantoss | https://huggingface.co/datasets/ricardosantoss/top20_com_validacao | 访问 |
| TOP12出院报告数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含临床笔记和CID-10编码的出院报告数据集,用于文本分析,共1899条训练样本。 | ricardosantoss | https://huggingface.co/datasets/ricardosantoss/top12_com_relatorios_de_alta | 访问 |
| 越南医疗问答数据集 | 医学文本与大模型 | 其他 | 文本 | 问答 | 越南语医疗问答数据集,含10015条问答对,问题来自用户,答案来自专家,用于医疗问答任务。 | tarudesu | https://huggingface.co/datasets/tarudesu/ViHealthQA | 访问 |
| Edgar-Cayce Readings | 医学文本与大模型 | 其他 | 文本 | 问答 | 基于埃德加·凯西解读的医疗问答数据集,文本模态。 | Dregandor | https://huggingface.co/datasets/Dregandor/Edgar-Cayce_Readings | 访问 |
| Huatuo26M-Lite | 医学文本与大模型 | 其他 | 文本 | 问答 | 178k条中文医学问答数据,经净化和重写优化,覆盖多种疾病类别。 | FreedomIntelligence | https://huggingface.co/datasets/FreedomIntelligence/Huatuo26M-Lite | 访问 |
| 药物测试数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于德语药物相关文本混合而成的数据集,用于药物测试自动注释,模态为文本。 | 2ndBestKiller | https://huggingface.co/datasets/2ndBestKiller/DrugTest | 访问 |
| MedInstruct | 医学文本与大模型 | 其他 | 文本 | 指令跟随 | 合成生成的医疗指令数据集,包含52K条指令-响应对,用于微调医疗大语言模型。 | casey-martin | https://huggingface.co/datasets/casey-martin/MedInstruct | 访问 |
| Nepali-HealthChat | 医学文本与大模型 | 其他 | 文本 | 问答 | 尼泊尔语医疗健康问答数据集,包含文本问答对,可用于训练医疗问答模型。 | NepaliAI | https://huggingface.co/datasets/NepaliAI/Nepali-HealthChat | 访问 |
| 医疗草地MedQA数据 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含约1万条医学问答文本数据的开源数据集,训练集大小约10MB。 | mmaak | https://huggingface.co/datasets/mmaak/medical_meadow_medqa_data | 访问 |
| MedSum | 医学文本与大模型 | 其他 | 文本 | 摘要生成 | 基于医生-患者对话生成临床笔记的医学摘要数据集。 | beanham | https://huggingface.co/datasets/beanham/medsum | 访问 |
| Llama2-医疗健康Guanaco | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于Llama2和Guanaco格式的医疗健康对话数据集,用于微调语言模型。 | JayChauhan99 | https://huggingface.co/datasets/JayChauhan99/llama2-healthcare-guanaco | 访问 |
| 处理过的CADEC数据集 | 医学文本与大模型 | 其他 | 文本 | 医学文本 | 用于医学文本命名实体识别,标注ADR、药物、疾病等实体,共1250个样本。 | mireiaplalis | https://huggingface.co/datasets/mireiaplalis/processed_cadec | 访问 |
| 药物评论数据集 | 医学文本与大模型 | 其他 | 文本 | 文本分类 | DrugsCom Reviews数据集提供患者对药物的评论、医疗条件及10星评分,用于情感分析和文本分类。 | Zakia | https://huggingface.co/datasets/Zakia/drugscom_reviews | 访问 |
| NHS问答数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | NHS问答数据集,包含医疗健康问答对,文本模态,用于问答任务。 | shireesh-uop | https://huggingface.co/datasets/shireesh-uop/nhs_qna | 访问 |
| NHS分类数据集 | 医学文本与大模型 | 其他 | 文本 | 文本分类 | NHS分类数据集,含27124条文本样本及标签,用于文本分类任务。 | shireesh-uop | https://huggingface.co/datasets/shireesh-uop/nhs_classification | 访问 |
| PubMedCausal荷兰语翻译数据集 | 医学文本与大模型 | 其他 | 文本 | 文本分类 | PubMedCausal数据集的荷兰语翻译版,包含2368个训练样本,用于医疗健康领域的文本分类、问答和句子相似性任务。 | UMCU | https://huggingface.co/datasets/UMCU/PubMedCausal_Dutch_translated_with_MariaNMT | 访问 |
| 健康建议(荷兰语翻译版,使用MariaNMT) | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含8384个荷兰语医疗健康领域样本,涵盖文本分类、问答和句子相似性任务,使用MariaNMT模型翻译自英文HealthAdvice数据集。 | UMCU | https://huggingface.co/datasets/UMCU/HealthAdvice_Dutch_translated_with_MariaNMT | 访问 |
| 医学指令混合数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 一个包含约55万条文本的医学指令混合数据集,用于指令微调。 | proserve | https://huggingface.co/datasets/proserve/medical-instruct-mixer | 访问 |
| 医疗小型咨询对话数据集 | 医学文本与大模型 | 其他 | 文本 | 对话 | 虚构的医疗咨询对话数据集,用于语言建模实验。 | FunDialogues | https://huggingface.co/datasets/FunDialogues/healthcare-minor-consultation | 访问 |
| mozay22/clincal_bert_large_code_mapping | 医学文本与大模型 | 其他 | 文本 | 代码映射 | 基于临床BERT大模型的医学代码映射数据集,用于临床文本到标准代码的转换。 | mozay22 | https://huggingface.co/datasets/mozay22/clincal_bert_large_code_mapping | 访问 |
| 医学问答数据集 | 医学文本与大模型 | 其他 | 文本 | 问答 | 一个包含约1万至10万条医学问答对的数据集,用于医疗问答任务。 | rajveer43 | https://huggingface.co/datasets/rajveer43/QnAMedicDaataset | 访问 |
| Aarogya_MedText 医疗文本数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含1412个医疗文本提示-完成对的数据集,用于医疗对话训练。 | VaibhavGp69 | https://huggingface.co/datasets/VaibhavGp69/Aarogya_MedText | 访问 |
| Aarogya_MedQuad医疗问答数据集 | 医学文本与大模型 | 其他 | 文本 | 问答 | 含16407条医疗问答对,包括问题类型、提示、问题和答案,用于医疗问答系统训练。 | VaibhavGp69 | https://huggingface.co/datasets/VaibhavGp69/Aarogya_MedQuad-MedicalQnADataset | 访问 |
| 土耳其语ARC问答数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含250个土耳其语多项选择问答样本,基于ARC数据集,用于评估模型科学推理能力。 | ibranze | https://huggingface.co/datasets/ibranze/araproje_arc_tr_w5 | 访问 |
| CPPE-5医学个人防护装备数据集 | 通用医学数据集 | 其他 | 图像 | 图像 | CPPE-5是一个用于医学个人防护装备次级分类的图像数据集,包含1000张训练图像和29张测试图像,标注有边界框。 | rishitdagli | https://huggingface.co/datasets/rishitdagli/cppe-5 | 访问 |
| medquad-medicalqa-wizdolalpaca-instruct | 医学文本与大模型 | 其他 | 文本 | 文本 | 合并多个医学问答与伦理推理数据集的指令数据集,用于训练医学模型进行思维树推理。 | jtatman | https://huggingface.co/datasets/jtatman/medquad-medicalqa-wizdolalpaca-instruct | 访问 |
| PMC-Patients患者摘要数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含16.7万条从PMC病例报告中提取的患者摘要及关系标注,用于临床决策支持检索任务。 | zhengyun21 | https://huggingface.co/datasets/zhengyun21/PMC-Patients | 访问 |