数据集导航 · 医学文本与大模型
医学文本与大模型数据集(第 6 页)
思陌医疗数据服务整理的医学文本与大模型公开数据集,共 298 个,覆盖该领域多模态数据,助力医疗AI研发选型。
全部
肿瘤 579
神经系统疾病 507
心血管系统疾病 462
耳鼻咽喉疾病 451
眼病 412
皮肤与结缔组织疾病 399
泌尿生殖系统疾病 362
内分泌系统疾病 352
医学文本与大模型 285
呼吸道疾病 245
口颌系统疾病 219
消化系统疾病 200
免疫系统疾病 137
通用医学数据集 136
血液与淋巴系统疾病 106
感染 96
创伤与损伤 66
肌肉骨骼疾病 14
化学诱发性障碍 4
环境因素所致疾病 3
共 285 个数据集 · 第 6 / 10 页
| 数据集名称 | 系统分类 | 病种 | 数据模态 | 任务类型 | 描述 | 来源 | 原始地址 | 操作 |
|---|---|---|---|---|---|---|---|---|
| HEAD-QA多选医疗问答数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | HEAD-QA是一个多选医疗问答数据集,问题来自西班牙医疗考试,涵盖多个医学领域,提供西班牙语和英语版本。 | dvilares | https://huggingface.co/datasets/dvilares/head_qa | 访问 |
| MOCHA | 医学文本与大模型 | 其他 | 文本 | 评价指标 | MOCHA是一个用于训练和评估生成式阅读理解指标的数据集,包含40K人类评分和最小对,支持开发更准确的自动评估指标。 | anthonychen | https://huggingface.co/datasets/anthonychen/mocha | 访问 |
| ChatDoctor-50k | 医学文本与大模型 | 其他 | 文本 | 对话 | 包含50,000条医疗对话样本的文本数据集,用于训练医疗聊天机器人。 | GGYIMAH1031 | https://huggingface.co/datasets/GGYIMAH1031/ChatDoctor-50k | 访问 |
| ICDCM代码描述数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含ICDCM代码与描述对应的文本数据集,共22.6万条,用于疾病编码和分类。 | jilp00 | https://huggingface.co/datasets/jilp00/icdcm-code-desc | 访问 |
| Trial7 | 医学文本与大模型 | 其他 | 文本 | 对话 | 包含10个样本的文本数据集,用于疾病预测,包含对话和推理过程。 | Dstycoon | https://huggingface.co/datasets/Dstycoon/Trial7 | 访问 |
| 英国NHS全科医生诊所评论(2022-2024) | 医学文本与大模型 | 其他 | 文本 | 全科医生 | 英格兰NHS全科医生诊所患者评论数据集,包含2022-2024年超过6.1万条评论,用于分析患者体验和服务质量。 | janduplessis886 | https://huggingface.co/datasets/janduplessis886/england-nhs-gp-reviews | 访问 |
| 增强临床笔记 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含3万组真实临床笔记、合成对话和结构化患者信息,用于训练临床笔记生成模型。 | AGBonnet | https://huggingface.co/datasets/aisc-team-a1/augmented-clinical-notes | 访问 |
| 医疗领域输入输出数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 医疗领域文本输入输出数据集,包含输入文本和多个带标签分数的输出,适用于文本生成或分类任务。 | HoangHa | https://huggingface.co/datasets/HoangHa/medical-domain_inout | 访问 |
| 医疗转录测试输入输出数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 医疗转录指令跟随数据集,包含6173条训练样本和325条测试样本,用于医疗文本生成任务。 | HoangHa | https://huggingface.co/datasets/HoangHa/MedicalTranscriptions_test_inout | 访问 |
| 华佗医疗问答ShareGPT格式数据集 | 医学文本与大模型 | 其他 | 文本 | 问答 | 华佗GPT医疗问答数据集的ShareGPT格式,包含约27.6万条医生-患者对话,用于医疗对话模型训练。 | shibing624 | https://huggingface.co/datasets/shibing624/huatuo_medical_qa_sharegpt | 访问 |
| ChatDoctor 50%预处理版本 | 医学文本与大模型 | 其他 | 文本 | 文本 | 约9.8万条医患对话文本数据,用于医学对话系统训练。 | typosonlr | https://huggingface.co/datasets/typosonlr/ChatDoctor_50percent_preprocessed | 访问 |
| Wish-QA-ASQA-Llama数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含问答对和文本段落的问答数据集,共3460个训练样本。 | ibm-research | https://huggingface.co/datasets/ibm-research/Wish-QA-ASQA-Llama | 访问 |
| Wish-QA-MED-Llama | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含10000个医学问答样本的文本数据集,用于训练医学问答模型。 | ibm-research | https://huggingface.co/datasets/ibm-research/Wish-QA-MED-Llama | 访问 |
| ChatDoctor 200k精简嵌入版 | 医学文本与大模型 | 其他 | 文本 | 文本 | ChatDoctor 200k精简嵌入版数据集,含约20万条医疗对话样本,用于训练医疗对话AI模型。 | dkshjn | https://huggingface.co/datasets/dkshjn/chatdoctor-200k-stripped-embedded | 访问 |
| ChatDoctor-200k-精简嵌入版v2 | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于ChatDoctor-200k的医疗对话数据集,包含输入、指令、输出及嵌入向量,共10个示例。 | dkshjn | https://huggingface.co/datasets/dkshjn/chatdoctor-200k-stripped-embedded-v2 | 访问 |
| hindiDoctor | 医学文本与大模型 | 其他 | 文本 | 文本 | 推测为印地语医疗文本数据集,具体内容未提供。 | bharathnaik | https://huggingface.co/datasets/bharathnaik/hindiDoctor | 访问 |
| 合成临床笔记(带嵌入) | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于Asclepius合成临床笔记,转换为Alpaca格式并添加嵌入,原始数据来自PubMed Central和MIMIC 3,用于临床文本生成。 | Technoculture | https://huggingface.co/datasets/Technoculture/synthetic-clinical-notes-embedded | 访问 |
| HealthCareMagic-100k | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含约11.2万条医疗问答样本的文本数据集,用于训练医疗对话模型。 | ruslanmv | https://huggingface.co/datasets/ruslanmv/HealthCareMagic-100k | 访问 |
| Gold-alpaca-医疗-小 | 医学文本与大模型 | 其他 | 文本 | 指令微调 | 医疗指令微调数据集,含27360个训练样本,用于训练医疗问答模型。 | hemanth955 | https://huggingface.co/datasets/hemanth955/Gold-alpaca-med-small | 访问 |
| Gold-alpaca-med-small-final | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于Alpaca的医学指令微调数据集,包含27360条文本样本,用于训练医学问答模型。 | hemanth955 | https://huggingface.co/datasets/hemanth955/Gold-alpaca-med-small-final | 访问 |
| OpusMemat医疗机器翻译数据集 | 医学文本与大模型 | 其他 | 文本 | 翻译 | 科萨语-英语医学领域平行语料库,用于医疗机器翻译任务。 | Helsinki-NLP | https://huggingface.co/datasets/Helsinki-NLP/opus_memat | 访问 |
| TOP12葡萄牙语验证数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含葡萄牙语临床笔记及其CID-10编码序列的文本数据集,用于疾病自动编码任务。 | ricardosantoss | https://huggingface.co/datasets/ricardosantoss/TOP12_COM_VALIDACAO_PORTUGUES | 访问 |
| TOP20临床笔记验证数据集(葡萄牙语) | 医学文本与大模型 | 其他 | 文本 | 临床笔记 | 葡萄牙语临床笔记及ICD-10编码数据集,用于疾病自动编码任务。 | ricardosantoss | https://huggingface.co/datasets/ricardosantoss/TOP20_COM_VALIDACAO_PORTUGUES | 访问 |
| 临床实践指南数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含47K条临床实践指南的文本数据集,来自17个在线医学资源,用于医学NLP任务。 | aisc-team-b1 | https://huggingface.co/datasets/aisc-team-b1/guidelines | 访问 |
| HealthSearchQA | 医学文本与大模型 | 其他 | 文本 | 问答 | 包含3,173个消费者常见健康问题的问答数据集,用于医学问答研究。 | aisc-team-d2 | https://huggingface.co/datasets/aisc-team-d2/healthsearchqa | 访问 |
| 韩语医学QA数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 韩语医学问答数据集,含问答对、选项及提示文本,用于医学问答任务。 | Saxo | https://huggingface.co/datasets/Saxo/ko_medical_meadow_med_qa_options_linkbricks_single_dataset_with_prompt_text_huggingface | 访问 |
| 医疗翻译数据集(英泰)v.2 | 医学文本与大模型 | 其他 | 文本 | 翻译 | 医疗领域英泰翻译平行语料,约1.6万条,用于机器翻译任务。 | Tippawan | https://huggingface.co/datasets/Tippawan/medical_translation_v.2 | 访问 |
| ChatDoctor医疗对话数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 医疗领域患者-医生对话数据集,包含真实和生成对话,用于问答任务。 | avaliev | https://huggingface.co/datasets/avaliev/chat_doctor | 访问 |
| 医学提示链式推理数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含100个样本的医疗推理提示链式数据集,用于训练模型进行医疗问答。 | dkshjn | https://huggingface.co/datasets/dkshjn/MedpromptCoT | 访问 |
| 美国社会安全与医疗保险常见问题示例 | 医学文本与大模型 | 其他 | 文本 | FAQ问答 | 美国社会安全与医疗保险FAQ示例数据集,文本模态,用于问答。 | AlexSo79 | https://huggingface.co/datasets/AlexSo79/US_Social_Security_Medicare_FAQs_Sample | 访问 |