数据集导航
医疗数据集导航 - 全部数据集(第 104 页)
汇集 20 大疾病系统 5035 个医疗数据集,支持搜索与分类筛选,助力医疗AI研发选型
全部 5035
肿瘤 579
神经系统疾病 507
心血管系统疾病 462
耳鼻咽喉疾病 451
眼病 412
皮肤与结缔组织疾病 399
泌尿生殖系统疾病 362
内分泌系统疾病 352
医学文本与大模型 285
呼吸道疾病 245
口颌系统疾病 219
消化系统疾病 200
免疫系统疾病 137
通用医学数据集 136
血液与淋巴系统疾病 106
感染 96
创伤与损伤 66
肌肉骨骼疾病 14
化学诱发性障碍 4
环境因素所致疾病 3
共 5035 个数据集 · 第 104 / 168 页
| 数据集名称 | 系统分类 | 病种 | 数据模态 | 任务类型 | 描述 | 来源 | 原始地址 | 操作 |
|---|---|---|---|---|---|---|---|---|
| openchat/cogstack-opengpt-sharegpt | 医学文本与大模型 | 其他 | 文本 | 对话 | CogStack OpenGPT医疗对话数据集,采用ShareGPT格式,用于医疗对话模型训练。 | openchat | https://huggingface.co/datasets/openchat/cogstack-opengpt-sharegpt | 访问 |
| MEDISCO | 通用医学数据集 | 其他 | 音频 | 语音识别 | 印尼语医疗领域语音语料库,包含720个样本,用于自动语音识别任务。 | mrqorib | https://huggingface.co/datasets/mrqorib/MEDISCO | 访问 |
| medical-1000-64-16-jinaai_jina-embeddings-v2-small-en-10-gpt-4-turbo-0_9062874564 | 医学文本与大模型 | 其他 | 文本 | 检索 | 医疗领域生成数据集,用于训练医疗文本嵌入模型,支持检索任务。 | florianhoenicke | https://huggingface.co/datasets/florianhoenicke/medical-1000-64-16-jinaai_jina-embeddings-v2-small-en-10-gpt-4-turbo-0_9062874564 | 访问 |
| 医疗Llama3指令数据集(短版) | 医学文本与大模型 | 其他 | 文本 | 问答 | 包含2000条医疗问答对,用于指令微调,来源于WikiDoc和Medquad,涵盖多种医疗知识。 | Shekswess | https://huggingface.co/datasets/Shekswess/medical_llama3_instruct_dataset_short | 访问 |
| Teladoc应用商店评论情感分析数据集 | 医学文本与大模型 | 其他 | 文本 | 情感分析 | Teladoc远程医疗应用商店评论的方面级情感分析数据集,含标题、内容、情感标签等字段。 | Alpaca69B | https://huggingface.co/datasets/Alpaca69B/reviews_appstore_teladoc_absa | 访问 |
| Teladoc应用商店评论ABSA数据集 | 医学文本与大模型 | 其他 | 文本 | 情感分析 | Teladoc远程医疗应用评论的方面级情感分析数据集,包含496条文本样本,用于分析用户对服务的情绪和方面。 | Alpaca69B | https://huggingface.co/datasets/Alpaca69B/reviews_appstore_teladoc_absa1 | 访问 |
| 医疗指令微调数据集 | 医学文本与大模型 | 其他 | 文本 | 指令微调 | 中文医疗指令微调数据集,用于文本生成任务,包含指令-响应对。 | bohu | https://huggingface.co/datasets/bohu/medical | 访问 |
| SemEval2018-Task9 预测结果2A.医学 | 医学文本与大模型 | 其他 | 文本 | 文本 | SemEval-2018医学上位词发现任务的预测结果集,含输入文本、真实标签和预测结果。 | feliphe-galiza | https://huggingface.co/datasets/feliphe-galiza/SemEval2018-Task9-preds-2A.medical | 访问 |
| SNOMED周末重测试数据集 | 医学文本与大模型 | 其他 | 文本 | 文本分类 | SNOMED CT临床术语文本分类数据集,包含1345个训练和测试样本。 | Tippawan | https://huggingface.co/datasets/Tippawan/SNOMED-weekend-retest-v1 | 访问 |
| Simsamu | 通用医学数据集 | 其他 | 音频 | 说话人分割 | Simsamu数据集包含61个法语模拟医疗调度对话录音,用于说话人分割和转录任务。 | diarizers-community | https://huggingface.co/datasets/medkit/simsamu | 访问 |
| MSD手册主题用户基础数据集 | 医学文本与大模型 | 其他 | 文本 | 文本分类 | 基于MSD手册的多语言健康文本数据集,涵盖症状、疾病等主题,支持文本分类、问答等任务。 | nuvocare | https://huggingface.co/datasets/nuvocare/MSD_manual_topics_user_base | 访问 |
| 医疗问答数据集QAER | 医学文本与大模型 | 其他 | 文本 | 问答 | QAER是英文医疗问答数据集,包含医疗问题与答案对,用于问答系统。 | Reymaaref | https://huggingface.co/datasets/Reymaaref/QAER | 访问 |
| 症状到疾病数据集 | 医学文本与大模型 | 其他 | 文本 | 症状 | 症状到疾病对话数据集,用于疾病诊断预测。 | Mostafijur | https://huggingface.co/datasets/Mostafijur/symptom_to_disease | 访问 |
| 麻醉素养数据集 | 医学文本与大模型 | 其他 | 文本 | 可读性 | 包含术前患者指导文本及其经LLM调整至6年级阅读水平的版本,用于可读性分析和验证。 | stanfordaimlab | https://huggingface.co/datasets/stanfordaimlab/anesthesia_literacy | 访问 |
| Apr29 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含健康信息学领域示例对话的农业数据集,展示医疗角色间的文本交流。 | leducanh1203 | https://huggingface.co/datasets/leducanh1203/Apr29 | 访问 |
| 患者-医生文本分类器英文数据集 | 医学文本与大模型 | 其他 | 文本 | 文本分类 | 英文对话文本中患者、医生、中性角色分类数据集,包含约4.1万样本,支持文本分类任务。 | LukeGPT88 | https://huggingface.co/datasets/LukeGPT88/patient-doctor-text-classifier-eng-dataset | 访问 |
| 医疗文档2 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含医疗预约、处方和账单等文档的医疗文本数据集,覆盖从业者和保险视角。 | Rohit228 | https://huggingface.co/datasets/Rohit228/medical_documents_2 | 访问 |
| 医疗文档数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 医疗文档数据集,包含医疗预约、处方和账单等示例。 | Rohit228 | https://huggingface.co/datasets/Rohit228/Medical_Documents | 访问 |
| AI医学通用数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 约2700万行医疗问答对数据集,支持医疗领域大型语言模型的训练,数据来源于ClinicalTrials、EMEA和PubMed。 | ruslanmv | https://huggingface.co/datasets/ruslanmv/ai-medical-dataset | 访问 |
| 医疗LLaMA3指令数据集(短版) | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含2000条医疗指令数据的文本数据集,用于微调LLaMA3模型。 | jewpaltz | https://huggingface.co/datasets/jewpaltz/medical_llama3_instruct_dataset_short | 访问 |
| Processed_Medicalbot_Dataset | 医学文本与大模型 | 其他 | 文本 | 文本生成 | 医疗文本生成数据集,用于训练医疗对话机器人。 | oudaher | https://huggingface.co/datasets/oudaher/Processed_Medicalbot_Dataset | 访问 |
| 医疗问诊数据SFT | 医学文本与大模型 | 其他 | 文本 | 文本 | 整合ChatDoctor、中文多科室问诊与Huatuo26M-Lite的医疗问诊对话文本数据集,用于SFT训练。 | BRZ911 | https://huggingface.co/datasets/BRZ911/Medical_consultation_data_SFT | 访问 |
| phr治疗数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含4062个训练样本,用于医疗治疗相关NLP任务,数据模态为文本。 | prathameshbagal | https://huggingface.co/datasets/prathameshbagal/phr_therapy_dataset | 访问 |
| medical_re_one | 医学文本与大模型 | 其他 | 文本 | 关系抽取 | 包含2000个医学文本样本的关系抽取数据集。 | zoohun | https://huggingface.co/datasets/zoohun/medical_re_one | 访问 |
| 医学关系抽取数据集二 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含2000条文本样本的医学关系抽取数据集,用于训练关系抽取模型。 | zoohun | https://huggingface.co/datasets/zoohun/medical_re_two | 访问 |
| medical_re_three | 医学文本与大模型 | 其他 | 文本 | 文本 | 医学关系抽取三元组数据集,含3037条文本样本,用于抽取医学实体间关系。 | zoohun | https://huggingface.co/datasets/zoohun/medical_re_three | 访问 |
| medical_bot | 医学文本与大模型 | 其他 | 文本 | 问答 | 一个包含256,916条文本样本的医疗问答数据集,用于训练医疗领域对话系统。 | Shankhadeep144 | https://huggingface.co/datasets/Shankhadeep144/medical_bot | 访问 |
| CMS覆盖文档数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | CMS医疗保险覆盖文档文本数据集,包含LCD、NCD、文章和IOMs,已分块处理。 | evekhm | https://huggingface.co/datasets/evekhm/cms_iom_3000 | 访问 |
| 意大利语医学问答数据集 | 医学文本与大模型 | 其他 | 文本 | 问答 | 意大利语医学问答合成数据集,用于RAG微调,包含约10K至100K条问答对。 | ReDiX | https://huggingface.co/datasets/ReDiX/medQA-ita | 访问 |
| MedQuad医疗问答数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于MedQuad的医疗问答文本数据集,包含问题、上下文和答案,用于训练医疗问答模型。 | DataScientist1122 | https://huggingface.co/datasets/DataScientist1122/MedQuad-QA16407-CL-PIPE_BERT | 访问 |