数据集导航 · 医学文本与大模型
医学文本与大模型数据集(第 4 页)
思陌医疗数据服务整理的医学文本与大模型公开数据集,共 298 个,覆盖该领域多模态数据,助力医疗AI研发选型。
全部
肿瘤 579
神经系统疾病 507
心血管系统疾病 462
耳鼻咽喉疾病 451
眼病 412
皮肤与结缔组织疾病 399
泌尿生殖系统疾病 362
内分泌系统疾病 352
医学文本与大模型 285
呼吸道疾病 245
口颌系统疾病 219
消化系统疾病 200
免疫系统疾病 137
通用医学数据集 136
血液与淋巴系统疾病 106
感染 96
创伤与损伤 66
肌肉骨骼疾病 14
化学诱发性障碍 4
环境因素所致疾病 3
共 285 个数据集 · 第 4 / 10 页
| 数据集名称 | 系统分类 | 病种 | 数据模态 | 任务类型 | 描述 | 来源 | 原始地址 | 操作 |
|---|---|---|---|---|---|---|---|---|
| 标准医疗问题数据 | 医学文本与大模型 | 其他 | 文本 | 文本 | 将非标准患者咨询转换为标准化医疗问题的文本数据集,用于训练医疗对话AI系统。 | PandaVT | https://huggingface.co/datasets/PandaVT/datatager_standard_med_question | 访问 |
| MedQuad医学问答数据集(Guanco-Llama2格式) | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于MedQuad的医学问答数据集,包含43801条训练样本,采用Guanco-Llama2格式。 | whoispanashe | https://huggingface.co/datasets/whoispanashe/medquad-guanco-llama2 | 访问 |
| Counsel Chat | 医学文本与大模型 | 其他 | 文本 | 问答 | 医疗领域的问答和文本分类数据集,包含上下文、回答、主题等特征。 | andreshere | https://huggingface.co/datasets/andreshere/counsel_chat | 访问 |
| 英文医学经验问答基准数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 英文医学经验问答基准数据集,用于评估模型在医学问答任务上的表现。 | shuyuej | https://huggingface.co/datasets/shuyuej/English-MedExpQA-Benchmark | 访问 |
| French-MedExpQA基准数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 法语医学经验问答基准数据集,用于评估医学问答模型性能。 | shuyuej | https://huggingface.co/datasets/shuyuej/French-MedExpQA-Benchmark | 访问 |
| 医疗10万文本数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含10万条医疗文本数据,适用于医疗自然语言处理任务。 | Naveenpoliasetty | https://huggingface.co/datasets/Naveenpoliasetty/healthcare10milliion | 访问 |
| Llama3-8b-MedBot | 医学文本与大模型 | 其他 | 文本 | 文本 | Llama3-8b-MedBot是一个医学对话数据集,包含11万条对话样本,用于训练医疗问答模型。 | Ali-PYT | https://huggingface.co/datasets/Ali-PYT/Llama3-8b-MedBot | 访问 |
| MedSyn-synthetic | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含41,185个样本的合成俄语临床笔记数据集,覆盖219个ICD-10代码,用于文本分类和生成任务。 | Glebkaa | https://huggingface.co/datasets/Glebkaa/MedSyn-synthetic | 访问 |
| gemma2b-closedqa-eval-by-gemini15flash | 医学文本与大模型 | 其他 | 文本 | 文本问答 | 一个用于评估Gemma2B模型在封闭域问答任务上表现的文本数据集,包含60个样本及评估得分。 | llama-duo | https://huggingface.co/datasets/llama-duo/gemma2b-closedqa-eval-by-gemini15flash | 访问 |
| doctor-closing-ko | 医学文本与大模型 | 其他 | 文本 | 文本分类 | 韩语医疗对话句子分类数据集,包含句子和标签,用于医疗对话结束语识别。 | j5ng | https://huggingface.co/datasets/j5ng/doctor-closing-ko | 访问 |
| ORPO韩语翻译医学数据集 | 医学文本与大模型 | 其他 | 文本 | 偏好优化 | 韩语翻译的医学问答数据集,用于偏好优化训练,包含10403条样本。 | GrowingApple | https://huggingface.co/datasets/GrowingApple/orpo_kor_translated_medical | 访问 |
| 医疗转录文本数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含2236条医疗转录文本,涵盖多医学专科,可用于文本分析。 | adisingh19 | https://huggingface.co/datasets/adisingh19/medical_transcriptions | 访问 |
| 医疗保健行业合成文档问答测试集(OCR分块) | 医学文本与大模型 | 其他 | 问答 | 针对医疗保健行业文档的合成问答数据集,包含OCR分块后的文档图像、查询和答案,用于评估文档问答模型。 | vidore | https://huggingface.co/datasets/vidore/syntheticDocQA_healthcare_industry_test_ocr_chunk | 访问 | |
| USQA | 医学文本与大模型 | 其他 | 文本 | 问答 | USQA是面向医学问答、多选和文本生成的小规模英文数据集,规模小于1000条。 | Baron-GG | https://huggingface.co/datasets/Baron-GG/USQA | 访问 |
| 药物-靶点相互作用数据集 | 医学文本与大模型 | 其他 | 文本 | 药物发现 | 用于药物-靶点相互作用预测的数据集,包含药物分子与靶点蛋白质相互作用信息,支持药物发现与生物信息学研究。 | AT8805 | https://huggingface.co/datasets/AT8805/DTI | 访问 |
| medzoom-llama2-30 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含30个文本样本的医学领域LLaMA2训练数据集。 | lotfi4000 | https://huggingface.co/datasets/lotfi4000/medzoom-llama2-30 | 访问 |
| Aceso入职对话5K | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含5000个医患入职对话的合成数据集,用于医疗咨询场景。 | Dong237 | https://huggingface.co/datasets/Dong237/Aceso-onboarding-5k | 访问 |
| MIMIC-III住院病程元数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于MIMIC-III的重症监护住院病程及摘要文本数据集,用于文本摘要。 | dmacres | https://huggingface.co/datasets/dmacres/mimiciii-hospitalcourse-meta | 访问 |
| 华佗百科问答364k | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含36.4万条中文医学百科问答对,用于医学问答任务。 | xDAN-datasets | https://huggingface.co/datasets/xDAN-datasets/huatuo_encyclopedia_qa_364k | 访问 |
| ChatDoctor_HealthCareMagic_112k | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含112k条医疗对话的数据集,用于训练医疗问答模型。 | xDAN-datasets | https://huggingface.co/datasets/xDAN-datasets/ChatDoctor_HealthCareMagic_112k | 访问 |
| 医学指令样本10k | 医学文本与大模型 | 其他 | 文本 | 指令微调 | 约1万条医疗对话指令样本,用于对话模型微调,纯文本格式。 | Pontonkid | https://huggingface.co/datasets/Pontonkid/sample_medical-instruction-10k | 访问 |
| medical_meadow_mediqa_2k | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含2000条人工生成的医患对话数据,用于医疗自然语言处理研究。 | xDAN-datasets | https://huggingface.co/datasets/xDAN-datasets/medical_meadow_mediqa_2k | 访问 |
| 医疗草原维基文档患者信息6k | 医学文本与大模型 | 其他 | 文本 | 问答 | 基于维基文档患者信息,由GPT-3.5-turbo生成的6k条医疗问答对话数据集。 | xDAN-datasets | https://huggingface.co/datasets/xDAN-datasets/medical_meadow_wikidoc_patient_information_6k | 访问 |
| MedQuad | 医学文本与大模型 | 其他 | 文本 | 文本 | MedQuad是一个医学问答数据集,包含文本形式的问题和答案对,用于医学知识问答任务。 | Nimsi2613 | https://huggingface.co/datasets/Nimsi2613/MedQuad | 访问 |
| MedQuad_split | 医学文本与大模型 | 其他 | 文本 | 文本 | MedQuad_split是医学问答数据集,包含问题-答案对,用于训练和评估医学问答系统。 | davidgaofc | https://huggingface.co/datasets/davidgaofc/MedQuad_split | 访问 |
| 美国医学执照考试教材数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 美国医学执照考试英文教材文本数据集,用于医学相关自然语言处理任务。 | Medilora | https://huggingface.co/datasets/Medilora/us_medical_license_exam_textbooks_en | 访问 |
| 医疗对话知识数据集v2 | 医学文本与大模型 | 其他 | 文本 | 对话 | 6290条医疗对话数据,用于指令微调,模态为文本。 | mlabonne | https://huggingface.co/datasets/mlabonne/know_medical_dialogue_v2 | 访问 |
| menuwriter_alimentos_dt_1.2k | 医学文本与大模型 | 其他 | 文本 | 文本 | 约1.2k条西班牙语医疗文本数据集,涉及食物主题,用于文本生成和问答任务。 | Isaac45 | https://huggingface.co/datasets/Isaac45/menuwriter_alimentos_dt_1.2k | 访问 |
| HealthCareMagic-llama2-5k | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含5000条医疗相关文本样本,用于训练语言模型。 | mmaak | https://huggingface.co/datasets/mmaak/HealthCareMagic-llama2-5k | 访问 |
| MIMIC分词平衡子集数据集 | 医学文本与大模型 | 其他 | 文本 | 文本分类 | MIMIC临床文本数据的分词平衡子集,用于文本分类任务。 | passionMan | https://huggingface.co/datasets/passionMan/mimic_tokenized_dataset_balanced_frac_0.1 | 访问 |