数据集导航 · 医学文本与大模型
医学文本与大模型数据集(第 3 页)
思陌医疗数据服务整理的医学文本与大模型公开数据集,共 298 个,覆盖该领域多模态数据,助力医疗AI研发选型。
全部
肿瘤 579
神经系统疾病 507
心血管系统疾病 462
耳鼻咽喉疾病 451
眼病 412
皮肤与结缔组织疾病 399
泌尿生殖系统疾病 362
内分泌系统疾病 352
医学文本与大模型 285
呼吸道疾病 245
口颌系统疾病 219
消化系统疾病 200
免疫系统疾病 137
通用医学数据集 136
血液与淋巴系统疾病 106
感染 96
创伤与损伤 66
肌肉骨骼疾病 14
化学诱发性障碍 4
环境因素所致疾病 3
共 285 个数据集 · 第 3 / 10 页
| 数据集名称 | 系统分类 | 病种 | 数据模态 | 任务类型 | 描述 | 来源 | 原始地址 | 操作 |
|---|---|---|---|---|---|---|---|---|
| Med_Instruction_eng | 医学文本与大模型 | 其他 | 文本 | 指令微调 | 整合多个医学指令来源的文本数据集,用于医学大语言模型微调。 | ChenWeiLi | https://huggingface.co/datasets/ChenWeiLi/Med_Instruction_eng | 访问 |
| 病人-医生文本分类器英语数据集 | 医学文本与大模型 | 其他 | 文本 | 文本分类 | 医患对话英文文本分类数据集,约5.3万条标注样本,用于文本分类任务。 | LukeGPT88 | https://huggingface.co/datasets/LukeGPT88/patient-doctor-text-classifier-eng-dataset-0528 | 访问 |
| MedQuad医疗问答数据集(llama-3格式) | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含16407条医疗问答对的数据集,用于医学知识问答任务,数据模态为文本。 | Mohamed-Ahmed161 | https://huggingface.co/datasets/Mohamed-Ahmed161/MedQuad-MedicalQnADataset-llama-3 | 访问 |
| ICD-10-CM代码与嵌入向量数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含ICD-10-CM诊断代码及其嵌入向量的数据集,用于疾病编码和文本相似度分析。 | abhiwebshar | https://huggingface.co/datasets/abhiwebshar/icd10cm-codes-with-embeddings | 访问 |
| 年龄医学问答数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含不同年龄组医学问答对的文本数据集,用于评估模型在年龄维度上的医学问答能力。 | AIM-Harvard | https://huggingface.co/datasets/AIM-Harvard/age-medqa | 访问 |
| darooyab_qa | 医学文本与大模型 | 其他 | 文本 | 问答 | 波斯语医疗问答数据集,包含1万至10万问答对。 | amirmmahdavikia | https://huggingface.co/datasets/amirmmahdavikia/darooyab_qa | 访问 |
| prubas_tesis | 医学文本与大模型 | 其他 | 文本 | 文本生成 | 西班牙语医学文本数据集,用于文本生成和特征提取任务。 | anfemora | https://huggingface.co/datasets/anfemora/prubas_tesis | 访问 |
| AI医疗LLaMA2对话数据集25k | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含25,000条医疗对话的文本数据集,用于训练医疗AI对话模型。 | condeac | https://huggingface.co/datasets/condeac/ai-medical-llama2-25k | 访问 |
| AI医疗Llama2 11k数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含11,000条医疗对话文本的数据集,用于训练医疗领域语言模型。 | condeac | https://huggingface.co/datasets/condeac/ai-medical-llama2-11k | 访问 |
| AI医学对话Llama2-5k | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含5000条医学对话样本,用于训练医疗对话模型。 | condeac | https://huggingface.co/datasets/condeac/ai-medical-llama2-5k | 访问 |
| 德语医疗识别数据集v0.1 | 医学文本与大模型 | 其他 | 文本 | 文本 | 德语医疗识别数据集,含1176条指令-输出对,用于医疗领域文本识别任务。 | thewimo | https://huggingface.co/datasets/thewimo/german-medical-identification-dataset-v0.1 | 访问 |
| ai-medical-llama2-1k | 医学文本与大模型 | 其他 | 文本 | 文本 | 1000条医疗对话数据,用于微调医疗大语言模型。 | condeac | https://huggingface.co/datasets/condeac/ai-medical-llama2-1k | 访问 |
| akemiH_MedQA_Reason | 医学文本与大模型 | 其他 | 文本 | 文本 | 基于MedQA-Reason的医学问答数据集,包含问题、答案、推理和摘要,共10161条文本样本。 | JosefAlbers | https://huggingface.co/datasets/JosefAlbers/akemiH_MedQA_Reason | 访问 |
| Meducol聊天机器人数据集V01 | 医学文本与大模型 | 其他 | 文本 | 聊天机器人 | 包含6342条训练和334条测试样本的医疗对话文本数据集,用于训练聊天机器人。 | meducadeus | https://huggingface.co/datasets/meducadeus/Meducol-Chatbot-Datasets-V01 | 访问 |
| parvpareek/pitt | 医学文本与大模型 | 其他 | 文本 | 分类 | 包含患者转录文本及类别标签的文本分类数据集。 | parvpareek | https://huggingface.co/datasets/parvpareek/pitt | 访问 |
| 合成文档问答医疗保健行业测试集 | 医学文本与大模型 | 其他 | 多模态 | 文档问答 | 医疗保健行业合成文档问答测试集,含1000个图像-文本样本,用于文档问答评估。 | coldoc | https://huggingface.co/datasets/vidore/syntheticDocQA_healthcare_industry_test | 访问 |
| 医疗对话-llama3-中文 | 医学文本与大模型 | 其他 | 文本 | 文本 | 中文医疗对话数据集,用于训练LLaMA3等语言模型,提升医疗领域对话能力。 | ZH112 | https://huggingface.co/datasets/ZH112/medical-dialog-llama3-zh | 访问 |
| EMPEC(中文医疗人员考试) | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含81761道中文医疗人员考试单选题,覆盖多种医疗专业和学科,用于评估AI模型的中文医疗知识。 | KenLuo | https://huggingface.co/datasets/KenLuo/EMPEC | 访问 |
| MultiSpanQA | 医学文本与大模型 | 其他 | 文本 | 问答 | MultiSpanQA是一个用于医疗领域多跨度问答的数据集,包含上下文、问题和证据,支持基于证据的答案提取。 | riiwang | https://huggingface.co/datasets/riiwang/MultiSpanQA | 访问 |
| 德语医疗匿名化数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 德语医疗文本匿名化数据集,78个样本,标注人名、日期、地点、年龄等敏感信息,用于脱敏。 | thewimo | https://huggingface.co/datasets/thewimo/german-medical-anonymization-dataset-v0.1 | 访问 |
| 越南语医疗笔记数据集 | 医学文本与大模型 | 其他 | 文本 | 对话 | 越南语医疗对话笔记数据集,包含18058条对话样本,用于医疗文本分析。 | hungsvdut2k2 | https://huggingface.co/datasets/hungsvdut2k2/vietnamese-medical-notes | 访问 |
| 越南语医疗聊天数据集 | 医学文本与大模型 | 其他 | 文本 | 对话 | 越南语医疗对话数据集,包含111701条医患对话样本。 | hungsvdut2k2 | https://huggingface.co/datasets/hungsvdut2k2/vietnamese-chat-doctor | 访问 |
| 医疗信息提取数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 从患者咨询文本中提取症状、诊断、治疗建议等关键医疗信息,用于优化问诊流程和AI辅助诊疗。 | pandalla | https://huggingface.co/datasets/pandalla/datatager_extract_med_information | 访问 |
| 临床问题增强数据集 | 医学文本与大模型 | 其他 | 文本 | 文本 | 用于改善医患沟通的临床问题增强数据集,包含患者咨询及追问问题,促使患者补充病情细节。 | pandalla | https://huggingface.co/datasets/pandalla/datatager_clinical_question_enhancement | 访问 |
| 症状识别与医疗建议数据集 | 医学文本与大模型 | 其他 | 文本 | 医疗建议 | 基于真实医患交互文本,用于训练AI识别症状并给出医疗建议的数据集。 | PandaVT | https://huggingface.co/datasets/PandaVT/datatager_symptom_recognition_and_advice | 访问 |
| vietnamese-medical-chat-data | 医学文本与大模型 | 其他 | 文本 | 文本 | 越南语医疗对话数据集,包含4.6万条医患对话,用于医疗问答任务。 | hungsvdut2k2 | https://huggingface.co/datasets/hungsvdut2k2/vietnamese-medical-chat-data | 访问 |
| DACCORD矛盾检测数据集 | 医学文本与大模型 | 其他 | 文本 | 矛盾检测 | 1034个法语句子对的矛盾检测数据集,涵盖俄乌冲突、COVID-19和气候危机主题。 | maximoss | https://huggingface.co/datasets/maximoss/daccord-contradictions | 访问 |
| share-gpt-medical医疗对话数据集 | 医学文本与大模型 | 其他 | 文本 | 对话 | 约11.2万条医疗GPT对话文本,用于构建医疗对话系统。 | srikar-v05 | https://huggingface.co/datasets/srikar-v05/share-gpt-medical | 访问 |
| 医疗保健行业合成文档问答测试集 | 医学文本与大模型 | 其他 | 多模态 | 多模态 | 面向医疗保健行业的合成文档问答测试集,包含2174个多模态样本(图像+文本)。 | coldoc | https://huggingface.co/datasets/coldoc/baseline_cap_syntheticDocQA_healthcare_industry_test | 访问 |
| 医疗问答-3k | 医学文本与大模型 | 其他 | 文本 | 文本 | 包含3000条医疗问答对的数据集,可用于训练医疗问答模型。 | sunilghanchi | https://huggingface.co/datasets/sunilghanchi/medical-qna-3k | 访问 |