摘要:药物评论预测数据集是一个大规模情感分析数据集,包含超过 200,000 条用户评论,覆盖 2,000 多种药物和不同健康状况,具有 7 个属性特征。数据集使用 NLTK VADER 情感分析工具生成负面、中性、积极和综合评分,通过概率阈值(>0.5/<0.5)进行二元分类(积极/消极体验)。研究采用多种监督学习模型(朴素贝叶斯、决策树、LDA 等)构建自动化评论分类系统,帮助制药公司改进药物并支持决策。

数据集简介

数据集概述

数据集包含 7 个属性特征,涵盖药物信息、用户评论文本、健康状况、评分等维度,为药物评论分析提供多角度信息。超过 2,000 种药物的覆盖范围使数据集具有广泛的药物类别代表性,200,000+ 条观测记录提供了充足的训练样本。用户评论文本是核心特征,包含丰富的情感表达、用药体验描述和药效反馈信息。通过 VADER 情感分析工具,从原始文本中提取四个情感维度评分:负面分数、中性分数、积极分数和综合分数(compound score),这些量化指标为后续的机器学习分类提供了结构化输入特征。

该数据集支持药物评论情感分析、用户体验分类、药效反馈挖掘、制药决策支持以及自然语言处理研究等多个应用方向。研究目标是创建一个无缝系统,能够使用最优准确率模型清洗、处理和分类数以万计的评论,同时支持单条评论的实时预测。通过自动化情感分类,制药公司可以快速识别药物的优势和问题领域、监测特定药物的用户满意度趋势、发现需要改进的药物特性,并根据用户反馈优化药物配方或使用指南。数据集的大规模和多样性使其适用于深度学习模型(如 LSTM、BERT)、传统机器学习算法对比研究、特征工程优化以及领域适应性迁移学习实验,为药物警戒、患者反馈管理和数据驱动的药物开发提供技术支撑。

数据集来源

该数据集包含超过 200,000 条用户药物评论观测记录,覆盖 2,000 多种针对不同健康状况的药物,具有 7 个属性特征和大量用户体验文本,使用 NLTK VADER 情感分析工具生成负面、中性、积极和综合评分,专为药物评论情感分类和制药决策支持研究而构建。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-63
文件大小:47M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知