5 分钟跑通第一个开源数据集例子:awesome-public-datasets

发布时间:2026/8/29 15:34:43
5 分钟跑通第一个开源数据集例子:awesome-public-datasets 5 分钟跑通第一个开源数据集例子awesome-public-datasets【免费下载链接】awesome-public-datasetsA topic-centric list of HQ open datasets.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-public-datasetsawesome-public-datasets 是一个按主题组织的开源数据集清单按领域收集高质量公开数据并标注可用性。上周一个同事做生存率作业找不到带标注的小数据集我让他直接解压仓库里的titanic.csv就动手了。清单目前收录约1000条数据源大部分标着OK可以直接取用。它都能干什么按主题归类公开数据集清单覆盖 40 多个领域从农业、生物学到金融、体育每条数据源附来源链接和一句话说明README 本身就是完整索引Datasets/目录里放有可直接使用的样例数据解压即可跑代码整份清单由自动化工具apd-core持续生成和更新不用手动维护仓库里跟上手最相关的文件就三个README.rst—— 主清单全部数据集按领域分类在这里Datasets/—— 数据文件存放目录目前有titanic.csv.zipLICENSE—— 仓库自身的 MIT 许可每条清单条目还带状态标识OK表示数据经确认可直接使用FIXME表示源或格式需要修复用前要先核对。5 分钟跑通第一个开源数据集例子先解压仓库自带的泰坦尼克数据再用 pandas 读入按船舱等级算生还率并画一张柱状图。# 解压仓库自带的泰坦尼克数据 unzip Datasets/titanic.csv.zip -d Datasets/import pandas as pd df pd.read_csv(Datasets/titanic.csv) # 读取数据 rate df.groupby(Pclass)[Survived].mean() # 各船舱等级生还率 print(rate) rate.plot(kindbar, title各船舱等级生还率) # 画一张柱状图跑完你会看到控制台打印三档数值以及一张柱子图一等舱生还率最高、三等舱最低这就是这个数据集最经典的结论。按场景挑公开数据使用场景推荐数据集一句话备注数据分析与可视化练习Palmer penguins三种企鹅形态测量小而干净气候与天气研究NOAA Climate Datasets长期气象观测状态 OK癌症研究与药物开发CCLE 癌症细胞系百科全书数百种细胞系的表达与药敏数据农业政策与粮食安全全球作物历史产量1981–2016主要作物逐年产量记录清单按 40 多个主题分区在目录里可以直接定位到 Agriculture、Biology、Finance 等小节。挑选时优先带OK标识的条目FIXME意味着来源或格式待修复先核对再用。用之前核对这三条看数据源许可与引用要求检查关键字段的缺失比例确认数据截止时间是否仍有效FIXME 标识的数据源必须人工核实仓库本身是 MIT 许可详见 LICENSE具体数据集则以各自来源的许可为准。怎么跟住 awesome-public-datasets 的更新整份清单由 apd-core 工具自动生成数据源的链接和说明会随工具迭代刷新不需要手动改文件。想第一时间收到数据更新动态可以加入项目维护的 Slack 社区遇到问题直接提 Issue 就行。如果你发现了新的高质量数据源按贡献指南提交数据集建议也可以。现在就可以解压本仓库的Datasets/titanic.csv.zip把上面那几行代码跑一遍。之后遇到具体课题再到 README 对应主题分区里挑标 OK 的条目试手。【免费下载链接】awesome-public-datasetsA topic-centric list of HQ open datasets.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考