Cookiecutter Data Science(CCDS)是 DrivenData 维护的数据科学项目脚手架工具,用于快速建立逻辑清晰、相对标准化但仍可灵活调整的科研与数据分析工程。它解决的是“项目如何组织、复现和交接”的问题,而不是替用户执行统计分析或训练模型;因此本作品明确归入“数据分析”类。
v2 版本通过独立的 ccds 命令行程序扩展 Cookiecutter。用户输入项目名称、仓库名、Python 模块名、作者、简介与目标 Python 版本,并可选择数据存储方式(本地、Azure、S3 或 GCS)、环境管理器(virtualenv、conda、pipenv、uv、pixi、poetry 或不创建)、依赖文件格式、基础 PyData 包、测试框架、代码规范工具、文档系统、开源许可证以及是否生成代码骨架。
生成结果是一套可直接开始工作的项目目录:data/raw 保存不可变原始数据,data/external、interim、processed 分别承载第三方数据、中间结果和最终建模数据;同时生成 notebooks、models、references、docs、reports/figures、项目 README、Makefile、依赖与环境配置,以及可选的 dataset、features、modeling、predict、train、plots 等 Python 源码骨架。这样的分层有助于团队协作、审计数据流、区分探索性笔记本与可复用代码,并提升分析结果的可复现性。
推荐在 Python 3.9+ 环境中通过 pipx 安装 cookiecutter-data-science,然后运行 ccds 交互式创建项目。默认使用与已安装 CCDS 版本一致的模板;如需严格复现,可通过 -c/--checkout 指定 tag、分支或提交。旧版 v1 的调用方式不同,使用前请确认文档与版本。
本页面为第三方索引发布,原作者与维护方为 DrivenData,官方仓库采用 MIT 许可证。模板生成的新项目可由用户另行选择不创建许可证、MIT 或 BSD-3-Clause;用户数据、第三方数据集、模型、依赖包与云服务仍遵循各自的许可、隐私和使用条款。
安装与安全提示:ccds 依赖 Click、Cookiecutter 和 Tomlkit,会从 GitHub 获取所选模板,并在目标位置创建、移动、删除或改写项目文件;生成钩子会清理未选模板、写入依赖和 Python 版本配置。请在新目录或已备份位置运行,先核对输出路径和所选 tag,不要把云密钥、令牌、个人数据或受限原始数据写入模板参数、公开仓库、日志或环境示例。S3、Azure、GCS 等选项只提供项目配置骨架,连接云端时应使用最小权限凭据。生成后的 Makefile、依赖安装、数据下载和训练命令仍需逐项审阅后再执行。仓库未提供根目录 SECURITY.md,遇到安全问题应通过官方维护渠道核实。