不用自己收数据:FMA 音乐数据集三步走到流派分类

发布时间:2026/8/24 18:35:45
不用自己收数据:FMA 音乐数据集三步走到流派分类 不用自己收数据FMA 音乐数据集三步走到流派分类【免费下载链接】fmaFMA: A Dataset For Music Analysis项目地址: https://gitcode.com/gh_mirrors/fm/fma你要做音乐流派分类或音频特征实验最先卡住的往往是数据授权音频去哪找、标签谁来标、怎么划分训练集。FMAFree Music Archive音乐分析数据集把 106,574 首 Creative Commons 授权曲目、预计算特征和官方训练/验证/测试划分一次性给到你第一天就能开跑实验。 它适合什么时候用快速验证音频模型你需要有标签、多流派的音频和可复现的评估划分又不想花几周时间收集标注。FMA 的 small 子集有 8 个平衡流派一两个下午能跑完一轮训练评估。论文里做方法对比已有 100 多篇论文用 FMA 做基准你直接用 tracks.csv 里的官方划分数字就能和已有结果对上。做特征或表示学习数据既有 MFCC 等预计算特征也有原始波形。特征级分类、端到端学谱图两条路线都有料。 从零跑到第一次成功克隆代码后建一个隔离的 Python 环境装依赖仓库锁定在 2017 年前后的版本新环境是必须的git clone https://gitcode.com/gh_mirrors/fm/fma cd fma pip install -r requirements.txt然后按 README 里的下载链接把 fma_metadata.zip 和 fma_small.zip 放进 data/ 目录用 README 给出的 sha1 校验后解压。再在仓库根目录建一个 .env 文件内容一行AUDIO_DIR./data/fma_small/接着用 jupyter notebook 打开 usage.ipynb前几个 cell 加载四张元数据表、播放音频能出声音就说明环境通了。里面装了什么数据分五个压缩包元数据只有 342 MiB音频按四种规模提供文件体积内容fma_metadata.zip342 MiB106,574 首曲目的 4 张 CSV建议先下它fma_small.zip7.2 GiB8,000 首 30 秒片段8 个平衡流派fma_medium.zip22 GiB25,000 首 30 秒片段16 个不平衡流派fma_large.zip93 GiB106,574 首 30 秒片段161 个流派fma_full.zip879 GiB完整长度曲目不裁 30 秒元数据里的四张表各一句话tracks.csv每首曲目的 ID、标题、艺术家、流派、标签、播放次数以及所属子集和划分genres.csv163 个流派及其父子关系可推断流派层级features.csv用 librosa 提取的音频特征MFCC 等每首一行echonest.csvSpotify前 Echonest为 13,129 首曲目提供的音频特征拿它做这几件事流派分类。最典型的用途。usage.ipynb 展示了用预计算特征跑 SVM、以及直接从音频训练两条完整流程baselines.ipynb 给出基准分数你的结果拿它当参照系。特征探索与可视化。analysis.ipynb 对 MFCC 等特征做降维画散点图能直观看出哪些特征把流派分开也复现了论文中的图熟悉数据时很有用。预训练与相似度检索。10 万多首曲目、917 GiB 共 343 天的音频加上艺术家、专辑、标签这类元数据足够你预训练音频表示模型或搭一个音乐相似度原型。新手要知道的事先用 small。7.2 GiB 不占地方8 个流派是平衡的不用额外处理类别不平衡流程跑通再扩到 medium 或 large。用官方划分。tracks.csv 里每首曲目都标了 training/validation/test直接用结果才能和其他工作比较。medium 和 large 流派不平衡。分类时记得用类别权重或采样策略。版本偏老。requirements 锁在 python 3.6、numpy 1.12.1、tensorflow-gpu 1.0.1 那一代新系统上可能要调版本或专门建旧环境。先校验再解压。每个 zip 都对照 README 的 sha1unzip 报错可换 7zip下 full 版前先确认磁盘有 879 GiB 空间。下一步去哪usage.ipynb加载四张 CSV、播放音频、训练并评估自己的模型analysis.ipynb元数据与特征探索复现论文图表baselines.ipynb流派识别的基准模型与得分features.py生成 features.csv 的特征提取代码utils.pynotebook 全程用到的 load()、get_audio_path() 等辅助函数解压 fma_small、填好 .env、打开 usage.ipynb你的第一个流派分类实验今天就能开始。【免费下载链接】fmaFMA: A Dataset For Music Analysis项目地址: https://gitcode.com/gh_mirrors/fm/fma创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻