
MiniMind-O训练数据揭秘mini与full两套数据集的构成、差异与用法完全指南【免费下载链接】minimind-o️ A 0.1B Omni model trained from scratch, capable of listening, speaking, and seeing!项目地址: https://gitcode.com/gh_mirrors/mi/minimind-oMiniMind-O 是一个从 0 训练的0.1B 端到端 Omni 模型单一权重同时支持文本、语音、图像三模态输入并能输出文本与流式语音。它的开源仓库同步提供了mini 与 full 两套训练数据集mini 让单张 3090 显卡约 2 小时就能跑通完整链路full 则是已发布权重的实际训练源。这篇文章为新手系统拆解两套数据的构成、差异与用法帮你选对数据、少走弯路。 两套数据、5 个子集mini 与 full 一表看懂MiniMind-O 的训练数据按任务类型拆成 5 个 parquet 子集mini 是 full 的轻量子集按英文 无视觉筛选而来数据集任务语言输入语音时长输出语音时长定位sft_t2a_mini文本→语音T2A英文—约 470.14 hmini 入门sft_a2a_mini语音→语音A2A英文约 74.64 h约 56.60 hmini 入门sft_t2a文本→语音T2A中英文—约 1636.01 hfull 训练sft_a2a语音→语音A2A中英文约 1711.97 h约 423.40 hfull 训练sft_i2t图像→文本I2T中英文——full 训练三个关键差异规模full 的语音输出约 2000 小时量级mini 只有约 530 小时相差近 4 倍语言mini 只保留英文full 覆盖中英文混合场景模态mini 不含图像数据无 I2T 子集full 才是视觉对齐的完整训练源。 数据背后的三类任务T2A、A2A 与 I2T理解数据集构成前先记住三个缩写——它们对应 Omni 模型的三种核心能力T2AText-to-Audio文本进、语音出。训练模型开口说话让 Talker 学会在 Thinker 的语义条件下生成 8 层 Mimi 语音 codesA2AAudio-to-Audio语音进、语音出。这是最接近真实对话的形态模型要同时听懂问题并组织回答I2TImage-to-Text图像进、文本出。训练视觉路径让模型能看懂图并给出描述。MiniMind-O 用 Thinker–Talker 双路径架构承接这三类数据Thinker 负责理解文本/语音/图像并产出语义回复Talker 再把语义渲染成可解码的流式语音 codes。⏱️ mini 数据集单卡 3090 约 2 小时跑通全链路mini 子集的定位非常明确用最低成本验证 Thinker–Talker、Mimi 编解码、序列布局和音色注入链路而不是复现发布模型的完整能力。它由两个文件组成sft_t2a_mini.parquet英文 T2A约 470 小时输出语音先让模型学会说sft_a2a_mini.parquet英文 A2A约 75 小时输入、约 57 小时输出语音再接入语音输入形成听-说闭环。官方备注很实在中文 Talker 要同时处理更复杂的字音映射、韵律停顿和多说话人稳定性明显比英文难不能指望 mini 训练出稳定的中文语音能力。mini 的英文单语种内部 CER字错率表现仍可维持在可用范围足够新手理解训练流程和观察 loss 收敛。 full 数据集发布权重的真实训练源full 数据集与已发布的minimind-3o、minimind-3o-moe权重一一对应是技术报告中 CER、音色相似度等指标的实际数据来源。两个子集的中英文比例如下这个分布会直接影响模型行为子集中文占比英文占比混合占比sft_t2a45.7%46.5%7.8%sft_a2a70.8%21.2%8.0% 一个实用结论短中文和短英文回答通常较稳定较长的英文语音更容易出现读音漂移和漏词——这正是数据分布反映到模型行为上的例子。数据构造上语音统一来自公开 Omni / 语音指令数据如 VoiceAssistant-400K、UltraChat-300K-SLAM-Omni 等并基于 Qwen3-TTS 做了大量多说话人合成同时用 CAM 提取 speaker embedding 作为音色条件。I2T 子集则与孪生项目 MiniMind-V 的视觉指令数据来源一致。图中可以看到语音、音色条件如何与文本 token 在同一条序列中共存——这也是 I2T / A2A 数据注入模型时遵循的统一格式。I2T 数据训练出的看图说话链路效果大致如下 数据是怎么存储的parquet 文件与 Mimi codes所有数据以parquet 格式存储由 dataset/omni_dataset.py 中的OmniDataset类负责读取和预处理几个关键细节值得了解语音不存波形、存 codes所有语音统一转成 Mimi codes8 层 codebook帧率 12.5 Hz解码输出 24 kHz 波形训练时直接预测离散 token图像统一为 256×256由 SigLIP2 P32 编码为 64 个 patch token对话式结构每条样本是conversations多轮对话 JSONquestion_audios/answer_audios各轮音频image_bytesspk_emb说话人 embeddingref_audios参考音色内置数据增强训练时会对输入语音做随机变速0.7~1.6x、加噪、时间遮蔽、低通滤波、混响等augment_wav/augment_mel模拟真实录音环境无需数据预处理。 上手使用mini 数据三步开训第 1 步下载数据。快速开始时只需下载带_mini后缀的两个子集sft_t2a_mini.parquet、sft_a2a_mini.parquet放到仓库的dataset/目录下。第 2 步执行训练。官方把 mini 的推荐流程T2A 对齐 → A2A 投影层对齐 → A2A 全量精调写进了 trainer/train.sh在trainer/目录下直接执行即可cd trainer bash train.sh三条命令分别对应约 60 分钟和两个 15 分钟的训练阶段单张 RTX 3090 总计约 2 小时。训练入口 trainer/train_sft_omni.py 的--data_path参数决定使用哪个 parquet--mode参数控制全量训练或只对齐音频/视觉投影层。第 3 步验证效果。训练完可运行 eval_omni.py 对模型做命令行问答听一听语音输出是否符合预期。A2A 子集训练出的语音问、语音答效果大致如下full 数据版本️ full 训练管线7 个阶段练出发布模型如果想复现发布权重trainer/train.sh 中同样给出了 full 的推荐管线4 卡环境按数据流逐步接入能力共 7 个阶段sft_t2a× 6 epochs全量训练让 Talker 学会在 Thinker 语义条件下生成语音sft_a2aaudio_proj 模式只训音频投影层接入语音输入sft_a2a× 3 epochs全量训练打通语音进语音出链路sft_i2tvision_proj 模式只训视觉投影层避免图像数据过度改写语言与语音能力sft_i2t全量进一步对齐视觉路径sft_a2a回炉巩固语音能力sft_i2t收尾打磨视觉能力。Dense 与 MoE 版本沿用同一套数据和阶段顺序full 训练全程冻结 SenseVoice-Small、SigLIP2 与 Mimi 等外部编码器。✅ mini 还是 full按你的目标选你的目标推荐理由第一次接触 Omni 模型训练mini单卡 3090 约 2 小时跑通成本最低复现发布权重 / 做中文语音full与发布权重同源含中文与图像数据研究音色克隆、投影层微调mini 即可链路组件齐全够做消融实验复现论文指标fullCER、音色相似度等指标均基于 full总结MiniMind-O 的 mini 与 full 两套训练数据设计得很实用mini 负责跑通链路full 负责练出能力。两者共享同一套 parquet 存储格式、Mimi codes 语音表示和 dataset/omni_dataset.py 数据管线切换数据即可平滑过渡。建议新手从 mini 起步读懂 T2A→A2A 的训练顺序后再按需扩展到 full 数据集。更多细节可参阅仓库的 README.md 与技术报告。【免费下载链接】minimind-o️ A 0.1B Omni model trained from scratch, capable of listening, speaking, and seeing!项目地址: https://gitcode.com/gh_mirrors/mi/minimind-o创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考