ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

免费的多语言语料库平台 Tatoeba:用社区共建平行句子数据集

免费的多语言语料库平台 Tatoeba:用社区共建平行句子数据集 免费的多语言语料库平台 Tatoeba用社区共建平行句子数据集【免费下载链接】tatoeba2Tatoeba is a platform whose purpose is to create a collaborative and open dataset of sentences and their translations.项目地址: https://gitcode.com/gh_mirrors/ta/tatoeba2Tatoeba 是一个开源的句子翻译数据库用于协作收集和开放共享多语言句子及其对应译文线上已收录 400 多种语言的语料。 它解决什么痛点想给模型找平行语料公开数据集往往又旧又窄语种覆盖不全、句子之间对不上号、许可条款还限制商用。自己标注一批成本直接劝退。Tatoeba 的思路是让母语者贡献真实句子、社区交叉校对翻译关系把语料生产拆成无数人各干一小块的协作流程数据持续生长且许可开放。 最短路径跑起来官方推荐的本地部署方式是预构建的 Vagrant 虚拟机打包好了 Web 服务器、数据库和全文索引组件Linux、macOS、Windows 通用前提是装好 VirtualBox 和 Vagrantgit clone https://gitcode.com/gh_mirrors/ta/tatoeba2 cd tatoeba2 vagrant up耐心等下载完成然后浏览器打开http://localhost:8080/就能看到实例内置了admin、contributor等测试账号密码都是123456。注意默认环境里没有任何句子而且此时搜索功能也不会工作这一点后面会讲。 核心工作流贡献一条句子和译文你在某个语言页面输入一句短句并选好语种系统会检查该句子是否已存在、并把它写入语料库同时触发索引更新队列。你拿到一个可以检索、可以被其他人翻译的句子条目。跨语言检索平行句你在搜索框输入关键词并选择源语言与目标语言系统在 Manticore 全文索引一种针对搜索优化的数据库Tatoeba 用它做句子全文检索里定位句子并取出翻译关系。你拿到一组句对可直接用于 NLP 训练或语言学习数据采用 CC BY 许可商用也没问题。本地实例里让搜索生效默认装好的实例是空库你往里面加了句子之后需要在虚拟机里执行vagrant ssh登录再运行sudo bin/cake sphinx_indexes update delta和sudo bin/cake sphinx_indexes update main重建索引delta 在前main 在后。重建完成后新句子就能被搜到了——顺序别搞反这是新人最容易卡住的地方。⚙️ 架构一瞥技术栈是 PHP 8 CakePHP 4 框架一个结构清晰的 PHP MVC 框架 MariaDB 存业务数据再加一层 Manticore 索引做全文搜索。仓库主要看三个地方src/ 是 Web 应用主体Controller 处理请求、Model 管数据config/Migrations/ 存放数据库迁移脚本按时间戳命名能直接看出表结构演进史ansible/ 则负责服务器端的自动化部署。测试在 tests/ 下phpunit一键跑全量套件。 社区与贡献贡献内容不需要写代码注册账号后就能加句子、补翻译、审校他人内容质量靠社区投票和版主审核维持。想贡献代码的话本地环境起来后直接改src/下的文件改动会实时反映在 8080 端口提交前跑一遍phpunit即可。遇到问题可以去官方 Discussions 提问XMPP 聊天室也有人在。️ 踩坑速查vagrant up报 libvirt 错误Debian trixie 系统→ 系统提示有误导性项目实际用的是 VirtualBox → 按官方文档装 VirtualBox并用vagrant up --providervirtualbox指定提供者。加了句子但搜索不到→ 空库实例需要手动重建索引且必须 delta 索引先于 main 索引 → 依次执行上面两条cake sphinx_indexes命令。Windows 下git diff出现一堆文件权限变更→ Git for Windows 默认行尾/权限行为差异 → 执行git config core.fileMode false。适合谁来用语言学习者可以用它当例句库和发音参考NLP 研究者和开发者可以直接下载平行语料做训练集想搭建本地语料平台的人可以把它当蓝本。仓库克隆下来vagrant up之后你就能拥有自己的句子翻译数据库。【免费下载链接】tatoeba2Tatoeba is a platform whose purpose is to create a collaborative and open dataset of sentences and their translations.项目地址: https://gitcode.com/gh_mirrors/ta/tatoeba2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表