Takoboto 的词典和例句数据来自哪里?

Takoboto 本身不编纂词典,而是把多个开源日语语言项目的数据整合到一个查询界面里。单词和汉字释义来自 JMDict、EDICT、KANJIDIC,例句来自 Tatoeba 和 Tanaka Corpus,部首分解数据来自 Kradfile2 和 Kradfile-u,语法页面内容来自 jgram.org。这些文件分属 Electronic Dictionary Research and Development Group(EDRDG)等不同来源,各自带有不同的授权条款,因此引用或二次使用时要分别确认,不能一概按同一许可处理。

各部分数据的具体来源

内容类型 数据来源 说明
单词释义 JMDict、EDICT 日英词典文件,覆盖词条、读音、词性等
汉字信息 KANJIDIC 汉字的读音、含义、笔画等属性
例句 Tatoeba、Tanaka Corpus 双语例句库
部首分解 Kradfile2、Kradfile-u 覆盖 13108 个日本汉字的部首拆解
语法页面 jgram.org 采用 CC BY-SA 2.0 许可

授权情况需要注意什么

网站页面明确说明,JMDict、EDICT、KANJIDIC 这些文件属于 Electronic Dictionary Research and Development Group 的财产,Takoboto 是在符合该组织许可(licence)的前提下使用它们。这意味着:

  • 这些词典数据并非 Takoboto 自有,而是按 EDRDG 的许可条款使用;
  • 语法内容单独标注为 CC BY-SA 2.0,与词典数据的授权不是同一套;
  • 例句来自 Tatoeba 和 Tanaka Corpus,属于另外的项目,授权也需单独核对。

如果你打算把 Takoboto 上看到的内容用于自己的项目、论文或再发布,正确做法是回到上述原始项目页面查看各自的许可条款,而不是直接以 Takoboto 网站作为授权依据。

这对使用者意味着什么

对普通学习者来说,数据来源决定了查询结果的可靠性边界:词条和汉字信息来自长期维护的 EDRDG 词典文件,例句来自众包或语料库项目,语法说明来自 jgram.org。理解这一点,就能明白为什么同一个词在不同工具里可能给出略有差异的释义——底层数据源不同,或版本不同。

对开发者或内容创作者来说,来源清单本身就是一份可追溯的引用路径:需要词典数据就去找 JMDict/EDICT/KANJIDIC,需要例句就去找 Tatoeba 或 Tanaka Corpus,需要部首拆解就去找 Kradfile2/Kradfile-u,需要语法条目就去找 jgram.org。Takoboto 在这里扮演的是整合与呈现的角色,而不是数据的原始出处。

takoboto.jp