我们在做的事
古籍元数据已上线
以作品为纲,把历代官私书目的著录与存世各版本汇到同一条目下,一眼看清一部书的来龙去脉。
进入古籍总目资源收集已上线
收集网上已有的文字资源和影印资源,逐条挂到对应的作品与版本下,顺着链接就能查到出处。
图文对读规划中
识别出的每个字对回书影上的位置,读文字时随时对看原书。
全文检索规划中
在书名、作者之外,检索古籍文本;异体、繁简自动归并。
协同校对规划中
字图对照着改错字、补标点,校对结果回流到公开文本。
古籍专用模型规划中
用校好的文本训练断句、标点、专名识别,反过来加快整理。
CC0
文本开放
古籍文本以 CC0 公有领域发布,可自由复制、改编、再发布,无需署名。
- book-text古籍文本与辑佚
- book-index古籍目录索引,只存元数据:作品、版本、丛编、人物条目
转录自维基文库、Kanripo 的文本沿用来源许可(CC BY-SA),每部文本的阅读页顶部标有来源与许可,详见关于我们的「数据来源与授权」。
Apache-2.0
代码开源
网站、排版、资源抓取等工具以 Apache-2.0 开源。在 GitHub 查看全部 →
- luatex-cn基于 LuaTeX 的中文排版包:古籍竖排版式复刻,以及现代中文排版,已上 CTAN
- bookget-py古籍数字资源下载与管理工具,支持 37 个数字图书馆站点,走 IIIF
