Ancient Library:1060 部希腊语/拉丁语原典,点任意单词即可解析
文章摘要
Ancient Library 是一个把古典学正典(canon)做成「可解析阅读器」的网站。它的自我定位写在首页第一行:为整个古典正典提供完整的词形解析阅读体验——在任何一部作品中点击任意一个词,就能得到它的词元(lemma)、形态分析(morphology)以及完整的词典条目;拉丁语用 Lewis & Short,希腊语用 Liddell-Scott-Jones,这两部都是各自语言最经典的大部头词典。
规模上,站点收录 1,060 部作品,其中拉丁语 293 部、希腊语 767 部,涵盖 140 位作者,并提供完整的 A–Z 索引。内容按语言和体裁分类组织:
拉丁语部分包括史诗 23 部、抒情诗与哀歌 42 部(卡图卢斯、贺拉斯和罗马哀歌诗人)、悲剧 10 部(塞内卡)、喜剧 26 部(普劳图斯与泰伦提乌斯)、历史 16 部(凯撒、李维、萨鲁斯特、塔西佗)、传记 68 部、演说与修辞 48 部(西塞罗为主)、哲学 22 部(西塞罗、塞内卡、卢克莱修)、书信 8 部(西塞罗、小普林尼、塞内卡)、教诲与技术类 5 部、神话与宗教颂诗 12 部(奥维德的历书与神话诗)、讽刺与寓言 6 部(贺拉斯、尤维纳利斯、佩尔西乌斯、费德鲁斯)、散文小说 4 部、科学与医学 2 部(老普林尼的百科全书等)、语法与参考 1 部(革利乌斯的杂记)。
希腊语部分体量更大:史诗 45 部(荷马、赫西俄德及其后继者)、抒情与哀歌 26 部(品达、诗选等)、悲剧 34 部(埃斯库罗斯、索福克勒斯、欧里庇得斯)、喜剧 11 部(阿里斯托芬与米南德)、历史 47 部(希罗多德、修昔底德及后继者)、地理与游记 2 部(斯特拉波与保萨尼阿斯)、传记 146 部(普鲁塔克《名人传》等)、演说与修辞 247 部(阿提卡演说家与第二次智者运动)、哲学 53 部(柏拉图、亚里士多德、斯多亚派)、教诲与技术类 12 部、神话与宗教 2 部(阿波罗多洛斯的神话集)、讽刺与寓言 71 部(萨莫萨塔的琉善)、散文小说 7 部(希腊小说)、科学与医学 26 部(希波克拉底、盖伦、欧几里得、托勒密)、语法与参考 2 部(古代辞书)、圣经文本 27 部(希腊语新约)、早期基督教著作 9 部(教父作品)。
从产品形态看,它试图解决的是古典语言学习者最大的摩擦点:读原典时每隔几个词就要停下来查字典和查变位表。把词形解析直接内联进阅读界面,理论上能把这种「读一页要一小时」的体验压缩到接近正常阅读的节奏。站点的技术底座并未在首页详述,但从 HN 讨论中可以确认:文本与词典数据来自长期开放的 Perseus Digital Library 语料,拉丁语的形态标注则由作者声称使用的 LatinCy 神经语言模型完成。
需要说明的是:这个站点是纯静态呈现的作品列表 + 阅读器,首页没有作者自述、技术栈说明或项目背景,因此关于它的实现方式、数据来源与准确率的绝大部分信息,实际上都来自下面的 HN 讨论。
HN 评论精华
这条帖子拿到 260 分,讨论热度很高,但整体走向并不是「一片叫好」——恰恰相反,评论区大致分成三块:与既有项目 Perseus 的比较(多数偏批评)、大量具体的排版与语言学挑错,以及一条意外温暖的「你们这些搞技术的怎么会关心古典学」的身世自述串。
与 Perseus 的比较,是全场最尖锐的一条线
-
soiltype 一上来就问:这个东西有什么 Perseus Digital Library 还没提供的用途吗?flats 附议:Perseus 从 1987 年就存在了,功能似乎还更多,「这个大概只是排版更好看一点」。cwnyth 更直接:「这难道不就是套了个壳的 Perseus?」
-
thaumasiotes 补充了背景:Perseus 自己已宣布进入生命周期末期,有一个后继项目。milkcrate 点名那是 Scaife,并评价「基本没法用」——在他 2020 年前后的机器上几分钟内就慢到爬行,阅读体验极不舒服。panagathon 说它比老的 Perseus Hopper 是巨大的倒退。equalbeforegod 认为真正该做的是把 Perseus 网站修到不再动不动 503(它极不可靠),并主张对加州州政府提起信息公开申请,索取 UC Irvine 的 TLG 项目囤积的、由公共资金资助却付费才能访问的数据,好让语料库真正得以扩展;他还认为 Perseus「90 年代风格的 HTML 观感」其实是优点。
-
turpentine 给出了最不客气的一条判词:Perseus 这类工具至少存在 15 年了,还能原文与英译并排对照、原词全部交叉引用超链接,且由承诺严谨与细致翻译的学者维护;「Ancient Library 是某种 vibecoded 替代品,它用的 LLM 翻译一定是错的。恕不感冒。」
-
gbjcantab 的评价可能是最有代表性的技术判断:这是个不错的点子(更好看的 Perseus),但它在真正的实质——形态标注——上垮掉了。他当天早上读《奥德赛》第 13 卷开头,抽查的词里大约 40% 没有答案或答错;他也承认整体错误率肯定低于此,因为「你通常只会去查难词」。而 Perseus 那些全对。他的总结在 HN 上被广泛引用:「这就是相当典型的 2026 年式应用:一个好看的、拥有既有产品 60% 功能、其中 30% 是坏的东西。」
具体的语言学挑错
-
JuniperMesos 贡献了最扎实的一处技术核查。他检查了凯撒《高卢战记》著名的开篇句,指出其中的
nostra被标注为主格复数中性,但在该句中它实际是夺格单数阴性(长音 -â,因为站点根本不标元音长度所以未体现),修饰一个隐含的linguâ,意思是「用我们的语言」。他引用了 archive.org 上 1918 年那部标注元音长度的逐词直译本作为对照。他补充说自己的拉丁语是自学、水平平平,连他都能看出这个错误,而《高卢战记》是传统拉丁语教学中很早就会读到的极著名文本——「站点声称完成解析的 LatinCy 神经模型在这里都出错,让我对更难的语法角落里的分析质量没什么信心。」 -
gfaure 指出后附连词
-que不应被拆成独立的词;cwnyth 补充说这一点加上标点前的空格,说明这是为分词(tokenization)而做的处理,但事后没有任何东西把它拼回去。 -
marginalia_nu 举了实例:某处查
fulgere只得到指向fulgo的引用而没有释义。qsort 解释这其实没问题——拉丁语词典历来以第一人称单数现在时直陈式列词条(比如你会找到sum而不是esse),它只是在展示词典条目;但 marginalia_nu 回应说在这个场景下没什么用,因为你除了在正在读的文本里碰巧找到基本词形之外,根本没法用别的方式导航这本「词典」。Planktonne 推荐 William Whitaker’s Words 作为他见过最好的资源。 -
希腊语排版被多人批评。smithkl42 指出任何带钝音符(grave accent)的元音,重音符号会显示成一个独立字母,读起来非常刺眼;他还注意到逗号句号前有奇怪的空格。hcayless 说希腊语字体很糟——用的是现代希腊语的「尖音符」,看起来很怪,而且逗号前不该有空格;他也提醒「Perseus 做了让这一切成为可能的工作,这一点很酷」,并希望站点能说明所用的是哪个版本的校勘本。milkcrate、laichzeit0、usern20260720 讨论了更合适的字体选择(New Athena Unicode、Theano Modern 等)。
-
leoc、veqq、DFHippie 都提到同一件事:文本没有标注长音符(macron)。DFHippie 说得最清楚——如果目的是教学,就该把长音、空格、标点、大小写全都加上;「让每个词可点击,却让读者自己去猜元音长度,等于活干了一半。」leoc 还把这个项目放进了「逐行对照本(interlinear)」的谱系里,追溯到洛克、19 世纪的 James Hamilton,以及缪勒 1864 年的梵英对照本,并提到现代语言学界的「逐行语素注解」传统和 hyplern、interlinearbooks、Legentibus 等当代出版方。
-
frollogaston 提了个有趣的疑问:拉丁语文本里所有 V 都显示成 U 让他很不适应,而且大多数词条弹窗用的又是另一套拼法(
iam变成jam)。tempodox 的立场正好相反:他认为把 Iulius 拼成 J「岂有此理」,但正文没有人为区分 u 和 v 是值得赞赏的。retrac 从史料角度补充:无论用空格还是小写字母,对古典拉丁语和希腊语来说都是时代错置——古代只有一种字体形式,通常也不标词界;他还解释了送气符号(breathing marks)是公元前 400 年左右的创新,比荷马文本最初书写晚了几个世纪,现代校勘本普遍使用现代化拼写。
UI 层面的具体反馈
- beloch、Boss0565、frollogaston、b3orn、ndoddhdudhhd 集中反映了同一组问题:弹窗里的释义应该加粗突出,现在得在词条里「打猎」才能找到;有时还要展开条目才能看到释义;关闭弹窗的方式不直观;加载太慢。ndoddhdudhhd 说:「如果这两点修好,我会每天用。」gaigalas 补充说点空白处关闭弹窗只在版心内的空白有效,宽屏下大部分空白在两侧却点不掉;某些书(如《启示录》)缺章节标记;他的总结是「点子不错,但实现非常粗糙,需要大量打磨才能真正好用」。noisy_boy 想找完整译文而不只是逐词释义,未能找到入口。
同类项目的自荐
-
lsb 说这与他的研究生论文项目 NoDictionaries 思路相似(并在评论区当场修正了别人指出的一处
edes解析问题);onlyafly 介绍了自己做的希腊语阅读器 Kevilex,卖点是跨文本记忆你的词汇量(可标记生词/学习中/已掌握),并据此推荐合适难度的文本,还带闪卡复习、句子讲解、文本导入和古英语文库;spudlyo 在给一本经典拉丁语初级读本做音频强制对齐、词性标注、形态与释义增强;0bit 推荐了 latinlanguage.org。 -
laichzeit0 的自述是全帖技术含量最高的一条:他克隆了 Diogenes 仓库、让 Claude 把那套久经考验的老 Perl 代码重写成 Python,用 TLG 数据库作为希腊语和拉丁语文本源;还接入了 Barrington 古代地图集做地名查询,做到「词典 + 地图」双查。他另外买了 Ioannis Stratakis 大约六小时的重构阿提卡发音朗读录音,用带完整重音和送气标记的文本微调了一个 StyleTTS2 语音模型,效果「极其自然」;长期目标是做一个能用阿提卡希腊语对话的私人导师(语音转文字 → LLM → 文字转语音)。他的感慨是:「LLM 对我这种既是业余古典学者又会写软件的人来说是彻底的游戏规则改变者。它们在阿提卡希腊语和拉丁语上好得惊人,等于把世界上最好的老师放在你指尖,而这些冷门题目本来是不可能有这种资源的。」
「你们都是谁?」——一条意外温暖的身世串
-
tmshapland 提问:每次看到古典学的帖子上 HN 首页我都很惊讶,说明这个社区里关心古典学的人不少——你们都是谁,怎么会在这里?他自述本科读的是古典学与葡萄栽培,研究生读大气科学,然后进了科技行业。
-
回答五花八门:bonoboTP 认为这是强相关的——希腊神话、古典学、列车时刻表与车型、所有航天探测器与 NASA 的一切、Haskell,本质上是同一类「书呆子癖好」。spudlyo 是刚退休的软件工程师,因为读 19 世纪文学、被那些受过古典教育的人物激励,又常常要查拉丁语典故,才起念学一点拉丁语,发现 LLPSI 教材后一发不可收。baruz 的路径最曲折:六岁迷天文 → 希腊神话 → 希腊诗歌(都读译本),同时跟着 Dewdney 的专栏学编程,进大学本想学医却总被人文学科吸引,在工程系实验室的 Sun 工作站上玩 netrek 和 MUD,最终转去学 AI,读 Russell & Norvig 和 Paul Graham;后来在全国各地做网络性能测试顾问期间,靠在酒店里学希腊语打发时间。Curious_Cake 说自己因为植物学而对拉丁语和希腊语的构词着迷(
sativa意为「栽培的」,nemo意为「无人」,所以「海底总动员」字面是「寻找无人」),并引用约翰·缪尔那句「当我们试图单独挑出任何一样东西,就会发现它与宇宙中其他一切都拴在一起」。boelboel 提供了地域视角:在某些国家古典学仍是中学广泛教授的科目,在他成长的弗兰德斯,拥有高学历的人里可能超过一半学过拉丁语,「在某些圈子里,不学拉丁语/希腊语意味着你要么不够聪明,要么没文化,所以任何『有教养的』计算机或工程学位持有者都学过拉丁语」。nephihaha 的回答最见心气:「过去和未来一样重要。如果这里的人既懂编程又懂古典史,我认为那意味着他们的世界观更完整。」他还说,读古代文本最让他触动的不是与今天的显著差异,而是那些相似之处。