全球首款古希腊语大模型Apollo问世
「奥地利科学院联合法国AI实验室Mistral与科技服务商Sail Reply,发布全球首款面向古希腊语的大语言模型Apollo。模型以手稿、莎草纸与石刻铭文训练,涵盖约6亿个古希腊历史词汇,可基于统计概率补全残片缺失词句,帮助学者加快古籍修复与研究。」
奥地利科学院将于当地时间周三正式发布全球首款面向古希腊语的高级大语言模型Apollo。该项目由奥地利科学院联合法国AI实验室Mistral以及科技服务商Sail Reply共同开发,训练素材取自手稿、莎草纸与石刻铭文,总计约6亿个古希腊历史词汇。
古希腊莎草纸残片的修复长期是一项极为繁重的工作。全球各地高校图书馆保存着数十万份残片,不少损毁严重,其内容或许已无法解读;对于尚存修复希望的文本,学者只能逐条补全缺失的词句。伦敦大学学院古典学与历史语言学教授斯蒂芬·科尔文指出,精通古希腊历史、能够胜任这类修复工作的专家,全世界寥寥无几。而在Apollo出现之前,补全流程完全依赖资深学者:先要划分单词边界,因为古希腊文本书写原本没有空格分隔;之后还要判定文献年代,结合当时的社会政治背景,查阅各类参考资料,才能斟酌选择合适文字。
Apollo把这类专业知识整合进了模型内部。奥地利科学院历史学家、莎草纸文献研究学者安娜·多尔甘诺夫介绍,当模型识别到荷马文本,就会使用荷马时代的古希腊语进行补充;遇到多利亚方言石刻铭文,则自动切换为多利亚方言。针对破损残缺的文献,Apollo会基于统计概率给出可能性最高的词句来填补文本空白,有望挖掘出此前被掩盖的历史事件与古代社会习俗细节。科研人员可以通过聊天机器人界面免费使用该模型。
研发团队希望借助Apollo帮助学者更快筛选出与自身细分研究方向相关的莎草纸残片,发掘新的研究切入点。长期深陷艰苦文本复原工作的学术界期待它能提升研究效率,让学者把精力放在分析古代文献背后的历史意义,而不再耗费大量精力辨识残缺文字本身。
牛津大学收藏着全球规模最大的古代莎草纸藏品。该校古典语言与文学教授阿尔芒·当古尔评价说,如果机器可以提示某处空白有三个备选词汇,将极大加快研究进度。在他看来,每一次完成一处文本复原,都会为古代世界的知识库增添一小块新内容。
不过Apollo并不会颠覆学界对古代世界的整体认知。大量莎草纸迟迟没有完成修复,本身就是因为记载的大多是日常内容,例如私人信件、婚约、行政文书。科尔文表示,普通读者或许以为学界一下子就能发掘出索福克勒斯几部失传的戏剧,但这并不会发生。尽管如此,该模型依旧有助于还原古代日常生活的更多细节,并为现有的学术推论提供佐证。
Sail Reply公司合伙人迪米特里斯·弗利塔斯表示,用这种方式解锁古代知识,放在一年之前还是无法想象的事情。他提出,如果Apollo项目取得成功,这套技术可以很方便地迁移到其他古代语言,例如拉丁语、古埃及语,也可以推广到其他需要整理、索引大规模文献资料库的学术领域。
也有学者提出顾虑:依靠以概率运算为基础的大语言模型补全古代文献缺损部分,有可能产生错误,进而污染原始历史记录。为规避该风险,Apollo的设计思路是提供多组候选文字方案,最终仍然交由学者做出抉择。多尔甘诺夫强调,关键点在于人的专业判断必须保留,一旦彻底依赖AI完成历史文献的转录与解读,麻烦就会随之而来。
人工智能已经在不少科研领域交出亮眼成果:OpenAI此前宣布旗下AI模型解决了一道延续200年之久的数学难题;谷歌DeepMind利用AI整理出大型数据集,用以分析基因突变如何作用于分子生物学。Apollo的出现,则把大语言模型的能力边界进一步延伸到了古代语言文字与文献学研究领域。
来源:Heooo AI工具导航