合作交流

当前位置: 网站首页 > 合作交流 > 文化管理与政策学术创新共同体 > 正文

文化管理与政策学术创新共同体

AI新时代面向文化遗产活化利用的智慧数据生成路径探析

发布时间:2026-09-18   信息来源:    浏览量:

推介人:丁艺雯

原文出处:范炜&曾蕾.(2024).AI新时代面向文化遗产活化利用的智慧数据生成路径探析.中国图书馆学报,50(2),4-29.https://doi.org/10.13530/j.cnki.jlis.2024010.


一、研究背景

生成式人工智能的爆发,把文化遗产领域推到了一个前所未有的十字路口。以ChatGPT为代表的AI技术正在重塑信息生产、知识组织与服务方式。在AI新时代,图书馆、档案馆、博物馆这些文化记忆机构馆藏资源是重要的数据资源,是机器学习模型训练的高质量“数据养料”;馆藏资源为机器学习提供了训练数据,创造了最佳实践和案例,但也存在数据的版权、隐私、伦理与合理使用等挑战。

与此同时,国家层面接连出台文件,《关于推进实施国家文化数字化战略的意见》《“数据要素×”三年行动计划》相继落地,数据成为重要的生产要素,文化记忆机构的数据资源体系建设被正式纳入国家战略棋盘。但现实远没有政策文本那样顺理成章。一方面,文化遗产的数据类型极其庞杂:除了最常见的文本,还有图像、音频、三维模型、甚至气味记录,多模态特性让传统“编目-检索”那一套捉襟见肘;另一方面,大量珍贵馆藏仍沉睡在硬盘和库房里,数字化不等于数据化,更不等于“智慧”。在AI时代,图档博机构面临的核心拷问是:如何让几十年积累的文化遗产数据,真正变成可被机器理解、可被算法调用、可支撑创新应用的高质量数据养料?

国际上,UNESCO早在2021年就发布了《人工智能伦理问题建议书》,欧盟砸下数千万欧元建设文化遗产数据共享空间,美国、日本、芬兰等国也在知识图谱、关联数据、多模态处理上跑出了不少示范项目。国内虽有中华古籍资源库、国家图书馆“中国记忆”等积累,但整体仍处在“重采集、轻关联”“重存储、轻计算”的阶段。本文正是在这种“技术已就绪、数据待激活”的窗口期,系统探讨面向文化遗产活化利用的智慧数据生成路径。

二、研究设计

本文采用理论梳理与多案例解析相结合的研究路径,围绕“数据-智慧”的转化主线,从异构数据资源处理、非遗活态文化建模、智慧数据生成策略三个层面展开论证,整体呈现由数据类型分类,典型项目实证到理论抽象出路径的递进结构。

1.异构多模态数据的智慧化路径。研究者首先将文化遗产数据按形态拆为两大类。第一类是机器可读的文本类数据,包括结构化的元数据、半结构化的档案查找辅助工具、非结构化的年度报告和口述史等,处理手段涵盖自动标引、OCR/HTR识别、语义分析与知识图谱构建。第二类是非文本类数据,涵盖2D图像、3D图像、音频、气味、实物货币等,借助计算机视觉、语音识别、多模态大模型等技术实现从“看得见”到“读得懂”的跨越。

2.以人为中心的非遗活态数据建模。针对非物质文化遗产以人为载体的特殊性,文章提出以传承人个体为锚点的数据模型设计思路。该模型围绕“项目-人-事(活动)-物-地”五要素展开,把抢救性记录工程积累的口述史、教学影像、仪式录像等多模态资料,通过本体构建和知识图谱串联起来,使非遗从名录条目变成可计算、可推理、可活化的智慧数据。

3.国家与区域级知识网络底座。在研究设计的最高一层,作者引入芬兰Sampo模型作为参照,展示如何通过共享本体、关联数据和语义门户,把分散在各机构的异构文化遗产资源汇聚成国家级知识网络。这一层设计回答了数据如何走出机构孤岛、形成公共基础设施的问题,为归纳路径策略提供了架构层面的支撑。

三、研究发现

1.文本类数据:从数字化走向语义增强。

研究发现,结构化文本,例如MEDLINE索引、档案元数据在AI辅助下可实现近乎实时的自动标引与实体抽取,效率较人工提升数十倍;半结构化文本,如档案查找辅助工具经语义分析工具处理后,能批量产出人名、机构、地名、事件等实体标签,极大丰富了检索维度。但研究也明确指出,机器结果仍需人工校核,尤其在社交标签、行业术语等分类上,准确率远未到可完全放手的阶段。

2.非文本类数据:多模态大模型打开新空间。

在图像方面,OCR、矢量化与计算机视觉已能将古籍、碑刻、器物上的图文信息转化为可检索内容,三维扫描与VR/AR结合则让文物在虚拟空间中复活;在音频方面,语音识别与文本语义分析的联动,使诗歌朗诵档案、口述史录音可被全文检索与情感分析。最具想象力的是气味数据,欧盟Odeuropa项目通过文本与图像挖掘,重建十六至二十世纪欧洲的嗅觉地图,把气味纳入了文化遗产的数据版图。

3.大众参与与专题整合:从孤岛到关联网络。

研究发现,灾害记忆、社区贡献的混合媒体等“事件中心”数据,正在倒逼图档博放弃以物为中心的传统元数据模式,转向以事件、活动为线索的组织方式。而在国家层面,德国国家经济学图书馆ZBW将PM20数据集捐赠给Wikidata,芬兰Sampo系列项目将二十多个专题知识库统一在共享本体之下,都证明了一条可行路径:先结构化、再语义关联、最后AI增强,数据便能从机构私有走向公共可用。

4.非遗活态文化:以羌年为例的数据化思路。

文章以羌年这一入选UNESCO急需保护名录的非遗项目为切入点,展示了活态文化的智慧数据设计思路。羌族无文字,文化传承全靠口传心授,汶川地震更让传承链条雪上加霜。研究者提出,应以羌族祭司等传承人为核心节点,把锅庄舞、羌绣、羌语歌谣、仪式流程等多类别非遗项目关联起来,形成“项目—人—事—物—地”五维交织的数据网络。AI在此的作用不是替代传承,而是辅助记录、加速转录翻译、生成数字分身,让濒危的文化记忆多一层数字化保险。

四、讨论

本文没有神化AI在文化遗产保护中的作用,而是清醒地指出:文化遗产数据资源建设与智慧数据的生成不是一蹴而就的,不能单纯依靠技术来突破和完成。文化遗产数据资源建设是一盘棋,需要深入持续地理解文化的多元性、时代性以及文化遗产的多样性、丰富性,注重对文物、文献、音视频等不同载体资料的纵向挖掘与横向关联。图档博机构的核心竞争力,恰恰在于几十年积累的领域知识、受控词表和编目规范,这些在AI时代非但没有过时,反而成了训练高质量领域模型不可或缺的基础。

文章由此提出四点策略。其一,主动拥抱AI,抓住新一轮AI赋能机遇,及时补齐数据基础设施短板,加强数据资源体系建设。其二,尽快开展馆藏数据资源的“大语言模型+知识库”结合工作,实现智能分析与计算增强。其三,鼓励更广泛的文化遗产数据开放与共享,支持活化利用的创新。其四,确保可信的智慧数据。

归根结底,本文想传递的核心是:让AI回归技术,让文化回归文化。智慧数据不是用算法把文化遗产重新创造一遍,而是用更聪明的方式,把人类已经积累千年的文化记忆,转化成这个时代读得懂、用得上、传得下去的知识。当数据真正“智慧”起来,文化遗产便能在当下真正“活起来”“火起来”。

关闭

版权所有:西安建筑科技大学公共管理学院 | 站点维护:信息网络中心 | 联系邮箱:ggglxy@xauat.edu.cn | 联系电话:029-82203303

雁塔校区 地址:西安市碑林区雁塔路中段13号 710055 | 草堂校区 地址:西安市草堂寺景区草寺东路 710311