编目常见URI问题:什么时候开始用?RWO又是什么?

合作编目项目(PCC)“MARC中URI工作组”完成了《创制和获取URI的常用词表和参考源指南》,为在MARC 21中使用URI热身。
参见:创制和获取URI的常用词表和参考源指南(2018-3-2)

工作组同时提供了一个“URI常见问题”,面对的是分裂的现状:一方面有人对URI知之甚少,另一方面有人已经想在MARC数据中添加URI。
URI FAQs (2018-2-6) :计有27个问答

面对不了解URI者的问题较多,以下几个与RWO相关的问题是我感兴趣的(下一行是我的理解、不是翻译):
– 什么是真实世界对象?(问题3)
Real World Object 简称 RWO = Thing 或 实体。在BIBFRAME由1.0发展到2.0过程中频频出现。
– 为什么在浏览器中使用URI,却发送不同的链接?(问题5)
这是由于“解引”(dereferencing),输入的是RWO的URI,最终显示的是RWO描述的URL(RWO本身无法显示吧)。
– $0和$1中的URI有什么不同?(问题11)
RWO的描述和RWO本身
– 为什么skos:Concept不是RWO?(问题12)
概念也可以是RWO,但skos:Concept是概念的说明。因此,不能说两个skos:Concept互相owl:sameAs,只能说两者完全匹配(skos:exactMatch)或近似匹配(skos:closeMatch),或具有相同的焦点/面对相同实体(foaf:focus),但本身不是同一个Thing。

对于急着想在MARC数据中使用URI的,特别注意以下信息,总体来说就是还需要再等上一年半载:
1、OCLC方面:尚未配置$1为有效子字段(问题7),计划2018年下半年接受$1(问题14);对于2017年12月加入MARC 21的758字段(资源标识符),OCLC可能在2018年下半年发布有关实施的技术公告(问题20)。
2、PCC方面:PCC指导委员会(标准和培训)将在2018年提供在MARC字段中使用URI、包括758字段的最佳实践(问题16、问题20)。
3、工具:添加过程最好是自动处理,但目前元数据编辑器中多半没有查询工具(问题22),有用的工具有MARCEdit的MARCNext、LOD/OpenRefine或者直接用SPARQL(问题24),验证URI工具有VapourVafu(问题23)。

关于MARCNext可参见MARCEdit开发者的博客:Terry’s Worklog: MarcEdit’s Research Toolkit – MARCNext (2014-8-23)

创制和获取URI的常用词表和参考源指南

应用关联数据,并不是简单地把数据以三元组形式发布。要能使发布的数据相互关联,在数据中采用或关联已有URI/IRI是很重要的工作。美国合作编目项目(PCC)MARC中URI工作组在2018年2月14日发布了一份文档《创制和获取URI:常用词表和参考源指南》,总结了40个图博档领域常用的词表和参考源的信息。自然以英语为主,但从图示看有些有中文(如《艺术和建筑叙词表》AAT、联合国粮农组织《多语种农业叙词表》AGROVOC)。中文开放资源总体上不多,如果也能参照总结一个,会是很有益的工作。

创制和获取URI:常用词表和参考源指南 FORMULATING AND OBTAINING URIs: A GUIDE TO COMMONLY USED VOCABULARIES AND REFERENCE SOURCES / Prepared by the Program for Cooperative Cataloging Task Group on URIs in MARC. Version Date: 2018-02-14

文档称,“MARC最近开发了一种机器可操作的方式,指定规范URI或规范所描述事物URI(https://www.loc.gov/marc/mac/2017/2017-08.html),但填充这些子字段的实践是新生的”。所说的机器可操作的方式,指MARC21分别为实体描述和实体本身(真实世界对象,RWO)定义了不同的子字段:
$0 Authority record control number or standard number
$1 Real World Object URI (R)(新增)
参见:600字段含$t时,$0代表作品还是个人?(附:MARC21新增$1子字段)(2017-12-4)
其中实体描述通常是各种书目和规范记录,当然还有图书馆界之外的描述记录;而实体本身及其URI,对编目而言完全是新概念,如何获取更是新挑战。

本文档把数据源分为2类,第1类是关联数据资源,共28项;第2类是具有控制号或其他标准标识符但未发布为RDF的数据源,共12项。不知道是不是因为这些资源太过有名,所有40个资源都没有介绍收录内容或范围。
每个资源列出的具体信息,第2类比较简单,基本只有名称、最后查看日期和主页(网址),仅其中的IMDb还列出了联系信息、使用限制及图示。第1类则有与使用有关的详细信息,除前述IMDb所列各项外,还包括:建模(基于SKOS的较多),存放URI的MARC子字段($0记录、$1实体、$4关系词),创建或获取URI方法与样例、截屏图示、API或Web Services或批下载、查询获取URI样例等,数据版本/更新频率、使用者(多为空)、工具(多为空),其他(相关资源,偶有)。
以下按大致内容对2类资源重新排列(有$0 $1 $4的为关联数据资源):

艺术
AAT – Art & Architecture Thesaurus($0)
TGM – Thesaurus for Graphic Materials($0)

音乐
AllMusic 音乐
Discogs 唱片
LCMPT – Library of Congress Medium of Performance Thesaurus($0)
MusicBrainz – The Open Music Encyclopedia($1)

影视戏剧
AllMovie
BFI – British Film Institute
IBDB – Internet Broadway Database
IMDb – Internet Movie Database

游戏
GAMECIP Computer Game Media Format Vocabulary($0)
GAMECIP Computer Game Platform Controlled Vocabulary($0)

地理
Canadian Geographical Names
GNIS – Geographic Names Information System,GeoNames($1)
TGN – Getty Thesaurus of Geographic Names($0,$1)

个人团体
ISNI – International Standard Name Identifier($1)
Legal Entity Identifier 企业标识号
ORCID($1)
ResearcherID
Scholar Universe
ULAN – Union List of Artist Names($0,$1)
VIAF – Virtual International Authority File($1)

农业:AGROVOC($0)
医学:MeSH RDF- Medical Subject Headings RDF($0)

综合
BBC Things($1)
CERL Thesaurus($1)欧洲1450-1830年间地名、人名
DBpedia($1)
GND – Gemeinsame Normdatei (Integrated Authority File) 德国国家图书馆规范档($0主题,$1会议或事件、团体、家族、个人、地点或地理名称、作品)
LC/NACO Authorities($0规范,$1 RWO)
Library of Congress Authorities
Wikidata($1)

综合(主题词表/元数据词表)
FAST – Faceted Application of Subject Terminology($0),
LCSH – Library of Congress Subject Headings($0)
LC Children’s Subject Headings($0)
LCDGT – Library of Congress Demographic Group Terms($0)
LCGFT – Library of Congress Genre/Form Terms($0)
MARC Relator Terms and Codes($4)
RDA Vocabularies($0取值,$4元素)
RBMS Controlled Vocabularies($0)珍本与特藏编目用受控词表

面向机器应用的RDA(2018ALA仲冬会议上的RDA-续)

《资源描述和检索》(RDA)通常是被当作编目规则而存在的,但在它以联机版工具包(RDA Toolkit)发布之后,对元数据注册方面的重视逐渐增强。随着3R计划对工具包网站的重新设计和对RDA本身的重构,它进一步强化了编目规则以外的职能。尽管对这方面的进展有所关注,2014年时还写了篇文章《RDA:从内容标准到元数据标准》(图书馆论坛,2014(7):1-7),但看到Kathy Glennan在2018 ALA仲冬会议PCC成员会上的报告,还是给震住了:供编目员使用的工具包(RDA及辅助资料),只是RDA体系中一小部分、也是唯一收费内容,其他大部分是提供给应用开发者和机器使用的免费内容。

Kathy Glennan. RDA, Linked Data, and the 3R Project(RDA、关联数据和3R计划)

– RDA正在更多地变为数据字典,不同部分提供给不同类型用户【PPT第5张】
RDA Reference 参考 –> 开发者
RDA Vocabularies 词表 –> 开发者
RDA Registry 注册 –> 应用开发者
RDA Vocabulay Server 词表服务器 –> 开发者【根据第11张和下图补】
RDA Toolkit 工具包 –>编目员
RIMMF –> 培训者
– 核心部分在“RDA参考”【PPT第6张】
所有RDA元素及其定义和相关范围注释,所有取值词表术语及定义,包含翻译
以RDF关联数据格式存储在“开放元数据注册”(Open Metadata Registry, OMR)网站
RDA工具包内容的主要来源
– RDA参考数据工作流【PPT第14张】

RDA Ref Data Workflow

可以感觉到RDA雄心勃勃。然后问题来了:有了RDA词表,还需要BIBFRAME吗?刚完成一篇国际编目标准现状与进展的文章,结尾是“群雄逐鹿、未知鹿死谁手?”[update 2018-2-26将在《图书馆论坛》发表、中国知网优先数字出版]

在2018 ALA仲冬会议RDA关联数据论坛上,康奈尔大学Steven Folsom的报告,介绍梅隆基金资助的LD4L-Labs和LD4P项目对BIBFRAME的扩展(bibliotek-o),很重要的部分是重用RDAu(即不限定WEMI的RDA元素)。对于BIBFRAME和RDA,他最后的设问是:[一起]向前走,还是再次分道扬镳?

Steven Folsom. non-RDA is the new non-MARC: bibliotek-o and RDA
bibliotek-o: a BIBFRAME Ontology Extension

参见:
Diane Hillmann谈书目框架转换行动(2012-7-7)
图书馆从传统数据观走向关联数据及语义网:五周年(2012-5-16)
Diane谈RDA元数据注册的设计(2012-11-18)
JSC会议有关RDA注册的讨论与决定(2012-11-18)
RDA注册元素集终于正式发布(2014-1-23)
JSC主席Gordon Dunsire论《RDA和语义网》(2014-3-17)
RIMMF:多元数据格式中的RDA(附广告:《RDA:从内容标准到元数据标准》)(2014-8-20)
Christine Frodl和RDA注册前史(2018-2-12)