创制和获取URI的常用词表和参考源指南

应用关联数据,并不是简单地把数据以三元组形式发布。要能使发布的数据相互关联,在数据中采用或关联已有URI/IRI是很重要的工作。美国合作编目项目(PCC)MARC中URI工作组在2018年2月14日发布了一份文档《创制和获取URI:常用词表和参考源指南》,总结了40个图博档领域常用的词表和参考源的信息。自然以英语为主,但从图示看有些有中文(如《艺术和建筑叙词表》AAT、联合国粮农组织《多语种农业叙词表》AGROVOC)。中文开放资源总体上不多,如果也能参照总结一个,会是很有益的工作。

创制和获取URI:常用词表和参考源指南 FORMULATING AND OBTAINING URIs: A GUIDE TO COMMONLY USED VOCABULARIES AND REFERENCE SOURCES / Prepared by the Program for Cooperative Cataloging Task Group on URIs in MARC. Version Date: 2018-02-14

文档称,“MARC最近开发了一种机器可操作的方式,指定规范URI或规范所描述事物URI(https://www.loc.gov/marc/mac/2017/2017-08.html),但填充这些子字段的实践是新生的”。所说的机器可操作的方式,指MARC21分别为实体描述和实体本身(真实世界对象,RWO)定义了不同的子字段:
$0 Authority record control number or standard number
$1 Real World Object URI (R)(新增)
参见:600字段含$t时,$0代表作品还是个人?(附:MARC21新增$1子字段)(2017-12-4)
其中实体描述通常是各种书目和规范记录,当然还有图书馆界之外的描述记录;而实体本身及其URI,对编目而言完全是新概念,如何获取更是新挑战。

本文档把数据源分为2类,第1类是关联数据资源,共28项;第2类是具有控制号或其他标准标识符但未发布为RDF的数据源,共12项。不知道是不是因为这些资源太过有名,所有40个资源都没有介绍收录内容或范围。
每个资源列出的具体信息,第2类比较简单,基本只有名称、最后查看日期和主页(网址),仅其中的IMDb还列出了联系信息、使用限制及图示。第1类则有与使用有关的详细信息,除前述IMDb所列各项外,还包括:建模(基于SKOS的较多),存放URI的MARC子字段($0记录、$1实体、$4关系词),创建或获取URI方法与样例、截屏图示、API或Web Services或批下载、查询获取URI样例等,数据版本/更新频率、使用者(多为空)、工具(多为空),其他(相关资源,偶有)。
以下按大致内容对2类资源重新排列(有$0 $1 $4的为关联数据资源):

艺术
AAT – Art & Architecture Thesaurus($0)
TGM – Thesaurus for Graphic Materials($0)

音乐
AllMusic 音乐
Discogs 唱片
LCMPT – Library of Congress Medium of Performance Thesaurus($0)
MusicBrainz – The Open Music Encyclopedia($1)

影视戏剧
AllMovie
BFI – British Film Institute
IBDB – Internet Broadway Database
IMDb – Internet Movie Database

游戏
GAMECIP Computer Game Media Format Vocabulary($0)
GAMECIP Computer Game Platform Controlled Vocabulary($0)

地理
Canadian Geographical Names
GNIS – Geographic Names Information System,GeoNames($1)
TGN – Getty Thesaurus of Geographic Names($0,$1)

个人团体
ISNI – International Standard Name Identifier($1)
Legal Entity Identifier 企业标识号
ORCID($1)
ResearcherID
Scholar Universe
ULAN – Union List of Artist Names($0,$1)
VIAF – Virtual International Authority File($1)

农业:AGROVOC($0)
医学:MeSH RDF- Medical Subject Headings RDF($0)

综合
BBC Things($1)
CERL Thesaurus($1)欧洲1450-1830年间地名、人名
DBpedia($1)
GND – Gemeinsame Normdatei (Integrated Authority File) 德国国家图书馆规范档($0主题,$1会议或事件、团体、家族、个人、地点或地理名称、作品)
LC/NACO Authorities($0规范,$1 RWO)
Library of Congress Authorities
Wikidata($1)

综合(主题词表/元数据词表)
FAST – Faceted Application of Subject Terminology($0),
LCSH – Library of Congress Subject Headings($0)
LC Children’s Subject Headings($0)
LCDGT – Library of Congress Demographic Group Terms($0)
LCGFT – Library of Congress Genre/Form Terms($0)
MARC Relator Terms and Codes($4)
RDA Vocabularies($0取值,$4元素)
RBMS Controlled Vocabularies($0)珍本与特藏编目用受控词表

UNIMARC书目和规范格式2017年修订发布

UNIMARC加快了更新的步伐。第3版书目格式发布于2008年、规范格式发布于2009年,第1次更新2012年,到2014年才发布(RDA课题2013年结项时盼望而未等到);第2次更新2016年,当年底、次年初发布;今天发现IFLA网站已经有了2017年更新(网页更新于2017-10-30),看说明似乎以后会每年即时发布更新。

UNIMARC Bibliographic, 3rd edition (with updates)
UNIMARC Authorities, 3rd edition (with updates)
书目格式有19处更新,其中新增4个字段;规范格式有4处更新,其中新增1个字段。新增字段如下:

017 – Other identifier 其他标识符(书目、规范)
(书目)不适用其他字段的单件标识符。是用于标识单件的唯一、永久、国际认可的字母数字代码。没有举例。
经查2008年版有此字段,名为Other standard identifier,原定义中“标准号或标准码”现改称“标识符”。
对应MARC21的024字段Other Standard Identifier(1993年增加字段)
(规范)不适用其他字段的、与2XX字段命名实体相关的标识符。参考:2016年新增010 ISNI。1个例子,ORCID号
017 7# $a0000-0002-8038-722X$2orcid

231 – Digital File Characteristics(书目)
可重复。也可记录在215$c。可以采用不同来源术语。以下为例6,分别采用RDA和Wikidata术语(没有举ISBD术语的例子):
231 ##$aImage file$2rda
231 ##$bQ2195$e3 Mo$2wikidata
对应MARC21的347字段(2011年新增)

283 – Carrier Type(书目)
2016年新增181-183代码字段,分别对应ISBD0的内容形式、媒介类型和载体类型;又定义了203内容形式和媒介类型,使用相应的术语,分别与181和182配套使用。此次补上了与183配套使用的283。
203字段没有定义$2来源,举例用的是ISBD术语。此次几个例子都是用的RDA而非ISBD术语,或可预计203字段也将增加$2来源。例2:
183 #0$8main part$asd$2rdacarrier
183 #0$8liner notes$anb$2rdacarrier
283 ##$8main part$aAudio disc$2rdacarrier
283 ##$8liner notes$aSheet$2rdacarrier
对应MARC21的338字段(2009年新增)。MARC21用336-338同一个字段记录代码和术语,UNIMARC用2个字段,记得2012更新时曾经讨论过,不知最终的决定是出于何种考虑。

338 Funding Information Note(书目)
资助项目信息。对应MARC21的536字段(原有字段)。

参见:
Publications from UNIMARC
UNIMARC书目和规范格式2016修订发布(2017-7-31)
UNIMARC书目和规范格式2012修订发布(2014-7-21)

600字段含$t时,$0代表作品还是个人?(附:MARC21新增$1子字段)

MARC21中$0子字段是控制子字段,在很多字段中出现,其定义为“规范记录控制号或标准号”(可重复)
MARC 21 Bibliographic: Appendix A – Control Subfields
$0 – Authority record control number or standard number (R)
在字段开始先用括号加代码说明来源(规范记录的机构代码、标准号的标识符),如:
100 1#$aBach, Johann Sebastian.$4aut$0(DE-101c)310008891
100 1#$aTrollope, Anthony,$d1815-1882.$0(isni)0000000121358464
但是,(uri)目前省略(原因后述),如:
710 2#$aCalifornia Poets in the Schools (Project),$eissuing body,$epublisher.$0http://id.loc.gov/authorities/names/n85319780

BIBFRAME邮件组中,芬兰国家图书馆的Osma Suominen询问:600字段含$t时,$0代表什么?
600 field with $t: what does the $0 represent? (2017-11-27)
事情的起源是:有条MARC记录,有作品(名称-题名)作为主题(600$a$t),其中含有作者规范控制号($0),当用marc2bibfram2转换时,$0被当作了作品ID。因此Osma Suominen问,600字段含$t时,$0代表个人还是作品?
康奈尔大学的Steven Michael Folsom回复是:如果没有$t(名称)则$0关于“作者”;如果有$t(名称-题名)则$0指代“作品”,如果没有作品URI,字段中不应该有$0。700等也如此。

实际上更确切地说,以上$0子字段代表的是个人或作品的“(规范)记录”,而非个人或作品“本身”,后者由MARC21新定义的$1子字段表示。见MARC建议No. 2017-08,建议已于2017.8.7获批,不过MARC21标准网站中各字段尚未更新。

——— MARC建议No. 2017-08:用子字段$0和$1捕获URI ———
MARC PROPOSAL NO. 2017-08: Use of Subfields $0 and $1 to Capture Uniform Resource Identifiers (URIs) in the MARC 21 Formats

“转换MARC21到关联数据的实验建议,在MARC21中存储URI有很大好处。……对指代不同实体类型的URI使用不同MARC21子字段,是与关联数据对话的重要前提,建议细化$0定义,并新定义$1”:
$0原来的定义是:规范记录控制号或标准号。如果是URI,则用前缀(uri)表示。为更简便解引HTTP格式URI,现去除前缀(uri)(但其他号码仍然保留,样例见前)。
建议新定义$1作为真实世界对象(RWO,Real-World Object)URI,即$0为规范(记录)URI,而$1为Thing URI。涉及所有格式(书目、规范、分类、馆藏、社区信息)中大量与规范形式相关的字段。例子如:
600 00 $a Zeus $c (Greek deity)
$0http://id.loc.gov/authorities/names/no2014048635
$1 http://viaf.org/viaf/308237987

650 #0 $a Kindness
$0 http://id.loc.gov/authorities/subjects/sh85072376
$1 http://dbpedia.org/resource/Kindness
$1 http://www.wikidata.org/entity/Q488085

830 #0 $a Oxford history of art.
$0 http://id.loc.gov/authorities/names/n96099923
$1 http://viaf.org/viaf/184384669
$1 http://www.wikidata.org/entity/Q24039213