0. 学习导航:先建立一张地图#
0.1 信息组织究竟在解决什么#
信息组织面对的不是“信息太少”,而是资源很多、表达不一、关系隐蔽,用户又无法准确说出自己需要什么。它要在资源与用户之间建立一套稳定的中介结构,使资源:
- 可以被识别:这是什么资源,是哪一个版本?
- 可以被聚合:同一作者、同一作品、同一主题的资源能否汇到一起?
- 可以被区分:名称相同、版本不同或主题相近的资源如何区分?
- 可以被关联:翻译、改编、引用、上下位概念之间有什么关系?
- 可以被检索和浏览:用户从哪些入口进入,如何扩检或缩检?
因此,信息组织可以压缩为一条加工链:
资源界定 → 特征分析 → 信息描述 → 内容标引 → 建立索引 → 检索匹配 → 评价与维护
0.2 三层结构#
| 层次 | 核心问题 | 主要成果 |
|---|---|---|
| 描述层 | 资源“是什么” | 元数据记录、标识符、责任关系 |
| 语义层 | 资源“讲什么、与什么相关” | 分类号、主题词、关键词、本体关系 |
| 检索层 | 用户“怎样找到它” | 目录、索引、分面、查询与排序 |
0.3 贯穿全篇的虚构案例#
后文反复使用一篇虚构论文:
李明:《生成式人工智能支持高校图书馆知识服务:方法与评价》,2026 年发表于《图书情报研究》,讨论大语言模型、RAG 在高校图书馆参考咨询中的应用与评价。
同一资源会依次经历:
- 描述题名、作者、日期和载体。
- 判断中心主题与文献类型。
- 选择分类位置。
- 赋予主题词和关键词。
- 建立索引并设计查询式。
- 用查全率、查准率评价结果。
这能看出:描述、分类、主题标引和检索不是四件孤立的事,而是对同一资源的不同表示。
1. 导论:信息为什么需要组织#
1.1 “组织”的三件事#
任何信息组织系统都要回答:
- 如何描述:选择哪些属性、字段或符号表示对象。
- 如何排列:按类别、主题、时间、权重或关系安排对象。
- 如何展示和检索:设置哪些入口、检索点、导航与反馈方式。
常见概括是 描述(Description)—排列(Arrangement)—展示/检索(Presentation/Retrieval)。信息组织不是简单“整理好看”,而是根据使用需要,对资源的内容特征与外部特征进行选择、处理、序化和提供。
1.2 定义中的三个维度#
- 使用需要:谁使用、解决什么问题、发生在什么场景。
- 内容特征:资源谈论什么,属于什么学科和主题。
- 外部特征:题名、责任者、版本、载体、出版信息、标识符等。
外部特征常支持已知项检索;内容特征主要支持主题发现。二者共同构成资源的可检索表示。
1.3 数据、信息与知识#
| 层次 | 简要定义 | 判断重点 | 例子 |
|---|---|---|---|
| 数据 Data | 尚未解释的符号或事实记录 | 需要解释框架 | 字符串 G250.7 |
| 信息 Information | 在语境中获得意义、可供判断的数据 | 依赖任务与目的 | G250.7 是一个分类标记 |
| 知识 Knowledge | 经过组织、理解和推理形成的认知结构 | 强调联系与应用 | 能据此理解资源的学科位置并继续浏览 |
DIKW 不是不可逆的绝对等级。同一对象在不同任务里可以承担数据、信息或知识的角色。
1.4 Buckland 的四种信息观#
| 抽象 | 具体 | |
|---|---|---|
| 实体 | Information-as-knowledge:作为认知成果的信息 | Information-as-thing:作为物的文献、数据和载体 |
| 过程 | Information-as-process:获知与认知更新 | Information processing:数据加工、传递和运算 |
信息系统能够直接保存和组织的通常是 information-as-thing;它的价值则在于支持 information-as-process,最终影响人的知识状态。
1.5 信息组织的对象与粒度#
- 集合层:整个馆藏、数据库、网站或专题资源库。
- 个体层:一本书、一篇论文、一个网页或一段视频。
- 成分层:章节、图表、字段、事实或知识单元。
粒度越细,检索越精确,加工成本也越高。组织前必须先明确系统边界:一篇论文在期刊数据库中是一个资源个体,在引文数据库中又会拆成作者、机构、参考文献等多个可关联单元。
1.6 信息组织与信息检索#
信息组织提供文档表示,信息检索处理需求表示,两者在匹配环节相遇:
资源 → 描述与标引 → 文档表示 / 索引 ↔ 查询表示 ← 用户需求
组织质量会直接限制检索上限:没有稳定的名称形式、主题表达和关系记录,再先进的排序算法也只能在混乱的数据上工作。
2. 信息组织原理:控制什么,为什么控制#
2.1 三个理论基础#
- 逻辑学:支持概念划分、类目层级、同位类互斥和关系判断。
- 语言学:处理词形、词义、同义词、多义词和术语组合。
- 系统论:把资源、用户、人员、工具、规则和交互看成整体。
2.2 信息组织的四类活动#
- 选择:确定资源范围、收录标准与组织粒度。
- 描述和标引:记录形式特征,分析并表达主题内容。
- 设计交互:建立目录、索引、分类导航、分面与搜索入口。
- 维护和治理:修订规范记录、更新词表、管理权限和保存信息。
2.3 三项保证原则#
- 文献保证:类目和术语应有实际资源依据,避免只凭抽象推演无限细分。
- 用户保证:表达方式要能回应目标用户的语言和检索习惯。
- 系统与设备适应:粒度、编码和交互方式要适合技术条件、网络与终端。
三者可能冲突:学术上最精确的术语不一定是用户会输入的词;用户最常说的词也不一定适合作为稳定的规范标目。系统需要在专业准确性与可用性之间建立映射。
2.4 什么是规范控制#
规范控制不是简单“统一格式”,而是为实体或概念选择稳定的规范形式,同时保存变体、关系和使用说明。常见控制对象包括:
- 名称控制:同一人不同笔名、译名和姓名形式统一到规范名称。
- 同义控制:多个表达指向同一概念,如“电脑”参见“计算机”。
- 多义控制:用限定语区分同形异义,如“苹果(水果)”与“苹果(公司)”。
- 关系控制:明确上位、下位、整体、部分和相关关系。
- 格式控制:统一日期、代码、语言和标识符的表达方式。
规范记录通常包含:规范形式、变体形式、标识符、适用范围、关系与来源说明。它使“同物聚集、异物区分”成为可能。
2.5 从分类表到本体:KOS 光谱#
知识组织系统(Knowledge Organization Systems, KOS)并非只有分类表:
| 工具 | 主要结构 | 典型用途 |
|---|---|---|
| 术语表 Glossary | 术语 + 定义 | 统一基本含义 |
| 分类体系 Taxonomy | 以上下位层级为主 | 导航、聚类、权限或产品目录 |
| 主题词表 / 叙词表 | 等同 + 等级 + 相关关系 | 控制标引、查询扩展 |
| 本体 Ontology | 概念、属性、关系、约束与公理 | 机器推理、语义互操作 |
从左到右,语义关系更明确,建设与维护成本也更高。不能因为本体形式化程度高,就在所有场景中取代简单词表。
2.6 信息组织系统的四个要素#
- 资源:被选择、描述和标引的对象。
- 用户:提出需求并解释结果的人。
- 中介:连接二者的馆员、制度、算法或平台。
- 工具:规则、元数据方案、分类表、词表、索引和界面。
分析一个系统时连续追问:谁在找?找什么?为什么找?用什么语言表达?系统凭什么匹配?结果怎样反馈?
3. 信息描述:把资源变成可操作的记录#
3.1 描述活动与描述结果#
信息描述是依据规则,对资源特征进行分析、选择和记录的活动;其结构化结果就是元数据记录。记录并非资源本身,而是资源在系统中的替代物(surrogate)。
这一区分很重要:搜索目录时,系统最先匹配的是记录中的字段与索引,不是书架上的实体本身。
3.2 描述什么:四个观察维度#
| 维度 | 例子 | 特点 |
|---|---|---|
| 外部、静态 | 题名、责任者、出版者、ISBN、分类号 | 相对稳定,常用于识别与定位 |
| 内部、静态 | 摘要、正文用词、目录、图表 | 来自内容本身 |
| 外部、动态 | 引用、链接、下载量、点阅量 | 随时间和平台变化 |
| 内部、动态 | 版本修订、网页内容更新、法规有效状态 | 需要版本与时间管理 |
不能把“元数据”理解成只记录题名和作者。保存、版权、技术环境和关系数据同样属于元数据体系。
3.3 元数据三大类型#
- 描述性元数据:题名、责任者、主题、摘要等,用于发现和识别。
- 结构性元数据:章节顺序、页码、文件组成和资源间结构关系。
- 管理性元数据:格式、权限、来源、保存事件、技术参数等。
3.4 元数据支持的用户任务#
- 发现:通过题名、作者、主题等入口找到候选资源。
- 识别:确认记录指向的究竟是哪一个资源。
- 选择:比较版本、语言、载体和适用对象。
- 获取:知道馆藏地、链接、访问条件或借阅状态。
- 探索:沿作者、作品、主题和引用关系继续发现。
- 管理:记录来源、权利、保存状态与生命周期。
3.5 字段、元素、取值与检索点#
- 字段 / 元素:规定要描述哪一种属性,如题名、日期。
- 取值:该资源在某字段中的具体内容。
- 检索点 / 访问点:允许用户进入记录集合的字段或规范实体。
- 标识符:在特定范围内唯一指向资源或实体的代码。
同一个元素未必自动成为检索点;能检索也不意味着已进行规范控制。例如系统可以搜索所有题名词,但题名词通常不是规范主题词。
3.6 描述质量#
一条高质量记录应做到:
- 客观:以资源和可靠来源为依据,不随意推断。
- 准确:字段含义、取值和关系没有事实错误。
- 充分:足以支持预定用户任务,但不追求无限详细。
- 一致:相似资源采用相同规则,名称与代码受控。
- 可维护:来源、时间和规则版本清楚,便于修订。
4. 信息描述工作与元数据标准#
4.1 一个方案如何设计#
- 界定资源范围和描述粒度。
- 明确用户任务和使用场景。
- 复用已有标准,确定本地扩展。
- 为每个元素规定名称、定义、取值类型、是否必填、是否可重复。
- 为主题、类型、角色等字段选择受控词表。
- 确定唯一标识符、编码语法和交换方式。
- 用样例记录、检索任务和数据校验反复测试。
这套“字段规则的规则”也叫元数据方案或应用纲要。只有字段名而没有定义、取值规范和约束,不足以形成可互操作的方案。
4.2 Dublin Core 十五项#
Dublin Core 是跨领域、低门槛的资源描述元素集。十五个核心元素可以按记忆组归纳:
| 记忆组 | 元素 |
|---|---|
| 内容 | Title、Subject、Description、Type、Source、Relation、Coverage |
| 责任与权利 | Creator、Publisher、Contributor、Rights |
| 生命周期与载体 | Date、Format、Identifier、Language |
其中 Identifier 是特定语境中的无歧义引用,如 ISBN、DOI 或持久 URI;Subject 表达资源主题。实际关联数据项目通常使用更丰富的 DCMI Metadata Terms,而不止十五项基础元素。
4.3 用 Dublin Core 描述贯穿案例#
| 元素 | 示例值 |
|---|---|
| Title | 生成式人工智能支持高校图书馆知识服务:方法与评价 |
| Creator | 李明 |
| Subject | 高校图书馆;生成式人工智能;知识服务;服务评价 |
| Type | Text |
| Date | 2026 |
| Language | zh-CN |
| Identifier | urn:example:paper-01 |
| Relation | 刊载于《图书情报研究》2026 年第 2 期 |
这张表仍只是示范记录。正式方案还需说明 Subject 是否受控、姓名采用什么规范形式、Date 遵守何种格式,以及 Identifier 由谁分配。
4.4 FRBR:区分作品与载体#
传统 FRBR 第一组实体最适合用“同一小说的不同版本”理解:
- 作品 Work:抽象的创作内容。
- 内容表达 Expression:某种语言、演奏或修订形成的表达。
- 载体表现 Manifestation:某出版社、某版次形成的一组物化产品。
- 单件 Item:图书馆实际持有的某一册或某个文件副本。
第二组描述个人、团体等责任主体;第三组描述作为主题的概念、对象、事件和地点。其价值是把传统“一条记录包办全部”的结构拆成实体与关系网络。
标准更新:IFLA LRM 已整合 FRBR、FRAD、FRSAD。考试仍应掌握 FRBR 的经典层次,但理解当前标准脉络时应以 LRM 的统一实体关系视角为准。
4.5 MARC、XML、RDF 与 BIBFRAME 不在同一层次#
| 标准或技术 | 它是什么 | 关键结构 | 不要误解为 |
|---|---|---|---|
| MARC 21 | 书目数据的机读编码格式 | 记录头、目录、字段、指示符、子字段 | 编目内容规则本身 |
| XML | 通用标记语法 | 元素、属性、层次与 Schema | 自带书目语义的模型 |
| RDF | Web 资源图数据模型 | 主语—谓语—宾语三元组 | 只能用 XML 书写的格式 |
| BIBFRAME | 面向关联数据的书目模型与词汇 | Work、Instance、Item 及其关系 | MARC 字段的简单改名 |
RDF 关注“谁与谁有什么关系”;XML 关注“文档怎样结构化表达”。RDF 可以采用 Turtle、JSON-LD、RDF/XML 等多种序列化。
4.6 一个最小 RDF 例子#
@prefix dcterms: <http://purl.org/dc/terms/> .@prefix dcmitype: <http://purl.org/dc/dcmitype/> .
<urn:example:paper-01> dcterms:title "生成式人工智能支持高校图书馆知识服务:方法与评价"@zh ; dcterms:creator <urn:example:person-li-ming> ; dcterms:subject <urn:example:concept-generative-ai> ; dcterms:type dcmitype:Text .这里的价值不在 Turtle 标点,而在于题名是字面量,作者和主题则被建模为可继续描述、可跨系统链接的资源。
5. 分类法:用类目体系表达知识位置#
5.1 类、分类和分类法#
- 类:具有共同属性的对象集合。
- 分类:依据属性异同区分并归入类别的活动。
- 分类法:由类目体系、标记符号、注释说明和索引构成的规范工具。
分类法的核心不是“给书贴号码”,而是用知识体系中的位置表达主题关系,并支持系统浏览和相近资源聚类。
5.2 类目划分的逻辑要求#
- 唯一性:同一层次尽量采用同一划分标准。
- 完整性:下位类总体上应覆盖上位类范围。
- 互斥性:同位类边界尽量清楚,避免无规则交叉。
- 科学性:反映对象本质属性和相对稳定的学科认识。
- 逻辑性:上下位、并列和相关关系能够解释。
现实知识经常跨学科,绝对互斥很难实现,因此分类法还需要交替类目、参见、复分和组配等机制处理多维主题。
5.3 分类法的组成#
- 类目体系:主表、复分表、类目层级和参照关系。
- 标记符号:分类号,可用数字、字母或混合号码。
- 说明与注释:类目范围、包含、排除、沿革和组配规则。
- 类目索引:把自然语言主题映射到类目位置。
好的标记应具有简明性、层次表达能力、可扩充性和适度助记性。但符号只是类目的地址,不能脱离类目含义和注释独立解释。
5.4 等级列举与分面组配#
| 维度 | 等级列举分类法 | 分面组配分类法 |
|---|---|---|
| 基本思路 | 预先列出大量类目,按等级逐级展开 | 分析主题的基本概念或分面,使用时组合 |
| 长处 | 结构直观,便于浏览、排架与共用 | 灵活,适合复杂主题和多维属性 |
| 局限 | 类目容易膨胀,新主题适应较慢 | 规则复杂,对分析和组配能力要求高 |
| 代表 | 《中图法》、DDC、LCC | 冒号分类法;UDC 具有明显分析—综合特征 |
现实分类法常是混合型:以列举体系为主体,同时使用复分表和组配符号增强表达能力。
5.5 分面分析#
分面是按某一共同特征形成的一组概念。经典冒号分类法常用 PMEST 帮助分析:
- Personality:本体或核心对象。
- Matter:材料、性质。
- Energy:过程、操作或问题。
- Space:空间。
- Time:时间。
它的意义不在背五个英文词,而在于把“一个复杂主题”拆成可重组的概念单元,并规定稳定的引用次序。
5.6 多主题文献的关系判断#
- 并列关系:几个主题地位相同;有共同上位类时可归共同上位类,否则依据重点或规则处理。
- 从属关系:大主题包含小主题;通常归入较完整主题,若重点明确落在小主题则从专。
- 应用关系:某学科方法应用于另一对象;通常优先考虑研究目的和被解决的问题。
- 影响关系:A 对 B 的影响,需判断文献着重解释 A 还是 B 的变化。
- 比较关系:比较多个对象时,按共同上位概念或分类法中的比较规则处理。
主题词出现次数最多,不必然就是分类主题。分类首先看研究目的、学科视角和论证重心。
6. 主要分类法:同为分类,设计思想并不相同#
6.1 五种代表性分类法#
| 分类法 | 顶层结构与标记 | 主要特点 | 复习抓手 |
|---|---|---|---|
| 《中国图书馆分类法》 | 5 个基本部类、22 个基本大类;字母数字混合 | 中国图书馆常用,列举为主并配复分机制 | 基本大类、复分与仿分 |
| DDC | 10 个基本大类;十进数字 | 数字层级清楚,配表和相关索引,全球应用广 | 10—100—1000 的十进展开 |
| LCC | 21 个基本大类;字母与数字组合 | 为美国国会图书馆馆藏发展,学术馆常见 | 字母大类、类表分册、列举性较强 |
| UDC | 十进数字 + 多种连接和辅助符号 | 分析—综合能力强,可表达复杂主题 | 主表、共同辅助表、组配符号 |
| CC 冒号分类法 | 分面与冒号等符号 | 典型分面组配思想 | PMEST 与引用次序 |
6.2 《中图法》的基本结构#
- 马克思主义、列宁主义、毛泽东思想、邓小平理论:A
- 哲学、宗教:B
- 社会科学:C—K
- 自然科学:N—X
- 综合性图书:Z
复分是使用通用或专类复分表表达地区、时代、形式等共同因素;仿分是参照另一类已经展开的结构设置本类下位类。常见记忆句“先分类,后分析”强调先确定学科归属,再用复分等方式补充地区、时代或文献形式。
6.3 DDC 与 UDC 为什么不能混称#
二者都用十进数字,但设计能力不同:
- DDC 以等级展开和相对索引见长,表中已有的类号较多。
- UDC 是明显的分析—综合系统,可用共同辅助表与连接符表达地点、语言、形式及主题关系。
“都用小数”只是表面相似;真正要比较的是类目结构、组配能力和使用场景。
6.4 贯穿案例如何确定分类位置#
虚构论文同时出现“大语言模型”“高校图书馆”“知识服务”“评价”。判断步骤:
- 看题名、摘要和结论确定研究目的。
- 判断是研究 AI 算法本身,还是研究 AI 在图书馆服务中的应用。
- 本文主要解决高校图书馆知识服务问题,因此应先在图书馆学/信息服务范围寻找类目。
- 再依现行分类表规则表达高校、智能技术或评价等次要因素。
- 最终类号必须查阅当前类表与注释,不能仅凭关键词猜号。
这体现了应用关系中的核心原则:分类跟着学科视角和研究目的走,不跟着最“新”或最醒目的词走。
7. 分类标引与分类检索工具#
7.1 分类标引的完整流程#
- 资源审读:查看题名、摘要、目录、前言、结论与责任说明。
- 主题分析:判断主题对象、方面、关系和学科视角。
- 概念转换:把自然语言主题转换为分类法中的类目概念。
- 查表定位:先用索引寻找候选类,再回到类目体系和注释核实。
- 组配复分:按规则加入地区、时代、形式等因素。
- 校核记录:检查专指度、一致性、号码顺序和历史沿用。
类目索引只是入口,不是分类结论。找到索引词后必须回到类表上下文检查范围注释、上下位类和参见关系。
7.2 专指度与一致性#
- 专指度:使用分类法所允许的、与资源主题相称的最具体类目。
- 一致性:相同或相似资源在相同规则下获得相同或相近结果。
只追求专指度可能造成类号过细和数据稀疏;只追求一致性又可能牺牲新主题表达。实际工作要受类表深度、馆藏规模和用户需求约束。
7.3 分类号、书次号与索书号#
- 分类号:表达资源的学科或主题位置。
- 书次号:区分同一分类号下的不同文献,常与作者或题名有关。
- 索书号:用于馆藏排架和定位,通常由分类号、书次号及卷册等组成。
所以分类号不是 ISBN,索书号也不等于分类号。前者表达知识位置,后者指向具体馆藏排列位置。
7.4 分类检索怎样扩展和缩小#
- 从当前类目进入下位类:提高专指度、缩小范围。
- 回到上位类:扩大主题范围、提高查全可能。
- 浏览同位类:发现相邻主题。
- 沿相关类和交替类参见:跨越不同学科视角。
- 结合地区、时代、形式等分面筛选:从多维度缩小结果。
分类导航的优势是即使用户不知道准确术语,也能通过知识结构逐步定位。
8. 主题法:用语词直接表达文献主题#
8.1 主题法与分类法#
| 维度 | 分类法 | 主题法 |
|---|---|---|
| 核心符号 | 分类号 | 规范语词或自然语言词 |
| 主要结构 | 学科体系、等级关系 | 字顺入口 + 词间语义关系 |
| 强项 | 系统浏览、排架、学科聚类 | 特定主题直接检索 |
| 局限 | 同一主题可能因学科视角分散 | 容易割裂完整知识体系 |
二者是互补关系:分类法告诉用户主题处于知识体系的什么位置,主题法告诉用户可以用什么词直接找到它。
8.2 自然语言主题法与受控主题法#
- 关键词法:直接选取题名、摘要或正文中的词,更新快但歧义多。
- 标题法:以规范标题及其细分形式表达主题,常具有先组特征。
- 叙词法:以概念单元为基础,系统控制等同、等级和相关关系。
8.3 先组与后组#
- 先组式:标引阶段已把多个概念组合成一个完整主题标目,例如“大学图书馆—参考咨询—人工智能应用”。
- 后组式:标引时分别记录“大学图书馆”“参考咨询”“生成式人工智能”,检索时再用 AND 组合。
先组式语义关系较明确,但组合数量容易膨胀;后组式灵活,但检索时可能出现错误组配。
8.4 主题标引流程#
- 明确用户和系统任务。
- 审读资源,确定中心主题和次要主题。
- 抽取概念并判断概念间关系。
- 把自然语言概念映射到规范词。
- 按规则选择专指词、组配词或主题标目。
- 检查完整性、一致性和必要的参照关系。
8.5 叙词表的三类核心关系#
- USE / UF:规范词与非规范入口词,处理同义或准同义关系。
- BT / NT:上位词与下位词,表达等级关系。
- RT:相关词,表达非等级的语义关联。
此外还需要**范围注释(Scope Note)**说明词义边界。只列出一堆词而没有关系与使用规则,不能算完整叙词表。
9. 典型主题词表与主题检索工具#
9.1 三类代表#
| 工具 | 领域与结构 | 学习重点 |
|---|---|---|
| LCSH | 美国国会图书馆主题标题表;标题和细分较丰富 | 规范标题、参照、细分与先组特点 |
| MeSH | 生物医学受控词表;描述词、入口词、限定词和树状层级 | 自动映射、上下位扩检、专业领域控制 |
| 《中国分类主题词表》 | 将分类语言与主题语言建立对应 | 分类号与主题词的双向转换和兼容 |
不同词表服务不同语料和用户。把通用词表直接搬到专业领域,往往会缺少专指概念;专业词表则可能增加普通用户门槛。
9.2 用 MeSH 理解“入口词—规范词—树结构”#
用户输入的日常词可以先映射到规范描述词;描述词再处于一个或多个树状位置中。检索时:
- 使用入口词映射解决同义表达。
- “爆炸”下位词提高查全率。
- 使用限定词表达疾病的诊断、药物治疗等方面。
- 只检索主要主题或关闭下位词扩展可提高查准率。
这是一套完整的“用户语言—规范概念—等级检索”机制,不只是医学术语字典。
9.3 贯穿案例的主题表达#
针对虚构论文,可形成候选概念:
- 高等学校图书馆
- 生成式人工智能
- 知识服务
- 参考咨询
- 服务评价
- 检索增强生成(RAG)
受控标引时应查词表确认规范形式和专指度;自然语言关键词则可保留“大语言模型”“智能问答”等新表达。两套词汇并存,既支持稳定聚合,也照顾新词与用户语言。
9.4 主题检索的扩检与缩检#
扩检:
- 加入同义词、缩写、旧称和外文词。
- 使用上位词或允许下位词自动展开。
- 使用 OR 连接同类表达。
- 放宽字段、截词或邻近距离。
缩检:
- 使用更专指的主题词。
- 加入限定词、方面词或另一个概念。
- 限定主题字段、题名字段或主要主题。
- 用 AND、短语检索和必要的 NOT 消歧。
10. 自然语言标引、自动标引与语义检索#
10.1 控制语言与自然语言#
| 维度 | 控制语言 | 自然语言 |
|---|---|---|
| 一致性 | 高,可聚合同义表达 | 低,同义词和词形变体较多 |
| 歧义 | 有范围注释和关系控制 | 多义词容易造成噪声 |
| 成本 | 标引与维护成本高 | 获取快、更新及时 |
| 用户门槛 | 需要了解词表或映射机制 | 接近日常表达 |
| 典型应用 | 分类表、主题词表、叙词表 | 关键词、全文检索 |
现代系统通常不是二选一,而是让用户用自然语言提问,再通过同义映射、实体识别、词表或本体增强检索。
10.2 中文切词#
中文没有天然空格,自动处理首先要确定词边界。常见方法:
- 基于词典的最大匹配。
- 基于词频、互信息等统计特征。
- 基于序列标注、神经网络和预训练模型。
切词错误会向后传播:“高校图书馆”被切成“高校 / 图书 / 馆”时,主题识别和向量表示都会受到影响。
10.3 Zipf 定律与 TF-IDF#
Zipf 定律揭示少量词高频、大量词低频。高频词往往区分度不足,因此不能只用词频判断主题重要性。
是文档总数, 是包含词 的文档数。某词在当前文档中常见、在整个集合中少见时,权重通常较高。
10.4 向量空间与嵌入#
查询和文档可表示为向量,用余弦相似度比较方向:
- TF-IDF / 词袋向量:可解释、稀疏,不直接理解上下文。
- Word2Vec 等静态词向量:相似词空间接近,但同一词通常只有一个表示。
- BERT 等上下文嵌入:词义随上下文变化,更适合语义匹配。
向量相似不等于事实正确,也不天然遵守学科边界。控制词表和本体仍可用于标准化、消歧、过滤和结果解释。
10.5 自动标引的三种任务#
- 自动抽词:直接从原文选择关键词。
- 自动赋词:把文本映射到受控词表中的规范词。
- 自动分类:预测资源所属类目或多个标签。
评价自动标引时不能只看总体准确率,还应检查长尾类目、类别不平衡、新术语、跨学科资源和人工一致性。
10.6 RAG 与知识组织#
RAG 的典型链条是:
文档解析 → 切块 → 元数据与权限处理 → 建立关键词/向量索引 → 召回 → 重排 → 生成 → 引证
知识组织可在多个环节介入:
- 用元数据过滤时间、类型、来源和权限。
- 用词表扩展同义词并规范实体。
- 用分类与本体补充上下位关系。
- 用稳定标识符维护引用和来源。
- 用粒度规则减少切块断义。
所以 RAG 不是跳过信息组织,而是把信息组织从目录记录延伸到检索管线。
11. 网络信息资源组织#
11.1 网络资源的特点#
网络资源分布式存在,具有超文本结构、多媒体形态、更新快速、数量巨大、质量不一和边界不稳定等特点。单靠集中式人工标引无法承担全部组织任务。
11.2 四种组织方式#
- 主题树:按目录层级组织,便于浏览。
- 数据库方式:用结构化字段保存并按需查询,典型于 Deep Web。
- 文件与全文索引:抓取、解析文本,建立倒排索引。
- 超文本方式:用链接把不同空间的信息单元组织成网络。
11.3 内容分析与链接分析#
- 基于内容:比较关键词、主题、元标签或语义向量。
- 基于链接:把链接视为权威或推荐信号,典型方法包括 PageRank、HITS。
PageRank 的一种常见归一化表达为:
是阻尼系数, 是网页总数, 是链向 的网页, 是 的出链数。有些教材把常数项写成 ,差异来自归一化约定。
11.4 Folksonomy#
Folksonomy 是用户用自由标签共同组织资源的方式。它开放、平面、反应新概念快,也能呈现群体视角;问题是同义、多义、拼写变体、恶意标签和粒度不一。可通过标签推荐、规范化、聚类和受控词映射改善质量。
11.5 Web 1.0、Web 2.0 与语义网#
| 维度 | Web 1.0 | Web 2.0 | 语义网语境中的 Web 3.0 |
|---|---|---|---|
| 核心特征 | 单向发布 | 用户参与、UGC | 机器可理解语义、跨源关联 |
| 组织重点 | 目录、网页、超链接 | 标签、社交关系 | URI、RDF、本体、知识图谱 |
| 变化本质 | 文件网络 | 社会参与和平台化 | 数据与语义层增强 |
这里的 Web 3.0 指课程中的语义网,不等同于加密货币行业常说的 Web3。
11.6 语义网的技术层次#
- Unicode:跨语言字符表达。
- URI / IRI:统一标识资源。
- XML:提供结构化语法。
- RDF / RDFS:描述三元组与基础语义。
- OWL:表达本体、概念关系和更强约束。
11.7 移动环境#
移动设备屏幕小、操作碎片化、情境依赖强。组织设计应压缩层级、卡片化表达,并合理利用位置、时间和传感器信息进行情境推荐,同时遵守最小必要、知情同意和权限隔离等隐私原则。
12. 信息检索系统与评价#
12.1 检索系统结构#
- 资源经描述与标引进入文档集合。
- 系统根据字段、词项或向量建立索引。
- 用户把信息需求转化为查询。
- 查询表示与文档表示匹配并排序。
- 用户查看结果、点击、修改查询,形成反馈。
按组织方式可形成目录、文摘索引、数据库、全文搜索引擎、知识图谱和 RAG 问答系统。
12.2 检索类型#
- 已知资源检索:目标明确,强调识别与定位。
- 主题检索:围绕主题获取相关资源。
- 探索性检索:需求在浏览、比较和反馈中逐渐形成。
- 目的性浏览:沿分类、引文、作者、标签或推荐逐步进入。
12.3 布尔逻辑#
- AND:取交集,缩小范围,通常提高查准率。
- OR:取并集,扩大范围,通常提高查全率。
- NOT:排除集合,用于消歧,但可能误删相关资源。
- XOR:只满足 A 或 B 之一,实际检索中较少使用。
贯穿案例的查询可以写成:
(“生成式人工智能” OR “大语言模型” OR RAG)AND (“高校图书馆” OR “大学图书馆”)AND (“知识服务” OR “参考咨询”)不同数据库的字段代码、引号、截词和邻近算符并不通用,正式检索前要查平台帮助。
12.4 查全率、查准率与 F1#
| 实际相关 | 实际不相关 | |
|---|---|---|
| 系统检出 | ||
| 系统未检出 |
12.5 一道完整计算例题#
某主题共有 80 篇相关文献。系统检出 50 篇,其中 40 篇相关:
- :相关且检出。
- :不相关但误检。
- :相关但漏检。
结论:结果集较干净,但漏掉一半相关文献。若用于系统综述,应优先扩展同义词和上位概念;若用于普通问答,则可能更重视前几条结果质量。
12.6 高查准不等于好系统#
只返回 1 篇且这 1 篇相关,查准率可以是 100%,但大量相关文献未被找到。评价必须结合任务、排序和成本。常见补充指标还有 Precision@k、MAP、MRR、nDCG、响应时间、覆盖范围、数据新鲜度和用户满意度。
13. 贯穿案例:把整套方法串起来#
现在把虚构论文完整走一遍。
13.1 界定资源#
- 资源层次:论文个体。
- 组成部分:题名、作者、摘要、正文、参考文献、图表。
- 关系:刊载于某期刊;引用其他文献;由作者和机构创作。
13.2 信息描述#
- 外部特征:题名、作者、期刊、年份、卷期、语言、资源类型、标识符。
- 内容特征:高校图书馆、生成式人工智能、知识服务、参考咨询、服务评价。
- 管理信息:来源、访问权限、文件格式、采集与更新时间。
13.3 分类标引#
先判断研究目的:它讨论的是图书馆知识服务,而非训练大模型的新算法。因此在图书馆学/信息服务范围选择主类,再按现行类表处理高校、人工智能应用和评价等方面。
13.4 主题标引#
- 规范词候选:高等学校图书馆、知识服务、人工智能、服务评价。
- 自然语言补充:生成式人工智能、大语言模型、RAG、智能参考咨询。
- 关系:生成式人工智能是人工智能的下位概念;RAG 与智能问答相关。
13.5 建立检索入口#
- 已知项入口:题名、作者、期刊、标识符。
- 主题入口:规范主题词、分类号、关键词。
- 关系入口:作者机构、引用文献、相似论文。
- 全文入口:摘要和正文词项、语义向量。
13.6 检索与评价#
先用规范词和自然语言同义词组成查询,再根据误检和漏检修订:
- 漏检多:加入“大模型”“智能问答”、上位词和英文表达。
- 误检多:限定主题字段、加入“高校图书馆”,排除纯算法论文。
- 结果排序不佳:用日期、来源质量、被引关系或语义重排调整。
这一案例说明,信息组织的最终产物不是某个孤立号码或词,而是一组可解释、可维护、可被检索系统利用的资源表示。
14. 易错辨析与答题模板#
14.1 十组易错概念#
| 容易混淆 | 正确区分 |
|---|---|
| 信息描述 vs 元数据 | 前者是活动,后者是结构化结果 |
| MARC vs 编目规则 | MARC 是编码格式,内容规则决定记录什么、怎样记录 |
| XML vs RDF | XML 主要表达语法结构,RDF 表达资源关系语义 |
| FRBR vs BIBFRAME | FRBR 是经典书目概念模型;BIBFRAME 是面向关联数据的模型和词汇 |
| 分类号 vs 索书号 | 分类号表达主题位置;索书号还要区分并定位具体馆藏 |
| 类目索引 vs 类表 | 索引用于找候选类,最终判断必须回到类表和注释 |
| 主题词 vs 关键词 | 主题词受规范控制;关键词可直接来自自然语言 |
| 标题法 vs 叙词法 | 标题法常先组;叙词法强调概念单元及三类关系 |
| DDC vs UDC | 都用十进标记,但 UDC 的分析—综合和符号组配能力更强 |
| 高查准率 vs 高质量 | 还要看查全、排序、任务、覆盖与成本 |
14.2 名词解释模板#
按“属概念 + 核心构成或机制 + 作用”回答。
例:叙词表是一种受控词汇工具,由规范叙词及其等同、等级和相关关系构成,用于统一主题表达、支持标引一致性和查询扩展。
14.3 比较题模板#
按“共同点 + 差异维度 + 使用场景 + 联系或趋势”回答。至少比较:
- 表达符号。
- 组织结构。
- 标引阶段与检索阶段。
- 优点、局限和适用资源。
常见组合:分类法与主题法、控制语言与自然语言、等级列举与分面组配、TF-IDF 与语义嵌入。
14.4 场景分析模板#
- 界定资源与组织粒度。
- 明确用户、任务和系统条件。
- 设计描述元素和规范控制。
- 分析主题并选择分类法、词表或本体。
- 建立字段索引、全文索引或向量索引。
- 设计浏览、查询和结果展示。
- 用查全、查准、效率、可用性与维护成本评价。
14.5 计算题模板#
- 查全/查准:先画 表,确定 、、、 再代公式。
- TF-IDF:先求文档频率 ,再求 ,最后乘词频。
- 余弦相似度:点积 → 两个模长 → 相除。
- PageRank:找入链页面 → 看各自 PageRank 与出链数 → 乘阻尼系数并加随机跳转项。
15. 一页式速记#
信息组织根据用户任务,对资源的外部特征和内容特征进行选择、描述、标引、排列与维护,使资源能够被识别、聚合、区分、关联和检索。描述活动产生元数据;分类法用知识体系中的位置表达主题,主题法用语词直接提供入口;控制语言保证一致性,自然语言保证及时性和用户友好,现代系统常把二者结合。分类标引先分析学科视角和研究目的,再查索引、回类表、复分组配;主题标引则从自然语言概念映射到规范词,并通过 USE/UF、BT/NT、RT 控制关系。检索系统把文档表示与查询表示匹配,布尔检索负责集合运算,TF-IDF、向量和链接分析负责权重与排序;查全率衡量漏检,查准率衡量误检,F1 综合二者。网络和 AI 并未取消信息组织,而是把描述、规范控制、分类、本体和标识符扩展到知识图谱、语义检索与 RAG 管线。
参考与延伸#
- 清华大学出版社:《信息组织》内容简介与公开目录
- DCMI Metadata Terms
- MARC 21 Format for Bibliographic Data
- BIBFRAME 2.0 Model
- RDF Concepts and Abstract Data Model
- IFLA Library Reference Model
- OCLC:Dewey Decimal Classification
- Library of Congress Classification
- UDC Consortium:About UDC
- Library of Congress Subject Headings
- National Library of Medicine:Introduction to MeSH