Skip to content

信息组织课程笔记

从资源描述、分类标引到语义检索

· 53 min · 信息组织 / 图书馆学 / 课程笔记

0. 学习导航:先建立一张地图#

0.1 信息组织究竟在解决什么#

信息组织面对的不是“信息太少”,而是资源很多、表达不一、关系隐蔽,用户又无法准确说出自己需要什么。它要在资源与用户之间建立一套稳定的中介结构,使资源:

因此,信息组织可以压缩为一条加工链:

资源界定 → 特征分析 → 信息描述 → 内容标引 → 建立索引 → 检索匹配 → 评价与维护

0.2 三层结构#

层次核心问题主要成果
描述层资源“是什么”元数据记录、标识符、责任关系
语义层资源“讲什么、与什么相关”分类号、主题词、关键词、本体关系
检索层用户“怎样找到它”目录、索引、分面、查询与排序

0.3 贯穿全篇的虚构案例#

后文反复使用一篇虚构论文:

李明:《生成式人工智能支持高校图书馆知识服务:方法与评价》,2026 年发表于《图书情报研究》,讨论大语言模型、RAG 在高校图书馆参考咨询中的应用与评价。

同一资源会依次经历:

  1. 描述题名、作者、日期和载体。
  2. 判断中心主题与文献类型。
  3. 选择分类位置。
  4. 赋予主题词和关键词。
  5. 建立索引并设计查询式。
  6. 用查全率、查准率评价结果。

这能看出:描述、分类、主题标引和检索不是四件孤立的事,而是对同一资源的不同表示。

1. 导论:信息为什么需要组织#

1.1 “组织”的三件事#

任何信息组织系统都要回答:

常见概括是 描述(Description)—排列(Arrangement)—展示/检索(Presentation/Retrieval)。信息组织不是简单“整理好看”,而是根据使用需要,对资源的内容特征与外部特征进行选择、处理、序化和提供。

1.2 定义中的三个维度#

外部特征常支持已知项检索;内容特征主要支持主题发现。二者共同构成资源的可检索表示。

1.3 数据、信息与知识#

层次简要定义判断重点例子
数据 Data尚未解释的符号或事实记录需要解释框架字符串 G250.7
信息 Information在语境中获得意义、可供判断的数据依赖任务与目的G250.7 是一个分类标记
知识 Knowledge经过组织、理解和推理形成的认知结构强调联系与应用能据此理解资源的学科位置并继续浏览

DIKW 不是不可逆的绝对等级。同一对象在不同任务里可以承担数据、信息或知识的角色。

1.4 Buckland 的四种信息观#

抽象具体
实体Information-as-knowledge:作为认知成果的信息Information-as-thing:作为物的文献、数据和载体
过程Information-as-process:获知与认知更新Information processing:数据加工、传递和运算

信息系统能够直接保存和组织的通常是 information-as-thing;它的价值则在于支持 information-as-process,最终影响人的知识状态。

1.5 信息组织的对象与粒度#

粒度越细,检索越精确,加工成本也越高。组织前必须先明确系统边界:一篇论文在期刊数据库中是一个资源个体,在引文数据库中又会拆成作者、机构、参考文献等多个可关联单元。

1.6 信息组织与信息检索#

信息组织提供文档表示,信息检索处理需求表示,两者在匹配环节相遇:

资源 → 描述与标引 → 文档表示 / 索引 ↔ 查询表示 ← 用户需求

组织质量会直接限制检索上限:没有稳定的名称形式、主题表达和关系记录,再先进的排序算法也只能在混乱的数据上工作。

2. 信息组织原理:控制什么,为什么控制#

2.1 三个理论基础#

2.2 信息组织的四类活动#

  1. 选择:确定资源范围、收录标准与组织粒度。
  2. 描述和标引:记录形式特征,分析并表达主题内容。
  3. 设计交互:建立目录、索引、分类导航、分面与搜索入口。
  4. 维护和治理:修订规范记录、更新词表、管理权限和保存信息。

2.3 三项保证原则#

三者可能冲突:学术上最精确的术语不一定是用户会输入的词;用户最常说的词也不一定适合作为稳定的规范标目。系统需要在专业准确性与可用性之间建立映射。

2.4 什么是规范控制#

规范控制不是简单“统一格式”,而是为实体或概念选择稳定的规范形式,同时保存变体、关系和使用说明。常见控制对象包括:

规范记录通常包含:规范形式、变体形式、标识符、适用范围、关系与来源说明。它使“同物聚集、异物区分”成为可能。

2.5 从分类表到本体:KOS 光谱#

知识组织系统(Knowledge Organization Systems, KOS)并非只有分类表:

工具主要结构典型用途
术语表 Glossary术语 + 定义统一基本含义
分类体系 Taxonomy以上下位层级为主导航、聚类、权限或产品目录
主题词表 / 叙词表等同 + 等级 + 相关关系控制标引、查询扩展
本体 Ontology概念、属性、关系、约束与公理机器推理、语义互操作

从左到右,语义关系更明确,建设与维护成本也更高。不能因为本体形式化程度高,就在所有场景中取代简单词表。

2.6 信息组织系统的四个要素#

分析一个系统时连续追问:谁在找?找什么?为什么找?用什么语言表达?系统凭什么匹配?结果怎样反馈?

3. 信息描述:把资源变成可操作的记录#

3.1 描述活动与描述结果#

信息描述是依据规则,对资源特征进行分析、选择和记录的活动;其结构化结果就是元数据记录。记录并非资源本身,而是资源在系统中的替代物(surrogate)

这一区分很重要:搜索目录时,系统最先匹配的是记录中的字段与索引,不是书架上的实体本身。

3.2 描述什么:四个观察维度#

维度例子特点
外部、静态题名、责任者、出版者、ISBN、分类号相对稳定,常用于识别与定位
内部、静态摘要、正文用词、目录、图表来自内容本身
外部、动态引用、链接、下载量、点阅量随时间和平台变化
内部、动态版本修订、网页内容更新、法规有效状态需要版本与时间管理

不能把“元数据”理解成只记录题名和作者。保存、版权、技术环境和关系数据同样属于元数据体系。

3.3 元数据三大类型#

3.4 元数据支持的用户任务#

  1. 发现:通过题名、作者、主题等入口找到候选资源。
  2. 识别:确认记录指向的究竟是哪一个资源。
  3. 选择:比较版本、语言、载体和适用对象。
  4. 获取:知道馆藏地、链接、访问条件或借阅状态。
  5. 探索:沿作者、作品、主题和引用关系继续发现。
  6. 管理:记录来源、权利、保存状态与生命周期。

3.5 字段、元素、取值与检索点#

同一个元素未必自动成为检索点;能检索也不意味着已进行规范控制。例如系统可以搜索所有题名词,但题名词通常不是规范主题词。

3.6 描述质量#

一条高质量记录应做到:

4. 信息描述工作与元数据标准#

4.1 一个方案如何设计#

  1. 界定资源范围和描述粒度。
  2. 明确用户任务和使用场景。
  3. 复用已有标准,确定本地扩展。
  4. 为每个元素规定名称、定义、取值类型、是否必填、是否可重复。
  5. 为主题、类型、角色等字段选择受控词表。
  6. 确定唯一标识符、编码语法和交换方式。
  7. 用样例记录、检索任务和数据校验反复测试。

这套“字段规则的规则”也叫元数据方案或应用纲要。只有字段名而没有定义、取值规范和约束,不足以形成可互操作的方案。

4.2 Dublin Core 十五项#

Dublin Core 是跨领域、低门槛的资源描述元素集。十五个核心元素可以按记忆组归纳:

记忆组元素
内容Title、Subject、Description、Type、Source、Relation、Coverage
责任与权利Creator、Publisher、Contributor、Rights
生命周期与载体Date、Format、Identifier、Language

其中 Identifier 是特定语境中的无歧义引用,如 ISBN、DOI 或持久 URI;Subject 表达资源主题。实际关联数据项目通常使用更丰富的 DCMI Metadata Terms,而不止十五项基础元素。

4.3 用 Dublin Core 描述贯穿案例#

元素示例值
Title生成式人工智能支持高校图书馆知识服务:方法与评价
Creator李明
Subject高校图书馆;生成式人工智能;知识服务;服务评价
TypeText
Date2026
Languagezh-CN
Identifierurn:example:paper-01
Relation刊载于《图书情报研究》2026 年第 2 期

这张表仍只是示范记录。正式方案还需说明 Subject 是否受控、姓名采用什么规范形式、Date 遵守何种格式,以及 Identifier 由谁分配。

4.4 FRBR:区分作品与载体#

传统 FRBR 第一组实体最适合用“同一小说的不同版本”理解:

  1. 作品 Work:抽象的创作内容。
  2. 内容表达 Expression:某种语言、演奏或修订形成的表达。
  3. 载体表现 Manifestation:某出版社、某版次形成的一组物化产品。
  4. 单件 Item:图书馆实际持有的某一册或某个文件副本。

第二组描述个人、团体等责任主体;第三组描述作为主题的概念、对象、事件和地点。其价值是把传统“一条记录包办全部”的结构拆成实体与关系网络。

标准更新:IFLA LRM 已整合 FRBR、FRAD、FRSAD。考试仍应掌握 FRBR 的经典层次,但理解当前标准脉络时应以 LRM 的统一实体关系视角为准。

4.5 MARC、XML、RDF 与 BIBFRAME 不在同一层次#

标准或技术它是什么关键结构不要误解为
MARC 21书目数据的机读编码格式记录头、目录、字段、指示符、子字段编目内容规则本身
XML通用标记语法元素、属性、层次与 Schema自带书目语义的模型
RDFWeb 资源图数据模型主语—谓语—宾语三元组只能用 XML 书写的格式
BIBFRAME面向关联数据的书目模型与词汇Work、Instance、Item 及其关系MARC 字段的简单改名

RDF 关注“谁与谁有什么关系”;XML 关注“文档怎样结构化表达”。RDF 可以采用 Turtle、JSON-LD、RDF/XML 等多种序列化。

4.6 一个最小 RDF 例子#

@prefix dcterms: <http://purl.org/dc/terms/> .
@prefix dcmitype: <http://purl.org/dc/dcmitype/> .
<urn:example:paper-01>
dcterms:title "生成式人工智能支持高校图书馆知识服务:方法与评价"@zh ;
dcterms:creator <urn:example:person-li-ming> ;
dcterms:subject <urn:example:concept-generative-ai> ;
dcterms:type dcmitype:Text .

这里的价值不在 Turtle 标点,而在于题名是字面量,作者和主题则被建模为可继续描述、可跨系统链接的资源。

5. 分类法:用类目体系表达知识位置#

5.1 类、分类和分类法#

分类法的核心不是“给书贴号码”,而是用知识体系中的位置表达主题关系,并支持系统浏览和相近资源聚类。

5.2 类目划分的逻辑要求#

现实知识经常跨学科,绝对互斥很难实现,因此分类法还需要交替类目、参见、复分和组配等机制处理多维主题。

5.3 分类法的组成#

好的标记应具有简明性、层次表达能力、可扩充性和适度助记性。但符号只是类目的地址,不能脱离类目含义和注释独立解释。

5.4 等级列举与分面组配#

维度等级列举分类法分面组配分类法
基本思路预先列出大量类目,按等级逐级展开分析主题的基本概念或分面,使用时组合
长处结构直观,便于浏览、排架与共用灵活,适合复杂主题和多维属性
局限类目容易膨胀,新主题适应较慢规则复杂,对分析和组配能力要求高
代表《中图法》、DDC、LCC冒号分类法;UDC 具有明显分析—综合特征

现实分类法常是混合型:以列举体系为主体,同时使用复分表和组配符号增强表达能力。

5.5 分面分析#

分面是按某一共同特征形成的一组概念。经典冒号分类法常用 PMEST 帮助分析:

它的意义不在背五个英文词,而在于把“一个复杂主题”拆成可重组的概念单元,并规定稳定的引用次序。

5.6 多主题文献的关系判断#

主题词出现次数最多,不必然就是分类主题。分类首先看研究目的、学科视角和论证重心。

6. 主要分类法:同为分类,设计思想并不相同#

6.1 五种代表性分类法#

分类法顶层结构与标记主要特点复习抓手
《中国图书馆分类法》5 个基本部类、22 个基本大类;字母数字混合中国图书馆常用,列举为主并配复分机制基本大类、复分与仿分
DDC10 个基本大类;十进数字数字层级清楚,配表和相关索引,全球应用广10—100—1000 的十进展开
LCC21 个基本大类;字母与数字组合为美国国会图书馆馆藏发展,学术馆常见字母大类、类表分册、列举性较强
UDC十进数字 + 多种连接和辅助符号分析—综合能力强,可表达复杂主题主表、共同辅助表、组配符号
CC 冒号分类法分面与冒号等符号典型分面组配思想PMEST 与引用次序

6.2 《中图法》的基本结构#

复分是使用通用或专类复分表表达地区、时代、形式等共同因素;仿分是参照另一类已经展开的结构设置本类下位类。常见记忆句“先分类,后分析”强调先确定学科归属,再用复分等方式补充地区、时代或文献形式。

6.3 DDC 与 UDC 为什么不能混称#

二者都用十进数字,但设计能力不同:

“都用小数”只是表面相似;真正要比较的是类目结构、组配能力和使用场景。

6.4 贯穿案例如何确定分类位置#

虚构论文同时出现“大语言模型”“高校图书馆”“知识服务”“评价”。判断步骤:

  1. 看题名、摘要和结论确定研究目的。
  2. 判断是研究 AI 算法本身,还是研究 AI 在图书馆服务中的应用。
  3. 本文主要解决高校图书馆知识服务问题,因此应先在图书馆学/信息服务范围寻找类目。
  4. 再依现行分类表规则表达高校、智能技术或评价等次要因素。
  5. 最终类号必须查阅当前类表与注释,不能仅凭关键词猜号。

这体现了应用关系中的核心原则:分类跟着学科视角和研究目的走,不跟着最“新”或最醒目的词走。

7. 分类标引与分类检索工具#

7.1 分类标引的完整流程#

  1. 资源审读:查看题名、摘要、目录、前言、结论与责任说明。
  2. 主题分析:判断主题对象、方面、关系和学科视角。
  3. 概念转换:把自然语言主题转换为分类法中的类目概念。
  4. 查表定位:先用索引寻找候选类,再回到类目体系和注释核实。
  5. 组配复分:按规则加入地区、时代、形式等因素。
  6. 校核记录:检查专指度、一致性、号码顺序和历史沿用。

类目索引只是入口,不是分类结论。找到索引词后必须回到类表上下文检查范围注释、上下位类和参见关系。

7.2 专指度与一致性#

只追求专指度可能造成类号过细和数据稀疏;只追求一致性又可能牺牲新主题表达。实际工作要受类表深度、馆藏规模和用户需求约束。

7.3 分类号、书次号与索书号#

所以分类号不是 ISBN,索书号也不等于分类号。前者表达知识位置,后者指向具体馆藏排列位置。

7.4 分类检索怎样扩展和缩小#

分类导航的优势是即使用户不知道准确术语,也能通过知识结构逐步定位。

8. 主题法:用语词直接表达文献主题#

8.1 主题法与分类法#

维度分类法主题法
核心符号分类号规范语词或自然语言词
主要结构学科体系、等级关系字顺入口 + 词间语义关系
强项系统浏览、排架、学科聚类特定主题直接检索
局限同一主题可能因学科视角分散容易割裂完整知识体系

二者是互补关系:分类法告诉用户主题处于知识体系的什么位置,主题法告诉用户可以用什么词直接找到它。

8.2 自然语言主题法与受控主题法#

8.3 先组与后组#

先组式语义关系较明确,但组合数量容易膨胀;后组式灵活,但检索时可能出现错误组配。

8.4 主题标引流程#

  1. 明确用户和系统任务。
  2. 审读资源,确定中心主题和次要主题。
  3. 抽取概念并判断概念间关系。
  4. 把自然语言概念映射到规范词。
  5. 按规则选择专指词、组配词或主题标目。
  6. 检查完整性、一致性和必要的参照关系。

8.5 叙词表的三类核心关系#

此外还需要**范围注释(Scope Note)**说明词义边界。只列出一堆词而没有关系与使用规则,不能算完整叙词表。

9. 典型主题词表与主题检索工具#

9.1 三类代表#

工具领域与结构学习重点
LCSH美国国会图书馆主题标题表;标题和细分较丰富规范标题、参照、细分与先组特点
MeSH生物医学受控词表;描述词、入口词、限定词和树状层级自动映射、上下位扩检、专业领域控制
《中国分类主题词表》将分类语言与主题语言建立对应分类号与主题词的双向转换和兼容

不同词表服务不同语料和用户。把通用词表直接搬到专业领域,往往会缺少专指概念;专业词表则可能增加普通用户门槛。

9.2 用 MeSH 理解“入口词—规范词—树结构”#

用户输入的日常词可以先映射到规范描述词;描述词再处于一个或多个树状位置中。检索时:

这是一套完整的“用户语言—规范概念—等级检索”机制,不只是医学术语字典。

9.3 贯穿案例的主题表达#

针对虚构论文,可形成候选概念:

受控标引时应查词表确认规范形式和专指度;自然语言关键词则可保留“大语言模型”“智能问答”等新表达。两套词汇并存,既支持稳定聚合,也照顾新词与用户语言。

9.4 主题检索的扩检与缩检#

扩检:

缩检:

10. 自然语言标引、自动标引与语义检索#

10.1 控制语言与自然语言#

维度控制语言自然语言
一致性高,可聚合同义表达低,同义词和词形变体较多
歧义有范围注释和关系控制多义词容易造成噪声
成本标引与维护成本高获取快、更新及时
用户门槛需要了解词表或映射机制接近日常表达
典型应用分类表、主题词表、叙词表关键词、全文检索

现代系统通常不是二选一,而是让用户用自然语言提问,再通过同义映射、实体识别、词表或本体增强检索。

10.2 中文切词#

中文没有天然空格,自动处理首先要确定词边界。常见方法:

切词错误会向后传播:“高校图书馆”被切成“高校 / 图书 / 馆”时,主题识别和向量表示都会受到影响。

10.3 Zipf 定律与 TF-IDF#

Zipf 定律揭示少量词高频、大量词低频。高频词往往区分度不足,因此不能只用词频判断主题重要性。

tfidf(t,d)=tf(t,d)×idf(t)\operatorname{tfidf}(t,d)=\operatorname{tf}(t,d)\times\operatorname{idf}(t) idf(t)=logNdf(t)\operatorname{idf}(t)=\log\frac{N}{\operatorname{df}(t)}

NN 是文档总数,df(t)\operatorname{df}(t) 是包含词 tt 的文档数。某词在当前文档中常见、在整个集合中少见时,权重通常较高。

10.4 向量空间与嵌入#

查询和文档可表示为向量,用余弦相似度比较方向:

cos(θ)=qdqd\cos(\theta)=\frac{\mathbf{q}\cdot\mathbf{d}}{\lVert\mathbf{q}\rVert\lVert\mathbf{d}\rVert}

向量相似不等于事实正确,也不天然遵守学科边界。控制词表和本体仍可用于标准化、消歧、过滤和结果解释。

10.5 自动标引的三种任务#

评价自动标引时不能只看总体准确率,还应检查长尾类目、类别不平衡、新术语、跨学科资源和人工一致性。

10.6 RAG 与知识组织#

RAG 的典型链条是:

文档解析 → 切块 → 元数据与权限处理 → 建立关键词/向量索引 → 召回 → 重排 → 生成 → 引证

知识组织可在多个环节介入:

所以 RAG 不是跳过信息组织,而是把信息组织从目录记录延伸到检索管线。

11. 网络信息资源组织#

11.1 网络资源的特点#

网络资源分布式存在,具有超文本结构、多媒体形态、更新快速、数量巨大、质量不一和边界不稳定等特点。单靠集中式人工标引无法承担全部组织任务。

11.2 四种组织方式#

11.3 内容分析与链接分析#

PageRank 的一种常见归一化表达为:

PR(A)=1dN+di=1nPR(Ti)C(Ti)PR(A)=\frac{1-d}{N}+d\sum_{i=1}^{n}\frac{PR(T_i)}{C(T_i)}

dd 是阻尼系数,NN 是网页总数,TiT_i 是链向 AA 的网页,C(Ti)C(T_i)TiT_i 的出链数。有些教材把常数项写成 1d1-d,差异来自归一化约定。

11.4 Folksonomy#

Folksonomy 是用户用自由标签共同组织资源的方式。它开放、平面、反应新概念快,也能呈现群体视角;问题是同义、多义、拼写变体、恶意标签和粒度不一。可通过标签推荐、规范化、聚类和受控词映射改善质量。

11.5 Web 1.0、Web 2.0 与语义网#

维度Web 1.0Web 2.0语义网语境中的 Web 3.0
核心特征单向发布用户参与、UGC机器可理解语义、跨源关联
组织重点目录、网页、超链接标签、社交关系URI、RDF、本体、知识图谱
变化本质文件网络社会参与和平台化数据与语义层增强

这里的 Web 3.0 指课程中的语义网,不等同于加密货币行业常说的 Web3。

11.6 语义网的技术层次#

11.7 移动环境#

移动设备屏幕小、操作碎片化、情境依赖强。组织设计应压缩层级、卡片化表达,并合理利用位置、时间和传感器信息进行情境推荐,同时遵守最小必要、知情同意和权限隔离等隐私原则。

12. 信息检索系统与评价#

12.1 检索系统结构#

  1. 资源经描述与标引进入文档集合。
  2. 系统根据字段、词项或向量建立索引。
  3. 用户把信息需求转化为查询。
  4. 查询表示与文档表示匹配并排序。
  5. 用户查看结果、点击、修改查询,形成反馈。

按组织方式可形成目录、文摘索引、数据库、全文搜索引擎、知识图谱和 RAG 问答系统。

12.2 检索类型#

12.3 布尔逻辑#

贯穿案例的查询可以写成:

(“生成式人工智能” OR “大语言模型” OR RAG)
AND (“高校图书馆” OR “大学图书馆”)
AND (“知识服务” OR “参考咨询”)

不同数据库的字段代码、引号、截词和邻近算符并不通用,正式检索前要查平台帮助。

12.4 查全率、查准率与 F1#

实际相关实际不相关
系统检出AABB
系统未检出CCDD
R=AA+CR=\frac{A}{A+C} P=AA+BP=\frac{A}{A+B} F1=2PRP+RF_1=\frac{2PR}{P+R}

12.5 一道完整计算例题#

某主题共有 80 篇相关文献。系统检出 50 篇,其中 40 篇相关:

R=4040+40=0.50R=\frac{40}{40+40}=0.50 P=4040+10=0.80P=\frac{40}{40+10}=0.80 F1=2×0.50×0.800.50+0.800.615F_1=\frac{2\times0.50\times0.80}{0.50+0.80}\approx0.615

结论:结果集较干净,但漏掉一半相关文献。若用于系统综述,应优先扩展同义词和上位概念;若用于普通问答,则可能更重视前几条结果质量。

12.6 高查准不等于好系统#

只返回 1 篇且这 1 篇相关,查准率可以是 100%,但大量相关文献未被找到。评价必须结合任务、排序和成本。常见补充指标还有 Precision@k、MAP、MRR、nDCG、响应时间、覆盖范围、数据新鲜度和用户满意度。

13. 贯穿案例:把整套方法串起来#

现在把虚构论文完整走一遍。

13.1 界定资源#

13.2 信息描述#

13.3 分类标引#

先判断研究目的:它讨论的是图书馆知识服务,而非训练大模型的新算法。因此在图书馆学/信息服务范围选择主类,再按现行类表处理高校、人工智能应用和评价等方面。

13.4 主题标引#

13.5 建立检索入口#

13.6 检索与评价#

先用规范词和自然语言同义词组成查询,再根据误检和漏检修订:

这一案例说明,信息组织的最终产物不是某个孤立号码或词,而是一组可解释、可维护、可被检索系统利用的资源表示

14. 易错辨析与答题模板#

14.1 十组易错概念#

容易混淆正确区分
信息描述 vs 元数据前者是活动,后者是结构化结果
MARC vs 编目规则MARC 是编码格式,内容规则决定记录什么、怎样记录
XML vs RDFXML 主要表达语法结构,RDF 表达资源关系语义
FRBR vs BIBFRAMEFRBR 是经典书目概念模型;BIBFRAME 是面向关联数据的模型和词汇
分类号 vs 索书号分类号表达主题位置;索书号还要区分并定位具体馆藏
类目索引 vs 类表索引用于找候选类,最终判断必须回到类表和注释
主题词 vs 关键词主题词受规范控制;关键词可直接来自自然语言
标题法 vs 叙词法标题法常先组;叙词法强调概念单元及三类关系
DDC vs UDC都用十进标记,但 UDC 的分析—综合和符号组配能力更强
高查准率 vs 高质量还要看查全、排序、任务、覆盖与成本

14.2 名词解释模板#

按“属概念 + 核心构成或机制 + 作用”回答。

例:叙词表是一种受控词汇工具,由规范叙词及其等同、等级和相关关系构成,用于统一主题表达、支持标引一致性和查询扩展。

14.3 比较题模板#

按“共同点 + 差异维度 + 使用场景 + 联系或趋势”回答。至少比较:

常见组合:分类法与主题法、控制语言与自然语言、等级列举与分面组配、TF-IDF 与语义嵌入。

14.4 场景分析模板#

  1. 界定资源与组织粒度。
  2. 明确用户、任务和系统条件。
  3. 设计描述元素和规范控制。
  4. 分析主题并选择分类法、词表或本体。
  5. 建立字段索引、全文索引或向量索引。
  6. 设计浏览、查询和结果展示。
  7. 用查全、查准、效率、可用性与维护成本评价。

14.5 计算题模板#

15. 一页式速记#

信息组织根据用户任务,对资源的外部特征和内容特征进行选择、描述、标引、排列与维护,使资源能够被识别、聚合、区分、关联和检索。描述活动产生元数据;分类法用知识体系中的位置表达主题,主题法用语词直接提供入口;控制语言保证一致性,自然语言保证及时性和用户友好,现代系统常把二者结合。分类标引先分析学科视角和研究目的,再查索引、回类表、复分组配;主题标引则从自然语言概念映射到规范词,并通过 USE/UF、BT/NT、RT 控制关系。检索系统把文档表示与查询表示匹配,布尔检索负责集合运算,TF-IDF、向量和链接分析负责权重与排序;查全率衡量漏检,查准率衡量误检,F1 综合二者。网络和 AI 并未取消信息组织,而是把描述、规范控制、分类、本体和标识符扩展到知识图谱、语义检索与 RAG 管线。

参考与延伸#