您当前的位置:首页 > CADAL项目标准规范丛书 CADAL数字图书馆知识标准规范及应用研究 > 下载地址1
CADAL项目标准规范丛书 CADAL数字图书馆知识标准规范及应用研究
- 名 称: CADAL项目标准规范丛书 CADAL数字图书馆知识标准规范及应用研究 - 下载地址1
- 下载地址:[下载地址1]
- 提 取 码:
- 浏览次数:3
发表评论
加入收藏夹
错误报告
目录| 新闻评论(共有 0 条评论) |
资料介绍
前 言
本书系“CADAL项目标准规范丛书”之一 , 对 CADAL建设过程中资源的存储方怯予以梳理 , 从实践出发进行总结归纳 , 系统地总结了数字资源的存储方法、通常采用的仓储标准及资源发布时可遵循的相关压缩规范。
本书共分 4 章 , 涵盖了存储的概念、数字资源长期保存的策略、数字对象存储的标准及数字资源索引与压缩四大部分内容 , 具体如下。
第 1 章 , 对数字资源的存储系统进行了详细的论述 , 包括对存储介质特点的介绍、存储系统结构的分析和存储设备的介绍。
第 2 章 , 论述了数字资源长期保存的概念模型、组织框架及保存策略。 数字资源长期保存是对数字资源进行摄入、保存和管理 , 在一定条件下提供服务或转移保存的活动。 数字信息资源长期保存是伴随信息数字化和服务网络化的发展而出现的 , 按数字资源保存时间可划分为长期保存、中期保存及短期保存。
第 3 章 , 论述了数字对象的存储标准 , 包括通用数字资源存储规范中数字资源存储文档(DRSS)结构描述 , 数字对象文本类型存储的标准、数字对象图像类型存储标准、数字对象音频类型存储标准及数字对象视频类型存储标准。
第 4 章 , 论述了数字资源索引与压缩标准 , 包括数字资源索引技术介绍和数字资源压缩规范介绍 , 以便于在实际数字资源发布时采用。
本书第 1 章和第 3 章由刘翔撰写 , 第 2 章由施干卫撰写 , 第 4 章由黄志强撰写。 另外 ,支文英主要负责书稿的校对工作。
由于作者水平有限 , 加之编写时间较为仓促 , 书中难免有疏漏和错误之处 , 恳请读者予以指正。
刘 翔
2018 年 8 月于浙江理工大学
目 录
第 1 章 存储系统简介 1
1 . 1 存储系统 1
1 . 2 存储介质 1
1 . 2. 1 光存储 2
1 . 2. 2 Flash 存储 2
1 . 2. 3 硬盘 4
1 . 3 存储系统结构 4
1 . 3 . 1 主机系统 4
1 . 3 . 2 连接方怯 6
1 . 3 . 3 存储设备 9
1 . 3 . 4 磁盘阵列 10
1 . 4 网络存储系统 16
1 . 4. 1 直连怯存储 16
1 . 4. 2 存储区域网络 17
1 . 4. 3 NAS 网络存储技术 25
1 . 4. 4 ⅠP SAN 34
1 . 5 对象存储系统 39
1 . 5 . 1 对象存储系统简介 40
1 . 5 . 2 OSD基本概念 41
1 . 5 . 3 对象存储文件系统体系结构 47
1 . 5 . 4 OSD的安全 53
1 . 6 信息生命周期管理 55
1 . 6 . 1 信息生命周期 56
1 . 6 . 2 信息生命周期的五个阶段 57
1 . 6 . 3 信息生命周期管理 57
1 . 6 . 4 ⅠLM 对企业的战略价值 58
1 . 6 . 5 ⅠLM 的实施方法 58
数字资源存储、仓储和发布的标准规范建设
1 . 6 . 6 信息生命周期管理实施的步骤 63
1 . 6 . 7 信息生命周期管理的战略 64
第 2 章 数字资源长期保存 65
2. 1 数字资源长期保存模型 65
2. 1 . 1 OAⅠS数字资源长期保存概念模型 65
2. 1 . 2 SⅠRF数字资源长期保存模型 68
2. 2 数字资源组织框架 69
2. 3 数字资源存储框架 69
2. 4 数字资源长期保存策略 70
2. 4. 1 首选介质一磁带存储 70
2. 4. 2 磁带存储系统的特点 71
2. 4. 3 磁带存储系统的类型 71
2. 4. 4 磁带存储系统的选择 73
2. 5 面向对象的并行文件系统与 SⅠRF 74
2. 6 推荐的存储架构模型 74
2. 7 文件及目录策略 75
第 3 章 数字对象存储标准 76
3 . 1 通用数字资源存储规范 76
3 . 1 . 1 数字资源存储文档 76
3 . 1 . 2 DRSS文档头节点 drssHdr 79
3 . 1 . 3 DRSS文档描述型元数据节点 dmdSec 82
3 . 1 . 4 DRSS文档管理型元数据节点 amdSec 85
3 . 1 . 5 DRSS文档文件节点 fileSec 89
3 . 1 . 6 DRSS文档结构图节点 structMap 94
3 . 1 . 7 DRSS文档属性组 101
3 . 2 数字对象文本类型存储标准 103
3 . 2. 1 文本文件 103
3 . 2. 2 编码 103
3 . 3 数字对象图像类型存储标准 112
3 . 3 . 1 文件大小 112
3 . 3 . 2 文件格怯 112
3 . 3 . 3 格怯版本 115
3 . 3 . 4 压缩模怯 115
3 . 3 . 5 压缩率 115
3 . 3 . 6 图像宽度 115
3 . 3 . 7 图像高度 116
3 . 3 . 8 色彩空间 116
3 . 3 . 9 图像来源 118
3 . 3 . 10 来源类型 118
3 . 3 . 11 图像获取设备信息 118
3 . 3 . 12 创建时间 118
3 . 3 . 13 创建者 118
3 . 3 . 14 创建设备 118
3 . 3 . 15 扫描仪信息 119
3 . 3 . 16 光学分辨率 119
3 . 3 . 17 扫描软件 120
3 . 3 . 18 数码相机信息 120
3 . 3 . 19 光圈值 121
3 . 3 . 20 曝光时间 122
3 . 3 . 21 ⅠsO值 123
3 . 4 数字对象音频类型存储标准 123
3 . 4. 1 音频块大小 123
3 . 4. 2 音频数据编码 123
3 . 4. 3 有损和无损 124
3 . 4. 4 频率与采样率 124
3 . 4. 5 采样位数 125
3 . 4. 6 位速 126
3 . 4. 7 采样字长 126
3 . 4. 8 音频压缩 128
3 . 4. 9 编码器 128
3 . 4. 10 音频格怯 129
3 . 4. 11 声道 134
3 . 4. 12 声场 135
3 . 4. 13 声场衰变和混响时间 137
3 . 5 数字对象视频类型存储标准 137
3 . 5 . 1 数据率 137
3 . 5 . 2 色彩 137
3 . 5 . 3 编码器 138
3
3 . 5 . 4 压缩率 139
3 . 5 . 5 帧 139
3 . 5 . 6 帧速率 139
3 . 5 . 7 采样率 140
3 . 5 . 8 显示比例 140
3 . 5 . 9 信号制怯 140
3 . 5 . 10 视频格怯 141
3 . 5 . 11 分辨率 145
第 4 章 数字资源索引与压缩 147
4. 1 数字资源索引技术 147
4. 1 . 1 索引技术概论 147
4. 1 . 2 XML索引及其分类 148
4. 1 . 3 数字资源文档的存取 149
4. 1 . 4 主流数据库管理系统的 XML索引 151
4. 2 数字资源压缩规范 155
4. 2. 1 数字资源压缩概述 155
4. 2. 2 文本数字资源的压缩 158
4. 2. 3 图像数字资源的压缩 159
4. 2. 4 视频数字资源的压缩 161
4. 2. 5 音频数字资源的压缩 163
4. 2. 6 推荐的数字资源压缩规范 165
参考文献 169
4
氵氵
氵
第 1 章 存储系统简介
1 . 1 存储系统
存储系统是用来保存数据,并能够按照用户请求提供相应数据的部件、设备和计算机系统。事实上,存储设备在本质上也是一种计算机系统,例如内存条本身也具有计算部件和寄存器。 本质上,存储系统使得信息在时间上得以延续,而不会消逝 ; 而计算机存储系统使得数字化信息得以保持在介质之中,在需要的时候能够提供及时的存取。
广义的存储设备包括 Cpu 中的寄存器、多级高速缓存(cache)、内部存储系统和外部存储系统。 内存也称为内存系统(memory system) ,而外部存储系统称作存储系统(storage system)。狭义的存储系统通常就仅仅指外部存储系统。 相对于内存系统,存储系统必须提供大容量和非易失性的数据存储能力,非易失性使得存储系统在掉电或者断连主机的情况下能够正确地保存数据。
存储网络的出现,使得存储的层次更加复杂,一个远地存储系统可以为主机提供存储服务,极大地扩充主机可以使用的存储空间,但同时引入了存储空间管理的复杂性。 因为每个存储设备总是要提供相应的存储空间供系统存取数据,必须把这些独立的、基础的物理存储空间构成统一使用的逻辑存储空间,这也是存储虚拟化所做的工作,但随着数据存储系统中存储设备和存储层次的增加,这种统一过程的复杂度和难度也相应地增加。
存储虚拟化(storage virtualizatio")最通俗的理解就是对存储硬件资源进行抽象化表现。通过将一个(或多个) 目标(target)服务或功能与其他附加的功能集成,统一提供有用的全面功能服务。 典型的虚拟化包括如下一些情况:屏蔽系统的复杂性,增加或集成新的功能,仿真、整合或分解现有的服务功能等。 虚拟化是作用在一个或者多个实体上的,而这些实体则是用来提供存储资源或服务的。
1 . 2 存储介质
在原始社会,人类用树枝和石头等来记录数据,随后人类懂得了冶炼技术,采用金属在石头上刻画一些象形文字来记录信息。 在战国至魏晋时代,采用了竹简为书写材料。 东汉时,蔡伦改进了造纸术,可以采用纸张保存信息。 近代信息技术飞速发展,存储的介质也多种多样。 目前数据存储介质可以分为以下三大类。
中大图文 五校样 开本 : 787X1092 成品 : 185mmX260mm 版芯 : 39 字 X41 行 行距 : × 2 正文字体号 : 5ss 2018. 11 . 29
灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬
1 . 2 . 1 光存储
光存储技术具有存储密度高、存储寿命长、非接触怯读写和擦除、信息的信噪比高、信息位的价格低等优点。 光存储由光盘表面的介质实现 , 光盘上有凹凸不平的小坑 , 光照射到其上有不同的反射 , 再转化为 0、1 的数字信号就成了光存储。 通常是采用光驱中激光头发出的激光 , 其照射到上面会有不同的光反射回来 , 光驱将反射回来的光转化为 0 或 1 的二进制数据。
1 . 只读碟(CD_ROM)
记录介质为涂有光刻胶的玻璃盘基。 只读碟(CD_ROM) , 即被写入数据之后只可以读取而无法再次写入的光碟。 直径约 4. 5 英寸 , 厚 1/8 英寸 , 能容纳约 660 MB 的数据。
2 . 可录光碟(CD_R)
采用热效应记录信息。 用聚焦激光束照射 CD_R 中的有机染料记录层 , 照射点的染料发生汽化 , 形成与记录信息对应的坑点 , 完成信息的记录。 CD_R是一种一次写入、永久读的标准。 CD_R写入数据后 , 该光碟就不能再刻写了。
3 . 可重写光碟(CD_ROM)
可重写光碟相对于其他光碟的优势在于刻录后可以使用软件擦除数据 , 再次使用光碟。理论重写次数可达 1000 次 , 容量分别为 700 MB、4 . 7 GB和 8. 5 GB。
4 . 蓝光存储
蓝光(blu_ray)或称蓝光碟(blu_ray disc , BD)利用波长较短(405 nm) 的蓝色激光读取和写入数据 , 并因此而得名。 而传统 DVD需要光头发出红色激光(波长为 650 nm)来读取或写入数据。 通常来说 , 波长越短的激光 , 能够在单位面积上记录或读取的信息越多。 当前 ,蓝光是最先进的大容量光碟格怯 , 容量达到 25 GB或 50 GB, 在速度上 , 蓝光的单倍(1X)速率为 36 Mbps , 即 4. 5 MB/s , 允许 1X~ 12X倍速的记录速度 , 即 4. 5 ~ 54 MB/s 的记录速度。
5 . 近场光存储
近场光存储是使用锥尖光纤作为数据读写的光头 , 而且将光纤与光碟之间的距离控制在纳米级 , 使从光纤中射出的光在扩散之前就接触到盘面 , 故称作近场记录。 与传统的光存储方怯相比 , 近场光存储的存储容量大大提高。 当光斑直径小于半个波长时 , 存储密度就会提高几个数量级 , 可达到 100 GB 以上。
1 . 2 . 2 FIash 存储
Flash 闪存是非易失存储器 , 可以简单地理解成采用半导体芯片作为存储介质的技术的总称 , 一般叫作 “ Flash Memory m 的技术 , 从字面上可理解为闪速存储器。 手机内的 TF卡、数码照相机用的 Flash卡、U盘等都属于这类产品。 常见的半导体存储卡有如下几种:
1 . CF卡
CF (compact flash)卡最大的优势就是价格便宜 , 它的缺点是体积较大。
第 1 章 存储系统简介
2 . MMC卡
MMC(multimedia card)卡是由西门子(SⅠEMENS)公司和首推 CF的闪迪(SanDisk)公司于 1997 年推出的。 MMC卡的接口设计非常简单 , 只有 7 针。 MMC卡目前已经相当成熟 , 它的架构较为简单 , 兼容性很好 , 可以反复擦写 30 万次。
3 . R2-MMC卡
RS_MMC(reduced_size multimedia card)卡也是一款投放市场不久的超小型闪存卡 , 其标准体积为 24 mmX18 mmX1 . 4 mm , 只有标准 MMC卡的一半大小 , 然而却继承和沿袭了 MMC卡所有的优势和性能特征。 RS_MMC卡同样支持自动错误改正、线上实时更新程序功能和平均读写演算法等诸多功能 , 在功耗、存储速度等方面比主流的 SD卡、MMC卡更加优秀。 作为目前 MMC卡标准的延伸技术 , RS_MMC卡解决了困扰手机及消费电子开发者很久的空间问题 , 使得设计超小外形的电子产品俨然成为可能。
4 . 2D卡
SD( secure digital)卡的技术是基于 MMC卡发展而来的 , 大小和 MMC卡差不多 , 尺寸为 32 mmX24 mmX2. 1 mm。 长、宽和 MMC卡一样 , 只是比 MMC卡厚了 0. 7 mm , 可以容纳更大容量的存储单元。 SD卡与 MMC卡保持着向上兼容 , 也就是说 , MMC卡可以被新的 SD设备存取 , 兼容性则取决于应用软件 , 但 SD卡却不可以被 MMC设备存取。 SD卡接口除了保留 MMC卡的 7 针外 , 还在两边多加了 2 针 , 作为数据线。 采用了 NAND 型Flash Memory , 基本上和 SmartMedia 的一样 , 平均数据传输率能达到 2MB/s。
5 . Mini 2D 卡
Mini SD(mini secure digital)卡与目前主流的普通 SD卡相比 , 在外形上更加小巧 , 重量仅有 3 g左右 , 体积只有 21 . 5 mmX20 mmX1 . 4 mm , 比普通 SD卡足足节省了 60%的空间。在存储容量上 , Mini SD卡也丝毫不差 , 从 32MB到几个吉字节都有。
6 . TF卡
TF(transflash)卡外观轻薄小巧 , 只有一元硬币的一半大小 , 体积约为 11 mmX15 mm X 1 mm , 据称是目前市面上体积最小的手机存储卡。 TF卡兼具嵌入怯快闪存储卡体积小、节省空间的优点 , 又具备可移除怯闪存卡的灵活特性 , 并附有 SD转接器 , 兼容任何 SD读卡器。
7 . XD卡
XD卡(XD_picture card)属于目前小巧的存储卡 , 同时具有很大的容量 , 主要是适应数码照相机的小型化的需求。
8 . 固态硬盘
固态硬盘(solid state disk , SSD)是用固态电子存储芯片阵列制成的硬盘 , 由控制单元和存储单元(FLASH芯片、DRAM 芯片)组成。 固态硬盘的接口规范和定义、功能及使用方法与普通硬盘完全相同 , 在产品外形和尺寸上也完全与普通硬盘一致。
中大图文 五校样 开本 : 787X1092 成品 : 185mmX260mm 版芯 : 39 字 X41 行 行距 : × 2 正文字体号 : 5SS 2018. 11 . 29
1 . 2 . 3 硬盘
硬磁盘(hard disk , HD) , 简称硬盘。 它是一种储存量巨大的设备。 ⅠBM 于 1956 年制造出世界上第一块硬盘350RAMAC, 一问世就被广泛地用于计算机设备上。 硬盘是电脑主要的存储媒介之一 , 由一个或者多个铝制或者玻璃制的碟片组成。 这些碟片外覆盖了铁磁性材料。 绝大多数硬盘都是固定硬盘 , 被永久性地密封固定在硬盘驱动器中。 硬盘按照盘体直径的不同 , 分为 3 . 5 英寸、2 . 5 英寸、1 . 8 英寸、1 英寸等几种。
1 . 3 存储系统结构
存储系统环境会随着不同的计算模型而不断改进。 目前 , 存储已经从单一内部磁盘演变为存储系统。 存储系统不但要负责对数据的读/写请求(或命令) , 而且要负责实质上数据的传输。 在较高层面上 , 存储系统应包括以下三个部分:
1 . 主机系统一在操作系统和需要数据的应用程序间交互
对存储数据的处理分布于存储系统的许多部分。 从主机的角度看 , 存储数据的读/写一般由物理部件和逻辑部件实现。 其中 , 物理部件包括中央处理器、内存、总线 ; 逻辑部件包括应用软件、操作系统、文件系统以及数据库系统。
2 . 连接方怯一在主机和存储设备间承载读/写命令和数据
网络互联包括在主机和存储系统间的任何部件。 互联的物理部件有连线(主机内总线、光纤、同轴电缆、连接器和插座)、适配器(负责连接外部设备和主机内总线的主机总线适配器、网络接口卡)、交换机/集线器 ; 互联的逻辑部件有通信协议及设备驱动程序。
3 . 存储设备一负责数据存储的设备
存储物理部件包括如磁盘、磁带、光碟的保持数据的物理设备 , 为这些设备服务的外部部件(如电源、风扇) , 以及将这些设备集成在一起的机械装置(如机箱和机架等) ; 存储逻辑部件包括协议、处理算法等。
1 . 3 . 1 主机系统
用户通过应用程序来存储、检索数据 , 而运行这些应用程序的计算机被称作“ 主机”。 主机的类型很广泛 , 可以是简单的笔记本电脑 , 也可以是复杂的服务器集群。 一台主机包括一组使用逻辑部件(软件、协议)进行相互通信的物理部件(硬件设备)。存储系统环境的数据访问及其总体性能取决于主机的物理部件和逻辑部件。
主机物理部件通常包含三个核心 : 中央处理单元(central processing unit , Cpu) , 内存及磁盘存储设备、输入和输出的 Ⅰ/O设备。
主机的逻辑部件由应用软件和协议组成 , 和物理部件一样 , 它们协同实现了与用户的数据交互。 主机的逻辑部件包括:操作系统(operating system , Os)、设备驱动程序(device driver)、文件系统(filesystem)、卷管理器(volume manager) 和应用程序(application program)。
中大图文 五校样 开本 : 787X1092 成品 : 185mmX260mm 版芯 : 39 字 X41 行 行距 : × 2 正文字体号 : 5ss 2018. 11 . 29
1 . 操作系统
操作系统控制计算机环境的所有方面的操作和用户接口。 其主要功能包括:管理所有系统硬件部件的内部操作和用户接口。操作系统管理着计算机环境中的各个方面,它工作于应用程序和计算机物理部件之间。 操作系统提供给应用程序的功能之一就是支持数据访问。 当然,操作系统也监视和响应用户动作。 它组织和控制着物理资源并负责物理资源的分配。 同时,它还提供了对所管理资源访问与使用的基本安全保障。 在管理一些其他底层资源,如文件系统、卷管理器和设备驱动的同时,操作系统也担当基本存储管理的任务。 其主要功能包括:控制应用程序与存储系统间的交互 ; 检测并响应用户的动作和系统状态 ; 将硬件部件连接到应用程序层和用户 ; 管理系统的活动,例如存储和通信动作。
2 . 设备驱动程序
设备驱动程序允许操作系统侦测并使用标准接口存取和控制特定设备,如打印机、扬声器、鼠标、键盘、视频设备和存储设备等。 设备驱动提供适当的协议使主机能够访问设备。
3 . 文件系统
文件系统提供数据的逻辑结构以及存取数据的方法。 一个文件就是一个有关联关系的记录或数据的集合,它们作为一个整体存储在一起并被命名。 一个文件系统就是大量文件的分层组织结构。 文件系统使得对存放在磁盘、磁盘分区 (disk partitioning) 或逻辑卷 (logical volume, LV) 内的数据文件的访问变得更加容易。 一个文件系统需要基于主机的逻辑结构和软件例程来控制对文件的存取。 对磁盘上文件的访问需要由文件拥有者授权才能进行,这通常也是由文件系统来控制的。
4 . 卷管理器
早期,硬盘驱动器(hard disk drive, HDD) 呈现给操作系统的是一组连续的物理块。整个硬盘驱动器都分配给文件系统或是其他数据体 , 由操作系统或应用程序使用。 这样做的缺点是缺乏灵活性:当一个硬盘驱动器的空间使用完时,想要扩展文件系统的大小就很难。 而当硬盘驱动器存储容量增加时,把整个硬盘驱动器分配给文件系统通常会导致存储空间不能被充分利用。 磁盘分区的引入就是为了改善硬盘驱动器的灵活性和使用率。 在分区时,硬盘驱动器被划分为几个逻辑卷。
逻辑卷管理器(logical volume manager, LVM) 的发展使得文件系统容量的动态扩展以及高效的存储管理成为可能。 LVM 是一个运行在物理机器上管理逻辑和物理存储设备的软件。 LVM 也是一个介于文件系统和物理磁盘之间可选的中间层次。 它可以把几个小的磁盘组合成一个大的虚拟磁盘,或是反过来把一个大容量物理磁盘划分为若干个小的虚拟磁盘,提供给应用程序使用。 LVM 提供了优化的存储访问,简化了存储资源的管理。 它隐藏了物理磁盘细节和数据在磁盘上的分布。 同时,它也允许管理员改变存储的分配而不用改变硬件,就算应用程序还在运行着也没有关系。
对操作系统来说,逻辑卷就像是一个物理设备。 一个逻辑卷可以由不连续的物理分区组成,并可以跨越多个物理卷。 一个文件系统可以创建在一个逻辑卷之上,而且逻辑卷可以通过配置来为应用程序提供优化的性能,也可以为镜像提供更好的数据可用性。
5
5 . 应用程序
应用程序提供在用户与主机间或者主机与其他系统间的交互点。 多数应用都有存储的需求。 这些存储短期或者长期依赖于应用程序。 一个应用程序就是一个提供计算操作逻辑的计算机程序 , 它提供了一个介于用户和主机以及多个主机之间的界面。 传统的使用数据库的商业应用都采用三层架构:前端是应用用户界面 ; 计算逻辑 , 或应用本身 , 构成了中间层 ; 而组织数据的底层数据库 , 则是后端。 应用程序可以直接发送一个请求到底层操作系统 , 由操作系统来完成在存储设备上的读写操作。 应用程序也可以在数据库之上 , 而数据库同样也要利用操作系统的服务来实现对存储设备的读写操作。 这些读写操作最终完成了前端和后端之间的事务。
数据访问可以分为块级别和文件级别两种方怯。 这取决于应用程序是使用逻辑块地址 , 还是使用文件名和文件记录标识符来读写磁盘。
块级别访问是磁盘访问的基本机制。 在这种类型的访问中 , 数据是通过指定逻辑块地址来从磁盘存储和查询数据的。 块地址是基于磁盘的几何结构配置来获得的 , 而块大小则确定了应用程序存储和访问数据的基本单位。 数据库 , 如 oracle 和 SQL Server , 在进行Ⅰ/o操作时 , 就是根据逻辑块地址来定位数据的位置和定义数据访问块的大小。
文件级别访问是块级别访问的一个抽象。 文件级别访问是通过指定文件名和路径来访问数据的。 它通 过底 层的 块级 别访 问来 存储 , 向上 则为 应用 程序 和数 据库 管理 系统(database management system , DBMS)屏蔽了逻辑块编址的复杂性。
对象级别访问是数据访问向智能化发展迈出的一步。 这里 , 对象是访问和存储数据的基本单位。 数据通过分类的方怯来组织和管理 , 并通过唯一的对象标识符来加以区分。 应用程序就是通过使用这些标识符来存储和检索数据的。
1 . 3 . 2 连接方怯
主机及存储系统通过总线及通信协议进行互联 , 具有内部存储的主机可以是笔记本、电脑或者巨型企业服务器。
1 . 总线
总线指为了实现计算机一个部件与其他部件间进行数据传输而设置的数据通路集合。 物理部件在设备间通 过发 送数 据包 的形 怯利 用总 线进 行通 信。 这些 数据 包可 以利用串行通路或者并行通路。 在串行通信中 , 各个数据位依次进行传送。 而在并行通信中 , 数据位同时在冗余的通路上进行传送。
一般在计算机系统中至少存在两种类型的总线 :系统总线 , 负责处理器与主存间的数据传输 ; 局部总线或者 Ⅰ/o总线 , 负责外部设备与主机的数据传输 , 是直接连接到处理器的高速数据通路。
位宽 , 即总线的规模 , 是总线中非常重要的指标。 位宽决定了一次可以传送的数据量。 例如 , 16 位总线能同时传送 16 位的数据 , 而 32 位总线则能传送 32 位的数据。 形象地讲 , 位宽就如同高速公路的并行车道数目。
总线都有用频率衡量的时钟速度指标。 高速总线能使得数据更快被传送 , 也使得应用
6
程序运行更快。
2 . 协议
协议指定义好的通信格怯 , 使得发送方和接收方设备能够以约定方怯通信。 为系统制定的通信协议包含的元素有:
(1)紧密互联的实体:如中央处理器与随机存储器(random access memory , RAM)、存储缓冲器与控制器 , 这些互联实体采用标准的总线技术进行工作。
(2)直接互联的实体:指在中等距离上连接的设备 , 例如主机与打印机 , 主机与存储器[磁盘簇(JBOD)或开放系统的直连怯存储(DAs)]。
(3)网络互联的实体:例如网络主机、NAs 或者 sAN。 用于局部总线和内部磁盘系统互联的协议包括 PCⅠ、ⅠDE/ATA及 sCsⅠ。
PCⅠ指外部设备互联协议 , 是一种定义在计算机内部的局部总线协议。 协议标准文本中详细规范了如何进行 PCⅠ 扩充卡(如网络卡或调制解调器) 的安装及与中央处理器的信息交换。 进一步地说 , PCⅠ包括微处理器和连接设备的互联系统 , 设备通过主机上各个插槽紧密联系并进行高速数据传输。 PCⅠ协议具有即插即用功能 , 使得新卡的识别非常简单 , 它可以进行 32 位或者 64 位的数据传输 , 可以达到 133MB/s 的吞吐率。
ⅠDE/ATA协议指集成设备电子技术和高级互联技术 , 是目前广泛应用于现代磁盘接口的协议。 ⅠDE/ATA具有低成本、高性能的特点。
sCsⅠ协议指小型计算机系统接口 , 是第二得到广泛使用的磁盘接口协议。 由于具有比 ⅠDE更明显的优点 , 使其在诸如高端计算机的场合中得到了青睐。 但是由于较高的成本以及对于家庭 用户 和商 业桌 面用 户来 讲并 不需 要新 增的 特点 , 使其 并没 有像 ⅠDE/ ATA协议那么被广泛应用。 需要强调的是 , sCsⅠ协议是一种系统接口 , 能够实现设备与PC或者其他系统的连接 , 并且采用并行的方怯实现多个数据线的数据传输。 目前 , sCsⅠ本身已经得到了很大的拓展 , 使得其应用范围可以不是单纯的并行接口 , 而是可以指相关技术和标准的宽泛概念。
发起一次 sCsⅠ通信的设备称为发起者 , 而为请求进行服务的 sCsⅠ设备称为目标。 如果发起者是主机 , 那么发起者会释放通信连接并继续处理其他事件 , 而目标则执行接收到的命令。 主机将等待来自于存储设备的中断信号以完成一次传输事务。 sCsⅠ 通信的部件包括发起者标 识 (initiator iD) , 目标 标识 (target iD) 和逻 辑单 元号 (logic unit numbers , LUNs)。其中 , 发起者标识指对发起者的唯一标号 , 也可以用作初始地址 ; 目标标识指目标的唯一标号 , 用于与发起者进行交换命令和状态的地址信息 ; 逻辑单元号说明在某个目标中的特定逻辑单元 , 逻辑单元可以不只是单个磁盘。
发起者标识 , 即初始的发起者ⅠD号 , 一般用作从存储设备反馈的响应信号。 目标标识 ,用于特定存储设备 , 即在诸如磁盘、磁带和光盘中设定的接口地址。 逻辑单元号 , 反映了由目标看到的设备真实地址。
下面我们总结 sCsⅠ 的特点 , 以及 ⅠDE/ATA 协议与 sCsⅠ协议的比较(见表 1. 1 和表 1. 2)。
本书系“CADAL项目标准规范丛书”之一 , 对 CADAL建设过程中资源的存储方怯予以梳理 , 从实践出发进行总结归纳 , 系统地总结了数字资源的存储方法、通常采用的仓储标准及资源发布时可遵循的相关压缩规范。
本书共分 4 章 , 涵盖了存储的概念、数字资源长期保存的策略、数字对象存储的标准及数字资源索引与压缩四大部分内容 , 具体如下。
第 1 章 , 对数字资源的存储系统进行了详细的论述 , 包括对存储介质特点的介绍、存储系统结构的分析和存储设备的介绍。
第 2 章 , 论述了数字资源长期保存的概念模型、组织框架及保存策略。 数字资源长期保存是对数字资源进行摄入、保存和管理 , 在一定条件下提供服务或转移保存的活动。 数字信息资源长期保存是伴随信息数字化和服务网络化的发展而出现的 , 按数字资源保存时间可划分为长期保存、中期保存及短期保存。
第 3 章 , 论述了数字对象的存储标准 , 包括通用数字资源存储规范中数字资源存储文档(DRSS)结构描述 , 数字对象文本类型存储的标准、数字对象图像类型存储标准、数字对象音频类型存储标准及数字对象视频类型存储标准。
第 4 章 , 论述了数字资源索引与压缩标准 , 包括数字资源索引技术介绍和数字资源压缩规范介绍 , 以便于在实际数字资源发布时采用。
本书第 1 章和第 3 章由刘翔撰写 , 第 2 章由施干卫撰写 , 第 4 章由黄志强撰写。 另外 ,支文英主要负责书稿的校对工作。
由于作者水平有限 , 加之编写时间较为仓促 , 书中难免有疏漏和错误之处 , 恳请读者予以指正。
刘 翔
2018 年 8 月于浙江理工大学
目 录
第 1 章 存储系统简介 1
1 . 1 存储系统 1
1 . 2 存储介质 1
1 . 2. 1 光存储 2
1 . 2. 2 Flash 存储 2
1 . 2. 3 硬盘 4
1 . 3 存储系统结构 4
1 . 3 . 1 主机系统 4
1 . 3 . 2 连接方怯 6
1 . 3 . 3 存储设备 9
1 . 3 . 4 磁盘阵列 10
1 . 4 网络存储系统 16
1 . 4. 1 直连怯存储 16
1 . 4. 2 存储区域网络 17
1 . 4. 3 NAS 网络存储技术 25
1 . 4. 4 ⅠP SAN 34
1 . 5 对象存储系统 39
1 . 5 . 1 对象存储系统简介 40
1 . 5 . 2 OSD基本概念 41
1 . 5 . 3 对象存储文件系统体系结构 47
1 . 5 . 4 OSD的安全 53
1 . 6 信息生命周期管理 55
1 . 6 . 1 信息生命周期 56
1 . 6 . 2 信息生命周期的五个阶段 57
1 . 6 . 3 信息生命周期管理 57
1 . 6 . 4 ⅠLM 对企业的战略价值 58
1 . 6 . 5 ⅠLM 的实施方法 58
数字资源存储、仓储和发布的标准规范建设
1 . 6 . 6 信息生命周期管理实施的步骤 63
1 . 6 . 7 信息生命周期管理的战略 64
第 2 章 数字资源长期保存 65
2. 1 数字资源长期保存模型 65
2. 1 . 1 OAⅠS数字资源长期保存概念模型 65
2. 1 . 2 SⅠRF数字资源长期保存模型 68
2. 2 数字资源组织框架 69
2. 3 数字资源存储框架 69
2. 4 数字资源长期保存策略 70
2. 4. 1 首选介质一磁带存储 70
2. 4. 2 磁带存储系统的特点 71
2. 4. 3 磁带存储系统的类型 71
2. 4. 4 磁带存储系统的选择 73
2. 5 面向对象的并行文件系统与 SⅠRF 74
2. 6 推荐的存储架构模型 74
2. 7 文件及目录策略 75
第 3 章 数字对象存储标准 76
3 . 1 通用数字资源存储规范 76
3 . 1 . 1 数字资源存储文档 76
3 . 1 . 2 DRSS文档头节点 drssHdr 79
3 . 1 . 3 DRSS文档描述型元数据节点 dmdSec 82
3 . 1 . 4 DRSS文档管理型元数据节点 amdSec 85
3 . 1 . 5 DRSS文档文件节点 fileSec 89
3 . 1 . 6 DRSS文档结构图节点 structMap 94
3 . 1 . 7 DRSS文档属性组 101
3 . 2 数字对象文本类型存储标准 103
3 . 2. 1 文本文件 103
3 . 2. 2 编码 103
3 . 3 数字对象图像类型存储标准 112
3 . 3 . 1 文件大小 112
3 . 3 . 2 文件格怯 112
3 . 3 . 3 格怯版本 115
3 . 3 . 4 压缩模怯 115
3 . 3 . 5 压缩率 115
3 . 3 . 6 图像宽度 115
3 . 3 . 7 图像高度 116
3 . 3 . 8 色彩空间 116
3 . 3 . 9 图像来源 118
3 . 3 . 10 来源类型 118
3 . 3 . 11 图像获取设备信息 118
3 . 3 . 12 创建时间 118
3 . 3 . 13 创建者 118
3 . 3 . 14 创建设备 118
3 . 3 . 15 扫描仪信息 119
3 . 3 . 16 光学分辨率 119
3 . 3 . 17 扫描软件 120
3 . 3 . 18 数码相机信息 120
3 . 3 . 19 光圈值 121
3 . 3 . 20 曝光时间 122
3 . 3 . 21 ⅠsO值 123
3 . 4 数字对象音频类型存储标准 123
3 . 4. 1 音频块大小 123
3 . 4. 2 音频数据编码 123
3 . 4. 3 有损和无损 124
3 . 4. 4 频率与采样率 124
3 . 4. 5 采样位数 125
3 . 4. 6 位速 126
3 . 4. 7 采样字长 126
3 . 4. 8 音频压缩 128
3 . 4. 9 编码器 128
3 . 4. 10 音频格怯 129
3 . 4. 11 声道 134
3 . 4. 12 声场 135
3 . 4. 13 声场衰变和混响时间 137
3 . 5 数字对象视频类型存储标准 137
3 . 5 . 1 数据率 137
3 . 5 . 2 色彩 137
3 . 5 . 3 编码器 138
3
3 . 5 . 4 压缩率 139
3 . 5 . 5 帧 139
3 . 5 . 6 帧速率 139
3 . 5 . 7 采样率 140
3 . 5 . 8 显示比例 140
3 . 5 . 9 信号制怯 140
3 . 5 . 10 视频格怯 141
3 . 5 . 11 分辨率 145
第 4 章 数字资源索引与压缩 147
4. 1 数字资源索引技术 147
4. 1 . 1 索引技术概论 147
4. 1 . 2 XML索引及其分类 148
4. 1 . 3 数字资源文档的存取 149
4. 1 . 4 主流数据库管理系统的 XML索引 151
4. 2 数字资源压缩规范 155
4. 2. 1 数字资源压缩概述 155
4. 2. 2 文本数字资源的压缩 158
4. 2. 3 图像数字资源的压缩 159
4. 2. 4 视频数字资源的压缩 161
4. 2. 5 音频数字资源的压缩 163
4. 2. 6 推荐的数字资源压缩规范 165
参考文献 169
4
氵氵
氵
第 1 章 存储系统简介
1 . 1 存储系统
存储系统是用来保存数据,并能够按照用户请求提供相应数据的部件、设备和计算机系统。事实上,存储设备在本质上也是一种计算机系统,例如内存条本身也具有计算部件和寄存器。 本质上,存储系统使得信息在时间上得以延续,而不会消逝 ; 而计算机存储系统使得数字化信息得以保持在介质之中,在需要的时候能够提供及时的存取。
广义的存储设备包括 Cpu 中的寄存器、多级高速缓存(cache)、内部存储系统和外部存储系统。 内存也称为内存系统(memory system) ,而外部存储系统称作存储系统(storage system)。狭义的存储系统通常就仅仅指外部存储系统。 相对于内存系统,存储系统必须提供大容量和非易失性的数据存储能力,非易失性使得存储系统在掉电或者断连主机的情况下能够正确地保存数据。
存储网络的出现,使得存储的层次更加复杂,一个远地存储系统可以为主机提供存储服务,极大地扩充主机可以使用的存储空间,但同时引入了存储空间管理的复杂性。 因为每个存储设备总是要提供相应的存储空间供系统存取数据,必须把这些独立的、基础的物理存储空间构成统一使用的逻辑存储空间,这也是存储虚拟化所做的工作,但随着数据存储系统中存储设备和存储层次的增加,这种统一过程的复杂度和难度也相应地增加。
存储虚拟化(storage virtualizatio")最通俗的理解就是对存储硬件资源进行抽象化表现。通过将一个(或多个) 目标(target)服务或功能与其他附加的功能集成,统一提供有用的全面功能服务。 典型的虚拟化包括如下一些情况:屏蔽系统的复杂性,增加或集成新的功能,仿真、整合或分解现有的服务功能等。 虚拟化是作用在一个或者多个实体上的,而这些实体则是用来提供存储资源或服务的。
1 . 2 存储介质
在原始社会,人类用树枝和石头等来记录数据,随后人类懂得了冶炼技术,采用金属在石头上刻画一些象形文字来记录信息。 在战国至魏晋时代,采用了竹简为书写材料。 东汉时,蔡伦改进了造纸术,可以采用纸张保存信息。 近代信息技术飞速发展,存储的介质也多种多样。 目前数据存储介质可以分为以下三大类。
中大图文 五校样 开本 : 787X1092 成品 : 185mmX260mm 版芯 : 39 字 X41 行 行距 : × 2 正文字体号 : 5ss 2018. 11 . 29
灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬灬
1 . 2 . 1 光存储
光存储技术具有存储密度高、存储寿命长、非接触怯读写和擦除、信息的信噪比高、信息位的价格低等优点。 光存储由光盘表面的介质实现 , 光盘上有凹凸不平的小坑 , 光照射到其上有不同的反射 , 再转化为 0、1 的数字信号就成了光存储。 通常是采用光驱中激光头发出的激光 , 其照射到上面会有不同的光反射回来 , 光驱将反射回来的光转化为 0 或 1 的二进制数据。
1 . 只读碟(CD_ROM)
记录介质为涂有光刻胶的玻璃盘基。 只读碟(CD_ROM) , 即被写入数据之后只可以读取而无法再次写入的光碟。 直径约 4. 5 英寸 , 厚 1/8 英寸 , 能容纳约 660 MB 的数据。
2 . 可录光碟(CD_R)
采用热效应记录信息。 用聚焦激光束照射 CD_R 中的有机染料记录层 , 照射点的染料发生汽化 , 形成与记录信息对应的坑点 , 完成信息的记录。 CD_R是一种一次写入、永久读的标准。 CD_R写入数据后 , 该光碟就不能再刻写了。
3 . 可重写光碟(CD_ROM)
可重写光碟相对于其他光碟的优势在于刻录后可以使用软件擦除数据 , 再次使用光碟。理论重写次数可达 1000 次 , 容量分别为 700 MB、4 . 7 GB和 8. 5 GB。
4 . 蓝光存储
蓝光(blu_ray)或称蓝光碟(blu_ray disc , BD)利用波长较短(405 nm) 的蓝色激光读取和写入数据 , 并因此而得名。 而传统 DVD需要光头发出红色激光(波长为 650 nm)来读取或写入数据。 通常来说 , 波长越短的激光 , 能够在单位面积上记录或读取的信息越多。 当前 ,蓝光是最先进的大容量光碟格怯 , 容量达到 25 GB或 50 GB, 在速度上 , 蓝光的单倍(1X)速率为 36 Mbps , 即 4. 5 MB/s , 允许 1X~ 12X倍速的记录速度 , 即 4. 5 ~ 54 MB/s 的记录速度。
5 . 近场光存储
近场光存储是使用锥尖光纤作为数据读写的光头 , 而且将光纤与光碟之间的距离控制在纳米级 , 使从光纤中射出的光在扩散之前就接触到盘面 , 故称作近场记录。 与传统的光存储方怯相比 , 近场光存储的存储容量大大提高。 当光斑直径小于半个波长时 , 存储密度就会提高几个数量级 , 可达到 100 GB 以上。
1 . 2 . 2 FIash 存储
Flash 闪存是非易失存储器 , 可以简单地理解成采用半导体芯片作为存储介质的技术的总称 , 一般叫作 “ Flash Memory m 的技术 , 从字面上可理解为闪速存储器。 手机内的 TF卡、数码照相机用的 Flash卡、U盘等都属于这类产品。 常见的半导体存储卡有如下几种:
1 . CF卡
CF (compact flash)卡最大的优势就是价格便宜 , 它的缺点是体积较大。
第 1 章 存储系统简介
2 . MMC卡
MMC(multimedia card)卡是由西门子(SⅠEMENS)公司和首推 CF的闪迪(SanDisk)公司于 1997 年推出的。 MMC卡的接口设计非常简单 , 只有 7 针。 MMC卡目前已经相当成熟 , 它的架构较为简单 , 兼容性很好 , 可以反复擦写 30 万次。
3 . R2-MMC卡
RS_MMC(reduced_size multimedia card)卡也是一款投放市场不久的超小型闪存卡 , 其标准体积为 24 mmX18 mmX1 . 4 mm , 只有标准 MMC卡的一半大小 , 然而却继承和沿袭了 MMC卡所有的优势和性能特征。 RS_MMC卡同样支持自动错误改正、线上实时更新程序功能和平均读写演算法等诸多功能 , 在功耗、存储速度等方面比主流的 SD卡、MMC卡更加优秀。 作为目前 MMC卡标准的延伸技术 , RS_MMC卡解决了困扰手机及消费电子开发者很久的空间问题 , 使得设计超小外形的电子产品俨然成为可能。
4 . 2D卡
SD( secure digital)卡的技术是基于 MMC卡发展而来的 , 大小和 MMC卡差不多 , 尺寸为 32 mmX24 mmX2. 1 mm。 长、宽和 MMC卡一样 , 只是比 MMC卡厚了 0. 7 mm , 可以容纳更大容量的存储单元。 SD卡与 MMC卡保持着向上兼容 , 也就是说 , MMC卡可以被新的 SD设备存取 , 兼容性则取决于应用软件 , 但 SD卡却不可以被 MMC设备存取。 SD卡接口除了保留 MMC卡的 7 针外 , 还在两边多加了 2 针 , 作为数据线。 采用了 NAND 型Flash Memory , 基本上和 SmartMedia 的一样 , 平均数据传输率能达到 2MB/s。
5 . Mini 2D 卡
Mini SD(mini secure digital)卡与目前主流的普通 SD卡相比 , 在外形上更加小巧 , 重量仅有 3 g左右 , 体积只有 21 . 5 mmX20 mmX1 . 4 mm , 比普通 SD卡足足节省了 60%的空间。在存储容量上 , Mini SD卡也丝毫不差 , 从 32MB到几个吉字节都有。
6 . TF卡
TF(transflash)卡外观轻薄小巧 , 只有一元硬币的一半大小 , 体积约为 11 mmX15 mm X 1 mm , 据称是目前市面上体积最小的手机存储卡。 TF卡兼具嵌入怯快闪存储卡体积小、节省空间的优点 , 又具备可移除怯闪存卡的灵活特性 , 并附有 SD转接器 , 兼容任何 SD读卡器。
7 . XD卡
XD卡(XD_picture card)属于目前小巧的存储卡 , 同时具有很大的容量 , 主要是适应数码照相机的小型化的需求。
8 . 固态硬盘
固态硬盘(solid state disk , SSD)是用固态电子存储芯片阵列制成的硬盘 , 由控制单元和存储单元(FLASH芯片、DRAM 芯片)组成。 固态硬盘的接口规范和定义、功能及使用方法与普通硬盘完全相同 , 在产品外形和尺寸上也完全与普通硬盘一致。
中大图文 五校样 开本 : 787X1092 成品 : 185mmX260mm 版芯 : 39 字 X41 行 行距 : × 2 正文字体号 : 5SS 2018. 11 . 29
1 . 2 . 3 硬盘
硬磁盘(hard disk , HD) , 简称硬盘。 它是一种储存量巨大的设备。 ⅠBM 于 1956 年制造出世界上第一块硬盘350RAMAC, 一问世就被广泛地用于计算机设备上。 硬盘是电脑主要的存储媒介之一 , 由一个或者多个铝制或者玻璃制的碟片组成。 这些碟片外覆盖了铁磁性材料。 绝大多数硬盘都是固定硬盘 , 被永久性地密封固定在硬盘驱动器中。 硬盘按照盘体直径的不同 , 分为 3 . 5 英寸、2 . 5 英寸、1 . 8 英寸、1 英寸等几种。
1 . 3 存储系统结构
存储系统环境会随着不同的计算模型而不断改进。 目前 , 存储已经从单一内部磁盘演变为存储系统。 存储系统不但要负责对数据的读/写请求(或命令) , 而且要负责实质上数据的传输。 在较高层面上 , 存储系统应包括以下三个部分:
1 . 主机系统一在操作系统和需要数据的应用程序间交互
对存储数据的处理分布于存储系统的许多部分。 从主机的角度看 , 存储数据的读/写一般由物理部件和逻辑部件实现。 其中 , 物理部件包括中央处理器、内存、总线 ; 逻辑部件包括应用软件、操作系统、文件系统以及数据库系统。
2 . 连接方怯一在主机和存储设备间承载读/写命令和数据
网络互联包括在主机和存储系统间的任何部件。 互联的物理部件有连线(主机内总线、光纤、同轴电缆、连接器和插座)、适配器(负责连接外部设备和主机内总线的主机总线适配器、网络接口卡)、交换机/集线器 ; 互联的逻辑部件有通信协议及设备驱动程序。
3 . 存储设备一负责数据存储的设备
存储物理部件包括如磁盘、磁带、光碟的保持数据的物理设备 , 为这些设备服务的外部部件(如电源、风扇) , 以及将这些设备集成在一起的机械装置(如机箱和机架等) ; 存储逻辑部件包括协议、处理算法等。
1 . 3 . 1 主机系统
用户通过应用程序来存储、检索数据 , 而运行这些应用程序的计算机被称作“ 主机”。 主机的类型很广泛 , 可以是简单的笔记本电脑 , 也可以是复杂的服务器集群。 一台主机包括一组使用逻辑部件(软件、协议)进行相互通信的物理部件(硬件设备)。存储系统环境的数据访问及其总体性能取决于主机的物理部件和逻辑部件。
主机物理部件通常包含三个核心 : 中央处理单元(central processing unit , Cpu) , 内存及磁盘存储设备、输入和输出的 Ⅰ/O设备。
主机的逻辑部件由应用软件和协议组成 , 和物理部件一样 , 它们协同实现了与用户的数据交互。 主机的逻辑部件包括:操作系统(operating system , Os)、设备驱动程序(device driver)、文件系统(filesystem)、卷管理器(volume manager) 和应用程序(application program)。
中大图文 五校样 开本 : 787X1092 成品 : 185mmX260mm 版芯 : 39 字 X41 行 行距 : × 2 正文字体号 : 5ss 2018. 11 . 29
1 . 操作系统
操作系统控制计算机环境的所有方面的操作和用户接口。 其主要功能包括:管理所有系统硬件部件的内部操作和用户接口。操作系统管理着计算机环境中的各个方面,它工作于应用程序和计算机物理部件之间。 操作系统提供给应用程序的功能之一就是支持数据访问。 当然,操作系统也监视和响应用户动作。 它组织和控制着物理资源并负责物理资源的分配。 同时,它还提供了对所管理资源访问与使用的基本安全保障。 在管理一些其他底层资源,如文件系统、卷管理器和设备驱动的同时,操作系统也担当基本存储管理的任务。 其主要功能包括:控制应用程序与存储系统间的交互 ; 检测并响应用户的动作和系统状态 ; 将硬件部件连接到应用程序层和用户 ; 管理系统的活动,例如存储和通信动作。
2 . 设备驱动程序
设备驱动程序允许操作系统侦测并使用标准接口存取和控制特定设备,如打印机、扬声器、鼠标、键盘、视频设备和存储设备等。 设备驱动提供适当的协议使主机能够访问设备。
3 . 文件系统
文件系统提供数据的逻辑结构以及存取数据的方法。 一个文件就是一个有关联关系的记录或数据的集合,它们作为一个整体存储在一起并被命名。 一个文件系统就是大量文件的分层组织结构。 文件系统使得对存放在磁盘、磁盘分区 (disk partitioning) 或逻辑卷 (logical volume, LV) 内的数据文件的访问变得更加容易。 一个文件系统需要基于主机的逻辑结构和软件例程来控制对文件的存取。 对磁盘上文件的访问需要由文件拥有者授权才能进行,这通常也是由文件系统来控制的。
4 . 卷管理器
早期,硬盘驱动器(hard disk drive, HDD) 呈现给操作系统的是一组连续的物理块。整个硬盘驱动器都分配给文件系统或是其他数据体 , 由操作系统或应用程序使用。 这样做的缺点是缺乏灵活性:当一个硬盘驱动器的空间使用完时,想要扩展文件系统的大小就很难。 而当硬盘驱动器存储容量增加时,把整个硬盘驱动器分配给文件系统通常会导致存储空间不能被充分利用。 磁盘分区的引入就是为了改善硬盘驱动器的灵活性和使用率。 在分区时,硬盘驱动器被划分为几个逻辑卷。
逻辑卷管理器(logical volume manager, LVM) 的发展使得文件系统容量的动态扩展以及高效的存储管理成为可能。 LVM 是一个运行在物理机器上管理逻辑和物理存储设备的软件。 LVM 也是一个介于文件系统和物理磁盘之间可选的中间层次。 它可以把几个小的磁盘组合成一个大的虚拟磁盘,或是反过来把一个大容量物理磁盘划分为若干个小的虚拟磁盘,提供给应用程序使用。 LVM 提供了优化的存储访问,简化了存储资源的管理。 它隐藏了物理磁盘细节和数据在磁盘上的分布。 同时,它也允许管理员改变存储的分配而不用改变硬件,就算应用程序还在运行着也没有关系。
对操作系统来说,逻辑卷就像是一个物理设备。 一个逻辑卷可以由不连续的物理分区组成,并可以跨越多个物理卷。 一个文件系统可以创建在一个逻辑卷之上,而且逻辑卷可以通过配置来为应用程序提供优化的性能,也可以为镜像提供更好的数据可用性。
5
5 . 应用程序
应用程序提供在用户与主机间或者主机与其他系统间的交互点。 多数应用都有存储的需求。 这些存储短期或者长期依赖于应用程序。 一个应用程序就是一个提供计算操作逻辑的计算机程序 , 它提供了一个介于用户和主机以及多个主机之间的界面。 传统的使用数据库的商业应用都采用三层架构:前端是应用用户界面 ; 计算逻辑 , 或应用本身 , 构成了中间层 ; 而组织数据的底层数据库 , 则是后端。 应用程序可以直接发送一个请求到底层操作系统 , 由操作系统来完成在存储设备上的读写操作。 应用程序也可以在数据库之上 , 而数据库同样也要利用操作系统的服务来实现对存储设备的读写操作。 这些读写操作最终完成了前端和后端之间的事务。
数据访问可以分为块级别和文件级别两种方怯。 这取决于应用程序是使用逻辑块地址 , 还是使用文件名和文件记录标识符来读写磁盘。
块级别访问是磁盘访问的基本机制。 在这种类型的访问中 , 数据是通过指定逻辑块地址来从磁盘存储和查询数据的。 块地址是基于磁盘的几何结构配置来获得的 , 而块大小则确定了应用程序存储和访问数据的基本单位。 数据库 , 如 oracle 和 SQL Server , 在进行Ⅰ/o操作时 , 就是根据逻辑块地址来定位数据的位置和定义数据访问块的大小。
文件级别访问是块级别访问的一个抽象。 文件级别访问是通过指定文件名和路径来访问数据的。 它通 过底 层的 块级 别访 问来 存储 , 向上 则为 应用 程序 和数 据库 管理 系统(database management system , DBMS)屏蔽了逻辑块编址的复杂性。
对象级别访问是数据访问向智能化发展迈出的一步。 这里 , 对象是访问和存储数据的基本单位。 数据通过分类的方怯来组织和管理 , 并通过唯一的对象标识符来加以区分。 应用程序就是通过使用这些标识符来存储和检索数据的。
1 . 3 . 2 连接方怯
主机及存储系统通过总线及通信协议进行互联 , 具有内部存储的主机可以是笔记本、电脑或者巨型企业服务器。
1 . 总线
总线指为了实现计算机一个部件与其他部件间进行数据传输而设置的数据通路集合。 物理部件在设备间通 过发 送数 据包 的形 怯利 用总 线进 行通 信。 这些 数据 包可 以利用串行通路或者并行通路。 在串行通信中 , 各个数据位依次进行传送。 而在并行通信中 , 数据位同时在冗余的通路上进行传送。
一般在计算机系统中至少存在两种类型的总线 :系统总线 , 负责处理器与主存间的数据传输 ; 局部总线或者 Ⅰ/o总线 , 负责外部设备与主机的数据传输 , 是直接连接到处理器的高速数据通路。
位宽 , 即总线的规模 , 是总线中非常重要的指标。 位宽决定了一次可以传送的数据量。 例如 , 16 位总线能同时传送 16 位的数据 , 而 32 位总线则能传送 32 位的数据。 形象地讲 , 位宽就如同高速公路的并行车道数目。
总线都有用频率衡量的时钟速度指标。 高速总线能使得数据更快被传送 , 也使得应用
6
程序运行更快。
2 . 协议
协议指定义好的通信格怯 , 使得发送方和接收方设备能够以约定方怯通信。 为系统制定的通信协议包含的元素有:
(1)紧密互联的实体:如中央处理器与随机存储器(random access memory , RAM)、存储缓冲器与控制器 , 这些互联实体采用标准的总线技术进行工作。
(2)直接互联的实体:指在中等距离上连接的设备 , 例如主机与打印机 , 主机与存储器[磁盘簇(JBOD)或开放系统的直连怯存储(DAs)]。
(3)网络互联的实体:例如网络主机、NAs 或者 sAN。 用于局部总线和内部磁盘系统互联的协议包括 PCⅠ、ⅠDE/ATA及 sCsⅠ。
PCⅠ指外部设备互联协议 , 是一种定义在计算机内部的局部总线协议。 协议标准文本中详细规范了如何进行 PCⅠ 扩充卡(如网络卡或调制解调器) 的安装及与中央处理器的信息交换。 进一步地说 , PCⅠ包括微处理器和连接设备的互联系统 , 设备通过主机上各个插槽紧密联系并进行高速数据传输。 PCⅠ协议具有即插即用功能 , 使得新卡的识别非常简单 , 它可以进行 32 位或者 64 位的数据传输 , 可以达到 133MB/s 的吞吐率。
ⅠDE/ATA协议指集成设备电子技术和高级互联技术 , 是目前广泛应用于现代磁盘接口的协议。 ⅠDE/ATA具有低成本、高性能的特点。
sCsⅠ协议指小型计算机系统接口 , 是第二得到广泛使用的磁盘接口协议。 由于具有比 ⅠDE更明显的优点 , 使其在诸如高端计算机的场合中得到了青睐。 但是由于较高的成本以及对于家庭 用户 和商 业桌 面用 户来 讲并 不需 要新 增的 特点 , 使其 并没 有像 ⅠDE/ ATA协议那么被广泛应用。 需要强调的是 , sCsⅠ协议是一种系统接口 , 能够实现设备与PC或者其他系统的连接 , 并且采用并行的方怯实现多个数据线的数据传输。 目前 , sCsⅠ本身已经得到了很大的拓展 , 使得其应用范围可以不是单纯的并行接口 , 而是可以指相关技术和标准的宽泛概念。
发起一次 sCsⅠ通信的设备称为发起者 , 而为请求进行服务的 sCsⅠ设备称为目标。 如果发起者是主机 , 那么发起者会释放通信连接并继续处理其他事件 , 而目标则执行接收到的命令。 主机将等待来自于存储设备的中断信号以完成一次传输事务。 sCsⅠ 通信的部件包括发起者标 识 (initiator iD) , 目标 标识 (target iD) 和逻 辑单 元号 (logic unit numbers , LUNs)。其中 , 发起者标识指对发起者的唯一标号 , 也可以用作初始地址 ; 目标标识指目标的唯一标号 , 用于与发起者进行交换命令和状态的地址信息 ; 逻辑单元号说明在某个目标中的特定逻辑单元 , 逻辑单元可以不只是单个磁盘。
发起者标识 , 即初始的发起者ⅠD号 , 一般用作从存储设备反馈的响应信号。 目标标识 ,用于特定存储设备 , 即在诸如磁盘、磁带和光盘中设定的接口地址。 逻辑单元号 , 反映了由目标看到的设备真实地址。
下面我们总结 sCsⅠ 的特点 , 以及 ⅠDE/ATA 协议与 sCsⅠ协议的比较(见表 1. 1 和表 1. 2)。

