网站地图 | Tags | 热门标准 | 最新标准 | 订阅

GB/T 41813.1-2022 信息技术 智能语音交互测试方法 第1部分:语音识别

  • 名  称:GB/T 41813.1-2022 信息技术 智能语音交互测试方法 第1部分:语音识别 - 下载地址2
  • 下载地址:[[下载地址1]][[下载地址2]]
  • 提 取 码
  • 浏览次数:3
下载帮助: 发表评论 加入收藏夹 错误报告目录
发表评论 共有条评论
用户名: 密码:
验证码: 匿名发表
新闻评论(共有 0 条评论)

资料介绍

  ICS 35 . 240 . 0 1 CCS L 77

  中 华 人 民 共 和 国 国 家 标 准

  GB/T 41813 . 1—2022

  信息技术 智能语音交互测试方法

  第 1 部分:语音识别

  Informationtechnology—Intelligentspeechinteractiontestingmethod—

  part1:Speechrecognition

  2022-10-12 发布 2023-05-01 实施

  国家市场监督管理总局国家标准化管理委员会

  

  发

  

  布

  GB/T 41813 . 1—2022

  目 次

  前言 Ⅲ

  引言 Ⅳ

  1 范围 1

  2 规范性引用文件 1

  3 术语和定义 1

  4 概述 2

  5 测试准备和执行 2

  5 . 1 测试数据集 2

  5 . 2 测试工具 3

  5 . 3 测试设备 3

  5 . 4 测试环境 4

  5 . 5 测试执行 4

  5 . 6 测试结果 4

  6 功能测试方法 4

  6 . 1 语音信号采集 4

  6 . 2 语音转文字 5

  6 . 3 语音唤醒 5

  6 . 4 前端信号处理 5

  6 . 5 说话人分离 5

  6 . 6 语言信息识别 6

  6 . 7 语音识别后处理 6

  7 性能测试方法 6

  7 . 1 语音识别效果 6

  7 . 2 语音识别效率 7

  7 . 3 语音唤醒效果 8

  7 . 4 前端信号处理效果 9

  7 . 5 说话人分离效果 10

  7 . 6 语言信息识别效果 10

  7 . 7 系统稳定性 11

  参考文献 12

  Ⅰ

  GB/T 41813 . 1—2022

  前 言

  本文件按照 GB/T 1 . 1—2020《标准化工作导则 第 1 部分:标准化文件的结构和起草规则》的规定起草。

  本文件是 GB/T 41813《信息技术 智能语音交互测试方法》的第 1 部分。 GB/T 41813 已经发布了以下部分:

  — 第 1 部分:语音识别;

  — 第 2 部分:语义理解。

  请注意本文件的某些内容可能涉及专利。 本文件的发布机构不承担识别专利的责任。

  本文件由全国信息技术标准化技术委员会(SAC/TC 28)提出并归口 。

  本文件起草单位:中国电子技术标准化研究院、科大讯飞股份有限公司、小米通讯技术有限公司、华为终端有限公司、深圳市优必选科技股份有限公司、中国电信集团有限公司、思必驰科技股份有限公司、中国科学院自动化研究所、中国医学科学院生物医学工程研究所、哈尔滨工业大学、海信视像科技股份有限公司、马上消费金融股份有限公司、腾讯科技(北京)有限公司、沈阳新松机器人自动化股份有限公司、深圳市人马互动科技有限公司、平安科技(深圳)有限公司、安徽咪鼠科技有限公司、泾丰科技(深圳)有限公司、北京捷通华声科技股份有限公司、北京百度网讯科技有限公司、深圳市北科瑞声科技股份有限公司、阿里云计算有限公司、云从科技集团股份有限公司、网易(杭州)网络有限公司、南京云问网络技术有限公司、联想(北京)有限公司、福州数据技术研究院有限公司、国家网络软件产品质量监督检验中心(济南)、中汽研(天津)汽车工程研究院有限公司、华南理工大学、山东省计算中心(国家超级计算济南中心)、中科极限元(杭州)智能科技股份有限公司、神思电子技术股份有限公司、郑州中业科技股份有限公司、中汽数据(天津)有限公司、中国电器科学研究院有限公司、上海计算机软件技术开发中心、北京爱数智慧科技有限公司。

  本文件主要起草人:董建、徐洋、吴国纲、马万钟、朱亚军、贾一君、周立君、宋文林、袁杰、杨震、田定书、钱彦昱、陶建华、花云飞、蒲江波、刘斌、李海峰、王峰、杨春勇、苏丹、张锋、冯海洪、刘国涛、任军民、陈楠、刑启洲、魏韬、李笑如、黄石磊、汪淼淼、李军、胡光龙、杨萌、孟宪明、温正棋、鹿飞、方斌、王岳、井煜、李介、张莹、蔡立志、徐向民、高永超、张晴晴。

  Ⅲ

  GB/T 41813 . 1—2022

  Ⅳ

  引

  

  言

  智能语音交互在智能家居、智能客服、移动终端、车载终端以及智慧教育、智慧医疗、智能办公、服务机器人等诸多领域应用广泛,已成为当前人机交互的重要方式之 一 。 随着智能语音交互越来越深入到生产生活的方方面面,需要对智能语音交互的系统参考框架、基础技术要求、互联网接口要求等进行统一规范。 在这方面,国家已制定了支撑智能语音交互系统的基础性国家标准。 在此基础上,也需要用统一的测试方法和评价标准来对智能语音交互系统的能力进行评测,为智能语音交互相关的产品和服务提供评测的基础方法和依据。

  GB/T 41813《信息技术 智能语音交互测试方法》为 GB/T 36464(所有部分)《信息技术 智能语音交互系统》提供基础通用的测试方法。 智能语音交互包括语音识别、语义理解和语音合成三个基本环节,各环节所涉及的测试对象、测试项 目 、测试环境和测试方法均有所不同。 GB/T 41813《信息技术

  智能语音交互测试方法》旨在确立和描述适用于智能语音交互各环节的通用测试项和通用测试方法,拟由三个部分构成。

  — 第 1 部分:语音识别。 目的在于为智能语音交互应用中的语音识别环节提供通用测试项和通用测试方法。

  — 第 2 部分:语义理解。 目的在于为智能语音交互应用中的语义理解环节提供通用测试项和通用测试方法。

  — 第 3 部分:语音合成。 目的在于为智能语音交互应用中的语音合成环节提供通用测试项和通用测试方法。

  GB/T 41813 . 1—2022

  信息技术 智能语音交互测试方法

  第 1 部分:语音识别

  1 范围

  本文件描述了智能语音交互测试中语音识别系统的通用测试项和通用测试方法。

  本文件适用于智能语音服务提供商、用户和第三方检测机构对智能语音交互应用的语音识别系统测试的设计和实施。

  2 规范性引用文件

  下列文件中的内容通过文中的规范性引用而构成本文件必不可少的条款。 其中,注 日期的引用文件,仅该日期对应的版本适用于本文件;不注日期的引用文件,其最新版本(包括所有的修改单)适用于本文件。

  GB/T 21023 中文语音识别系统通用技术规范

  GB/T 36464(所有部分) 信息技术 智能语音交互系统

  3 术语和定义

  GB/T 36464(所有部分)界定的以及下列术语和定义适用于本文件。

  3.1

  语音识别 speechrecognition

  将人类的声音信号转化为文字或者指令的过程。

  [来源:GB/T 36464 . 1—2020,3 . 7]

  3.2

  说话人分离 speakerdiarization

  对包含有效语音信号的音频流中的多个说话人进行说话人分割和说话人聚类的过程。

  注:说话人分离的 目的一般是对空间中存在的多个说话人进行分类和追踪。

  3.3

  说话人分割 speakersegmentation

  在多个说话人中找出说话人改变的时间边界,并根据这些边界将音频流切分成多个语音片段。

  3.4

  说话人聚类 speakerclustering

  将属于同一个说话人的一个或多个语音片段进行归类。

  3.5

  语音编码 speechcoding;speechencoding

  语音波形编码 speechwaveform coding

  按照一组能合理重构语音信号的规划,由经数字化的语音信号到离散的数据元序列的转换。

  注:语音数字化可与用于语音压缩的某一编码相结合。 因此,“语音编码”这一术语常指这种组合运算。

  [来源:GB/T 5271 . 29—2006,29 . 01 . 23]

  1

  GB/T 41813 . 1—2022

  3.6

  汉语方言 chinesedialect

  汉语中跟普通话有区别,只在特定地区使用的语言。

  4 概述

  智能语音交互测试中的语音识别测试主要包括功能测试与性能测试,具体如下:

  — 功能测试用于检查被测系统是否提供了语音识别相关的各项功能,具体包括:语音信号采集、语音转文字、语音唤醒、前端信号处理、说话人分离、语言信息识别及语音识别后处理;

  — 性能测试用于检测被测系统中语音识别相关的各项性能,具体包括:语音识别效果、语音识别效率、语音唤醒效果、前端信号处理效果、说话人分离效果、语言信息识别效果,及系统稳定性。

  测试过程中,依据被测系统技术规范进行在线/离线的功能和性能测试。 本文件所列测试项可用于对 GB/T 36464(所有部分)中语音识别相关的功能和性能要求进行测试。

  注:本文件对所列出的功能测试项选择不做要求,测试方根据被测系统的功能要求和测试需求选择测试项。

  5 测试准备和执行

  5 . 1 测试数据集

  在测试开始前,应通过提前录制或采集的方式制作测试数据集。 可根据不同测试项划分出多个测试数据集,在实际测试时可根据需要选择测试数据集。 测试数据集类型和要求应符合表 1 的要求。

  表 1 测试数据集类型和要求

  语音音频类型

  语音种类

  男声普通话

  女声普通话

  儿童普通话

  老人普通话

  男声

  汉语

  方言

  女声

  汉语

  方言

  无有效

  语音内

  容语音

  系统支持的语言信息

  类型语音

  混合语言

  信息类型语音

  空音频

  无噪声正常

  A类

  A类

  A类

  A类

  B类

  B类

  C类

  C类

  D类

  D类

  弱噪声正常a

  A类

  A类

  B类

  B类

  B类

  B类

  D类

  强噪声正常b

  B类

  B类

  C类

  C类

  C类

  C类

  D类

  大音量c

  B类

  B类

  B类

  B类

  D类

  D类

  D类

  快语速d

  B类

  B类

  C类

  C类

  D类

  D类

  D类

  截断音频

  C类

  C类

  —

  —

  —

  —

  —

  测试数据满足以下要求。

  a) 测试语音应至少 2 000 条,其中,各类测试语音数量要求如下:

  1) A类的总量不宜小于测试总量的 70% ;

  2) B类的总量不宜小于测试总量的 15%,不宜大于测试总量的 20% ;

  3) C类的总量不宜小于测试总量的 5%,不宜大于测试总量的 10% ;

  4) D类为可选,总量不宜大于测试总量的 5%。

  b) 各种语音种类的发音人,不应少于 30 名 。

  c) 3 s~5 s 时长的测试语音应占测试总量的 80%以上。

  d) 测试语音可包括中文和外文等,测试方可根据系统任务和应用场景设定测试语音内容。

  a 语音信噪比大于或等于 20 dB。

  b 语音信噪比小于 5 dB。

  c 在 16 bit量化比特下,波形采样点数值大于或等于 10 000 。

  d 语音输入速度大于每秒 5 字 。

  2

  GB/T 41813 . 1—2022

  5 . 2 测试工具

  语音识别测试工具包括可编程测试工具、测试统计工具和资源监测工具符合下列要求。

  a) 可编程测试工具要求如下:

  ● 应能调用被测系统开放接口;

  ● 应能对工具配置文件进行定制;

  ● 应能接收语音数据并将其输入至被测系统;

  ● 应能进行功能测试及其相应的性能测试;

  ● 应能以文本形式获取被测系统运行结果。

  b ) 测试统计工具要求如下:

  ● 应能自动对不同测试项的系统运行结果进行统计和分析;

  ● 应能自动对系统运行结果和标准结果对比文件进行比对。

  c) 资源监测工具应能监测内存、中央处理单元(CPU)、图形处理单元(GPU)、句柄数等系统资源参数。

  5 . 3 测试设备

  音频采样设备:音频采样设备参数应符合表 2 的要求。

  表 2 音频采样设备参数要求

  设备名称

  参数要求

  可移动的声卡

  支持 44 . 1 kHz及以上的采样频率,16 bit及以上的模数转换器和数模转换器

  录音软件

  支持 16 bit量化比特下的波形采样

  计算机

  支持录音软件的安装和使用

  声压计

  支持环境声压确认

  传声器设备:传声器设备参数应符合表 3 的要求。

  表 3 传声器设备参数要求

  参数名称

  符号和单位

  测试条件

  最小值

  典型值

  最大值

  灵敏度

  S/(dBV/ Pa)

  94 dB SPL@1 kHz

  -45

  - 38

  - 30

  信噪比

  SNR/ dB( A)

  94 dB SPL@1 kHz

  55

  —

  —

  输出阻抗

  Zout / Ω

  94 dB SPL@1 kHz

  —

  —

  400

  总谐波失真

  THD+N/ %

  100 dB SPL@1 kHz

  —

  —

  1

  115 dB SPL@1 kHz

  —

  —

  10

  指向性

  —

  全指向性

  —

  —

  —

  回放设备:回放设备参数应符合表 4 的要求。

  3

  GB/T 41813 . 1—2022

  表 4 回放设备参数要求

  设备名称

  参数要求

  其他要求

  计算机

  支持音频播放软件的安装和使用

  —

  回放外部环境

  外界噪声不超过 55 dB(A)情况下,室内本底噪声小于或等于 20 dB(A)(周围无明显振动源,关闭通风)

  —

  播放器

  频率响应( ±2.5 dB) : 74 Hz~18 kHz

  最大声压级:102 dB(A)

  可在无人工嘴的条件下使用

  功率放大器和人工嘴

  信噪比:90 dB(A)

  增益控制:0 dB~25 dB

  功率放大器 频 率 响 应:20 Hz~ 20 kHz, 人 工 嘴 频 率 响应:100 Hz~10 kHz

  最大声压级:110 dB(A)

  具 体 场 景 按 照 GB/T 36464(所有部分)执行

  噪声播放音箱

  功率:70 W(峰值 125 W)

  频率响应:50 Hz~21 kHz

  声压:≤113 dB SPL@1 m(对)

  输入阻抗:10 kΩ

  最大输入电平:22 dBu

  背景噪声播放音箱应经过频率响应均衡处理,被测系统麦克风(阵列)位置的回放噪声与原始噪声频率响应差

  异满足 +3 dB(100 Hz~10 kHz)

  —

  仿真人体

  根据播放器或人工嘴的尺寸和安装位置定制

  —

  5 . 4 测试环境

  应根据被测系统的功能和性能要求,以及应用场景配置相应的软硬件环境。

  5 . 5 测试执行

  应使用可编程测试工具和测试统计工具将测试数据集输入到在线/离线状态的被测系统中并获取运行结果。

  5 . 6 测试结果

  应根据被测系统技术要求对系统在各测试项上的运行结果进行记录和分析,形成测试结果。

  6 功能测试方法

  6 . 1 语音信号采集

  测试内容:检查被测系统是否提供给定拾音距离下的语音信号采集功能。

  测试方法:按照表 1 的要求和测试功能制作测试数据集,按照给定的拾音距离,放置被测系统和回放设备(播放器或人工嘴),使用可编程测试工具和测试统计工具将测试数据集输入到被测系统并获取运行结果。 拾音距离应根据被测系统的主要用途和应用场景进行设置,在实际测试中可根据需要进行区间划分,例如,按照 1 m、3 m 和 5 m划分为 4 个区间。

  4

  GB/T 41813 . 1—2022

  6 . 2 语音转文字

  测试内容:检查被测系统是否提供将所接收到的有效语音信号转化为与语音内容相符的文字结果,并将其输出的功能。

  测试方法:按照表 1 的要求和测试功能制作测试数据集,使用可编程测试工具和测试统计工具将测试数据集输入到被测系统并获取运行结果。

  6 . 3 语音唤醒

  测试内容:检查被测系统是否提供语音唤醒的功能,包括但不限于以下具体功能。

  a) 命令字(词)唤醒:能使用预定义唤醒命令字(词)唤醒被测系统。

  b) 自定义唤醒命令字(词):能自定义唤醒命令字(词)。

  c) 多命令字(词)唤醒:能使用不同的唤醒命令字(词)唤醒被测系统。

  d) 多音频流监听:被测系统在执行语音唤醒的同时能监听多个音频流。

  e) 语音打断唤醒:能使用语音打断的方式唤醒被测系统。

  f) 协同唤醒:使用相同命令字(词)的多个设备在同一场景中出现,一次唤醒操作有且仅有一个设备应答。

  测试方法:按照表 1 的要求和测试功能制作包含预定义唤醒命令字(词)、非唤醒命令字(词)、自定义唤醒命令字(词)、多个唤醒命令字(词)和语音打断唤醒命令字(词)的测试数据集,使用可编程测试工具和测试统计工具将测试数据集输入到被测系统并获取运行结果。

  6 . 4 前端信号处理

  测试内容:检查被测系统是否提供前端信号处理的功能,包括但不限于以下具体功能。

  a) 语音编解码:被测系统能设置语音编码算法的压缩等级,能支持不同音频编码格式下的语音音频的压缩和解压缩,并确保语音内容不变。

  b) 端点检测:被测系统能从连续音频流中检测出第一个或多个语音片段的起始点和结束点,能设置端点检测灵敏度,即设置语音等待超时时长和尾部静音长度。

  c) 语音增强:被测系统能自动对输入语音的信噪比进行改善,能对输入语音中的背景噪声和晚期混响进行抑制。

  d) 声源定位:被测系统能自动对发声源的空间位置进行定位。

  e) 格式转换:被测系统能自动对输入音频的格式进行转换,并确保语音内容不变。

  f) 重采样:被测系统能改变数字语音信号的采样率,并确保语音内容不变。

  g) 音频质量判断:被测系统能对输入音频质量进行自动判断。

  示例:对音量过小、信噪比过低或存在前、后截断的音频判断为音频质量较差。

  h) 声学回声消除:被测系统能对输入音频进行回声消除。

  测试方法:按照表 1 的要求和测试功能制作包含多种音频质量的测试数据集,包括前截断音频、后截断音频、音量小音频、信噪比低音频等,使用可编程测试工具和测试统计工具将测试数据集输入到被测系统并获取运行结果。

  6 . 5 说话人分离

  测试内容:检查被测系统是否提供说话人分离的功能,包括但不限于以下具体功能。

  a) 说话人分割:被测系统能 自动进行说话人分割,分割后的语音片段只包含一个说话人的语音内容。

  b) 说话人聚类:被测系统能自动进行说话人聚类,聚类后的语音片段分别对应不同的说话人。

  5

  GB/T 41813 . 1—2022

  测试方法:按照表 1 的要求和测试功能制作包含多个说话人交替对话的测试数据集,对话时长宜20 min,使用可编程测试工具和测试统计工具将测试数据集输入到被测系统并获取运行结果。

  6 . 6 语言信息识别

  测试内容:检查被测系统是否提供语言信息识别的功能,包括但不限于以下具体功能。

29139806529
下载排行 | 下载帮助 | 下载声明 | 信息反馈 | 网站地图  360book | 联系我们谢谢