资料介绍
ICS 35.240 CCS L70
团体 标准
01174T/ISC 0117—2026
企业级大模型和应用全栈服务能力
Enterprise-Level Large Models and Full-Stack Application Service Capabilities
(发布稿)
2026-07-20 发布 2026-08-20 实施
中国 互联 网协 会发 布
T/ISC 0117—2026
目次
前言 3
企业级大模型和应用全栈服务能力 4
1. 范围 4
2. 规范性引用文件 4
3. 术语和定义 4
3. 1 非结构化数据 unstructured data 4
3.2 结构化数据 structured data 4
3.3 训练数据 training data 4
3.4 模型训练 model training 4
3.5 微调 fine-tuning 4
3.6 模型评估 model evaluation 4
4. 符号和缩略语 5
5. 概述 5
6. 基础设施建设能力 6
6. 1 计算 6
6.2 存储 6
6.3 网络 6
7. 数据建设能力 6
7. 1 数据采集 6
7.2 数据存储 7
7.3 数据处理 7
7.3.1 数据清洗 7
7.3.2 数据标注 7
7.3.3 数据配平 8
7.3.4 数据增强 8
7.3.5 数据混合拆分 9
7.3.6 文档切分 9
7.4 数据管理 9
7.4.1 数据目录 9
7.4.2 质量管理 9
7.4.3 标签管理 10
7.5 数据安全 10
8. 模型建设能力 10
8. 1 模型训练 10
1
8.1.1 任务管理 10
8.1.2 模型优化 10
8.1.3 训练任务加速 11
8.1.4 断点续训 11
8.2 模型评估 11
8.3 模型推理 11
8.3.1 模型推理 11
8.3.2 模型部署 11
8.3.3 提示词管理 11
8.4 模型管理 11
8.4.1 模型服务管理 11
8.4.2 模型监控 11
8.5 模型安全 12
9. 应用建设能力 12
9. 1 应用开发 12
9.2 应用部署 12
9.3 应用管理 12
9.4 应用监控 12
9.5 应用安全 12
2
前言
本文件按照GB/T 1.1—2020《标准化工作导则第1部分:标准化文件的结构和起草规则》的规定起草。
请注意本文件的某些内容可能涉及专利。本文件的发布机构不承担识别专利的责任。
本文件由中国互联网协会提出并归口。
本文件起草单位:中国信息通信研究院、中移(苏州)软件技术有限公司、杭州智元研究院有限公司、中电信数智科技有限公司、国网石家庄供电公司、联通数据智能有限公司、京东科技信息技术有限公司、广州荔支网络技术有限公司、中国移动通信集团浙江有限公司、济南浪潮数据技术有限公司、河南农村商业银行股份有限公司、中原银行股份有限公司、紫金山实验室、北京直真科技股份有限公司、广东元能星泰孪生科技创新有限公司、蚂蚁科技集团股份有限公司、科大讯飞股份有限公司、中国移动通信集团山东有限公司中移齐鲁创新院分公司、中央民族大学、中国石油大学(华东)
本文件主要起草人:高源、徐恩庆、董恩然、李昂、王蕴婷、陈传志、王杨希、王壮、尚鹏辉、崔贤良、王光琦、尚啸、邢驰、郭洋、蒋彪、刘畅、高宇星、姜熠龙、黄玉龙、赵昆、张其濛、曹铮、刁雪飞、郝鹏、刘冶、徐晨鑫、谢文韬、薛卓亿、荆潇、刘元松、郭立民、李宪状、刘亚坤、胡光辉、顾永杰、魏宏彬、 白阳、汪浩、王大伟、邝贤生、贺皓、张金柱、韩冬、凌晖、伍亮、刘恒心、冯东柄、马文军、丁飞、朱子秋、孔鹏、刘聪、朱祥磊、孙丰勋、安禹、王飞、陈鸿龙、 吕明琪
3
1. 范围
本文件规定了企业级大模型和应用全栈服务能力的要求。
本文件适用于企业级大模型和应用全栈服务能力的建设、评估与选型。
2. 规范性引用文件
下列文件中的内容通过文中的规范性引用而构成本文件必不可少的条款。其中,注日期的引用文件,仅该日期对应的版本适用于本文件;不注日期的引用文件,其最新版本(包括所有的修改单)适用于本文件。
GB/T 5271.1-2000 信息技术词汇第1部分:基本术语
GB/T 5271.28-2001 信息技术词汇第28部分:人工智能基本概念与专家系统
GB/T 41867-2022 信息技术人工智能术语
GB/T 35295-2017 信息技术大数据术语
3. 术语和定义
3. 1 非结构化数据 unstructured data
不具备预定义数据模型或固定结构,不适合用数据库二维逻辑表来表现的数据。 [来源:GB/T 35295-2017,2.1.25]
3.2 结构化数据 structured data
一种数据表示形式,按此种形式,由数据元素汇集而成的每个记录的结构都是一致的并且可以使用关系模型予以有效描述。 [来源:GB/T 35295-2017,2.2.13]
3.3 训练数据 training data
用于训练机器学习模型的输入数据样本子集[来源:GB/T 41867-2022,3.2.34]
3.4 模型训练 model training
利用训练数据,基于机器学习算法,确定或改进机器学习模型参数的过程。[来源:GB/T41867-2022, 3.2.18]
3.5 微调 fine-tuning
在预训练模型基础上,使用特定领域数据集对模型参数进行进一步调整,以提升模型在该领域性能的技术。 [来源:GB/T 41867-2022,3.2.31]
3.6 模型评估 model evaluation
通过既定的各类人工智能任务评估指标,对训练生成的模型进行质量评判。
4
4. 符号和缩略语
下列符号和缩略语适用于本文件。
AI:人工智能(Artificial Intelligence)
API:应用程序编程接口(Application Programming Interface)
ARM:高级精简指令集机器(Advanced RISC Machine)
BLEU:双语评估替补(Bilingual Evaluation Understudy)
CPU:中央处理器(Central Processing Unit)
GPU:图形处理器(Graphics Processing Unit)
HDD:硬盘驱动器(Hard Disk Drive)
INT8:8位整数(8-bit Integer)
BF16:脑浮点16位格式(Brain Floating Point 16)
IoU:交并比(Intersection over Union)
IP:互联网协议(Internet Protocol)
JSON:JavaScript对象表示法(JavaScript Object Notation)
Lora:低秩自适应(Low-Rank Adaptation)
mAP:平均精度均值(mean Average Precision)
MP3:MPEG-1音频第三层(MPEG-1 Audio Layer III)
NPU:神经网络处理器(Neural Processing Unit)
OCR:光学字符识别(Optical Character Recognition)
QA:问答(Question and Answer)
Qlora:量化低秩自适应(Quantized Low-Rank Adaptation)
RDMA:远程直接内存访问(Remote Direct Memory Access)
RGB:红绿蓝色彩模式(Red Green Blue)
ROUGE:面向召回率的摘要评估方法(Recall-Oriented Understudy for Gisting Evaluation)
SDK:软件开发工具包(Software Development Kit)
SSD:固态硬盘(Solid State Drive)
WAV:波形音频文件格式(Waveform Audio File Format)
X86:x86指令集架构(x86 Architecture)
XML:可扩展标记语言(eXtensible Markup Language)
5. 概述
表 1 大模型和应用全栈服务能力总体架构
能力域
能力项
基础设施
计算
存储
网络
数据
数据采集
数据存储
数据处理
5
数据管理
数据安全
模型
模型训练
模型评估
模型推理
模型管理
模型安全
应用
应用开发
应用部署
应用监控
应用管理
应用安全
6. 基础设施建设能力
基础设施维度规范了企业建设基础设施时应该具备的计算、存储、网络能力。
6. 1 计算
1)应支持通用计算资源,例如X86、ARM等架构的CPU通算资源;
2)应支持GPU、NPU等智算资源;
3)应支持提供基于容器的智能计算集群;
4)应支持硬件资源的虚拟化;
5)应支持计算资源弹性扩缩容。
6.2 存储
1)应支持挂载高效读写硬盘,例如SSD、HDD等多种类型硬盘;
2)应支持存储资源管理及弹性扩缩容。
6.3 网络
1)应支持多类型网络接口;
2)宜支持高性能网络交换机等硬件设备;
3)宜支持高性能RDMA网络;
4)应具备提供网络资源管理能力,包括:
l 应支持创建、删除、编辑、查询虚拟私有网络;
l 应支持私有网络IP地址管理功能,如IP地址的自动和手动分配;
l 应支持创建、删除、编辑、查询虚拟子网;
l 宜支持查看私有网络拓扑信息;
l 宜支持虚拟网关和路由。
7. 数据建设能力
数据维度规范了企业应该具备的数据采集、存储、处理、管理和安全等能力。
7. 1 数据采集
6
1)应支持多种数据源的导入,包括内置数据和外部知识数据(通过API或其他方式接入外部知识源,如搜索引擎、开放数据库等);
2)应支持多模态数据的导入,包括文字、文档、图片、音频、视频、结构化数据等知识数据模态。
7.2 数据存储
1)应支持多种数据类型的存储,包括结构化数据(如表格、关系型数据等)、半结构化数据(如JSON、XML、API接口数据等)和非结构化数据(包括文档、图片、音频和视频等)的存储;
2)应支持多种存储方式:
l 应支持使用传统数据库系统存储结构化数据;
l 应支持使用分布式存储系统存储非结构化数据;
l 应支持使用图数据库存储知识图谱数据;
l 应支持使用向量数据库存储向量数据。
7.3 数据处理
7.3.1 数据清洗
1)应支持去重功能,消除数据集内部及不同数据集之间的重复数据,确保数据的唯一性和一致性;
注:数据去重是指通过特定的算法和技术手段,识别并移除数据中完全相同或高度相似的记录,避免数据冗余,提高数据的准确性和处理效率。
2)应提供过滤功能,识别并移除敏感、不当或不符合要求的数据,确保数据的合规性和安全性;
注:数据过滤是指依据预设的规则和标准,对数据进行筛选和审查,剔除其中的非法、有害、低质量或与目标不相关的内容,从而保障数据的合法性和可用性。
3)应支持转换功能,为模型训练提供标准化的数据格式。
注:数据转换是指通过对数据进行一系列的处理操作,如格式调整、编码转换、数据归一化等,将原始数据转换为适合模型训练和分析的统一格式,来提升数据质量、增强数据的一致性,同时通过敏感信息替换等方式保护数据隐私。
l 文本转换:支持格式转换、编码转换、多语种互译、文本结构化(如QA对提取、实体识别)、敏感词替换、文本摘要生成等;
l 图像转换:支持背景处理、人脸模糊、分辨率增强、尺寸调整、格式转换(如RGB标准化)等;
l 视频转换:支持格式转换、视频分割、关键帧提取、分辨率调整、标签生成(基于帧内容分析)、动态物体追踪等;
l 音频转换:支持高斯加噪、语音增强、格式转换(如WAV转MP3)、语音文本转录、采样率调整等;
l 多模态转换:支持跨模态数据提取(如图片OCR文字识别、公式结构解析、视频中语音与画面同步标注)。
7.3.2 数据标注
7.3.2.1 文本标注
1)应支持对文本进行自动化标注;
l 应支持对象自动提取功能, 自动标注文本中的人名、机构名、地点等实体信息;
l 应支持标签自动生成功能,对从文本中提取出的内容分配语义标签(如词性、情感、主题等) 以及实体间的关联关系;
7
2)应支持对文本数据进行人工标注。
7.3.2.2 图片标注
1)应支持对图片进行自动化标注;
l 应支持对象自动提取功能,从图片中定位并提取出具体的实体对象;
l 应支持标签自动生成功能,对从图片中提取出的对象或内容分配标签;
l 应支持图生文功能,基于图像内容自动生成结构化描述文本(如物体识别、场景描述、属性标注),并确保生成文本与图像语义的一致性;
2)应支持对图片进行人工标注。
7.3.2.3 视频标注
1)应支持对视频进行自动化标注;
l 应支持关键帧自动化提取,基于内容变化率自动标注视频关键帧时间戳;
l 应支持行为分析标注,识别并标注特定业务行为(如客户接待、设备操作);
l 应支持多模态关联标注,同步标注视频画面与对应音频文本内容;
2)应支持对视频进行人工标注。
7.3.2.4 音频标注
1)应支持对音频进行自动化标注;
l 应实现语音转写,将音频自动转写为带时间戳的文本;
l 宜支持声纹特征标注,区分并标注不同说话人的声纹特征;
l 应具备情感分析标注,根据语调自动标注积极/消极/中立情绪;
2)应支持对音频进行人工标注。
7.3.2.5 标注审核
1)应支持标注结果的质量审核机制包括抽样复核、校验规则校对等方式,确保标注数据的准确性和一致性。
7.3.3 数据配平
1)应支持数据比例均衡功能,支持各类别样本的比例自动或手动调整,确保数据集中各类别数据的分布合理,避免模型训练中的偏差问题;
2)应提供数据采样功能,对过多或过少的数据类别进行合理调整,优化数据集结构;
3)宜支持数据分布分析功能,帮助识别并纠正数据不平衡问题,提出配平建议或操作支持。
7.3.4 数据增强
数据增强是在学习模型时通过对原始数据进行变换、扰动或组合,生成额外的训练样本,来扩充训练数据集,提高模型的泛化能力。
7.3.4.1 文本数据增强
1)应支持对文本进行同义词替换处理;
2)应支持对文本进行随机插入、随机删除、句式结构调整、语序变换等处理。
7.3.4.2 图片数据增强
8
1)应支持对图片进行平移、翻转、旋转、缩放处理;
2)应支持对图片进行裁剪处理;
3)应支持对图片进行色彩(亮度、饱和度、对比度等)变换处理;
4)宜支持对图片进行噪声注入。
7.3.4.3 音频数据增强
1)应支持对音频进行重采样处理;
2)应支持对音频进行变声(如调整音量、音高、速度)处理;
3)应支持对音频进行音频切割、音频拼接处理;
4)应支持对音频进行加噪/降噪处理;
5)宜支持对音频的时域/频域进行扰动处理。
7.3.4.4 视频数据增强
1)应支持对视频进行帧率、分辨率调整;
2)应支持对视频进行裁剪;
3)应支持对视频的色彩、色调进行调整。
7.3.5 数据混合拆分
1)应支持多数据集混合功能,将来自不同来源、格式、类型、归属不同数据集的知识数据统一处理,形成完整的知识体系;
2)应提供数据融合功能(例如结构映射、格式转换、语义对齐),确保不同数据集之间的数据格式和结构兼容性;
3)应支持数据集拆分功能,将大数据集拆分成多个子集。
7.3.6 文档切分
文档切分是在生成知识库时将大块文档切分成小块,用于增加模型推理时从数据库召回的准确性。
1)应支持对多种格式的文档进行切分,包括但不限于Word、Excel、PDF等;
2)应支持多种分段配置方式,包括但不限于自定义配置分段策略(固定大小、基于结构、上下文组合)、分段最大长度设置等;
3)应支持多种分段策略,包括但不限于固定长度分段、 自适应分段。
7.4 数据管理
7.4.1 数据目录
1)应支持数据可视化管理能力,提供数据目录功能,方便用户管理和使用;
2)应支持数据分类分级管理能力,提供数据分类分组、数据分级等功能。
7.4.2 质量管理
1)应支持数据质量评估功能,针对文本、图片、音频、视频等不同模态的数据,制定相应的质量评估指标(如清晰度、完整性、一致性等),确保数据的整体质量;
2)应支持数据质量修复功能,通过自动化或人工干预方式,对低质量数据进行修复或替换,提升整体数据质量;
9
3)宜提供数据质量报告功能,生成详细的质量分析报告,帮助用户全面了解数据质量状况并优化数据处理流程。
7.4.3 标签管理
1)应支持标签用途管理功能,明确标签的具体用途(如用于模型蒸馏、多轮对话训练等),确保标签与任务目标的高度匹配;
2)宜支持标签来源管理功能,记录标签的生成方式(如自动化标注、人工标注)及来源(如内部标注团队、第三方服务),确保标签的可追溯性和可靠性;
3)宜提供多模态标签关联功能,将文本、图片、音频、视频等不同模态的标签进行关联,形成统一的标签体系,提升数据的综合应用能力。
7.5 数据安全
1)应采用动态脱敏技术对训练数据集进行特征值模糊化处理,并在数据存储与传输过程中实施端到端加密策略,确保原始数据不可还原;
2)应通过硬件级隔离或虚拟化技术实现推理环境与核心业务系统的物理/逻辑分离,防范模型输出泄露敏感信息;
3)应建立数据操作全链路日志追踪机制,对数据导出、模型参数修改等高危行为实施双人复核与实时告警;
4)应部署AI驱动的异常流量监测系统,实时识别非授权数据访问、模型逆向工程等攻击行为。
8. 模型建设能力
模型维度规范了企业在构建模型时,应该具备的训练、评估、推理、管理等能力。
8. 1 模型训练
8.1.1 任务管理
1)应支持训练任务部署在NPU/GPU多种硬件资源上;
2)应支持对训练任务进行创建、查询、管理、停止、删除等生命周期管理;
3)应支持提供多种主流训练框架,例如,TensorFlow、PyTorch等;
4)应支持利用数据集进行模型训练;
5)应支持模型训练的版本管理,可对指定版本进行重新训练;
6)应支持单机多卡模式并行训练;
7)宜支持多机多卡模式分布式训练;
8)宜支持实时输出模型训练信息,包含训练时长、迭代次数等;
9)宜支持模型训练模板配置,包含超参设置等;
10)宜支持模型训练过程的可视化,包含收敛、损失函数等参数值。
8.1.2 模型优化
8.1.2.1 模型微调
1)应支持创建和管理微调任务,提供全参微调、LoRA、QLoRA等精调方式。
8.1.2.2 模型量化
10
1)宜支持对模型进行剪枝、轻量化、蒸馏等操作,以降低模型计算复杂度的能力。
8.1.3 训练任务加速
具备提供适用于智能计算的网络、存储等优化和对模型训练加速的工具或组件,具体要求如下:
1)应支持提供面向大量IO吞吐场景的高性能存储服务;
2)应支持提供高性能网络、通信加速工具;
3)应支持提供针对AI训练加速工具。
8.1.4 断点续训
1)应支持模型在训练出现故障导致任务中断后,快速恢复。
8.2 模型评估
1)应支持模型评估测试数据集管理,包含测试数据集的创建、维护和查看等功能;
2)应支持自定义评估指标库,涵盖分类任务(准确率、F1值)、检测任务(mAP、IoU)、生成任务(BLEU、ROUGE)等场景化指标;
3)应支持基于测试集对模型进行评估;
4)应支持查看评估报告;
5)应支持筛选及导出评估分析结果,便于用户进行进一步的分析和处理。
8.3 模型推理
8.3.1 推理服务
1)应支持多种深度学习模型服务化框架,以支持不同模型的部署和运行;
2)应支持模型推理服务的弹性资源调度,包括手动、自动扩缩容,以适应不同负载下的服务需求。
8.3.2 模型部署
1)应支持多种部署方式,例如云端和分布式部署,来适应不同硬件环境,满足多样化的部署需求;
2)应支持多种模型精度部署,如BF16、INT8等, 以适应不同计算能力和资源限制。
8.3.3 提示词管理
1)应支持预置提示词;
2)宜具备提示词模板制定和模板选择功能。
8.4 模型管理
8.4.1 模型服务管理
1)应支持模型服务的添加、删除等编辑功能;
2)应支持生成API Key、API接口。
8.4.2 模型监控
1)应支持对模型所占用的资源使用进行监控,包括计算、存储、网络;
2)应支持查看调用总量、调用失败、输入、输出Token;
3)应支持按分钟、按小时、按日查看各监控项曲线走势图;
11
4)宜支持查看错误次数、错误占比、错误码等调用失败数据。
8.5 模型安全
1)应支持模型训练安全,包括但不限于提供多种手段防范外部恶意攻击、面对恶意攻击(如数据投毒、后门攻击)的应具备相应的防御性能力;
2)应支持在大模型推理时的实时监控与预警的能力, 以及对大模型进行恢复与应急处理。
9. 应用建设能力
应用维度规范了企业在开发AI应用时,应该具备的开发、部署、管理、监控、安全等维度的能力。
9. 1 应用开发
1)应支持集成开发环境,实现代码级应用开发;
2)应支持基于低代码/无代码的可视化应用开发, 以实现复杂业务逻辑的集成;
3)应支持将开发环境中的容器打包成镜像,用户可自定义镜像名称和版本。
9.2 应用部署
1)应支持以API、SDK的方式部署应用,提供灵活的集成选项;
2)应支持应用部署策略,包括但不限于:蓝绿部署、滚动升级等,且支持自动回滚,以确保部署过程的稳定性和可靠性;
3)应支持以容器镜像的方式部署应用, 以提高部署的便捷性和一致性。
9.3 应用管理
1)应支持对应用API调用接口进行管理;
2)应支持应用的全生命周期管理,包括(批量)部署、删除、版本升级、更新补丁等。
9.4 应用监控
1)应支持对平台部署应用的效果进行监控,包括准确率、召回率等指标;
2)应支持对平台服务的性能进行监控,包括平台吞吐率、响应时延、并发能力、资源占用率、运行稳定度等。
9.5 应用安全
1)应支持对API调用行为的监测系统,对异常高频访问、非授权数据提取等行为实施实时阻断与溯源;
2)应支持涉黄、涉暴、涉政、涉恐等违规敏感内容的审核;
3)应实现基于语义理解的上下文关联审核,对隐晦表述等高风险内容进行深度挖掘与分级处置。
12
相关推荐
- T∕ZZB 2206-2021 电机定子铁芯激光焊接装备
- T∕CFLP 0027-2020 国有企业采购管理规范
- T/CI 155-2023 基于多模态大模型的智慧交通出行技术规范
- T/ESSE 003-2023 利川红
- T∕CPSS 1003-2019 交流输入电压暂降与短时中断的低压直流型补偿装置技术规范
- T/ZBD 100.5-2023 建设工程结算审核作业指引
- T/ZZB 0125-2016 光学防抖手机摄像模块
- T/CRES 0032-2025 风力发电机组 脂类润滑轴承及齿轮运行和维护规范
- T/CASME 2087-2025 风力发电机组齿轮箱润滑管理要求
- T/PAYS 003-2024 磐安药膳九种体质养生套餐基本要求


