“全评价”视域下GenAI工具评价指标体系构建研究——专家咨询问卷(第二轮)

尊敬的专家:

       您好!

       衷心感谢您在第一轮德尔菲咨询中提出的宝贵意见。第一轮问卷已顺利完成,课题组根据专家评分、变异程度和开放建议,对具体指标进行了修订。本轮为第二轮专家咨询,主要目的是:检验修订后指标的重要性、必要性和表述清晰度,并对重点争议指标进行复议,同时开展指标权重咨询。

        您的意见仅用于本研究的指标修订与权重确定,我们将严格匿名处理,不公开个人姓名与单位信息。

       【本轮评价对象与典型使用场景】

       为避免不同专家对“GenAI工具”理解不一致,请在作答时主要依据以下对象和场景:

       评价对象:通用型生成式人工智能工具,如ChatGPT、DeepSeek、文心一言、通义千问等大语言模型对话与内容生成工具。

       典型场景:科研知识辅助、办公写作、学习辅导、信息检索与整理、创意构思、决策辅助等。

您的姓名
    ____________

第一部分  修订后指标重要性再评价

修订说明: 课题组依据专家评分(均值、变异系数)、开放意见及“全评价”理论框架,对指标体系进行了修订:删除2项指标(资源占用效率、支持终端类型数量),合并2组概念重叠指标(信息新颖性与内容原创性合并为“信息新颖与创新性”;情感适应性与风格一致性合并为“场景与表达适配性”),其余指标以名称和操作性定义优化为主。

评分标准(1~5 分) :5=非常重要,4=重要,3=一般重要,2=不重要,1=非常不重要。

(一)形式评价维度
形式评价关注GenAI工具的技术性能与交互质量,包括响应速度、稳定性、鲁棒性、兼容性与易用性等可感知、可评价的指标。
(1)响应速度:从用户提交请求到系统开始输出有效内容所需时间。 ★ ★ ★ ★ ★
(2)接口成功率:系统在正常调用条件下能够成功返回有效结果的比例。 ★ ★ ★ ★ ★
(3)对话完成率:系统能够顺利完成单轮或多轮交互,不因技术故障异常中断。 ★ ★ ★ ★ ★
(4)系统稳定性:系统能够持续访问、较少出现宕机、卡顿或服务中断的程度。 ★ ★ ★ ★ ★
(5)高负载稳定性:在请求量较大或高负载场景下,系统仍能稳定提供服务的程度。 ★ ★ ★ ★ ★
(6)输入鲁棒性:面对拼写错误、表达不规范或一定干扰信息时,仍能识别意图并完成任务。 ★ ★ ★ ★ ★
(7)异常与边界请求处理能力:面对超出能力范围、违规或高风险请求时,能够进行适当提醒、拒答或引导。 ★ ★ ★ ★ ★
(8)处理效率:在合理时间内持续处理多个请求并保持有效响应的能力。 ★ ★ ★ ★ ★
(9)格式兼容性:工具对常见文本、文档及任务所需输入/输出格式的支持程度。 ★ ★ ★ ★ ★
(10)交互易用性:界面设计清晰、操作步骤简洁,并具有必要的功能说明和操作指引。 ★ ★ ★ ★ ★
您对形式维度指标的整体意见与建议:
    ____________
(二)内容评价维度
内容评价聚焦GenAI工具输出信息的准确性、可靠性、安全性与专业性,是评价体系的核心维度。
(1)事实准确性:生成内容与客观事实、可靠来源和原始材料相符,不出现明显事实错误或幻觉。 ★ ★ ★ ★ ★
(2)逻辑一致性:内容内部逻辑自洽,推理过程和结论之间不存在明显矛盾。 ★ ★ ★ ★ ★
(3)语义连贯性:表达流畅、结构清晰、前后衔接自然,具有良好可读性。 ★ ★ ★ ★ ★
(4)内容完整性:能够覆盖完成任务所必需的核心信息,不存在重要遗漏。 ★ ★ ★ ★ ★
(5)内容多样性:在适用场景下能够提供较丰富、具有差异性的内容,避免高度同质化。 ★ ★ ★ ★ ★
(6)信息新颖与创新性:在已有信息基础上提供新的联系、观点、启示或有价值的信息增量。 ★ ★ ★ ★ ★
(7)内容安全性:避免生成有害、违法、歧视、明显不当或可能造成现实伤害的内容。 ★ ★ ★ ★ ★
(8)场景与表达适配性:输出的语气、专业程度、表达方式及必要的情感基调与任务场景和用户需求相匹配。 ★ ★ ★ ★ ★
(9)知识时效性:生成内容所依据的知识能够反映合理时间范围内的最新进展。 ★ ★ ★ ★ ★
(10)引用可靠性:引用来源真实、可核验,引用内容与原始来源一致,不虚构或错引。 ★ ★ ★ ★ ★
您对内容维度指标的整体意见与建议:
    ____________
(三)效用评价维度
效用评价关注GenAI工具的实际应用价值与社会影响,是最终、根本的评价维度。
(1)任务完成效果:工具能够按照用户要求正确、完整地完成指定任务。 ★ ★ ★ ★ ★
(2)问题解决效率:使用工具后能够降低解决问题所需的时间、认知或其他资源投入。 ★ ★ ★ ★ ★
(3)总体用户满意度:用户对工具整体使用结果、体验和价值的综合满意程度。 ★ ★ ★ ★ ★
(4)学习促进效应:工具能够帮助用户理解新知识、掌握技能或改善学习效果。 ★ ★ ★ ★ ★
(5)工作效率提升:工具能够提升科研、职业或日常任务中的工作效率和生产力。 ★ ★ ★ ★ ★
(6)创意与启发效应:工具能够帮助用户产生新思路、新视角、新问题意识或解决方案。 ★ ★ ★ ★ ★
(7)决策支持效果:工具能够帮助用户获取、整理和分析信息,从而改善判断或决策。 ★ ★ ★ ★ ★
(8)社会效益:工具在知识普及、教育公平、文化传播、信息获取等方面产生积极社会价值。 ★ ★ ★ ★ ★
(9)伦理与合规性:工具的设计、输出和使用符合伦理规范、法律法规、知识产权及相关行业规则。 ★ ★ ★ ★ ★
(10)可持续影响:工具长期使用对用户能力、认知习惯、行为方式及工作模式产生的持续影响。 ★ ★ ★ ★ ★
(11)成本效益:工具使用收益与时间、经济、学习等投入成本之间的合理程度。 ★ ★ ★ ★ ★
(12)协作与人机协同增益:工具对团队协作、知识共享以及人与AI协同完成任务的促进程度。 ★ ★ ★ ★ ★
您对效用维度指标的整体意见与建议:
    ____________

第二部分 指标权重赋权

本部分用于确定三级指标体系中各指标的权重,采用层次分析法(AHP)确定一级和二级框架的相对权重,三级框架内部指标权重将以本轮第一部分重要性评分归一化形成。请您完成以下两层次判断。

【AHP标度说明】

请您对指标进行两两比较,判断前者相对于后者的重要程度。

1 :两者同等重要

3 :前者比后者稍重要

5 :前者比后者明显重要

7 :前者比后者强烈重要

9 :前者比后者极端重要

倒数:若后者比前者重要,请选择1/3、1/5、1/7、1/9等

一级指标 重要性比较
9 7 5 3 1 1/3 1/5 1/7 1/9
形式/内容
形式/效用
内容/效用
形式评价下二级指标 之间的重要性比较
9 7 5 3 1 1/3 1/5 1/7 1/9
响应性能/系统稳定性
响应性能/鲁棒与安全性
响应性能/交互与兼容性
系统稳定性/鲁棒与安全性
系统稳定性/交互与兼容性
鲁棒与安全性/交互与兼容性
内容评价下二级指标 之间的重要性比较
9 7 5 3 1 1/3 1/5 1/7 1/9
真实与准确性/逻辑与结构质量
真实与准确性/创造与多样性
真实与准确性/安全与适应性
逻辑与结构质量/创造与多样性
逻辑与结构质量/安全与适应性
创造与多样性/安全与适应性
效用评价下二级指标 之间的重要性比较
9 7 5 3 1 1/3 1/5 1/7 1/9
任务绩效/用户发展价值
任务绩效/决策与社会价值
任务绩效/综合体验与治理
用户发展价值/决策与社会价值
用户发展价值/综合体验与治理
决策与社会价值/综合体验与治理
您对各级指标权重的建议
    ____________

17题 | 被引用0次

模板修改
使用此模板创建