“全评价”视域下GenAI工具评价指标体系构建研究——专家咨询问卷(第二轮)

尊敬的专家:       您好!       衷心感谢您在第一轮德尔菲咨询中提出的宝贵意见。第一轮问卷已顺利完成,课题组根据专家评分、变异程度和开放建议,对具体指标进行了修订。本轮为第二轮专家咨询,主要目的是:检验修订后指标的重要性、必要性和表述清晰度,并对重点争议指标进行复议,同时开展指标权重咨询。        您的意见仅用于本研究的指标修订与权重确定,我们将严格匿名处理,不公开个人姓名与单位信息。       【本轮评价对象与典型使用场景】       为避免不同专家对“GenAI工具”理解不一致,请在作答时主要依据以下对象和场景:       评价对象:通用型生成式人工智能工具,如ChatGPT、DeepSeek、文心一言、通义千问等大语言模型对话与内容生成工具。       典型场景:科研知识辅助、办公写作、学习辅导、信息检索与整理、创意构思、决策辅助等。

Q1:您的姓名

填空1

:第一部分  修订后指标重要性再评价修订说明:课题组依据专家评分(均值、变异系数)、开放意见及“全评价”理论框架,对指标体系进行了修订:删除2项指标(资源占用效率、支持终端类型数量),合并2组概念重叠指标(信息新颖性与内容原创性合并为“信息新颖与创新性”;情感适应性与风格一致性合并为“场景与表达适配性”),其余指标以名称和操作性定义优化为主。评分标准(1~5分):5=非常重要,4=重要,3=一般重要,2=不重要,1=非常不重要。

:(一)形式评价维度

Q2:形式评价关注GenAI工具的技术性能与交互质量,包括响应速度、稳定性、鲁棒性、兼容性与易用性等可感知、可评价的指标。

(1)响应速度:从用户提交请求到系统开始输出有效内容所需时间。
(2)接口成功率:系统在正常调用条件下能够成功返回有效结果的比例。
(3)对话完成率:系统能够顺利完成单轮或多轮交互,不因技术故障异常中断。
(4)系统稳定性:系统能够持续访问、较少出现宕机、卡顿或服务中断的程度。
(5)高负载稳定性:在请求量较大或高负载场景下,系统仍能稳定提供服务的程度。
(6)输入鲁棒性:面对拼写错误、表达不规范或一定干扰信息时,仍能识别意图并完成任务。
(7)异常与边界请求处理能力:面对超出能力范围、违规或高风险请求时,能够进行适当提醒、拒答或引导。
(8)处理效率:在合理时间内持续处理多个请求并保持有效响应的能力。
(9)格式兼容性:工具对常见文本、文档及任务所需输入/输出格式的支持程度。
(10)交互易用性:界面设计清晰、操作步骤简洁,并具有必要的功能说明和操作指引。

Q3:您对形式维度指标的整体意见与建议:

填空1

:(二)内容评价维度

Q4:内容评价聚焦GenAI工具输出信息的准确性、可靠性、安全性与专业性,是评价体系的核心维度。

(1)事实准确性:生成内容与客观事实、可靠来源和原始材料相符,不出现明显事实错误或幻觉。
(2)逻辑一致性:内容内部逻辑自洽,推理过程和结论之间不存在明显矛盾。
(3)语义连贯性:表达流畅、结构清晰、前后衔接自然,具有良好可读性。
(4)内容完整性:能够覆盖完成任务所必需的核心信息,不存在重要遗漏。
(5)内容多样性:在适用场景下能够提供较丰富、具有差异性的内容,避免高度同质化。
(6)信息新颖与创新性:在已有信息基础上提供新的联系、观点、启示或有价值的信息增量。
(7)内容安全性:避免生成有害、违法、歧视、明显不当或可能造成现实伤害的内容。
(8)场景与表达适配性:输出的语气、专业程度、表达方式及必要的情感基调与任务场景和用户需求相匹配。
(9)知识时效性:生成内容所依据的知识能够反映合理时间范围内的最新进展。
(10)引用可靠性:引用来源真实、可核验,引用内容与原始来源一致,不虚构或错引。

Q5:您对内容维度指标的整体意见与建议:

填空1

:(三)效用评价维度

Q6:效用评价关注GenAI工具的实际应用价值与社会影响,是最终、根本的评价维度。

(1)任务完成效果:工具能够按照用户要求正确、完整地完成指定任务。
(2)问题解决效率:使用工具后能够降低解决问题所需的时间、认知或其他资源投入。
(3)总体用户满意度:用户对工具整体使用结果、体验和价值的综合满意程度。
(4)学习促进效应:工具能够帮助用户理解新知识、掌握技能或改善学习效果。
(5)工作效率提升:工具能够提升科研、职业或日常任务中的工作效率和生产力。
(6)创意与启发效应:工具能够帮助用户产生新思路、新视角、新问题意识或解决方案。
(7)决策支持效果:工具能够帮助用户获取、整理和分析信息,从而改善判断或决策。
(8)社会效益:工具在知识普及、教育公平、文化传播、信息获取等方面产生积极社会价值。
(9)伦理与合规性:工具的设计、输出和使用符合伦理规范、法律法规、知识产权及相关行业规则。
(10)可持续影响:工具长期使用对用户能力、认知习惯、行为方式及工作模式产生的持续影响。
(11)成本效益:工具使用收益与时间、经济、学习等投入成本之间的合理程度。
(12)协作与人机协同增益:工具对团队协作、知识共享以及人与AI协同完成任务的促进程度。

Q7:您对效用维度指标的整体意见与建议:

填空1

:第二部分 指标权重赋权本部分用于确定三级指标体系中各指标的权重,采用层次分析法(AHP)确定一级和二级框架的相对权重,三级框架内部指标权重将以本轮第一部分重要性评分归一化形成。请您完成以下两层次判断。【AHP标度说明】请您对指标进行两两比较,判断前者相对于后者的重要程度。 1:两者同等重要 3 :前者比后者稍重要 5 :前者比后者明显重要 7 :前者比后者强烈重要 9 :前者比后者极端重要 倒数:若后者比前者重要,请选择1/3、1/5、1/7、1/9等

Q8:一级指标重要性比较

9
7
5
3
1
1/3
1/5
1/7
1/9

Q9:形式评价下二级指标之间的重要性比较

9
7
5
3
1
1/3
1/5
1/7
1/9

Q10:内容评价下二级指标之间的重要性比较

9
7
5
3
1
1/3
1/5
1/7
1/9

Q11:效用评价下二级指标之间的重要性比较

9
7
5
3
1
1/3
1/5
1/7
1/9

Q12:您对各级指标权重的建议

填空1
“全评价”视域下GenAI工具评价指标体系构建研究——专家咨询问卷(第二轮)
关于
2周前
更新
0
频次
17
题目数
分享
问问AI
有问题?问问AI帮你修改 改主题:如咖啡问卷改为奶茶问卷