1、德尔菲法的定义及其适用范围

1.1 德尔菲法的定义

德尔菲法(Delphi Method),又称专家咨询法,是20世纪50年代由美国兰德公司(RAND Corporation)为解决军事预测问题首次提出并应用的结构化预测与决策方法。其核心逻辑是通过“匿名反馈—迭代收敛”的机制,将分散专家的经验判断转化为系统性、权威性的群体意见,从而规避个体认知偏差与群体压力对决策的干扰。
从操作层面定义,德尔菲法由研究组织者拟定针对性调查问卷,以背对背的通信方式(如函件、电子邮件、线上问卷平台等)向预先遴选的专家组成员征询意见。与传统专家会议法不同,该方法中专家以匿名身份独立提交判断,研究组织者对每轮意见进行统计分析、归纳共性与分歧后,将汇总结果(含专家核心观点、分歧焦点等)反馈给所有专家,供其修正自身判断时参考。经过3-4轮这样的征询与反馈,专家意见会逐步从分散走向集中,最终组织者基于末次汇总的专家共识,对研究对象做出定量或定性的评价与预测。

德尔菲法的三大核心特点并非孤立存在,而是形成了相互支撑的逻辑闭环:

  • 匿名性:这是方法的基础。匿名消除了专家间的身份壁垒(如职称高低、资历深浅)与人际影响,避免“权威压制”“从众心理”等问题,确保每位专家都能基于专业判断自由表达意见,尤其保护了年轻专家的创新性观点。

  • 反馈性:这是意见收敛的关键。每轮反馈并非简单的“结果告知”,而是提供“群体意见分布+分歧点解析”的结构化信息,让专家清晰了解自身判断与群体认知的差异,为意见修正提供客观依据,实现“个体智慧—群体共识”的迭代升级。

  • 统计性:这是方法科学性的保障。不同于“少数服从多数”的简单表决,德尔菲法通过算术平均值、变异系数、肯德尔和谐系数等统计指标,对专家意见进行量化处理,既呈现意见的集中趋势,也明确分歧程度,使最终结论兼具定性解释与定量支撑。

1.2 应用范围

德尔菲法的适用边界清晰指向“信息不完全、不确定性高、缺乏客观数据支撑”的复杂问题场景,尤其在以专业判断为核心的研究与实践领域价值突出。其本质是利用专家的“隐性知识”(经验、直觉、行业洞察)弥补显性数据的不足,将分散的专业智慧转化为系统性共识,因此在以下聚焦专业领域的场景中应用最为广泛且成熟:
在这里插入图片描述

  • 评价指标体系的建立与具体指标确定:这是德尔菲法在社会科学与医疗领域的核心应用场景,尤其适用于缺乏统一标准的专业评价领域。其核心逻辑是通过专家多轮论证,实现“指标维度—具体条目—权重分配”的层层收敛。例如在构建重点科室院感风险评估指标体系时,研究小组先基于文献分析形成“人员管理、环境消毒、器械灭菌”等初始维度,再通过2-3轮专家函询,确定“医护手卫生依从率”“空气菌落数达标率”等具体指标,并明确各指标的重要性权重,最终形成兼具科学性与实操性的评价工具。整个过程中,专家需对指标的“代表性、独立性、可测性”进行量化评分(1-5分),组织者通过变异系数(CV)筛选出CV<0.25的共识性指标,确保体系的严谨性。

需要注意的是,上述应用场景中,德尔菲法需满足“专家群体可明确界定”“意见可量化评价”两个前提。其不适用于有明确客观标准的问题(如实验室指标参考值制定)、需即时响应的紧急场景(如突发灾害的现场护理调度),以及专家观点存在根本性学术对立且无法调和的领域。此外,在量表编制、护理方案构建等场景中,德尔菲法需与信效度检验、可行性试点等环节结合,才能形成完整的研究闭环。

  • 量表的编制及汉化修订:量表开发中,德尔菲法是解决“文化适配性”与“内容针对性”的关键工具。在原创量表编制中,需先通过患者访谈形成初始条目池,再由跨领域专家(如临床医师、流行病学专家、统计学专家)对条目进行“相关性、清晰度”评价,淘汰冗余条目并优化表述。华西医院孟照莉团队在研发华西耳鸣影响评估量表(WCTII)时,就通过5轮德尔菲函询,解决了初始维度与因子分析结果不符的问题,最终形成符合我国文化背景的量表条目。在量表汉化修订中,该方法主要用于修正国外量表中不符合本土习惯的表述,例如将“quality of life”的条目表述从“生活品质”优化为“生活质量”,并删除“教堂参与度”等与国内场景脱节的条目。

  • 量表内容效度的评定:内容效度是量表测量“目标概念契合度”的核心指标,德尔菲法通过专家群体判断实现量化评价。操作中需邀请10-15名相关领域专家(含量表应用场景的一线实践者与理论研究者),采用内容效度指数(CVI)进行评价,包括条目水平的CVI(I-CVI)和量表水平的平均CVI(S-CVI)。专家需判断每个条目“是否准确反映测量维度”“表述是否清晰无歧义”,I-CVI计算公式为“认为条目有效的专家数/总专家数”,当S-CVI≥0.9时,量表内容效度达到理想水平。例如在评定糖尿病自我管理量表时,专家会重点校验“胰岛素注射操作规范”条目是否覆盖临床核心要点,确保量表能真实反映评估目标。

  • 干预方案的构建:在慢性病管理、康复治疗等领域,德尔菲法用于构建“精准化、可落地”的干预方案,解决个体差异大、循证证据不足的问题。以脑卒中患者术后康复干预方案构建为例,研究小组先梳理出“运动训练、营养支持、心理疏导”等初始干预模块,再通过专家函询确定各模块的具体内容(如运动训练中的“肌力训练频率”“关节活动度标准”)、实施时机(如术后第3天启动床上被动运动)及效果评价指标。整个过程需平衡“临床有效性”与“实操可行性”,例如专家会根据社区医院设备条件,将“专业康复器械训练”调整为“家庭可操作的弹力带训练”,提升方案的推广价值。
    在这里插入图片描述

需要注意的是,德尔菲法并非“万能方法”,其不适用于有明确客观数据支撑的问题(如产品销量统计)、需要快速决策的紧急场景(如火灾现场救援方案),以及专家群体难以界定或意见无法量化分析的领域。

在这里插入图片描述

2、德尔菲法的实施流程与核心环节

针对无明确指南可循的前沿领域或争议性问题,德尔菲法是形成行业共识的金标准。其核心价值在于通过匿名反馈消除权威压制,让不同层级专家充分表达观点。例如在肿瘤姑息治疗领域,针对“终末期患者镇痛药物使用阈值”这一争议问题,通过3轮函询,让肿瘤科医师、疼痛科专家、伦理学家等群体达成共识:将“数字疼痛评分≤3分”作为调整药物剂量的核心依据,同时明确“肝肾功能不全患者的剂量折减标准”。共识形成后需同步呈现“意见收敛过程”(如各轮肯德尔和谐系数W的变化),增强结果的可信度。
德尔菲法的实施是一项系统性工作,需遵循“准备—实施—分析”的严谨流程,每个环节的操作质量直接决定最终结果的可靠性。其中“专家遴选”“问卷设计”“多轮反馈”是三大核心控制点,而数据处理则是检验方法有效性的关键。

2.1 基本步骤

德尔菲法的实施步骤具有严格的逻辑性,每一步都对应着“减少不确定性”的目标,典型流程如下:
在这里插入图片描述
关键:
在这里插入图片描述

2.2专家函询小组成立

专家函询小组并非单一的专家群体,而是由“核心专家+辅助团队”构成的协作体系。核心专家是意见征询的对象,辅助团队则由研究组织者、统计分析师、领域秘书组成,分别负责流程设计、数据处理、专业术语校准等工作,确保函询过程高效有序。
小组组建的核心目标是“保障意见的专业性与代表性”,因此需提前明确专家的“领域覆盖范围”,例如研究“智慧养老服务体系”时,专家需涵盖养老政策研究、老年医学、信息技术、社区服务实践等多个细分领域,避免因专家结构单一导致意见片面。

2.3拟定专家函询问卷

问卷是专家与组织者之间的核心沟通载体,其设计质量直接影响意见的有效性与回收率。问卷需遵循“目标导向、逻辑清晰、表述精准”三大原则,通常包含四个核心模块,各模块功能明确且层层递进:

  1. 卷首说明:含研究背景、核心目标、问卷填写方法、匿名承诺及回收时间,消除专家的信息不对称与顾虑,提升参与积极性。

  2. 专家基本信息表:用于后续计算专家权威程度,核心信息包括从事相关领域工作年限、专业技术职称、学历、研究/实践成果(如论文、项目经历)等,示例如下。

  3. 核心征询内容:根据研究目标设计,若为指标体系构建,需明确列出指标维度、初步指标名称及内涵说明;若为预测问题,需给出明确的预测场景与时间范围。

  4. 意见补充栏:为专家提供自由表达的空间,用于说明对指标/问题的修改建议、不认同的理由或未被涵盖的重要观点,这是第一轮问卷获取创新性意见的关键。

在指标相关性评价等定量征询中,通常采用李克特5点量表(完全不相关=1分、不相关=2分、一般=3分、比较相关=4分、十分相关=5分),并明确要求专家对打1-2分的指标详细说明“不相关原因”,为后续指标筛选提供依据。这种“定量评分+定性说明”的组合,既便于后续统计分析,又保留了专家判断的逻辑支撑。

问候咨询表示例

在这里插入图片描述

专家情况表
在这里插入图片描述
问卷信息及填写说明
将问卷的维度和题目分别列出,备选项为完全不相关、不相关、一般、比较相关、十分相关共5个等级,请咨询专家选择并说明不相关原因或修改意见,分别电邮给位专家,请专家进行评判。

问卷专家咨询表示例
在这里插入图片描述
指标体系专家示例
在这里插入图片描述
评价方案专家示例
在这里插入图片描述

2.4 选择函询专家

专家遴选是德尔菲法有效性的“源头保障”,核心逻辑是“质量优先、数量适度”。选择的原则如下:

在这里插入图片描述
从理论研究与实践经验来看,专家人数并非越多越好:人数过少会导致意见代表性不足,人数过多则会增加组织成本与数据处理难度,且易引发专家疲劳。因此,一般情况下专家人数控制在15-50人为宜,若研究主题高度细分(如某类特殊疾病的诊疗规范),可最低降至10人,但需确保覆盖主题的核心研究方向。
在这里插入图片描述
专家的纳入标准:

  • ①实践经验:从事研究相关领域工作满10年及以上,确保对行业痛点、发展规律有深刻认知;

  • ②专业资质:具有中级及以上专业技术职称+本科及以上学历,这是专业能力的基础证明;

  • ③主题相关性:具备与研究主题直接相关的研究背景(如主持/参与相关课题)或实践经验(如一线管理/服务经历);

  • ④参与意愿:遵循知情同意原则,选择积极性高、承诺按时完成各轮征询的专家,避免因专家中途退出影响流程连续性。

专家遴选原则
遵循“知识结构合理、专业特长互补、地域/机构多元”的原则,从高校、科研院所、行业协会、企业/实践一线等不同单位遴选专家,确保意见覆盖“理论研究—政策制定—实践执行”的全链条,避免单一视角的局限性。

专家选择结果示例:
在这里插入图片描述

2.5 第一轮专家反馈

第一轮反馈是“发散意见收集”的核心环节,其目标是获取专家对研究主题的原始、多元观点,为后续意见收敛奠定基础。该轮通常采用半开放性问卷,不预设过多限制条件,让专家充分表达专业判断。
反馈流程分为两步:首先,组织者回收问卷后,剔除无效问卷(如关键信息未填、评分逻辑矛盾的问卷),计算有效回收率以判断专家参与度;其次,对有效问卷进行“定性梳理+定量初步统计”——定性上,通过内容分析法提炼专家提出的新指标、新观点及核心分歧点;定量上,计算各指标的初步评分均值与标准差,明确意见分散程度。
在这里插入图片描述
经过第一论,对条目进行整理,重新筛选,筛选的标准如下:
在这里插入图片描述

2.6 第二轮专家反馈

第二轮反馈进入“意见收敛引导”阶段,核心任务是让专家基于第一轮的群体意见修正自身判断,因此反馈内容的“透明度与针对性”至关重要。组织者需向专家提供完整的第一轮反馈报告,报告中必须明确:

  • ①问卷回收情况:有效回收率、专家基本信息统计(如职称分布、领域占比),让专家了解群体代表性;

  • ②指标修改依据:详细说明新增、删除或修改指标的原因(如“新增‘数据安全指标’,基于8位专家的一致建议”);

  • ③意见分布详情:各指标的评分均值、标准差、核心分歧点(如“‘线上办理率’指标评分差异较大,专家A认为应侧重数量,专家B认为应侧重质量”);

  • ④本轮征询重点:明确要求专家针对分歧指标补充说明判断依据,对认可的指标确认评分。

这一轮的问卷通常转为结构化问卷,将第一轮梳理后的指标体系清晰呈现,便于专家聚焦核心分歧进行判断。通过该轮反馈,多数基础指标的意见会初步收敛,仅留下少数争议较大的指标进入下一轮。

示例:
在这里插入图片描述
修改后的问卷示例:
在这里插入图片描述

2.7第三轮专家反馈

判断是否需要第三轮函询,核心依据是专家意见的协调程度与收敛状态,需结合定量指标与定性反馈综合判断,具体标准如下:

  1. 核心定量指标(优先参考)
    以第二轮反馈数据为基础,重点看两个关键指标:
    变异系数(CV):若≥80% 指标的 CV<0.25(意见协调度高),仅少数指标 CV 在 0.25-0.35 之间,可结合定性分析决定是否终止;若存在≥30% 指标 CV>0.35(意见分歧大),必须启动第三轮。
    肯德尔和谐系数(W):若 W≥0.4 且显著性检验 P<0.05(整体意见一致且具统计学意义),可考虑终止;若 W<0.3 或 P≥0.05(整体分歧明显),需开展第三轮。
  2. 定性反馈补充判断
    若第二轮专家反馈中,分歧焦点明确且可通过进一步说明 / 数据支撑解决(如对指标定义理解偏差),需第三轮针对性反馈分歧逻辑,引导共识。
    若专家对核心问题(如指标维度、方案关键环节)已无新观点,仅少数微调建议,且定量指标达标,可终止。
  3. 特殊场景
    若研究主题敏感 / 复杂(如循证护理方案、肿瘤干预共识),即使定量指标达标,建议增加一轮验证共识稳定性。
    若第二轮有效回收率<70%,需先分析原因(如问卷问题)并优化,再启动第三轮,避免样本偏差影响结论。
    在这里插入图片描述

3. 数据的处理与分析

3.1专家积极程度

专家积极程度直接反映其对研究主题的认可与投入程度,是保障意见质量的前提。该指标通常用“问卷有效回收率”量化,计算公式为:有效回收率=(有效回收问卷数/实际发放问卷数)×100%。
从实践标准来看,有效回收率≥70%为可接受水平,≥85%为理想水平。若某轮回收率低于60%,需分析原因:若为专家遗忘,可通过友好提醒提升参与度;若为问卷设计问题(如内容晦涩、工作量过大),则需紧急优化问卷后重新发放。需注意的是,“有效回收”需排除填写不完整、逻辑矛盾的问卷,避免无效数据影响后续分析。

在这里插入图片描述
论文中常见的计算和表达:
在这里插入图片描述

3.2专家权威程度

专家权威程度(Cr)是衡量意见可信度的核心指标,反映专家基于自身知识储备做出判断的可靠程度。根据德尔菲法的经典理论,Cr由“判断依据(Ca)”和“熟悉程度(Cs)”两个维度决定,二者权重相等,计算公式为:Cr=(Ca + Cs)/2。
该指标的核心逻辑是:专家的判断若基于丰富的实践经验或扎实的理论研究(高Ca),且对研究主题有深入了解(高Cs),则其意见的权威性更高。通常认为Cr>0.7时,专家权威程度较高,研究结果的可信度有充分保障;若Cr<0.6,则需谨慎对待结论,或补充高权威专家重新征询。

判断依据(Ca)需由专家自我评价,通常从四个维度设置评分标准(1-4分,分数越高依据越充分),组织者根据专家选择计算均值作为该专家的Ca值:

判断依据,可以从实践经验、理论分析、同行处了解、直观感觉4个方面请专家自我评价,如下:

在这里插入图片描述

3.3 熟悉程度

熟悉程度(Cs)是专家对研究主题认知深度的直接体现,同样通过专家自我评价获取。通常采用5级评分法(1-5分),从“非常不熟悉”到“非常熟悉”对应不同分数,具体评分标准需结合研究主题明确界定,例如“非常熟悉”可定义为“主持过3项及以上相关课题,发表5篇及以上核心论文”。
Cs的计算需注意“个体差异”:不同领域专家对同一主题的熟悉程度可能不同,例如政策专家对“养老政策”的熟悉度高,而技术专家对“养老设备技术”的熟悉度高,因此需按专家领域分类计算Cs,再结合其对应的指标权重综合分析,避免“一刀切”评价。
在这里插入图片描述

在这里插入图片描述

3.4 专家意见协调程度

专家意见协调程度是判断“意见是否收敛”的核心指标,用于检验专家群体对各指标的判断是否存在一致性。该指标体系包含两个关键指标:变异系数(CV)和肯德尔和谐系数(W),二者分别从“单个指标”和“整体体系”两个层面衡量协调程度。
在这里插入图片描述

3.4.1变异系数

变异系数Q:表示专家对某一指标相对重要性、合理性的协调程度,系数越小说明专家间的协调程度越高。

变异系数是反映一组数据离散程度的相对指标,计算公式为:CV=(标准差/算术平均值)×100%。其优势是消除了指标评分量级的影响,可直接比较不同指标的专家意见分歧程度。

在德尔菲法中,CV的解读标准明确:CV<0.25表示专家对该指标的协调程度较高,意见基本一致;0.25≤CV≤0.35表示协调程度一般,需结合专家定性意见进一步分析;CV>0.35表示协调程度低,需重点反馈该指标的分歧点,引导专家深入论证。

3.4.2肯德尔协调系数

肯德尔和谐系数是衡量多个专家对一组指标评分一致性的整体指标,取值范围为0-1。W值越接近1,说明所有专家对指标体系的评分逻辑越一致,整体协调程度越高;W值接近0则说明专家意见极度分散,需反思专家遴选是否合理或指标定义是否清晰。

W值需结合显著性检验(P值)解读:只有当W显著(通常P<0.05)时,才能说明专家意见的一致性是统计学意义上的“真共识”,而非随机巧合。实际操作中,可通过SPSSAU、SPSS等统计软件直接导入专家评分数据,一键生成W值及显著性检验结果,无需手动计算。

在SPSSAU中直接导入专家对于不同指标重要程度的打分情况,就可以得到肯德尔协调系数W,如下:

在这里插入图片描述

在这里插入图片描述
在这里插入图片描述

上表格展示评价指标筛选界值,即某项评价指标是否应该保留;
第一、算术平均值指所有专家全部打分数据的平均值,变异系数CV值指所有专家全部打分数据的变异情况,满分频率指专家打满分的比率平均值,比如指标1为60%指标2为80%,那么满分频率为70%;
第二、界值公式和判断上,其以算术平均值、变异系数CV值及满分频率这3个指标作为基础,并且通过该3个指标的平均值和标准差进行相加减计算界值;
第三、如果指标数据在界值上或下时则认为该指标没有通过筛选,比如算术平均值和满分频率以小于界值作为标准,而变异系数CV值以大于界值作为标准。
在这里插入图片描述
上表格展示评价指标筛选界值,即某项评价指标是否应该保留。
第一、算术平均值指所有专家全部打分数据的平均值,变异系数CV值指所有专家全部打分数据的变异情况,满分频率指专家打满分的比率平均值,比如指标1为60%指标2为80%那么满分频率为70%;

第二、界值公式和判断上,其以算术平均值、变异系数CV值及满分频率这3个指标作为基础,并且通过该3个指标的平均值和标准差进行相加减计算界值;

第三、如果指标数据在界值上或下时则认为该指标没有通过筛选,比如算术平均值和满分频率以‘小于界值’作为标准,而变异系数CV值以‘大于界值’作为标准。

3.5 结果展示

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐