顯示具有 碩一上 標籤的文章。 顯示所有文章
顯示具有 碩一上 標籤的文章。 顯示所有文章

2020年2月18日 星期二

量表等級_再測信度、施測者間信度


Scale-level test-retest/inter-rater agreement/association

(ICC/ Pearson r)


一、概念
量表的總分在不同時間、同一情境下,重複施測於同一受試者時多次測驗結果的一致性。

二、統計分析
l  ICC (Intraclass Correlation Coefficients)
兩次測驗或兩位施測者之相關性及一致性
1.          依照不同的研究設計,使用不同的ICC Form

2.          判斷流程:依序選擇Model à Type à Definition

3.          Model
(1)   One-way random effects:設定好同一位個案要由幾個rater來評,假設為兩個。有一個rater pool。將個案編號,從pool裡隨機抽兩個,評完放回去,下一個個案,再抽。結果可能沒那麼好,但概化程度高。
(2)   Two-way random effects:從rater pool抽兩個,評所有case
(3)   Two-way mixed effects:結果可能較好,但概化程度差。

4.          Type
(1)   Single rater/measurement:用一位rater的分數來計
(2)   Multiple rater/measurement:多位raters的分數取平均
à理論上,應該要平均(Ex. OSCE時,個別rater差異大,用三個rater的平均較可信;聯考作文由三個老師來改…)但臨床上,受限於現實,通常是用前者。

5.          Definition
(1)   Absolute agreement: 反應評估結果的差異(完全一致)
(2)   Consistency: 反應評估結果的趨勢(只看相關)

6.          ICC解讀
前提 :至少 30 位具特異性之樣本和至少 3 位施測者
*不是只看單純的數值,還要看confidence interval*

Q1: ICC models的選擇需考慮那些因素?請以 inter-rater reliability 說明之。
A: (即Model à Type à Definition
(1)       研究設計(怎麼產生rater, rater的代表性)
(2)       Single or multiple
(3)       是看完全一致性(臨床通常看)還是相關性

A:(概化的差異;最難做的,最能概化)
- rater 的選擇方式與評個案的組合不同。
- one-way random effects 較有代表性,較能概化。
- two-way random effects, two-way mixed effects 均為方便樣本,概化程度有限。

l  Pearson r
1.          多次測驗或多個施測者之間的相關性
2.          價值有限
3.          不同工具/研究間難相比較(個案不同、時間不同)

Q1: ICC, Pearson r, and paired t test 分析 scale-level test-retest/inter-rater reliability 各有何缺點? 各容易受到那些因素影響?
A:
(1)   ICC提供的較多元,但看不清到底是什麼造成,為目前主流
Pearson r + pair t可更詳細,但解讀比較麻煩

ICC將相關性與完全一致性混著看
Pearson r  +  pair T 搭配看,會比ICC得到的訊息更詳細完整
(相關性)+(兩者的差異agreement

(2)   ICC能看三個以上的相關性
Pearson rpair t只能看兩兩之間
(3)   均受資料的[分布與集中程度]影響

A: group-level。只能知道大致的信度。

2020年2月17日 星期一

項目等級_再測信度、施測者間信度

Item-level test-retest/inter-rater agreement
(Kappa, weighted kappa)

一、概念
Q1: test-retest reliability inter-rater reliability 二者有何差異?
l   再測信度/施測者內信度:
在不同時間點,使用同一評估工具於相同個案,所獲結果之一致性。
l   施測者間信度:
不同施測者評估相同對象,所得結果之一致性。

Q2: 何時使用 test-retest reliability inter-rater reliability?
A:
- 問卷性質不同,造成工具誤差之來源不同
- 看何者的影響大,即較適合選擇該項

二、研究設計
l   再測信度/施測者內信度:
1.          同一施測者於一段時間後再測
2.          施測當下錄影,於一段時間後再看影帶施測
l   施測者間信度
1.          不同施測者輪流施測(雙盲)
2.          一施測者施測,另一人同時評估結果
3.          錄影表現,由多位施測者同時評分

Q: 錄影可控制個案之功能不變,以驗證 test-retest/inter-rater/intra-rater reliability, 但有何缺點?
A:
- 當評估涉及rater與個案的互動,錄影會少了rater評估的歷程,或受限於錄影角度,可能導致高估或低估。

三、研究設計之影響因素
l   再測信度/施測者內信度:
(1)       再測間隔時間
(2)       測驗性質
(3)       施測對象特質
1.      間隔時間約一到兩週。易受練習、記憶或身心成熟的影響。
2.      認知評估受練習及記憶影響較大,再測時間間隔應更長。
3.      個案評估特質於再測期間沒有變化。
舉例:對尚在變化過程中的中風病人施測時間宜短,以減少病人因隨時間而成熟變化,然而時間又不至於短到讓病人有記憶練習施測內容的機會,而對長期慢性精神病人,則施測時間間隔可較長些。

l   施測者間信度(關係、指導語、態度/接受度、訓練品質)
1.          施測間隔時間
2.          評估流程一致性
3.          評估關係建立
4.          施測情境
1.      兩施測者施測間隔不超過1個月
2.      用以檢驗工具的評估結果是否受到『評估者』或『施測者』的主觀判斷影響。(experimenter's bias)

Q: test-retest reliability inter-rater reliability 之再測時間間距設計,需考量那些因素?
A:
-          間隔短à記憶、練習效應
-          間隔長à個案變化

四、統計分析
個別項目à 名義、順序變項
名義變項:Kappa(κ)Percentage of agreement
順序變項:Weighted Kappa(kw)

  總分à 等距、等比變項
組內相關係數 (intraclass correlation coefficient,ICC)

1.          Percentage of agreement
測量信度,個別項目評分一致性或百分比。

(1)       名義變項,非次序量尺
(2)       簡單易用,但較為粗略
(3)       難以排除機率一致(chance agreement)因素,高估了一致的機率
(4)       適用於較少的評估者、太多評估者計算麻煩
(5)       例如:在比賽中,評委們於5題中的3題達成共識,協議百分比為3/5=60%


Q: % agreement 數值主要受到那些因素影響?
A: 真正的一致性、機率、分布(天花板或地板效應)

2.          Kappaweighted Kappa
Kappa
(1)       名義變項,非次序量尺
(2)       相較Percentage of agreement可以校正項目一致之機率,減少chance agreement的高估
(3)       樣本數小、分數集中(如天花板效應)時à同意一致的機率過高à易產生誤差而低估à不能使用kappa計算

weighted Kappa
(1)       名義變項,次序量尺。
(2)       相較kappa可以校正項目間差異程度,減少chance agreement的高估
(3)       樣本數小、分數集中(如天花板效應)時,同樣不適用

Q1: Kappa weighted Kappa 係數值主要受到那些因素影響?
A: 真正的一致性、機率、分布(天花板或地板效應),*看差異的程度*

Q2: Kappa weighted Kappa 數值可提供那些實用價值?
A: 可校正 % agreement

五、數值解釋
值可落在-11之間,但通常介於01之間。
當完全一致時,則值為1,當完全不一致時,則值為0

percentage of agreement(Po), kappa(K), weighted kappa(Kw)皆然

2021.09.13-09.18

  9/13( 一 ) 自己的研究 請教士捷學長 *3 (文獻搜尋、回顧、寫作方向) 其他 確認柔潔與劭彤將檔案交與宜瑄、宜瑄完成清點與校對 協助派發劭彤資料