2021年6月1日 星期二

Rasch 第一堂課前預習(看完一次,但還沒唸完)

 

Rasch 測量理論與其在教育和心理之應用 王文中

 

一、                傳統測驗總分的用途與劣勢:

僅管傳統測驗中分數大多是順序尺度。但我們習慣將分數加總。

利用其總分進行:1. 比較個別差異、2. 評估前後測改變、3. 進行團體比較

但傳統測驗既是測驗依賴又是樣本依賴,且各單題之間難度未定。

所以可能出現問題為:

1.      題目都可以讓A答對,但B答錯,但僅能顯示適合A的題目較多,不能顯示A的能力比B好

2.      測驗整體都很難,導致每個受試者的分數都很低,但卻沒有辦法顯示出受試者能力。(測驗依賴)

3.      受試者超強,不管什麼題目都對受試者來說很簡單。因此無法看出受試者能力。(樣本依賴)

 

所以傳統測驗的劣勢就是將「受試者能力估計」與「題目難度」綁定,導致互相干擾,彼此都解釋不了。

 

 

二、                Rasch分數轉換的基本概念(有一些數學式我弄不懂)

 

1.      會找一個參照的相對0點,以利於比較()

假設:

受試者能力為A

題目難度為B

在某題二分變項答1分(能力好)的機率為P1,答0分(能力差)的機率為P2。

 

Odd ratio = P1/ P0 代表答對的機率比答錯的機率高幾倍

Odd ratio = A/B 代表相對於B題來說,A的能力為B的幾倍

----我不太懂為什麼兩個式子相等

如果有甲乙兩人作同一份測驗

Odd ratio甲/ Odd ratio乙 = A甲/A乙

----不懂為什麼相除之後就可以得到能力比值

但總之取logit之後,兩個人的能力就可相減(變成等距),差距為logit單位

 

三、                圖的解釋:

圖一:如果兩者能力差距為X軸;兩者的答對機率差為Y倍

EX:如果兩者能力差異為0,答對的機率為0.5

----不是很確定文章中用的描述

疑問點有二:

1. 如果按照舉例所述,要怎麼看/定義兩者能力差距

2. 還是說兩者除了AB兩者以外,也可以同義代成能力與題目難度的差距

 



圖二:以不同能力的受試者來看三道題目

此圖特色有二

1.      隨著能力越高,答對機率越高(monotonically increasing)

2.      三道題目的曲線不會交叉,代表對所有能力的人來說,題目難易度皆相同

3.      ICC是曲線不是直線,是直線會導致答對機率超過1

----不懂為什麼用0.5來代表難易度



 

四、參數估計

 

使用最大概率估計法(maximum likelihood estimation)或是貝式統計

----先放著

總之就是出現某種情況的最大機率為何。

 

 

五、資料與rasch適配

 

1.      看受試者作答反應是否與模式預期相同

2.      看題目被作答的情形是否與模式預期相同 

*不符合的模式稱為殘差

可能情形有:答錯簡單,但答對很難的、猜測、亂答、特殊解法等等。因此有其他的模式以估計這種情況

 

六、多參數模式:

 

粗曲線:單參數模式:參數:題目難度

細曲線:二參數模式:參數:a斜率(鑑別度參數)+題目難度

點曲線:三參數模式:參數:c漸進線(猜測參數)+斜率(ICC)+題目難度

---問題很多:

為什麼粗曲線被認為是不好的曲線?

新增的兩參數(a斜率、漸進線)的意義?

 


七、分數使用:

效度:通過IRT檢驗即有效度

信度:每位受試者之誤差不相同,誤差因人而異

常模:無須依賴常模,但發展時仍要看其異質性

DIF:是否因為某種因素導致題目難度對受試者不一

6/2 遠距(Day12)

今日完成:

1.      Rasch紀要(上篇blog,不過王老師那一篇文獻還沒有念完,明日補上)

2.      統計期末計算題練習:完成一年考古

待釐清:

1.      淨相關與半淨相關的算法

2.      Full model 與 Reduce model的檢驗算法


*今天臨床研究中心發信來說,登記後會排序打疫苗,不知道排不排的到(也好險我都有定時更新紅卡)。 


待完成:

1.      IRB等韓醫師回復中

 

6/1預計完成事項:

上午

09:00-12:00

1.      將王文中老師的文獻念完,並更新於blog

下午

13:00-14:00

1.      Lynn英文。預計念這篇文獻:The Use of Rasch Analysis To Produce Scale-Free Measurement of Functional Ability

14:00-?

1.      統計期末考計算練習

 


2021年5月31日 星期一

Rasch潘老師上課整理

 

Rasch 內容記點

 

From 潘老師上課課程

 

背景知識:

1.      IRT有分成3種參數估計模式

1.          1-Parameter:僅估計Item difficulty

2.          2-parameter:估計Item difficulty + Discrimination

3.          3-parameter:僅估計Item difficulty + Discrimination +Guessing(猜測)

* Guessing:受試者作答可能用猜的

* Discrimination:項目鑑別度,指題目算出來的斜率為何。

2. Infit/outfit:

假設今天有一道題目難度為:1(最易)~7(最難)

Infit:受試者是否在相近的題目中,能夠照題目難度呈現能力。例如:答對4後也答對3,2。

Outfit:受試者是否有極端不一致的作答情形,例如:答對7,但卻答錯1的情形。

2.      Anlysis for residuals:用以找出剩下的殘差還有沒有什麼主成分。

3.      DIF是指「O特徵」,會造成測驗之難易度不同,須排除。

4.      Categories:指的是測驗量表的項目尺度,例如:李克特式3點/5點

5.      Monotonically increasing:單調遞增,指如受試者能力上升,答對A題之機率只增不減。

6.      step calibrations:指跨過不同的得分點,有相應的難度要求。

7.      average measures:指題目中的「難度順序」是固定的(聽起來很common sense,但是重點應是題目需要針對難度順序做共同基準),如果人的能提升,期平均得分也會提升。

優點:

1.      可以解決資料尺度的ordinal的問題,嚴格來說我們學門資料大多都是ordinal的

2.      IRT比起CTT比較不需要在意樣本代表性的問題。

* Sample-free:因為同樣一套難度的題目,對於不同族群來說,難易度應該相同。(驗證完成的測驗的應用,不太需要再考慮適用樣本因難度已固定)

*不太需要/具有樣本代表性的另外思路為:要驗證Rasch,必須要每個難度階層都有一定的人數,但真實樣本之能力大多會落在中間難度,故如果要能夠cover很簡單/很難的題目,勢必要找特定的族群,因此整體樣本就會非現實分配。

3.      Scale-free/task-free:如果個案的能力固定,在測相同概念的不同測驗中(例如BI and FIM)的相對位置應該都相同。

4.      Rater-free:將評估者主觀的評分加入校準

5.      Activity-free:將受試者要做的活動加入模式中加以校準。

6.      可以突破計分形式不一的問題

 

缺點:

1.      CTT對於所有考生測驗的精準度是一樣的;IRT對於越極端的考生精準度越差(根據上述點2)

 

圖的解釋:

本圖為4點李克特式量表,圖的產出為,將整個量表的0~3分進行機率疊加

如果項目難度是-1.2以下,最有可能拿0分。(紅色)

如果項目難度是-1.2~-0.1之間,最有可能拿1分。(藍色)


 


 

 

 

6/1 遠距(Day11)

 

今日完成:

1.      完成碩論IRB同意書修改。也發信詢問北護韓醫師的意願,等待韓醫師回覆

 

待完成:

 

6/1預計完成事項:

上午

9:00-12:00

1.      閱讀下週一之Rasch指定閱讀文獻

2.      Po昨日與老師Rasch的討論紀錄

下午

13:00-?

1.      準備週五之統計期末考之計算題部分

(壓力有點大哈哈,雖然上次成績還沒有公布,但感覺應該考的不是很好QQ,而且這次要考手算迴歸)

*想轉換心情就去改團動作業哈哈

2021年5月28日 星期五

5/31 遠距(Day10)

 

今日完成:

1.      念完統計閉書考範圍包含相關、單迴歸、複回歸

2.      完成統計作業二份(實習課相關code、期末作業)


 

上午

處理碩論IRB

 

下午

上課

 

 

 



CAT終止條件注意事項

  CAT 終止條件設定:   共會有三種考量: 分別為: 1.       MRR :某個人的信度到達 N 後,即停止施測。 2.       LRI : 某個人 增加信度小於 N 3.       MRR or LRI   首先: CAT 的考...