參與研究
研究開始之前,請先揀選參唔參與
參與者主動同意加入學術研究之後,客戶端先會建立模擬器工作階段或玩家識別碼。
必要研究資料
重播、評分同分析所需嘅 Blockly 程式 IR、挑戰版本、分數,以及必要嘅技術工作階段或提交識別碼。
自選背景資料
主要語言只記錄 zh、en 呢類粗略代碼;UTC 偏移只記錄目前分鐘數。「參與學術研究」預設會開啟兩項,亦可以喺「更多設定」逐項關閉。
唔會主動收集
唔收集瀏覽器指紋、精確 IANA 時區名稱、推斷位置、廣告識別碼或跨網站追蹤檔案。
資料匿名程度
研究記錄可能留有工作階段識別碼,伺服器亦會保存一般安全日誌。因此,呢啲資料雖然經過去識別化處理,但並非完全匿名。
問題界定
兩個問題,一套系統
教學
全班只可以跟同一個進度
硬件成本同監督要求限制咗機械人教學,課堂好多時只可以用統一固定進度。但學生學習速度各有不同,呢種落差會同時影響進度快同慢嘅學生。
量度
編程能力好難量化評分
程式同選擇題答案唔同:作答空間係開放嘅,結果亦係連續值。標準適性測驗並冇呢兩個前提,所以要先調整,先可以量度編程表現。
研究貢獻
呢項研究有咩新意
- 01
喺生成式題庫入面自適應揀題
挑戰唔係來自固定清單。題族先生成同校準候選題,再用 Fisher 資訊量揀適合目前能力估計嘅題目,所以題庫唔使逐題人手編寫都可以擴充。
- 02
保證解到嘅生成題目
程序生成同可達性有衝突:睇落合理嘅目標都可能到唔到。每個候選題出街之前都要先求解,將「希望解到」變成必要條件。
- 03
喺二分估計器用連續分數
編程表現係連續值,但現有估計器唔係。系統按每題嘅掌握門檻做保序映射,同時保留原始分數畀分析用。
- 04
用確定性保障公平
伺服器會重播每個程式,並按關節行程估算時間。客戶端硬件唔會改變結果,分數先可以公平用喺比賽或者診斷。
方法
自適應層點樣建構
每次試完,平台都會重新估計學習表現,再揀合適嘅下一關。輕鬆完成就加難;遇到困難就退一步。每個學生都有自己嘅級別。
模型
雙參數 Logistic 模型
模型採用 logit 尺度上嘅能力 θ、題目難度 b 同鑑別度 a。猜測參數固定為零:作答內容係程式,唔係選項,所以冇可能靠估撞中。再估計第三個參數只會擬合雜訊。
作答
程式就係作答內容
伺服器會重播學習者嘅程式中介表示並評分。標準化分數會以題目嘅掌握門檻 τ 為中心重新映射,令「高於 τ」同「已掌握」一致,再交畀估計器;原始分數會另外保存。
揀題
先睇資訊量,再控制曝光率
候選題會先按目前 θ 下嘅資訊量排序,再限制曝光次數。咁樣同一程度嘅學習者唔會次次收到相同題目,亦唔會過度消耗題庫入面少數題目。
生成
難度係生成目標,唔係事後結果
題目族會用淨空、可達性負荷、預算壓力同循環結構等特徵預測難度。每個候選題都會按目標難度 b 求解;參考求解器搵唔到解,就會喺生成階段淘汰。
校準
有足夠證據之前都係暫定
新題會先進入試用狀態:限制曝光量,亦唔會計入正式能力更新。收集到作答之後,會將 θ 固定喺後驗平均值,再用邊際似然嘅牛頓迭代重新擬合難度。
呢個版本將能力表示成一個綜合 θ,並喺每次作答記錄維度標籤,用嚟製作報告。真正嘅多維模型係之後嘅工作,唔係呢個版本聲稱做到嘅事。
效度
冇人完成到嘅題目,量度唔到能力
先畫好目標髮型,再寄望機械臂掂得到,係行唔通嘅。早期有一個挑戰要求剪走 91 塊頭髮,但機械臂只掂到 20 塊。任務根本冇可能完成,關卡亦冇任何提示。
而家會先運行求解器。候選目標先喺無碰撞關節空間掃掠,再交畀參考求解器;做唔到嘅目標會喺生成階段淘汰,唔會派畀學習者。求得嘅解亦會成為關卡嘅參考成本同參考時間。
可達集合由工具喺無碰撞關節空間掃掠時掂得到嘅全部體素組成。由於計算成本高,系統只會計一次,再快取成測試固定資料。測試之後會確認參考解可以重播,而且冇目標落喺掂唔到嘅位置。
促成呢個設計嘅失敗案例
學習者可能會將呢種結構上做唔到嘅情況當成自己失敗,而能力估計亦會將今次失敗當成依據。
可重現性
結果取決於乜嘢
確定性生成
髮型生成係挑戰設定嘅純函式。同一設定每次都會產生次序完全相同嘅體素集合,成個流程冇隨機因素。
伺服器端重播
競賽成績由服務端重播提交嘅程式得出,絕對唔會採用瀏覽器回報嘅數字。
用估算時間,唔係實測時間
執行時間按關節行程同設定速度計算,所以取決於程式,而唔係運行程式嘅裝置。
固定嘅傳輸契約
應用程式同服務共用相同嘅評分同程式類型。協定變更只會增量擴充,所以舊版用戶端仍然用到。
其他網站