Article · Writing
球掉一條命時多扣一分,真的會讓 AI 玩得更好嗎?
三次獨立訓練得到不同方向的結果。比較失命時多扣一分是否能穩定提高打磚塊的原始得分。
文章目錄
打磚塊時失去一條命,要不要讓模型多扣一分?這聽起來像是個小改動,卻可能改變它之後怎麼玩。
三次訓練給出三種方向:其中一次,多扣一分的模型平均多拿 9.48 分;另一次少了 1.74 分;第三次則多了 2.04 分。平均起來是增加 3.26 分,但如果改動真的有效,為什麼不同訓練會得到不同結果?
多扣的分數,只用來教模型
模型學習時會從遊戲回饋推測哪些選擇較好。這次只改變一件事:每失去一條命,額外給模型一分負向回饋,讓它更不願意失命。
這個額外扣分只影響訓練。最後比賽仍按 Breakout 原本的分數計算,因此比較的是模型在遊戲裡實際拿到多少分,而不是實驗版換了一套計分方式。
兩種訓練方式都各自完成一百萬次遊戲操作。之後,每一對模型都從相同的 50 個遊戲起點開始,逐局比較原始分數:
| 訓練組 | 原本回饋 | 失命多扣一分 | 平均差異 | 同起點分差範圍 |
|---|---|---|---|---|
| 第一組 | 35.96 | 45.44 | +9.48 | +4.28 到 +14.70 |
| 第二組 | 29.26 | 27.52 | −1.74 | −6.14 到 +2.76 |
| 第三組 | 32.50 | 34.54 | +2.04 | −3.54 到 +7.66 |
每組的分差範圍都來自這一對模型面對不同遊戲起點時的起伏。第二、三組的範圍包含零,代表在這些起點上,資料仍容許兩種模型沒有明顯差異。
五十局測試,不等於五十次重新訓練
同一對模型多玩五十局,可以看出它們面對不同開局時的表現差異;這不會讓模型重新學習五十次。真正能回答「重新訓練後,這個改動還會不會有效」的資料,只有三組不同的訓練結果。
三組平均分差是增加 3.26 分,中位數增加 2.04 分。但把訓練之間的差異也算進去後,合理的結果範圍從退步 1.74 分到進步 9.48 分,仍包含「沒有改善」的可能。現在看到的正向平均,還不能代表改動能穩定重現。
分數不是唯一的判斷
這次還要求失命扣分版的存活表現不能退步。第二組的存活指標變差,因此這個版本沒有通過後續採用條件;它沒有取代原本訓練方式,也沒有進入更長時間的最終比較。
目前比較適合的結論是:失命時多扣一分在部分訓練中伴隨較高分數,但三組結果不一致,而且可用的獨立訓練仍少。要知道這個改動是否真的有幫助,下一步需要增加不同訓練的比較,並理解存活表現為什麼在其中一組下降。