Article · Writing

球掉一條命時多扣一分,真的會讓 AI 玩得更好嗎?

三次獨立訓練得到不同方向的結果。比較失命時多扣一分是否能穩定提高打磚塊的原始得分。

2 分鐘閱讀
文章目錄

打磚塊時失去一條命,要不要讓模型多扣一分?這聽起來像是個小改動,卻可能改變它之後怎麼玩。

三次訓練給出三種方向:其中一次,多扣一分的模型平均多拿 9.48 分;另一次少了 1.74 分;第三次則多了 2.04 分。平均起來是增加 3.26 分,但如果改動真的有效,為什麼不同訓練會得到不同結果?

多扣的分數,只用來教模型

模型學習時會從遊戲回饋推測哪些選擇較好。這次只改變一件事:每失去一條命,額外給模型一分負向回饋,讓它更不願意失命。

這個額外扣分只影響訓練。最後比賽仍按 Breakout 原本的分數計算,因此比較的是模型在遊戲裡實際拿到多少分,而不是實驗版換了一套計分方式。

兩種訓練方式都各自完成一百萬次遊戲操作。之後,每一對模型都從相同的 50 個遊戲起點開始,逐局比較原始分數:

訓練組原本回饋失命多扣一分平均差異同起點分差範圍
第一組35.9645.44+9.48+4.28 到 +14.70
第二組29.2627.52−1.74−6.14 到 +2.76
第三組32.5034.54+2.04−3.54 到 +7.66

每組的分差範圍都來自這一對模型面對不同遊戲起點時的起伏。第二、三組的範圍包含零,代表在這些起點上,資料仍容許兩種模型沒有明顯差異。

五十局測試,不等於五十次重新訓練

同一對模型多玩五十局,可以看出它們面對不同開局時的表現差異;這不會讓模型重新學習五十次。真正能回答「重新訓練後,這個改動還會不會有效」的資料,只有三組不同的訓練結果。

三組平均分差是增加 3.26 分,中位數增加 2.04 分。但把訓練之間的差異也算進去後,合理的結果範圍從退步 1.74 分到進步 9.48 分,仍包含「沒有改善」的可能。現在看到的正向平均,還不能代表改動能穩定重現。

分數不是唯一的判斷

這次還要求失命扣分版的存活表現不能退步。第二組的存活指標變差,因此這個版本沒有通過後續採用條件;它沒有取代原本訓練方式,也沒有進入更長時間的最終比較。

目前比較適合的結論是:失命時多扣一分在部分訓練中伴隨較高分數,但三組結果不一致,而且可用的獨立訓練仍少。要知道這個改動是否真的有幫助,下一步需要增加不同訓練的比較,並理解存活表現為什麼在其中一組下降。