用錯AI,比不用更糟糕?(下)當KPI取代了目的

愈來愈多研究顯示,用錯AI的代價不會出現在使用當下。使用AI練習數學的高中生,撤除AI後考試成績反而比從未使用的同學低17%;資深醫師在導入AI輔助後,沒有AI時的偵測率也出現下滑。這些研究同時提醒,問題不在AI本身,而在用法。那麼,台灣的教育現場準備好了嗎?

上篇談到,愈來愈多研究顯示,用錯AI的代價不會出現在使用當下。使用AI練習數學的高中生,撤除AI後考試成績反而比從未使用的同學低17%;資深醫師在導入AI輔助後,沒有AI時的偵測率也出現下滑。這些研究同時提醒,問題不在AI本身,而在用法。

那麼,台灣的教育現場準備好了嗎?

願景寫在文件,真正考驗在執行

教育部自111年起連續四年投入200億元推動「生生用平板」,配發約61萬台學習載具。今年5月,教育部再提出「AI人才方舟計畫」,預計四年投入117.55億元,研發AI家教、AI助教等學習系統,讓AI真正進入教學現場。教育部長鄭英耀也表示,教育不只是教孩子會用AI,更要重新思考未來需要什麼樣的人才。

值得肯定的是,今年3月公布的《臺灣中小學教師與學生AI素養框架》,已經看見框架強調學生在與AI協作時,要保有學習方向與知識判斷的主導權,並在善用AI與避免「認知外包」之間取得平衡。
願景已經寫在文件上,但如同過去所有的政策一樣,接下來的考驗,在於教學與評量的實際執行方法,是否能和願景對齊。

看得到開機率,看不到學習

回到上篇爬樓梯的比喻。要知道腿力有沒有進步,可能會測驗爬到某個樓層需要多少時間,這個時間就是KPI(關鍵績效指標,也就是用來衡量目標是否達成的數字)。KPI原本只是觀察腿力的工具之一,但執行時很容易被誤認為目的本身。測驗只記錄抵達時間,沒有規定怎麼上樓,於是為了準時抵達,有人選擇搭電梯。表面上看來,大家都在時限內抵達了,但是卻沒有將腿力練出來。這個現象常被稱為「古德哈特定律」:當衡量指標本身變成追求的目標,就不再能準確反映真正想衡量的事。

中小學的平板電腦使用率,正是這個現象的縮影。2024年就有媒體報導,審計部發現六都之一有1000多台平板超過三個月未開機,於是教育局隨後將使用率列為軟體採購與載具調度的指標。接著毫不令人意外的,部分學校的使用率在幾個月內暴增三倍,甚至有老師反應,學校會要求老師讓每台平板開機跑一下,於是負責管理的老師就增加了「幫平板開機」的固定工作。使用率原本是為了了解平板有沒有被用在教學上,一旦成為考核指標,追求的就變成開機時數,而不是學生學到了什麼。

比較令人憂心的是,AI家教也可能落入同樣的陷阱。如果評量只看作業完成率或練習成績,直接給答案的AI家教會讓數字最好看,就像電梯讓每個人都準時抵達。

在上篇提到的Bastani研究中,另一組學生使用的AI家教被設定為只給提示、不給答案,比較像樓梯旁的扶手:學生爬累了可以扶一把,但每一步仍要自己走。這組學生練習時的成績比未使用AI的同學高出127%,撤除AI後的考試成績則與這些同學沒有顯著差異,並未出現退步。

要分辨眼前的是扶手還是電梯,方法其實不難,但必須先理解並重視教學現場的流程、教師能力及使用意願,以及教材教案的重新設計,這才是真正讓AI能協助學習的當務之急。

拿掉AI後,是否比原來更強?

回到一開始的討論,用錯AI,比不用更糟糕嗎?從現有研究來看,答案初步是肯定的,但「用錯」二字究竟是什麼意思?上篇提到的研究有一個共同的設計,測量的都是沒有AI協助時的能力。無法引述自己文章的寫作者、撤除AI後考試退步的高中生、沒有AI時偵測率下滑的醫師,代價都是在這個時刻才顯露出來。也就是說,用錯AI的傷害不會出現在使用當下,而是出現在需要獨自判斷的時候。

對教育現場來說,首先是在評量中保留不靠AI的環節,讓「學到了什麼」與「用了多少」同樣被看見。其次,方舟計畫即將研發的AI家教,值得在設計階段就確認它是給提示還是給答案,因為研究顯示,這個選擇可能決定學生是進步還是退步。這個道理並不限於校園,醫師與工程師的案例同樣提醒企業,導入AI提升效率的同時,也需要為員工保留自己判斷的練習機會。

AI可以讓人更快抵達,但能否讓人走得更穩、更遠,取決人類想讓AI扮演什麼樣的角色?在導入之前、在還沒有決定技術規格時就必須想清楚,AI到底是幫助人才增加能力的扶手,或者只是快速達成KPI的電梯?