Paper Insight Report · 論文深度解析

從程式碼中心到概念中心:以 LLM 輔助的「Vibe Coding」教學自然語言處理

From Code-Centric to Concept-Centric: Teaching NLP with LLM-Assisted “Vibe Coding”

2026 Hend Al-Khalifa(單一作者) arXiv 預印本 arXiv:2602.01919v1 [cs.CL]
研究取徑
混合方法(描述統計+主題分析)
樣本
N=19(回收率 100%)
核心方法
期末匿名問卷+開放式回饋
Section 01

論文基本資訊

項目內容
標題(原文)From Code-Centric to Concept-Centric: Teaching NLP with LLM-Assisted “Vibe Coding”
標題(中譯)從程式碼中心到概念中心:以大型語言模型輔助的「Vibe Coding」教學自然語言處理
作者Hend Al-Khalifa(沙烏地阿拉伯利雅德 King Saud University 電腦與資訊科學院/College of Computer and Information Sciences;通訊信箱 hend@ksu.edu.sa)
年代2026(arXiv 上載日期為 2026 年 2 月 2 日)
期刊/會議arXiv 預印本,編號 arXiv:2602.01919v1 [cs.CL];採 ACL 論文格式撰寫,惟正式投稿之期刊或研討會(原文未明示)
關鍵字(原文未明示)本文為 ACL 格式預印本,未設關鍵字欄位。以下為依標題與摘要整理之核心概念詞,僅供檢索參考:Vibe Coding →「氛圍式編碼/對話式生成程式」;Large Language Models (LLMs) →「大型語言模型」;NLP Education →「自然語言處理教育」;Prompt Log →「提示歷程記錄」;Reflection-based Assessment →「反思式評量」;Cognitive Load →「認知負荷」;Conceptual Understanding →「概念性理解」;AI-Assisted Programming →「AI 輔助程式設計」
論文篇幅正文 7 頁+參考文獻,PDF 共 8 頁(含 10 筆參考文獻)
Section 02

精簡摘要與研究框架

本研究針對大型語言模型(Large Language Models, LLMs)普及後自然語言處理(Natural Language Processing, NLP)教學面臨的兩難,提出並實作名為「Vibe Coding」的教學框架。作者在 King Saud University 一門大四(Level 8)NLP 課程(2025 年秋季學期、19 位資訊科技系學生)中,將 LLM 使用「合法化」為正式學習活動,並以三個支柱結構化:(1) 允許並鼓勵在實驗課以 LLM 生成程式碼;(2) 強制在筆記本中記錄提示歷程(prompt log);(3) 以批判反思取代程式品質作為主要評量依據。評分權重因此重新配置為程式輸出 20%、提示歷程 30%、批判反思 50%。學期共 12 週講授、7 次實作實驗與一個四階段期末專案(將 PIQA 資料集本地化為阿拉伯語)。期末以匿名 5 點量表問卷(13 個李克特題項+開放題)蒐集回饋,並對量化題計算描述統計、對開放題進行主題分析(thematic analysis)。結果顯示各構面平均值多落在 4.4–4.6/5.0,學生特別肯定「除錯負擔下降使概念學習得以聚焦」;但時間配置(M=3.53, SD=1.43)、LLM 輸出驗證與任務規格明確度成為主要挑戰。作者主張:唯有在評量對齊概念理解、並強制提示歷程與反思時,LLM 輔助學習才可能把焦點從語法流暢度移轉至概念精熟。

研究框架

本研究屬單組課程實踐評估,未做組間比較,故框架應理解為「教學設計 → 學生知覺結果」的描述性對應關係,而非統計檢定的因果模型。

  • 自變項(教學設計操弄):Vibe Coding 三要素——合法化的 LLM 程式生成、強制 prompt log、反思式評量;並以 20/30/50 的評分權重加以制度化。
  • 依變項(學生自陳結果):課程經驗、學習投入(more engaging, M=4.42)、概念學習(taught concepts despite LLMs, M=4.42)、對 LLM 輸出的批判評估能力(M=4.37)、評量公平性知覺(reflection fair, M=4.21;grading shift appropriate, M=4.26)、以及專案中的策略性 LLM 使用(M=4.53;89% 學生於專案使用 LLM)。
  • 中介機制(作者論述、未經測量):認知負荷(cognitive load)由語法除錯轉向概念處理;作者明白聲明此為學生知覺而非客觀認知負荷量測。
  • 邊界/調節條件:作者歸納四項必要條件——評量與概念理解對齊、提示文件化、驗證支援(測試案例/同儕互評/教師檢核點)、以及足夠的理解與記錄時間;另有阿拉伯語 NLP 模型可靠度較低、學生先備知識落差等情境限制。
  • 質性分析架構:以主題分析歸納 5 個主題(認知負荷降低、提示工程為可遷移技能、驗證與信任挑戰、時間壓力持續、專案中的策略性使用),並以學生匿名編號(S1、S2、S3、S4、S16)佐證。
Section 03

研究動機與研究目的

研究動機

  • 產業現實已改變:GitHub Copilot、ChatGPT、Claude 等工具在業界普及,資訊教育必須回答「如何在 AI 輔助編碼成為常態的前提下,仍確保學生發展深層概念理解」。
  • NLP 教學的張力特別尖銳:學生須同時掌握語言學理論、統計方法與軟體工程,傳統實驗課常讓學生把大量時間耗在除錯語法與實作細節,壓縮了理解 NLP 原理的認知資源。
  • 既有研究結論不一致且缺乏可操作框架:Denny 等人(2023)發現使用 Copilot 者完成任務更快但概念題表現較弱;Kazemitabaar 等人(2023)發現新手投入度提升但遷移任務學習下降。這些發現顯示「有鷹架的教學框架」是關鍵缺口。
  • 教育界對 vibe coding 的既有定位偏誤:此實務在學生間已相當普遍,卻常被教師視為學術不誠信或「不得不接受的現實」,缺乏將其重構為正當學習活動的系統性設計與評估。

研究目的與研究問題

作者將本研究定位為「該取徑在大學部 NLP 課程中的首次系統性評估(the first systematic evaluation of this approach)」,並在緒論以編號提出四個研究問題:

  1. 結構化的 LLM 輔助編碼(Vibe Coding)如何影響學生在 NLP 實驗課中的投入度與概念學習?
  2. 當評分重心由程式品質轉向概念反思時,學生對評量公平性的知覺為何?
  3. 當學生依賴 LLM 完成實驗實作時,會浮現哪些挑戰與挫折?
  4. 學生如何把 LLM 輔助編碼技能遷移到獨立的專案工作?
Section 04

文獻探討大綱

對應原文第 2 節「Background and Related Work」,共四個子節。本文為短篇教學實踐論文,文獻回顧採「問題定位+框架定義」型式,並未建立獨立的理論模型章節。

  • 2.1 AI 輔助程式設計於教育中的應用(AI-Assisted Programming in Education)——論證角色:確立爭議場域,說明從「誠信恐慌」轉向「有鷹架則可增益學習」的研究趨勢。
    • 早期關切:學術誠信與基本程式能力是否受損(Leinonen et al., 2023;Finnie-Ansley et al., 2022)——建立反方立場,凸顯本研究須回應的正當性質疑。
    • 轉向證據:適當鷹架下 AI 工具可提升學習成果(Denny et al., 2023;MacNeil et al., 2023)——為本研究「不禁止、改設計」的立場提供依據。
    • 關鍵矛盾證據:Copilot 使用者速度快、品質相當,但概念題較弱(Denny et al., 2023);新手投入度上升但遷移學習下降(Kazemitabaar et al., 2023)——直接指出「需要教學框架」的缺口,是本研究最核心的論證支點。
  • 2.2 教學取徑與 Vibe Coding(Pedagogical Approaches and Vibe Coding)——論證角色:把本研究框架安置在既有教學取徑譜系中,並給出可操作定義。
    • 「配對程式設計夥伴」隱喻(pair programmer, Sarsa et al., 2022):主張 AI 助手須被批判性評估,為本研究的「批判評估」目標鋪路。
    • 明示教學:提示工程與輸出驗證應被直接教(Prather et al., 2023)——支持將 prompt log 制度化。
    • 後設認知鷹架(metacognitive scaffolding, MacNeil et al., 2023):為 prompt log 的學習功能提供理論依據,是本研究最接近的理論支柱。
    • Vibe Coding 的界定:作者以大寫刻意區隔「教學框架」與「非正式實務」,定義為三要素(合法化 LLM 生成、強制提示歷程文件化、以概念理解與批判評估為評量重心),並強調其創新在於「明確切分實作(委由 LLM)與概念理解(以反思評量)」。
  • 2.3 NLP 教育的挑戰(NLP Education Challenges)——論證角色:說明為何 NLP 是最需要此框架的領域。
    • 學生須同時處理語言學理論、統計方法與軟體工程;傳統做法常以實作複雜度淹沒概念學習(Pannitto et al., 2021)。
    • Teaching NLP 系列工作坊呼籲教學創新(Jurgens et al., 2021);LLM 同時是「研究對象」與「學習工具」,形成重構課程的機會。
  • 2.4 AI 增強學習下的評量(Assessment in AI-Augmented Learning)——論證角色:為「評量改革」提供文獻正當性。
    • 核心論點:當學生能以極少理解生成可運作實作時,傳統程式碼評量即失效。
    • 替代方案:概念量表(concept inventories)、設計產出物、反思寫作(Cunningham et al., 2017)——本研究的反思式評量(解釋設計決策、分析結果、批判 LLM 輸出)即承接此脈絡。
理論標註:原文明示引用的概念性框架為「pair programmer 隱喻」「metacognitive scaffolding(後設認知鷹架)」與「認知負荷(cognitive load)」語彙,以及真實性評量/反思寫作傳統。原文並未使用 TAM、TPACK、ARCS、SQD、SDT 等模型;「評量驅動學習」(近似建構式對齊 constructive alignment)雖為結論 Lesson 1 的核心主張,但作者未指名該理論(原文未明示)。
Section 05

研究方法介紹

節次調整說明:本文屬單組、無對照的教學實踐評估報告(course implementation report),量化部分僅報告描述統計、未進行推論檢定,因此第 5–7 節側重「課程實施流程+問卷施測與分析程序」的方法論描述,而非典型實驗設計要素。

研究取徑與設計

採混合方法的課程實踐評估:以單一課程為個案,於學期末施測一次性問卷,量化題以描述統計(平均數、標準差)呈現,開放題以主題分析(thematic analysis)歸納重複出現的樣態。無控制組、無前後測、無隨機分派;作者亦自承「未控制學生先前的 LLM 使用經驗與程式能力個別差異」。

研究場域與對象

  • 場域:沙烏地阿拉伯利雅德 King Saud University 電腦與資訊科學院,大四(Level 8)NLP 課程,2025 年秋季學期。
  • 對象:19 位資訊科技(Information Technology)主修學生,問卷回收率 100%。
  • 先備條件:已修習 Python 程式設計、資料結構與機器學習概念。
  • 課程結構:12 週講授(每次 2 小時)+7 次實作實驗(每次 2 小時,緊接於各講授之後)+1 個多階段期末專案(阿拉伯語 Physical IQA 資料集建置與模型訓練)。課程內容依 Jurafsky & Martin 的《Speech and Language Processing》第三版草稿(聚焦 Volume I: Large Language Models)安排。
  • 7 次實驗主題依序為:NLP 前處理(Tokenization 與詞彙建構)、POS 標記與 NER 分析、文本分類、N-gram 語言模型、詞嵌入、Transformer 微調、情境內學習(Zero/Few-Shot)。

教學介入:Vibe Coding 的四段實驗結構與評量設計

  • 四段結構:Lecture(2 小時理論)→ Lab Practice(2 小時,明確允許並鼓勵使用 ChatGPT、Claude、Gemini 等 LLM 生成程式碼)→ Prompt Log Documentation(於每項任務前在實驗筆記本直接記錄所用提示、LLM 回應與對生成碼所做的修改)→ Critical Reflection(填寫 Google 表單,回答概念理解、設計決策與結果分析題)。
  • 評分權重:程式輸出 20%(僅看功能,風格不計)、提示歷程 30%(提示品質與迭代歷程)、批判反思 50%(概念理解與分析深度)。提示歷程的評分依據為提示的清晰度與具體性、迭代修正的證據、以及文件的完整性。
  • 反思題示例(各實驗不同但一致鎖定高階思考):英文與阿拉伯文分詞的差異;簡單空白分詞的常見問題(如「dog.」);Penn Treebank 與 Universal POS 標記差異之案例與原因;四種機器學習模型(Multinomial NB、Logistic Regression、Linear SVM、XGBoost)跨指標的效能比較;unigram/bigram/trigram 生成文本的連貫性差異;min_count 由 5 改為 2 對鄰近詞連貫性與類比準確率的權衡;三種架構(Encoder-only/Encoder-decoder/Decoder-only)用於諷刺偵測任務的選擇理由。
  • 期末專案(12 週、小組進行,四階段):Phase 1 翻譯(將指定 PIQA 題目譯為現代標準阿拉伯語,保留解答對之間的最小對比,並記錄翻譯挑戰與文化調適);Phase 2 語料分析(長度分布、詞彙與詞性樣態、頻繁對比之辨識——時間、空間、否定標記,並標註以定義評估切片);Phase 3 模型開發(隨機、多數類、詞彙啟發式基線,加上線性分類器與 transformer 類模型(阿拉伯語或多語),至少兩項消融研究);Phase 4 評估(整體準確率與切片結果、對 10–15 個失敗案例做錯誤分析並分類、提出修正並至少以實驗驗證一項修正)。專案中同樣允許以 LLM 協助翻譯、程式生成與除錯,但必須記錄所有 AI 互動並對所有輸出執行人工品質保證,最後以團隊簡報展示完整流程與發現。

資料蒐集工具

  • 期末綜合問卷,涵蓋四個構面共 13 個李克特題項:一般課程經驗 3 題、Vibe Coding 歷程 4 題、評量結構 3 題、專案結構與 LLM 使用 3 題,另有開放題詢問優點、挑戰與建議。
  • 所有李克特題採 5 點量表(1=非常不同意,5=非常同意);問卷為匿名,以鼓勵誠實作答。

資料分析方法

  • 量化:計算各題平均數與標準差(僅描述統計,未進行任何推論統計檢定)。結果以四張表呈現(Table 1–4,皆為 N=19)。
  • 質性:對開放題進行主題分析,辨識學生經驗中重複出現的樣態,最終收斂為 5 個主題,並引用學生原話(以 S1、S2、S3、S4、S16 匿名編號標示)。

信效度與研究倫理處理

  • 已處理者:問卷匿名化以降低作答壓力;回收率 100%(19/19)避免無回應偏誤;作者於討論中主動標示「這些發現反映學生知覺而非客觀認知負荷量測」,並承認無法排除學生以 LLM 協助撰寫反思答案的可能性。
  • 未報告者:問卷的內部一致性信度(如 Cronbach's α)、構面效度或專家審閱程序(原文未明示);主題分析的編碼者間信度或多重編碼程序(原文未明示);研究倫理審查(IRB)核准資訊(原文未明示);問卷完整題目文字未附錄(原文未明示)。
Section 06

研究流程(表格)

依原文實際敘述順序整理,涵蓋「課程設計 → 教學實施 → 資料蒐集 → 分析 → 收斂」五個環節,共 9 個步驟。
步驟階段名稱主要工作產出
1課程情境與框架設計於 King Saud University 大四(Level 8)NLP 課程植入 Vibe Coding;規劃 12 週講授、7 次實驗與四階段期末專案;重新配置評分權重為程式輸出 20%/提示歷程 30%/批判反思 50%課程大綱、實驗架構與評量規準
2講授(Lecture, 2 小時)教師完整講解各主題的理論基礎與 NLP 核心概念,作為後續實作的概念前置學生的概念先備知識
3實作練習(Lab Practice, 2 小時)學生以結構化任務單完成 7 個主題實驗,明確被允許並鼓勵使用 ChatGPT/Claude/Gemini 等 LLM 生成程式碼以實作講授概念可運作的實驗程式(僅評功能,不評風格;占 20%)
4提示歷程記錄(Prompt Log)學生於每項任務前,在實驗筆記本中直接記錄所使用的提示、LLM 的回應,以及對生成程式碼所做的任何修改提示歷程文件,依清晰度、具體性、迭代證據與完整性評分(占 30%)
5批判反思(Critical Reflection)學生填寫 Google 表單,回答鎖定概念理解、設計決策與結果分析的高階思考問題(各實驗題目不同)反思答案,為主要評分依據(占 50%)
6期末專案(四階段,12 週)小組將 PIQA 資料集本地化為阿拉伯語:Phase 1 翻譯與文化調適 → Phase 2 語料分析與對比標註 → Phase 3 基線與模型開發(含 ≥2 項消融研究)→ Phase 4 評估(整體與切片指標、10–15 個失敗案例錯誤分析、至少驗證一項修正);全程記錄 AI 互動並執行人工品質保證阿拉伯語 PIQA 資料集、訓練模型、評估與錯誤分析報告、團隊簡報
7期末問卷施測學期末施測匿名綜合問卷:一般課程經驗 3 題、Vibe Coding 歷程 4 題、評量結構 3 題、專案與 LLM 使用 3 題,加上開放式回饋題;全部採 5 點量表19 份有效問卷(回收率 100%)
8量化與質性資料分析計算各題平均數與標準差;對開放題進行主題分析,辨識重複出現的經驗樣態Table 1–4 描述統計結果+5 個質性主題與學生引語
9結果詮釋與教訓收斂討論對 NLP 教育與資訊教育的意涵、指出驗證挑戰與研究限制;收斂為 5 條 lessons learned 與 6 個未來研究方向四項成功必要條件、5 條實務教訓、未來研究議程
Section 07

條列式研究流程

  1. Step 1:在大四 NLP 課程中設計 Vibe Coding 框架,並把評分權重改為程式 20%、提示歷程 30%、反思 50%。
  2. Step 2:每個主題先以 2 小時講授建立理論與概念基礎。
  3. Step 3:緊接 2 小時實驗課,學生在結構化任務中公開使用 LLM 生成程式碼完成 7 個 NLP 主題實作。
  4. Step 4:學生在每項任務前於筆記本記錄提示、LLM 回應與對生成碼的修改,形成可檢視的提示歷程。
  5. Step 5:學生填寫 Google 表單完成批判反思,回答概念理解、設計決策與結果分析的高階問題。
  6. Step 6:小組以 12 週完成四階段期末專案,將 PIQA 資料集本地化為阿拉伯語並訓練與評估模型,全程記錄 AI 互動並做人工品質保證。
  7. Step 7:學期末以匿名 5 點量表問卷(13 題李克特+開放題)蒐集全體 19 位學生的回饋,回收率 100%。
  8. Step 8:對量化題計算平均數與標準差,對開放題執行主題分析,歸納出 5 個經驗主題。
  9. Step 9:綜整量化與質性結果,提出四項成功必要條件、5 條實務教訓與 6 個未來研究方向。
Section 08

研究議題與討論重點收斂

議題一:認知負荷降低是否真能換得更深的概念學習

發現摘要:學生最突出的自陳主題是「把實作外包給 LLM 釋出了心智資源」。量化上,「比傳統實驗更投入」M=4.42(SD=0.84)、「即使用 LLM 實作,實驗仍教會我概念」M=4.42(SD=0.69)、「對應用核心 NLP 概念有信心」M=4.00(SD=0.75)。質性佐證如「It made coding feel comfortable and with low pressure」(S1)、「Making me understand concepts rather than finding errors on my code」(S2),多位學生並將此與「除錯佔去不成比例時間」的傳統實驗課對比;能「try different ideas and immediately see the results」促成了迭代式探究。

作者詮釋:Vibe Coding 可把注意力從語法細節移轉至概念理解,但作者主動限縮此主張——「這些發現反映學生知覺而非客觀認知負荷量測」,且「降低實作負擔不必然等同更深的概念處理」,需以既有認知負荷工具進行嚴謹檢驗。與文獻的關係:與 Denny 等人(2023)「速度快但概念題較弱」及 Kazemitabaar 等人(2023)「投入上升但遷移學習下降」形成張力;作者的回應是「差異來自評量是否對齊概念」,即把矛盾轉化為條件式命題,而非直接反駁。

議題二:評量驅動學習——權重從程式碼移到反思

發現摘要:學生對評量改革反應正向:批判反思題被認為公平 M=4.21(SD=1.08),評分權重轉移被認為適當 M=4.26(SD=0.99)。結論的 Lesson 1 直陳「Assessment drives learning」,並指出學生之所以深入投入概念,正因為那是被評分的對象。

作者詮釋:評量與概念理解的對齊是四項必要條件之首;若仍以程式品質計分,LLM 的存在會使評量失去鑑別力(承接 2.4 節論點)。與文獻的關係:一致於 Cunningham 等人(2017)所代表的反思寫作/真實性評量傳統,並被作者提升為整個框架成立的前提。惟需注意:SD 超過 1.0 顯示仍有部分學生持不同看法,且原文未報告分數與知覺的關聯分析。

議題三:提示歷程記錄作為課責機制與後設認知鷹架

發現摘要:「提示歷程有用」是 Vibe Coding 構面中唯一低於 4.0 的題項,M=3.79(SD=1.13),變異也最大;作者解讀為「不同學生受益程度有差」。質性上,S4 表示「Getting better at writing prompts with time since we are instructed to practice it every lab」,顯示提示工程被學生視為可遷移技能。同一構面中「實驗有效教會我批判評估 LLM 輸出」則達 M=4.37(SD=0.76)。

作者詮釋:prompt log 同時扮演「課責機制」與「學習鷹架」兩種功能(Lesson 2:提示記錄促進後設認知),但承認實作仍有改進空間,未來可提供示例提示(exemplar prompts)或加入同儕互評。與文獻的關係:一致於 Prather 等人(2023)主張明示教學提示工程、以及 MacNeil 等人(2023)強調後設認知鷹架的立場。

議題四:驗證挑戰與「啟動悖論」(bootstrapping problem)

發現摘要:反覆出現的挫折是驗證 LLM 輸出:「Sometimes the LLM would give answers that weren't completely accurate or would go off track, so I had to spend extra time fixing or verifying the results」(S3)。部分學生在阿拉伯語 NLP 模型上尤其吃力,因 LLM 在該情境表現較不可靠。

作者詮釋:這是全篇最核心的張力——學生需要基礎知識才能批判 LLM 輸出,而取得該知識傳統上又需親手實作,形成啟動悖論。作者提出四種可能解方:(1) 階段式設計,基礎主題先用傳統實作;(2) 混合式實驗,手寫與 LLM 輔助任務並行;(3) 明示的驗證教學;(4) 同儕互評與方案比較。Lesson 4 將此列為「最重大的未解挑戰」。

議題五:時間壓力並未消失,而是轉移

發現摘要:時間配置是唯一明顯的負向訊號:M=3.53(SD=1.43),作者特別註明眾數為 5(時間充足)但平均偏低,代表意見高度分歧、部分學生覺得實驗課過於匆促;S3 直接建議「Increase the lab time. The current duration is really short, and it's difficult to complete all the tasks properly」。期末專案的範圍適切性亦僅 M=3.84(SD=1.26),為全問卷次低。

作者詮釋:LLM 使用並未消除時間壓力,而是把壓力從「除錯」轉移到「理解、驗證與記錄 AI 生成的方案」(Lesson 3)。因此「充足的理解與記錄時間」被列為四項必要條件之一。這也提示課程設計者:導入 LLM 不等於可以壓縮實作時數。

議題六:遷移發生——專案中的策略性 AI 使用

發現摘要:89% 學生在期末專案中使用 LLM(該題 M=4.53, SD=1.17),專案被視為有價值的技能應用機會(M=4.37, SD=0.83)。學生展現對「何時該用 LLM」的細緻判斷:除錯與錯誤排除、複雜演算法實作、環境設定、迭代式指引;並將 LLM 定位為補充而非替代:「I learned how to combine my own technical skills with AI tools in a strategic way—using LLMs as support, not as a replacement」(S16)。

作者詮釋:Lesson 5「Transfer happens」——學生把 Vibe Coding 策略成功遷移到獨立專案,顯示所培養的是可一般化的技能;並主張程式設計能力應被重新定義為問題拆解、演算法選擇、輸出驗證與策略性 AI 協作,而非原始的編碼能力。與文獻的關係:與 Kazemitabaar 等人(2023)「遷移任務學習下降」的結果方向相反,但須注意本研究的遷移證據來自學生自陳與教師觀察,並非以標準化遷移任務測得,兩者證據層級不同。

Section 09

未來研究缺口

作者明示的研究限制(Limitations, 第 5.3 節)

  • 樣本規模小(N=19)且來自單一機構,限制可推論性。
  • 對象為具備程式先備條件的大四生,結果未必適用於入門階段學生。
  • NLP 領域本身較適合高階 API 使用,此學科特性可能放大 LLM 的助益。
  • 存在阿拉伯語文本處理的特定挑戰,影響情境的普遍性。
  • 實施時點為 2025 年秋季,當時 LLM 能力已相當成熟,時序因素難以與教學設計效果分離。
  • 未控制學生先前的 LLM 使用經驗與程式能力等個別差異,可能影響結果與知覺;跨情境複製研究為必要。
  • 無法排除學生以 LLM 協助撰寫反思答案的可能性,這會影響「已展現概念理解」的主張;未來可探討監考式或口試式評量。
  • 學生知覺未經控制式認知負荷量測驗證,「實作負擔降低」是否真正轉化為更深的概念處理仍待確認。

作者明示的未來研究方向(Future Work, 第 6.2 節)

  • 縱貫研究:追蹤學生跨多學期乃至進入產業,檢視 Vibe Coding 培養的概念基礎是否轉化為持續的能力。
  • 控制實驗:以嚴謹的比較設計建立因果證據,並以效度已驗證的工具測量概念理解、有/無 AI 協助下的實作能力,以及對新問題的遷移學習。
  • 認知負荷測量:釐清降低的語法負荷是否真的釋出認知容量給概念處理,或學生整體投入反而變淺。
  • 驗證教學法:發展並檢驗具體教學方案,如逐級鷹架搭配明示的驗證策略、多個 LLM 生成方案的比較分析、結構化同儕互評協定。
  • 多樣族群:在入門與進階、不同程式背景、不同文化情境中測試,以確立可推論性並找出必要的調整。
  • 跨領域應用:檢驗 Vibe Coding 原則能否遷移到 NLP 以外的計算領域(如演算法、系統程式設計、資料庫),以及各領域特有的挑戰。
延伸判讀一(分析者判斷,非原文主張):全篇的結果證據僅來自「單一時點、單一來源」的期末自陳問卷,存在共同方法變異與社會期許偏誤的風險;更關鍵的是教師與研究者為同一人,即使問卷匿名,學生在正向回饋上仍可能受權力關係影響。後續研究若能加入第三方施測、課堂觀察或客觀學習表現指標(如概念前後測、標準化編碼任務),才能把「知覺良好」與「學會了」分開。
延伸判讀二(分析者判斷,非原文主張):問卷的測量品質未被檢視——13 個題項分屬四個構面,卻未報告任何信度係數(如 Cronbach's α)、構面效度或題目來源/專家審閱程序,完整題目文字亦未附錄;在 SD 普遍偏大(多題 1.0–1.43)的情況下,單以平均數詮釋容易掩蓋群體內部的分化。建議未來至少報告題項全文與信度,並輔以次群體或分布分析。
延伸判讀三(分析者判斷,非原文主張):研究浪費了手上最珍貴的歷程資料——強制蒐集的 prompt log 佔評分 30%,卻完全未被當作研究資料分析。若對提示語料進行內容分析(提示的具體性、迭代次數、修正類型),並與反思分數或概念表現交叉比對,即可在不增加施測負擔的前提下,提供「策略性 LLM 互動 → 概念理解」這條中介路徑的直接證據,而非僅停留在學生自陳。
Section 10

值得引用的段落句子

本文為 arXiv 預印本,內文未標示印刷頁碼,故出處統一以 PDF 頁次標示。

#原文句子中譯出處適用情境
1This shift poses a critical question for computer science education: How do we prepare students for a future where AI-assisted coding is the norm, while still ensuring they develop deep conceptual understanding?這一轉變為資訊科學教育提出了關鍵問題:當 AI 輔助編碼成為常態,我們該如何在確保學生發展深層概念理解的同時,為這樣的未來培育他們?PDF p.1緒論鋪陳、研究問題的正當性建立
2Traditional lab-based instruction often sees students spending substantial time debugging syntax errors and wrestling with implementation details, leaving limited cognitive resources for understanding the underlying NLP principles.傳統的實驗室式教學經常使學生耗費大量時間除錯語法錯誤、與實作細節纏鬥,以致理解底層 NLP 原理的認知資源相當有限。PDF p.1問題陳述、認知負荷論述的切入點
3Rather than treating LLMs as a threat to learning integrity, we position them as tools that can redirect student attention from low-level implementation concerns to high-level conceptual understanding, if properly scaffolded and assessed.與其把大型語言模型視為學習誠信的威脅,我們將其定位為工具——只要有適當的鷹架與評量,它們能把學生的注意力從低階實作事務重新導向高階概念理解。PDF p.1理論定位、論述立場宣示
4We define Vibe Coding (capitalized to distinguish the pedagogical framework from informal practice) as a structured educational approach with three core components: (1) sanctioned and encouraged use of LLMs for code generation during learning activities, (2) mandatory documentation of the prompting process to make AI interaction visible and reflectable, and (3) assessment focused on conceptual understanding and critical evaluation rather than independent code production.我們將 Vibe Coding(以大寫區別此教學框架與非正式實務)定義為具三項核心成分的結構化教育取徑:(1) 在學習活動中允許並鼓勵使用大型語言模型生成程式碼;(2) 強制記錄提示歷程,使 AI 互動可見且可反思;(3) 評量聚焦於概念理解與批判評估,而非獨立產出程式碼。PDF p.2定義引用、框架操作化的直接依據
5Traditional code-based assessment becomes problematic when students can generate functional implementations with minimal understanding.當學生能以極少的理解就產生可運作的實作時,傳統以程式碼為基礎的評量便產生了問題。PDF p.2評量改革論述、討論對話
6Kazemitabaar et al. (2023) observed that novice programmers using LLMs showed increased engagement but decreased learning on transfer tasks.Kazemitabaar 等人(2023)觀察到,使用大型語言模型的初學程式者投入度提升,但在遷移任務上的學習成效下降。PDF p.2文獻對話、呈現既有研究的矛盾證據
7It is important to note that these findings reflect student perceptions rather than objective cognitive load measurements.必須指出,這些發現反映的是學生的知覺,而非客觀的認知負荷測量。PDF p.5方法侷限的誠實表述、可作為方法論寫作的示範
8Interestingly, LLM use didn't eliminate time pressure, it shifted it from debugging to understanding, verifying, and documenting AI-generated solutions.值得注意的是,大型語言模型的使用並未消除時間壓力,而是將壓力從除錯轉移到理解、驗證與記錄 AI 生成的解決方案。PDF p.5討論、對「AI 省時」直覺假設的反駁
9This highlights a pedagogical challenge: students need foundational knowledge to critically evaluate LLM outputs, creating a bootstrapping problem.這凸顯了一項教學挑戰:學生需要基礎知識才能批判性評估大型語言模型的輸出,從而形成一個啟動悖論。PDF p.5核心張力的命名、討論與後續研究鋪陳
10Furthermore, we cannot rule out the possibility that students used LLMs to assist with their reflection responses, which may affect claims about demonstrated conceptual understanding.此外,我們無法排除學生以大型語言模型協助撰寫反思答案的可能性,這可能影響關於「已展現概念理解」的論斷。PDF p.6研究限制、AI 時代評量效度的討論
11Programming competency may need redefinition emphasizing problem decomposition, algorithm selection, output verification, and strategic AI collaboration rather than raw coding ability.程式設計能力或許需要重新定義,強調問題拆解、演算法選擇、輸出驗證與策略性 AI 協作,而非原始的編碼能力。PDF p.6結論性主張、課程與能力指標改革的引用
12I learned how to combine my own technical skills with AI tools in a strategic way—using LLMs as support, not as a replacement. (S16)我學會如何以策略性的方式,把自己的技術能力與 AI 工具結合——把大型語言模型當作支援,而不是取代。(學生 S16)PDF p.6質性佐證、AI 素養論述的學生視角
Section 11

值得延伸閱讀的論文

以下 9 筆全部出自本論文參考文獻清單(原文共 10 筆),未加入任何清單外的文獻。

  1. Kazemitabaar, M., Chow, J., Ma, C. K. T., Ericson, B. J., Weintrop, D., & Grossman, T. (2023). Studying the effect of AI code generators on supporting novice learners in introductory programming. In Proceedings of the 2023 CHI Conference on Human Factors in Computing Systems (pp. 1–23).
    為何值得讀:以實驗方式檢驗 AI 程式生成器對新手的效果,是「投入度上升但遷移學習下降」這項關鍵警訊的原始出處。|與本論文的關係:本文最主要的對照與張力來源;本論文主張「評量對齊可避免此問題」,若要挑戰或延伸本論文,此篇是必讀的反面證據。
  2. Denny, P., Kumar, V., & Giacaman, N. (2023). Conversing with Copilot: Exploring prompt engineering for solving CS1 problems using natural language. In Proceedings of the 54th ACM Technical Symposium on Computer Science Education V. 1 (pp. 1136–1142).
    為何值得讀:直接檢視以自然語言提示解決 CS1 問題的成效,發現速度提升但概念題較弱。|與本論文的關係:本論文「以提示互動取代手寫語法」的可行性依據,同時也是其須回應的概念學習疑慮。
  3. Prather, J., Denny, P., Leinonen, J., Becker, B. A., Albluwi, I., Craig, M., Keuning, H., Kiesler, N., Kohn, T., Luxton-Reilly, A., MacNeil, S., Petersen, A., Pettit, R., Reeves, B. N., & Savelka, J. (2023). The robots are here: Navigating the generative AI revolution in computing education. In Proceedings of the 2023 Working Group Reports on Innovation and Technology in Computer Science Education (pp. 108–159).
    為何值得讀:篇幅完整的工作組報告,全面梳理生成式 AI 對計算教育的衝擊與應對選項,適合作為文獻回顧的骨幹。|與本論文的關係:本論文採用的「明示教學提示工程與輸出驗證」策略即引自此報告。
  4. MacNeil, S., Tran, A., Hellas, A., Kim, J., Sarsa, S., Denny, P., Bernstein, S., & Leinonen, J. (2023). Experiences from using code explanations generated by large language models in a web software development e-book. In Proceedings of the 54th ACM Technical Symposium on Computer Science Education V. 1 (pp. 931–937).
    為何值得讀:呈現 LLM 生成程式解說融入教材的實地經驗,並強調後設認知鷹架的重要性。|與本論文的關係:本論文 prompt log 作為後設認知鷹架的理論依據來源。
  5. Sarsa, S., Denny, P., Hellas, A., & Leinonen, J. (2022). Automatic generation of programming exercises and code explanations using large language models. In Proceedings of the 2022 ACM Conference on International Computing Education Research – Volume 1 (pp. 27–43).
    為何值得讀:早期以 LLM 自動生成練習題與程式解說的代表作,提出「AI 助手=需被批判評估的配對夥伴」隱喻。|與本論文的關係:本論文「批判評估 LLM 輸出」的概念前身。
  6. Cunningham, K., Blanchard, S., Ericson, B. J., & Guzdial, M. (2017). Using tracing and sketching to solve programming problems: Replicating and extending an analysis of what students draw. In Proceedings of the 2017 ACM Conference on International Computing Education Research (pp. 164–172).
    為何值得讀:以追蹤與手繪等外顯化歷程評估學習者的深層理解,是替代性評量的方法學範例。|與本論文的關係:本論文反思式評量(要求解釋設計決策、分析結果)所援引的評量文獻基礎。
  7. Finnie-Ansley, J., Denny, P., Becker, B. A., Luxton-Reilly, A., & Prather, J. (2022). The robots are coming: Exploring the implications of OpenAI Codex on introductory programming. In Proceedings of the 24th Australasian Computing Education Conference (pp. 10–19).
    為何值得讀:最早系統性檢視 Codex 在入門程式課的衝擊,界定了學術誠信與基本能力的爭議框架。|與本論文的關係:代表本論文所要重構的「早期關切」立場,是理解其論述對手的起點。
  8. Pannitto, L., Busso, L., Combei, C. R., Messina, L., Miaschi, A., Sarti, G., & Nissim, M. (2021). Teaching NLP with bracelets and restaurant menus: An interactive workshop for Italian students. In Proceedings of the Fifth Workshop on Teaching NLP (pp. 160–170). Association for Computational Linguistics.
    為何值得讀:以具體教具與互動工作坊降低 NLP 概念門檻,提供「非程式路徑」的教學設計靈感。|與本論文的關係:本論文用以支撐「傳統做法常以實作複雜度淹沒概念學習」的核心引註。
  9. Leinonen, J., Denny, P., MacNeil, S., Sarsa, S., Bernstein, S., Kim, J., Tran, A., & Hellas, A. (2023). Comparing code explanations created by students and large language models. In Proceedings of the 2023 Conference on Innovation and Technology in Computer Science Education V. 1 (pp. 124–130).
    為何值得讀:直接比較學生與 LLM 產出的程式解說品質,對「反思答案是否可能由 AI 代筆」的評量效度問題極具參考價值。|與本論文的關係:可用以回應本論文自承的限制——無法排除學生以 LLM 協助撰寫反思答案。

另有一筆為論文集編輯條目(Jurgens, D., Kolhatkar, V., Li, L., Mieskes, M., & Pedersen, T. (Eds.). (2021). Proceedings of the Fifth Workshop on Teaching NLP. Association for Computational Linguistics.),適合作為 NLP 教學研究社群的整體入口,惟非單篇研究,故未列入上述推薦編號。