Jev 1.13 的 jaggedness

發布問題前,先篩除 Jev 1.13 的失敗模式。

搜尋

9 失敗模式

照字面理解

在指示與準則中明確寫出完整條件。

jev-1.13-failure-modejev-1.13

數學與數字

由程式碼處理算術與計數。

jev-1.13-failure-modejev-1.13

日期與時間比較

用 Choice 擷取各部分,再由程式碼比較。

jev-1.13-failure-modejev-1.13

間接提問

減少推理層級;明確指出相關的 state。

jev-1.13-failure-modejev-1.13

塞滿無關細節的大型 state

先行篩選;只傳送問題所需內容。

jev-1.13-failure-modejev-1.13

對抗性內容

寫出精確準則並測試邊界案例。

jev-1.13-failure-modejev-1.13

互相矛盾的指示與準則

讓準則與指示保持一致。

jev-1.13-failure-modejev-1.13

常識上的結構不變性

不要假設 Noul 與 Choice 的恆等關係。

jev-1.13-failure-modejev-1.13

內容生成

使用生成式模型;不要串接 Choice 來撰寫文字。

jev-1.13-failure-modejev-1.13

Jev 1.13 速度快、校準良好,也擅長常識判斷,但並非完美。TypeSafe 記載了 jev-1.13 的九種失敗模式,最近一次審閱日期為 17 September 2026。模型可能過度按字面理解、缺乏數值精確度,也不擅長多層間接推導。請按名稱或建議替代方案篩選清單,並避免在正式問題中加入算術、日期與生成工作。

如何使用此清單

搜尋會比對模式名稱與替代方案文字。每列的 Family 都是 jev-1.13-failure-mode;appliesTo 是 jev-1.13。清除搜尋即可返回全部九項。TypeSafe 表示,許多這類邊界問題會在後續版本修正。在此之前,請將替代方案欄視為正式環境問題的規範。

字面解讀:Jev 回答的是你實際寫下的問題,而非你心裡想問的問題。範圍限定詞、否定語句與隱含條件都會按字面解讀。當你發現自己正在解釋真正意圖時,該解釋就應寫進指示與準則。若無法避免解讀,請拆成兩個字面問題,再用程式碼合併結果。

數學與數字:Jev 不是計算機。字元、詞彙出現次數或長清單的計數並不可靠,而且集合越大,表現越差。十六進位色彩與底層編碼的表現不如英文名稱。不要靠內插 Score 級別重建精確數值。算術請留在程式碼中;逐一處理候選項目,每次只問一個語意問題,再自行加總。

Nine official Jev 1.13 jaggedness failure modes
九種官方 Jev 1.13 jaggedness 失敗模式。

日期、多層推導、state 與生成

日期與時間比較:Jev 會把日期當成文字,而非有先後順序的量值。無論判斷哪個日期較早、相隔多久,或是否落在某段期間內,都不可靠,尤其是格式與季度混用時。請用 Choice 擷取月、日、年(並提供「未註明」選項),再由程式碼組合及比較。

間接提問:雙重否定與多層屬性問題會降低準確度。減少推理層級,並明確指出相關的 state。塞滿無關細節的大型 state 會造成干擾,應先行篩選。state 中的對抗性內容可能左右答案,因為 state 是資料,而非可信任的使用者。請寫出精確準則並測試邊界案例。互相矛盾的指示與準則會使模型混淆;兩者必須一致,也不要把 true 對應到「否」。

常識上的結構不變性並無保證。針對同一個退款問題,Noul 與 Choice 可能得出不同結果,而一個 Noul 與其否定結果相加也不一定等於一。每項決策只用一種問法。內容生成不在適用範圍內:串接 Choice 來撰寫文字既慢又差。請用生成式模型或正規表示式提出選項,再由 Jev 選擇。

發布問題前

大聲讀出指示。如果還需要補一句話才能向同事解釋清楚,那句話就該寫進指示。請把邊界案例納入準則;若 Choice 用於擷取日期或列舉值,須明確提供「無/未註明」選項。

在此清單中搜尋你使用的動詞:計數、比較、生成、跨層、傾倒。數學與數字、日期與時間比較、內容生成、間接提問,以及大型 state,通常就是問題來源。當 state 包含會為自身標籤辯解的不受信任使用者文字時,也須留意對抗性內容。

測試資料中應保留這九筆記錄。只驗證正常 Choice 的單元測試,會漏掉 Noul/Choice 結果不一致的情況。TypeSafe 上次檢視此目錄是在 17 September 2026;後續 Jev 版本可能會縮短清單,但 jev-1.13.0 目前仍收錄全部九項。

檢查提示詞時,請把這份九列清單印在旁邊。頁面上的篩選器使用同一份清單:搜尋名稱或替代作法欄,並保留 jev-1.13-failure-mode 系列。若正式環境中的漏判不在這九項內,它仍是漏判,只是不屬於已有記錄的 jev-1.13 不平整邊界。

最先遇到的通常是照字面理解造成的漏判:模型確實照你寫的內容執行。有人要求它計數時,會遇到數學漏判;有人串接 Choice 來撰寫文章時,會遇到生成漏判。其餘六種模式通常要等正式上線第一週後才會發現。

發生漏判時,先為模式命名,再重寫提示詞。若無法判定模式,可能是遇到新的邊界,也可能是某個 state 仍把政策與工單混塞在同一字串中。

每一列的系列標籤都是 jev-1.13-failure-mode,appliesTo 則是 jev-1.13。兩者都是篩選條件,不是額外模式。

來源