【大紀元2026年10月01日訊】(英文大紀元記者Autumn Spredemann撰文/張紫珺編譯)近一段時間,隨著保護和優先考慮人類創作內容(human-authored content)的呼聲日益高漲,對於出版商、教育工作者和其他專業人士來說,識別人工智能(AI)生成的文字正在成為一個並不陌生的難題。
在這種背景下應運而生的AI寫作檢測軟件已經迎接了這個挑戰;一些工具開發商表示,它們區分人類寫作和AI寫作的準確率可以高達99%。
然而眾多律師表示,必須謹慎對待AI寫作檢測軟件得出的結論。如果教育工作者、出版商和雇主在判斷文章是否為AI生成時,以人工智能檢測的評分作為依據,可能會面臨嚴重的法律後果。
人工智能專家——甚至包括那些開發出檢測工具的專家——都表示,這些檢測服務旨在提供有用的線索,但是並非絕對正確。事實上,它們似乎都存在一個共同的盲點。
實踐檢驗
研究人員對人工智能檢測工具的有效性測評已經進行了一段時間,相關研究和專家都強調了一個關鍵點:人類仍然需要參與評估過程。
在2026年發表於《教育誠信國際期刊》(International Journal for Educational Integrity,簡稱IJEI,總部位於澳大利亞)的一項研究中,研究人員指出:「雖然檢測工具可以提供有用的初步示警,但是在涉及重大後果的決策時,不應將其視為決策的唯一證據。應該將檢測結果納入到更全面的評估策略之中。」
研究人員和行業專家也對這些檢測工具的準確性表示擔憂,擔心它們可能將人類寫作標記為人工智能寫作。
總部位於紐約的AI初創公司GPTZero的一位發言人告訴《大紀元時報》:「檢測結果只是一個信號,而不是定論。它應該引發進一步的調查,而不是成為調查的終結。」
在專業領域,有兩件事比檢測工具本身更重要。
發言人表示:「首先,一個組織需要制定書面的AI使用政策,然後才需要檢測工具。檢測工具可以幫助執行標準,但是它並不能替代標準本身。」
「第二,應關注模式而不是孤立的案例,並將檢測結果與流程證據結合起來。」
《大紀元時報》在兩週時間內測試了三款領先的AI寫作檢測工具——Pangram、GPTZero和Originality.AI。測試結果令人大開眼界。
在每個檢測平台的免費版本中,都使用了相同的寫作樣本,長度在500到2000字之間。所有寫作樣本均包含三種類型:100%人工智能寫作、100%人類寫作,以及人工智能和人類寫作比例分別為25:75、50:50和75:25的混合模式。
100%人工智能寫作樣本由大型語言模型ChatGPT和Claude創建,以確定某些自動寫作風格是否比其它風格更容易被檢測到。

在《大紀元時報》的測試中,所有三種檢測服務都能輕鬆識別出100%由人工智能生成的文本樣本。
Pangram和GPTZero均給出了100%的人工智能生成概率評分,而Originality.AI則認為該文本至少有40%的可能性是由人工智能生成的。
在測試中,三款檢測工具在識別100%真人寫作樣本時表現相近。然而,當引入混合寫作樣本時,情況就變得有趣起來。
在測試中,Pangram對人機混合寫作樣本進行檢測時,檢測結果的變化最為顯著。原本100%人類撰寫的文本經過編輯,加入了25%的AI生成的內容。檢測結果顯示,新文本中AI生成文本的比例達到了87%。
而當將人類寫作和AI生成的比例反轉為25:75時,Pangram在測試中給出的分數是AI寫作占100%。
在測試中,GPTZero和Originality.AI也將25:75的混合寫作樣本比例視為一個觸發點。這兩個程序在檢測該比例的文本時(無論是正向比例還是反轉比例)結果最為可靠,但在檢測50:50比例的文本時表現不佳。在對所有混合寫作樣本進行評分時,Pangram在檢測50:50比例的文本時準確率最高。
但是問題在於:使用Grammarly等AI編輯軟件也可能影響檢測的分數。
美國女作家米婭‧巴拉德(Mia Ballard)否認使用人工智能創作小說《害羞女孩》(Shy Girl,2025)。此前有報導稱,由於被懷疑大量使用人工智能,她與法國的阿歇特出版集團(Hachette)解約。巴拉德表示,她的編輯人員可能在修改或編輯過程中使用了人工智能。報導中只是說懷疑,而不是列出確鑿的證據表明巴拉德使用人工智能創作小說。
關於僅僅使用人工智能來編輯文章是否會被檢測服務標記為違規,一直存在諸多爭議。然而,Originality.AI的首席執行官喬納森‧吉爾漢姆(Jonathan Gillham)表示,這種情況完全有可能發生。

人工智能在編輯中的應用
「如果我使用Grammarly來修改我的文章,其中就包含了很多人工智能技術……如果你使用人工智能工具來輔助編輯,它會在編輯過程中輸入這些信息。」吉爾漢姆向《大紀元時報》解釋道。
這對於那些認為只使用人工智能工具進行編輯,就能安全通過人工智能檢測的人來說,這一點令人擔憂。不過,吉爾漢姆表示,這其中還有一些微妙的地方。
吉爾漢姆表示,僅僅糾正標點符號和拼寫錯誤可能不會引起檢測工具的注意,但接受修改建議則可能被識別。他認為,當有人接受對段落和句子進行重新措辭的建議時,這些更改會在文檔中留下類似的痕跡,而人工智能檢測工具可能會識別出這些痕跡。
吉爾漢姆表示,如果有人撰寫書籍、文章或論文,並使用人工智能工具進行編輯和修改,則該作品可能會被標記為人工智能作品。
這就是為什麼吉爾漢姆認為,企業制定「人工智能容忍政策」(AI tolerance policy)非常重要。
「例如,如果和我共事的人在寫作中使用人工智能,而公司對人工智能採取零容忍政策,那麼我就不能使用Grammarly等輔助工具。」他說道。
為了驗證這個理論,我們首先將一篇1,500字的人工撰寫的文章直接放入這三個檢測工具中,不做任何修改;然後,在根據Grammarly的建議進行修改後,再次放入這三個檢測工具中,看看它是否會生成AI寫作的分數。
在第一輪檢測中,所有樣本均未檢測到人工智能寫作。而在第二輪檢測中,Originality.AI和Pangram均未檢測到任何非人類因素的影響,但GPTZero檢測到了,並給這篇文章的人工智能比例判定為1%。
吉爾漢姆表示,公司或出版商必須明確他們可以允許多大程度使用人工智能寫作,這一點至關重要。明確了這一點,才能避免雙方的預期「不符」(mismatch)。他認為,問題產生的根源是缺乏透明度。
「人工智能檢測工具也是討論的一部分。在大數據集上,它是一個非常有效的工具,可以幫助我們了解一個組織正在創建多少人工智能內容。」他說道。
當被問及他是否認為人工智能檢測工具可以作為最終決策的依據時,吉爾漢姆的態度非常堅決。
「沒有任何工具的準確率能達到100%,而且當涉及到混合內容時,就會出現很多關於什麼是人類、什麼是人工智能的問題。」他說道。
總部位於賓夕法尼亞州的ANTLR Interactive的創始人兼高級軟件工程師凱爾‧斯威斯(Kyle Szives)也同意這種觀點。
「人工智能寫作檢測工具在技術上無法完全確定作者身分。從宏觀層面來說,人工智能檢測工具通常通過尋找機器生成文本中常見的統計信號,將一段文本歸類為人工智能撰寫或非人工智能撰寫。」斯威斯向《大紀元時報》解釋道。
斯威斯曾經開發過人工智能輔助產品,他表示,存在人工智能「概率或信號」(probability or signal)並不能確鑿證明某人在其寫作中使用了該技術。
「如果一段人工撰寫的文本結構僵化、公式化或者可預測,篇幅異常短小,有大量編輯的痕跡,或者遵循清晰但統一的專業風格,那麼這段文本可能會被標記為人工智能生成文本。」他說道。
斯威斯指出,反過來也會發生同樣的情況,即當人工智能生成的文本被大幅改寫或者與人類撰寫的文本合併時。此時還可能出現誤判為「非人工智能生成」的情況。
吉爾漢姆表示,人工智能寫作檢測工具會根據人類和人工智能的寫作進行訓練,但它們所做的與ChatGPT等系統所做的並沒有太大區別——都是模式識別。
當被問及檢測工具如何確定人工智能得分時,吉爾漢姆指出:「令人不安的答案是,人工智能系統是一個黑匣子。」而危險就在這裡。
「我認為外界對人工智能檢測存在一些誤解。」他說道,「測試表明這些檢測工具的準確率很高,但也有人將它們的準確率視為100%。」
法律後果
毫無疑問,人工智能檢測服務的市場需求非常迫切。
根據 Originality.AI研究人員的分析,在對亞馬遜(Amazon)上的書籍進行掃描分析後發現,82%的草藥療法類書籍、77%的成功相關的事業雞湯類書籍,和63%的宗教類書籍被懷疑是人工智能生成的。
這些發現得到了其它研究的支持。今年7月,紐約石溪大學(Stony Brook University)、哥倫比亞法學院(Columbia Law School)和密歇根大學(University of Michigan)的研究人員發表了他們的研究結果。他們審查了2023年至2026年間在亞馬遜上銷售的14,419本自助出版類型小說。研究人員使用人工智能檢測工具後發現,其中20%的小說含有「大量人工智能文本」。不含人工智能文本的書籍僅占測試組的37%。
「如果對作者的身分存在疑問,應該參考其它的證據,例如草稿、修訂記錄、來源注釋、元數據以及作者本人等等。」斯威斯說道。
一些美國律師強調,對員工、客戶或合同作出關鍵決策時,如果僅僅使用人工智能檢測工具,可能存在潛在風險。
「如果一家公司主要根據檢測工具的分數解僱員工、終止與承包商的合作或拒絕接受工作成果,那麼它就有可能基於一個可能錯誤的工具做出後果嚴重的決定。」麥克雷迪律師事務所(McCready Law)的創始人邁克爾‧麥克雷迪(Michael McCready)告訴《大紀元時報》。
麥克雷迪提到了聯邦貿易委員會(Federal Trade Commission,簡稱FTC)去年對人工智能檢測工具Workado採取的行動。聯邦貿易委員會(FTC)指控Workado向客戶宣稱其準確率高達98%;而該案中引用的一項獨立調查發現,該工具在通用內容上的準確率約為53%。
麥克雷迪表示:「還有一個主要的問題是歧視。如果人工智能寫作檢測工具不成比例地標記某些群體,而雇主又依賴這些檢測結果進行招聘、紀律處分或作出解僱決定,那麼該公司可能面臨法律風險。」
麥克雷迪表示,公司不能僅僅因為「軟件告訴我們這樣做」就可以逃避責任。
「最終的決定權仍然在企業手中。如果供應商對工具的準確性或可靠性做出了未經證實的聲明,則可能要承擔額外的責任。」他說道。
海姆利希律師事務所(Heimlich Law)總裁艾倫‧海姆利希(Alan Heimlich)對此表示贊同。
「最大的風險之一就是,企業可能會將概率誤認為證據。因為在任何情況下,人工智能寫作檢測工具實際上並不能證明作者身分,而如此篤信這些技術的準確性,最終可能會導致企業承擔不必要的責任。」他說道。
吉爾漢姆還強調,當人工智能檢測分數出人意表地彈出來的時候,不要操之過急。
「我們認為,只要情況允許,檢測評分應該成為展開一場討論的契機。」他說道。
原文:Does AI-Detection Software Work? We Tested 3 Popular Tools. 刊登於英文《大紀元時報》。
來源:大紀元:https://www.epochtimes.com/b5/26/10/1/n14861111.htm































