曾索賠1元!“大模型數據被盜第一案”和解
時間:2023-08-16 23:45:43
近日,世紀天鴻投資的AI輔助寫作產品筆神作文發布聲明稱,已于8月4日決定不再對學而思,針對相關數據調取事件發起訴訟。
筆神作文表示,經與學而思深入調查并坦誠溝通后,對雙方有爭議條款已達成一致,雙方已消除誤會,并將繼續深化合作,共同推進AI技術在教育領域的探索。
(資料圖片僅供參考)
6年成果,被爬取200+萬次,索賠1元
筆神作文將之稱為“AI大模型數據被盜第一案”。此前6月13日下午,筆神作文通過自己的微信公眾號、微博和第三方媒體發布消息稱,遭到有多年合作關系的“學而思”背刺,指控學而思“盜取了我們的作文庫存”,并稱4月數據被竊取,學而思5月就公布進行數學大模型-MathGPT 的研發使用,“未免也太過于‘巧合’了”。
對此,學而思方面則發布聲明回應稱,該公司對筆神作文接口的調用,屬于雙方合同約定的正常合作范圍,對筆神素材內容的使用均符合合同要求,并未用于合同以外的任何用途。
筆神作文在文章中表示,“我們的案件可能將會成為‘AI大模型數據被盜第一案’。”并表達了,要求公開致歉、刪除非法獲取的數據并中止應用、求償1元的訴求。
對此,筆神作文解釋道:“數據是有價值的,但我們心血更是無價,索賠 1 元是因為公平公正并不能用金錢衡量,我們希望通過訴訟告訴社會這種行為是錯誤的。人工智能行業的發展,靠的是共同創造,而非覬覦和剽竊他人的成果。”
公開資料顯示,筆神作文是北京一筆兩劃科技有限公司開發的智能寫作平臺,擁有語文作文寫前指導、作文批改評測等服務。
筆神作文在文章中稱,“在過去筆神作文成立的6年時間里,我們每個月都會收到30萬篇作文投稿和超過四十萬的點贊。總共積累了超過500萬篇作文素材,月批改量超3萬篇。”但在4月一個周末,這些數據資源被爬蟲爬取了超過兩百萬次。
文章中透露,筆神作文與學而思是合作關系,“雖然我們的產品已經設置了完備的數據安全機制,然而學而思卻利用了我們的這份信任,利用了我們對合作伙伴的接口不設防。”
筆神作文表示,在數據竊取事件發生后,筆神作文找學而思進行求證時,對方直接承認,是他們的算法組在爬取數據并作為己用。
此前,好未來公司 (三體云聯公司關聯公司,前身學而思) 在5月5日的官方微信公眾號發文表示: “學而思正在進行數學大模型-MathGPT 的研發使用,學而思學習機近期將上線一款‘AI助手’,涵蓋作文助手......等相關功能。”
筆神作文方面直言,“4月我們的「作文庫」數據被竊取,5月‘學而思’的「作文AI助手」新產品就即將上線了,這樣‘巧合’未免也太過于‘巧合’了。”
筆神作文還稱,團隊多次向學而思發出律師函,但對方始終沒有實質性答復。
不久后,針對筆神作文的這篇“征討檄文”,學而思發布聲明否認了筆神作文的說法,并稱“對方在公開聲明中提及學而思正在研發的數學大模型MathGPT以及學而思學習機‘作文AI助手’,并主觀揣測我方使用其數據用于兩款產品的訓練和研發,這與事實嚴重不符”。
學而思從三個方面回應了筆神作文:
1、學而思和筆神作文于2020年12月開始合作,合作協議明確約定:筆神作文為學而思提供“筆神作文范文素材服務接口”,用于學而思相關服務中,每月保底費用包含的調用次數為百萬次量級。合作至今,雙方一直按照調用量進行正常結算。
2、我方對筆神作文接口的調用,屬于雙方合同約定的正常合作范圍,對筆神素材內容的使用均符合合同要求,并未用于合同以外的任何用途。
3、對方在公開聲明中提及學而思正在研發的數學大模型MathGPT以及學而思學習機“作文AI助手”,并主觀揣測我方使用其數據用于兩款產品的訓練和研發,這與事實嚴重不符:首先,MathGPT是專注于數學領域的自研大模型,沒有任何作文相關數據; 其次,“作文AI助手”目前處于開發狀態,尚未發布,該服務并未使用筆神作文的任何數據。
500萬篇作文素材從何而來
作為AI核心要素之一的數據,據筆神作文和世紀天鴻披露,筆神作文積累的作文素材已超過500萬篇。
世紀天鴻此前在互動平臺中表示,筆神作文的大數據來源于自身累積,算法模型為公司自研訓練。
此前5月8日,深交所對世紀天鴻下發關注函,其中要求說明公司是否向一筆兩劃提供訓練“筆神作文”AI模型所需的數據;如是,需要結合公司有關數據的獲取方式及來源等,按照《數據安全法》等相關規定,說明獲取、處理及使用有關數據的合法性;有關數據資產產權的權屬是否清晰、是否存在潛在糾紛,相關方是否存在其他協議及利益安排。
世紀天鴻回復關注函時表示,經核實,一筆兩劃訓練“筆神作文”AI模型所需數據,均為一筆兩劃在自身經營過程中積累。截至目前,公司未使用“筆神作文”向客戶提供服務,也未向一筆兩劃提供“筆神作文”AI模型訓練所需數據。后續,如一筆兩劃就“筆神作文”AI 模型訓練有數據采買需求,公司將嚴格按照《數據安全法》等相關規定,在確保有關數據獲取、處理及使用合法、數據資產產權權屬清晰,無潛在糾紛的前提下,協商確定具體業務合作方式。
筆神作文向《科創板日報》表示:“用戶在筆神作文APP使用我們服務的過程中,根據協議,我們會積累大量用戶的原始的作文素材,成為我們的資產。這也是學而思與我們合作的原因,學而思如果從頭積累數據,時間成本很高,短期沒有辦法積累相同數量級的數據。”
據悉,根據筆神作文的用戶服務協議,用戶在筆神作文發表的內容,授予筆神作文免費且不可撤銷的非獨家使用許可。
平衡安全與發展成AI監管挑戰
筆神作文與學而思的糾紛,牽引出大模型的一個“隱秘的角落”:用于訓練AI大模型的數據,來源是否合法合規?事實上,關于大模型數據集的紛爭已在海內外頻頻上演。
今年1月,海外圖片供應商華蓋創意(Getty Images)起訴AI繪畫工具Stable Diffusion的開發者Stability AI,稱其侵犯了版權。華蓋創意稱,Stability AI“非法”從網站上竊取了數百萬張圖片。
2月,《華爾街日報》的一名記者在網上公開表示,他向ChatGPT索取了一份用來訓練它的新聞來源清單,收到的回復列出了20家媒體,但并不清楚OpenAI是否與所列出版商都達成了協議。
6月,美國一家律師事務所在加州一家聯邦法院向OpenAI提起集體訴訟。根據訴狀,OpenAI大規模盜取互聯網用戶與該公司產品的互動信息,及集成ChatGPT的應用中的隱私數據,并將這些信息用于該公司產品的模型訓練。受害者據稱可能多達數百萬人,潛在損失高達30億美元。
自去年底ChatGPT“一夜成名”,人工智能迎來“狂飆”時刻,AI生成內容(AIGC)領域快速發展。與此同時,數據泄漏、電信詐騙、個人隱私風險、著作權侵權、虛假信息等挑戰層出不窮。
隨著問題的凸顯,各國也把對于AI的監管提上日程。斯坦福大學發布的《2023年人工智能指數報告》中提到,對127個國家的立法記錄調研的結果顯示,包含“人工智能”的法案被通過成為法律的數量,從2016年的僅1個增長到2022年的37個。報告對81個國家2016年以來的人工智能法律法規記錄的分析也同樣表明,全球立法程序中提及人工智能的次數增加了近6.5倍。
新一輪人工智能飛速發展,如何平衡發展與安全成為此次發展過程中的一道必答題。
責任編輯:張薇


