Creative Commons International


A Collected Memoir


從一部千瘡百孔的詞典,拆政府原地重建

2004 年,在台北的一場會議中,我遇見 Larry Lessig。當時我深耕 Perl 社群,在「綜合 Perl 典藏網」(CPAN)上維護超過上百個開源模組。Lessig 提出的「創用 CC」(Creative Commons)授權框架,完美詮釋了我最直觀的想法,且將其化爲清晰可見的理念:自由軟體背後的開放精神,同樣能應用於文化、教育與知識的領域。1

這份洞見,歷經近十年光陰,透過一座千瘡百孔的詞典網站,才徹底改變了一切。


這個轉捩點出現在 2012 年 10 月。當時,一支坦承國家預算令人費解的政府宣傳廣告,在臺灣網路上瘋傳。2 一群對政府不信任公民能取得公開資訊而深感挫折的「公民黑客」,決定不再只是抱怨,而是動手打造解方。他們註冊了 g0v.tw——用數字 0 取代 gov.tw 中的 o——並於 2012 年 12 月 1 日在中研院舉辦了首次黑客松。3

我與這個圈子的淵源可追溯至多年以前。我是「自由軟體鑄造場」(Open Foundry)的初代開發者,該平台託管於中研院資訊科學研究所,而這正是推動臺灣創用 CC 的關鍵人物——莊庭瑞所任職的機構。4 這些社群的交會,可說是水到渠成。

在 2013 年 1 月 27 日的下一場 g0v 黑客松上,我的老友葉平(從量子物理學家轉職 Google 工程師,當時已移居加州)透過遠端參與。他發表了一篇名為「還文於民」的部落格文章。5 他的孩子當時正在美國學習華語,卻發現教育部線上詞典難以使用。這個建於 1996 年的網站,技術遠早於現代網頁標準:雖然沒有登入按鈕,卻會在 30 分鐘後自動登出;罕見字以無法複製貼上的微小點陣圖呈現;還標註「建議使用 IE 5 或 Netscape 4.7+ 瀏覽」——那個「+」根本多餘,因為 Netscape 早已停產。二十年的政府採購週期,忠實複製了這些「裂痕」。

葉平提出願景:下載詞典資料、清理並結構化,然後重建為現代網頁應用程式。短短 24 小時內,數十位黑客就精準實現了這一切——爬取 HTML、轉換為結構化資料、打造網站、輸入法擴充功能,以及離線與行動版本。

當數百人同時試圖從那些微小點陣圖中辨識 Unicode 碼位時,我們瞬間塞爆了 Google 試算表。於是我們迅速轉移到 EtherCalc——這是我在 Dan Bricklin 協助下開發的即時協作試算表。6 2013 年 2 月 1 日凌晨 2 點 2 分,我推送了「原型 webkit 客戶端的首次提交」。

葉平註冊的網域是 3du.tw——和 edu.tw 形似。我們將專案命名為「萌典」(MoeDict):「萌」既指教育部(MOE),也帶有「萌芽、初生」的意涵,當然還包含日系網路文化中那種可愛、令人心動的感覺。這個名字本身就是個黑客趣味,正如整個專案一樣。


接著,法律問題浮上檯面。教育部的網站聲明「版權所有,翻印必究」,並明文禁止連結至個別詞典條目。而我們不僅是連結,更是將整個資料集都搬了過來。在當時的臺灣,這種重製行為可能觸犯刑責。

這正是創用 CC 發揮關鍵轉變的時刻。

我們將所有程式碼與轉換後的資料以 CC0(公眾領域貢獻宣告)釋出。透過主張自身著作權為零,我們讓政府的資料成為這場行動中唯一受版權保護的內容。

這個策略極為精準:若我們對自己的貢獻不主張任何著作權,那麼我們就只是替政府執行資料轉換工作。我們所主張的原創表達比例為絕對的零,正好對應我們使用的 100% 政府資料。這正是合乎比例原則的合理使用。

CC0 也意味著教育部能順暢地將我們的成果併回自家系統,無需標記我們的貢獻。我們不是在打造競爭對手,而是把他們的工作做得更好,然後交還給他們,成為教育部本該提供的公共服務的延伸。

我們從「實價登錄地圖」事件中吸取教訓——那是由 Google 臺灣工程師發起的公民專案,使用政府不動產資料,卻因著作權問題被迫關閉。7 Aaron Swartz 遭起訴的悲劇也記憶猶新。8 大家都很清楚,我們可能面臨刑事指控。因此萌典主機架設在東京,部分原因便是讓管轄權更複雜。我們將這項工作組織成分散式的公民不服從:數十人各自下載一部分資料、各自主張合理使用、各自放棄自身著作權。若有人被起訴,其他人能立刻接手繼續。

就在教育部法務人員花了一整年爭論我們的案件時,我們持續開發。萌典流量成長至每月 700 萬造訪。當我們加入 Open Graph 圖片產生器(輸入任何詞彙,就能生成一張優美書法字體的分享圖)後,這個網站成了公民動員的利器。在婚姻平權運動中,組織者利用萌典將詞典釋義製作成易分享的橫幅。我們用詞典學,重新導向了 Facebook 的演算法。

接著,我們發起群眾外包的挑錯活動。我們的程式找出那些引用同一古籍出處、卻有一字之差的條目——這些很可能是數十年累積的錯字。我們邀請讀者考證正確版本。短短 18 天,我們蒐集超過 5,000 筆勘誤。9 而教育部平行進行的除錯活動,總共也只收到約 6,000 筆——其中大多數仍來自萌典使用者。

在我們交付這些勘誤的當天,教育部頒獎給我們,並宣告我們的行為屬於合理使用。10 教育部再也無法對我們採取行動——因為我們的貢獻者,正是他們的核心服務對象:教師、學生、語言學家與語言愛好者。對付我們,等同對付他們自己。


接下來的事連我們自己都感到驚訝:這個專案不斷「分岔」(forking)。

當我在萌典的華語之外,加入臺灣台語時,Google Play 評分下滑。有些使用者抱怨「用一個他們用不到的方言佔用手機空間」。而在台語社群內部,不同派系對羅馬拼音用法也有激烈分歧——白話字(Pe̍h-ōe-jī)對決臺羅(Tâi-lô)——甚至連是否該使用漢字都爭論不休。

我們每月舉辦萌典松,邀請所有派系參與。因為程式碼開源、資料採 CC0,任何意見不同的人都能直接「分岔」專案。我撰寫了各羅馬拼音系統間的轉換器,讓每個社群都能擁有偏好的版本。其中一個分岔專案「iTaigi」(愛台語)大受歡迎,因為它允許使用者新增現代詞彙——包括那些若交由教育部編輯委員會審核,可能要花上幾十年才會通過的寶可夢名字。11

我們透過群眾外包 OCR 校正,在兩天半內將《阿美語-國語-英語三語辭典》數位化——這是珍貴的原住民族語言寶典,原本僅存低畫質的 1970 年代掃描檔。12 接著是客語,然後是更多南島語言。每個社群都依自身需求,改造這個共享基礎設施。

這正是創用 CC 不只是靜態授權條款,更是一種鮮活實踐。「分岔的自由」化解了任何委員會都無法解決的衝突。


同一時期,我也與蘋果和牛津大學出版社合作,協助教育部詞典資料準備上架其他平台。毫不誇張地說,我同時站在所有陣營。當不存在人為製造的稀缺性時,你就能與所有人同時合作。

大約兩年後,教育部宣布所有過去與未來的詞典,都將以創用 CC 授權釋出。他們選擇了「CC 姓名標示-禁止改作 3.0 臺灣」(CC BY-ND 3.0 Taiwan),限制衍生作品。13 但這仍是深刻的轉變:從「版權所有,甚至連結都不准」,走向創用 CC,而這一切,源自最初幾十個人先放棄了自己的權利。

透過 g0v 的倡議與萌典的示範,臺灣在「全球開放資料指標」(Global Open Data Index)的排名,從第 36 名躍升至第 11 名,最終登上第 1 名。14 隨後在 2015 年,國家頒布新規:任何建置經費未達五千萬元的政府資訊系統,預設都必須以創用 CC 相容授權釋出資料。15

2016 年,我入閣擔任負責數位事務的行政院政務委員;上任第一天的記者會,就安排在萌典松之前。同樣的原則——基進透明(radical transparency)、粗略的共識(rough consensus)與進擊的程式(running code)——成為國家政策的一部分。在接下來的十年,當全球許多地方的民主評分下滑之際,臺灣在自由之家(Freedom House)、經濟學人智庫(EIU)以及 V-Dem 等指標上的排名卻持續上升。16

儘管我們是世界上最大規模境外影響力操作的首要目標,17 我們仍是情感極化程度最低的已開發社會之一,18 且有高達 91% 的公民認為我們的民主至少「還算不錯」。19 那道讓光透進來的裂痕,已成為一扇窗,映照出一個多元且相互關懷的社會。


回顧那段時光,我將創用 CC 視為一種文法,讓素昧平生的人們得以相互協作。CC0 讓我們能向充滿戒心的官僚體系,提出無可辯駁的論據。CC BY-ND 讓教育部得以在分享的同時,保留他們重視的完整性。而分岔的自由,則讓存在不可調和分歧的社群,依然能夠並肩前行。

Perl 創造者 Larry Wall 曾說:與其追求單一的奇點(singularity),不如擁抱多元(plurality)。這正是創用 CC 為我們開創的可能——不是單一標準答案,而是一個能容納無數答案的共享基礎設施。

如今,創用 CC 對「分享」的叩問,已延伸至機器學習的前沿。我們的回應是「仁工智慧」(Civic AI):將人工智慧的「人」替換為「仁」,象徵公民關懷。我們的「關懷六力」(6-Pack of Care)架構同樣以 CC0 釋出。20 這場分岔,仍在持續不斷地分岔下去。

我常反覆咀嚼 Leonard Cohen 的歌詞:「萬事萬物都有缺口,缺口就是光的入口。」一座擁有 20 年歷史、技術上千瘡百孔的詞典網站,讓一場運動的光芒得以透進。創用 CC 正是確保沒有人能壟斷這道光,並讓每個人都能幫助它持續閃耀的框架。