
2009 年的最後一天,寫了一篇「語意化網站出版技術:OpenCalais 與 Drupal」。當年語意網(Semantic Web)是顯學:透過後設資料的描述,讓電腦理解非結構化資料裡隱含的結構化意義,資訊的搜尋與整合就會更有效。OpenCalais 可以自動幫文章標注人名、地名、組織,我們一群人相信,這是網路出版的未來。
後來的故事大家知道了:語意網沒有等到它的未來。RDFa、微格式這些標準太繁瑣,寫內容的人不想標、標了也沒有立即好處,先有雞先有蛋的僵局一直沒解開。
十六年後,「讓機器讀懂內容」這件事實現了,但路線完全不是當年想的那條。LLM 不需要你乖乖標注語意,它直接把整篇文章讀進去。當年要靠一整套本體論才能回答的問題,現在丟給模型就好。
有趣的是,兜了一圈,語意網的老工具竟然又回來了,換了一副面孔:
- GEO(Generative Engine Optimization)教的那些事——清楚的標題結構、明確的事實陳述、標注出處——本質上就是在幫機器降低理解成本,跟當年語意化出版的目標一模一樣。
- llms.txt 這個新做法(2024 年由社群提出的提案,還不是正式標準,各家 AI 是否真的會讀取仍有爭論),是在網站根目錄放一份給 AI 讀的導覽文件,告訴模型這個網站是誰、重要內容在哪。這根本是 sitemap 與 Dublin Core 的精神復刻。
- Schema.org 的結構化標記,因為 AI 搜尋要抓可信的事實來源,重要性反而比 SEO 時代更高。
對經營網站的組織來說,實務結論很簡單:不用追新名詞,把十六年前就該做好的事做好——內容寫清楚、結構標明白、出處交代清楚——你的網站就同時對人類讀者、搜尋引擎、AI 模型都友善。
當年那篇文章引用的 Linked Data 雲圖,如今看來像一張沒有實現的藍圖。但技術史常常是這樣:夢想的方向是對的,實現的路徑猜錯了。讓機器讀懂內容這件事,最終不是靠人人變勤勞,而是靠機器變聰明。還好,勤勞留下的東西沒有白費。



