歡迎來到 DAVID888 Daily 每日放送!今天我們將帶大家探索從突破性的 GigaToken 1000 倍分詞加速、單一 HTML 檔簡報工具 Bento、陶哲軒如何用 ChatGPT 解數學難題,到利用古 DNA 解開麥第奇家族 400 年死亡之謎,以及用 AI 語意搜尋拯救非虛構好書、實測 AI 是否在過擬合「鵜鶘騎單車」、還有 Emacs 的可塑性計算哲學!
GigaToken:讓語言模型 Tokenization 速度狂飆 1000 倍的效能魔術
在大型語言模型(LLM)的訓練與推理鏈條中,大家通常把注意力放在 GPU 的矩陣運算上,但往往忽視了文字預處理(Pretokenization 與 Tokenization)這一步驟在 CPU 上所造成的嚴重效能瓶頸。為了徹底解決這個問題,開發者推出了一個名為 GigaToken 的全新開源項目,透過極致的系統級優化,將 BPE(Byte-Pair Encoding)分詞速度提升了近 1000 倍。
極限吞吐量與底層硬體優化
在 144 核心的 AMD EPYC 伺服器測試中,GigaToken 處理 GPT-2 模型分詞的吞吐量高達 24.53 GB/s,相比之下 HuggingFace Tokenizers 僅有 24.8 MB/s(速度相差 989 倍),tiktoken 亦僅有 36.0 MB/s(相差 681 倍)。即使在 Apple M4 Max 晶片上,也能達到 8.79 GB/s 的驚人速度。
這項突破主要歸功於幾項極致的系統程式設計技術:
- SIMD 向量化預分詞:完全摒棄傳統低效的正則表達式引擎(Regex Engine),改用 SIMD 指令集進行超平行化預處理。
- 高效能快取與零執行緒通訊:設計雙指針 Pretoken 快取架構,並消除執行緒之間的通訊開銷(Zero Thread Inter-communication),最大化降低 CPU 分支預測失敗率。
- 安全邊界碎片化:針對巨型文件,在 Rayon 執行緒池上進行基於安全邊界的平行碎片化處理。
以這樣的速度,處理高達 130 兆 Token 的 Common Crawl 全網超大型資料集,預處理時間將從傳統的數天縮短至僅需 6.5 小時。
社群討論與應用邊界
社群對於如此誇張的效能提升表達了高度關注。部分開發者質疑這是否屬於特定測試集上的「過擬合(Over-optimization)」,但作者澄清該架構已通用支援 Llama 3/4、Qwen 2/3 及 DeepSeek V3/R1 等 mainstream 模型。不過,對於基於 SentencePiece 的模型(如 Gemma、Llama 2),由於其 Text Normalizer 架構限制了快取發揮,加速效果會下降至 7x–21x。這證明了用 Rust 極致榨取記憶體快取階層與 CPU 指令集,是降低模型預訓練基建成本的關鍵突破點。
Bento:把整套 PowerPoint 縮小進單一 HTML 檔案的革命性嘗試
面對現代簡報軟體(如 Google Slides、Pitch 等)高度依賴雲端伺服器與訂閱制的現狀,開源專案 Bento 貫徹了「Local-First(在地優先)」的精神,帶來了一種嶄新的體驗:將整套簡報播放器、簡報者檢視(Speaker View)、視覺化圖表以及完全可互動的編輯器,全部打包在單一 .html 檔案中。
0 依賴與「檔案即軟體」的架構
Bento 不需要安裝任何應用程式,也不依賴任何外部伺服器,100% 離線皆可運行:
- 內嵌資料結構:簡報的結構與文字以 JSON 格式直接嵌入在 HTML 的
<script>標籤中,圖片與字型則轉為 Base64 內嵌。 - 原地自儲存(Self-saving):透過瀏覽器的 File System Access API,當使用者在網頁編輯器中按下
Cmd+S時,系統會直接將變更重寫回該.html檔案本身。 - 動態 Morph 轉場與實時圖表:支援跨 Slide 的共享元素平滑補間動畫,內建的動態圖表(長條圖、圓餅圖、散佈圖)還能與 Markdown 表格進行實時雙向連動。
長效保存與可塑性軟體
Hacker News 社群對此概念大加讚賞。許多開發者指出,傳統 SaaS 平台隨時面臨服務停擺或檔案格式不相容的風險,而 Bento 這種「檔案即軟體」的設計,確保了這份簡報在 10 年甚至 20 年後,只要有基本的瀏覽器就能完美開啟與重新編輯。這展現了「可塑性軟體(Malleable Software)」的終極價值——將 Web 瀏覽器視為通用執行期,打破了文件與編輯工具之間的藩籬。
數學大師陶哲軒的 AI 實驗:如何用 ChatGPT 探討雅可比猜想
菲爾茲獎得主、著名華人數學家陶哲軒(Terence Tao)近日公開了他與 ChatGPT(LLM 推理模型)關於代數幾何領域未解難題「雅可比猜想(Jacobian Conjecture)」反例(Counterexample)構造的完整對話紀錄,引發了學術界與 AI 社群的廣泛討論。
頂尖數學家的「橡皮鴨除錯法」
在這段對話中,陶哲軒並非期待 AI 直接「證明猜想」或「自動給出解答」,而是將 LLM 作為高效率的代數符號推導助手與「邏輯響應板(Sounding Board)」:
- 引導與驗證:陶哲軒透過多輪對話,逐步引導 LLM 推導複雜的多項式映射結構,並讓其驗證高維度反例構造的合法性。
- 邊界條件檢查:利用 LLM 迅速檢查符號運算中的邊界條件(Edge Cases),省去大量人工代數推導的時間。
社群觀察與 AI for Science 的正道
極客社群指出,這展示了 AI 輔助科學研究(AI for Science)的最佳範例。LLM 在純數學領域的最強價值不在於替代人類思考,而是作為一個零延遲的推導工具。然而,社群也警惕地提醒:只有像陶哲軒這種等級的專家,才能在第一時間識別出 LLM 在高度抽象推理中產生的微小「幻覺(Hallucination)」與邏輯瑕疵。普通使用者若盲目相信 LLM 輸出的高階數學推導,極易被誤導走向歧途。
AI 實驗室在偷偷針對熱門 Prompt「刷榜」嗎?鵜鶘騎單車實驗給出答案
前陣子 AI 社群盛傳一個陰謀論:各大頂尖 AI 實驗室(如 OpenAI、Anthropic、Google 等)為了在評測中拿到好成績,正在針對社群熱門的測試 Prompt——「生成鵜鶘騎單車的 SVG(Pelican riding a bicycle)」進行專門的過擬合刷榜(Benchmaxxing)。為了驗證這個傳言,研究員設計了一套嚴謹的統計實驗。
1,008 張 SVG 的嚴格實證
研究團隊建構了一個 8 種動物 × 6 種交通工具 的交叉矩陣(包含 pelican + bicycle),對 7 款主流 Frontier 模型(包含 GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、DeepSeek V4 Pro 等)採樣生成了 1,008 張 SVG,並由 GPT-5.6 Luna 與 Gemini 3.1 Flash-Lite 進行盲測評分與特徵提取。
實證數據顯示:
- 鵜鶘(Pelican) 的平均得分僅 4.08,在 8 種動物中排名倒數第 3(遠落後於貓咪 4.63 與鯨魚 4.62)。
- 單車(Bicycle) 在 6 種交通工具中排名倒數第 2,因為單車的車輪、鏈條與踏板等幾何結構客觀上非常難繪製。
- 「鵜鶘騎單車」 組合在 48 種組合中僅排名 第 42 名。
- 固定效應迴歸分析:控制題目難度後,沒有任何實驗室在「鵜鶘+單車」特定組合上展現出統計顯著的刷分效應(p-values 均未通過修正)。
解碼謠言背後的真相
這項研究成功擊破了實驗室針對熱門 Prompt 進行劣質過擬合(Overfitting)的傳聞。社群討論認為,模型之所以能畫出令人驚豔的 SVG,並非後台偷刷特定題目,而是源自於模型整體空間推理能力與向量程式碼生成能力的全面提升。
400 年歷史懸案大白!古 DNA 技術證實麥第奇大公死於雙重瘧疾而非砒霜
1587 年,義大利文藝復興時期著名的麥第奇家族(Medici)大公 Francesco I 與其妻子在短短數小時內相繼暴斃。400 多年來,關於這起事件是政敵投毒(砒霜毒殺)還是疾病所致的爭議從未停止。如今,古基因組學(Paleogenomics)給出了確定答案。
肋骨 DNA 中的古代病原體
研究團隊從 2004 年「Medici Project」開棺提取的骨骼樣本中進行古 DNA(aDNA)定序,成功從 Francesco 的肋骨骨骼 DNA 中提取出兩種瘧原蟲的基因序列:惡性瘧原蟲(Plasmodium falciparum)與三日瘧原蟲(Plasmodium malariae),證實大公臨終前遭受了極其嚴重的雙重瘧疾感染。此外,團隊還在其兄弟的骨骸中發現了一種全新的歷史瘧原蟲菌株,填補了文藝復興時期歐洲瘧疾演化的空白。
法醫學與歷史爭議的交鋒
儘管毒物學支持者提出歷史文獻記錄了大公臨終前發疹、手部痙攣等典型急毒性砒霜中毒症狀,但研究團隊指出,Francesco 本人是一名熱衷於實驗的煉金術士,平時接觸化學物質即可解釋皮膚異常。這項研究代表了古基因組學在歷史法醫學中的里程碑——它正將傳統歷史爭議從「文獻詮釋學」轉化為精確的「數據序列比對問題」。
抗擊 AI 垃圾內容:用語意搜尋打造高質量非虛構書籍探索器
在生成式 AI 充斥網路、帶來大量低質「AI 垃圾內容(AI Slop)」的時代,優質的非虛構(Non-fiction)書籍被視為人類智慧與深度的最後堡壘。然而,現代大學圖書館正在大量拆除實體開架書庫(Open Stacks),轉型為「學習中心」,這讓讀者失去了在書架間漫步、隨機偶遇好書的樂趣。
「Book Prize Index」語意搜尋引擎
為了重現圖書館的偶遇體驗,作者利用 AI 工具打造了一個名為 Book Prize Index 的語意搜尋引擎:
- 精選資料集:收錄約 6,500 本歷史上獲得或入圍英美重大非虛構獎項(如 Pulitzer Prize、National Book Award)的權威書籍。
- 自然語言跨維度查詢:結合 Embedding Model,讀者可以用自然語言查詢如「大衛·愛登堡風格但寫成書的內容」或「令人意外且怪異的經典傳記」。
- 色彩視覺化:分析了 5,000 本書籍封面的配色(Chromatic Index),並發現非虛構類獎項數量在 2014 年達到頂峰後微幅下降。
用 AI 反擊 AI Slop 的哲學
社群討論特別提到這項專案的反諷與巧思:作者「利用 AI 工具(Claude Code、GPT-5.6)來幫助人類尋找對抗 AI Slop 的優質書籍」。網友還建議加入「隨機擲骰子」功能,抽取書中的幾句話,完美還原過去在圖書館隨意翻閱書頁的驚喜感。這展示了 AI 語意搜尋的正確開啟方式——將其作為高精度的 Vector 檢索層,拯救被演算法掩埋的人類智慧遺產。
可塑性計算與 Emacs:為什麼「只為一個人開發」的軟體最極致?
現代商業 SaaS 軟體為了滿足成千上萬使用者的需求,往往變得越來越龐大、封閉且功能臃腫(Software Bloat)。作者透過為 Emacs 開發一個名為 fj.el 的 GitHub Issue 同步工具,深入探討了「可塑性計算(Malleable Computing)」的核心哲學——使用者應該擁有完全的自主權,將既有工具縫合成專屬的工作流。
392 行程式碼的膠水藝術
作者僅花了 2.5 小時、撰寫了 392 行 Elisp 程式碼,就建構出一個高效率的 issue 管理工具:
- 極簡 Backend:直接呼叫 GitHub CLI(
gh),委派身分驗證與 API 請求,完全不需要在 Emacs 內重新實作複雜的 OAuth。 - UI 與格式無縫轉換:使用
vtable繪製列表,並透過Pandoc與ox-gfm實現 GitHub Issue 與 Org-mode 任務的即時轉換。
為 1 個人開發 vs. 為 N 個人開發
文章引述了軟體開發的經典法則:商業軟體必須「為 $N$ 個人開發」,因此不得不包含 99% 你根本用不到的功能;而可塑性軟體允許開發者「只為 1 個人(自己)開發」,達到「剛剛好(Good Enough)」的極致效率。結合 Emacs 的動態 Lisp 環境,開發者可以在運行中即時修改程式碼,徹底省去編譯等待的時間。這提醒了我們:最高效的工具往往不是功能最繁複的商業軟體,而是利用 Unix 哲學與膠水程式碼打造的個人化工作流。