匿名AI Ox Alpha登場

程式跑分壓過Claude
23/08/2026
2278
收藏
分享
程式跑分壓過Claude

一個沒有公開開發者身分的人工智能模型,本周在程式設計測試中引起關注。AI模型聚合平台OpenRouter於20日上架匿名模型Ox Alpha,限時免費開放一周。獨立開發者測試顯示,它在DeepSWE程式修復基準的得分約80%,高於Claude Fable 5的65%,多項技術線索則被指與智譜GLM系列相近。

DeepSWE用真實程式碼庫測試模型能否閱讀專案、定位錯誤並產生有效修補,不只是回答單一程式問題。開發者Ben Davis讓Ox Alpha完成10項任務,並以修補能否通過測試計分。樣本數仍小,測試環境和提示方式亦會影響結果,因此80%不能直接等同全面程式能力。

Ox Alpha在OpenRouter以「stealth」形式出現,平台只提供基本使用介面,未披露參數規模、訓練資料、價格或正式產品名稱。模型支援文字、圖片和影片輸入,據測試可處理約104.8萬token的上下文,拒絕音訊輸入。這些特徵成為外界追查來源的線索。

Davis指,模型處理影片時的token消耗模式與智譜GLM-5V-Turbo相近,分詞器亦被指與GLM-5.3吻合;輸出風格、表情符號使用和多模態行為,也令他判斷模型很可能來自智譜。不過,智譜截至目前沒有確認,OpenRouter亦未公布提供者。

技術指紋未等同官宣

匿名上架是AI公司測試新模型的常見方法。開發者可在不知道品牌的情況下比較結果,減少先入為主;供應商亦可收集真實流量、錯誤率和用戶反應,再決定正式版本。智譜過往曾以隱身方式測試產品,因而加深市場聯想,但歷史做法仍不能單獨證明今次身分。

跑分比較亦須看對象。Claude Fable 5是Anthropic今年6月推出的模型配置,DeepSWE結果只反映特定程式修復任務;模型在長文本理解、工具使用、成本、速度和安全方面可能有不同表現。Ox Alpha限免期間的系統設定也可能改變,單次結果未必能長期重現。

DeepSWE的難點是修補必須落到程式庫,而不是生成看似合理的答案。模型要找到相關檔案、理解相依關係、修改最小範圍並通過測試。高分若可在更大樣本重現,代表模型在軟件工程代理方向具競爭力;若只在部分題型突出,則可能與測試資料或工具配置有關。

匿名模型亦帶來使用風險。開發者不知道服務提供者、資料保存政策和模型更新紀錄,不宜把商業機密、未公開程式碼或個人資料直接輸入。免費並不代表沒有成本,企業使用前仍須核對平台條款、資料管轄和退出安排。

OpenRouter的角色是把不同供應商模型接入同一介面,方便用戶比較。平台出現匿名模型,可迅速吸引測試流量,卻也令身份推測和跑分宣傳混在一起。若模型最終正式發布,供應商仍須公布名稱、版本、價格和技術文件,外界才能核對限免版本是否相同。(編輯部)

檢舉
檢舉類型:
具體描述:
提交
取消
評論
發佈

力報會員可享用評論功能

註冊 / 登錄

查看更多評論
收藏
分享

相關新聞

推薦新聞

找不到相關內容

七日預報