Thinking Machine Lab,在新一代AI實驗室(neo lab)中不是成立最早的,卻是最先拿出開源模型的:Inkling。
其中一個重要的原因,是Inkling在MoE(混合專家模型)架構上借鑒了DeepSeek V3,在后訓練強化學習的啟動階段,使用Kimi 2.5生成的數據進行了初始的監督微調。
Inkling是一個開放權重的混合專家模型,9750億參數(活躍410億),支持百萬上下文,用 45 萬億個token的文本、圖像、音頻和視頻進行了訓練。
TML還發布了預覽版Inkling-Small,這個輕巧一點的模型擁有2760億參數,(120 億活躍),訓練方法類似,實現了更成本、更延遲和盡可能強的性能。
TML對外是兩位女性聯合創始人的面孔,一位是OpenAI的前CTO穆拉蒂(Mira Murati),一位是OpenAI前負責對齊研究的副總裁翁荔。
她們說Inkling優秀之處,在于它便于定制,包括多模態能力、高效的思維過程,以及在 Tinker 平臺上的微調功能。它是一個更通用和均衡的模型,足夠靈活,適應變化。
TML認為,持續推理(即test-time scaling)和解決問題的能力,對于每個模型都很關鍵,但它們很難用榜單刷出來,開發者為了特定的任務微調模型,效率的重要性一點都不亞于在基礎測試上煞費苦心地得到高分。在真實世界中,成本和延遲是更重要的因素。
![]()
不過還是要看下模型評測分數(參見文末附表):
在推理方面,Inkling在美國做到了SOTA,但仍弱于中國的Kimi K2.6和GLM 5.2。在智能體編程方面亦是如此。在通用智能體方面,Inkling超過了Kimi K2.6。
Inkling在視覺方面略遜于Kimi K2.6。它有語音能力,Kimi和GLM沒有。它的聊天功能也略勝過GLM 5.2。在多模態方面,它與千問相當,弱于Gemini。
總之,Inkling的評測分數處于Kimi K2.6和GLM 5.2之間。在美國,業內認為它的性能相當于Opus 4.6 或者Gemini 3.5 flash。
美國終于有一家初創公司的開源模型,可以與中國同行掰手腕了,盡管在性能上有所不足,但它試圖用通用性、靈活性和更方便的定制化,更好服務真實應用場景。
它還追求比中國模型“更值得信任和更安全”。
在事實性(factuality)方面,Inkling的得分更高(參見文附附表)。獲取事實,并非讓模型“死記硬背”大量的知識,而是恰當校準,在回答中表現出有分寸的信心,包括那些沒有定論的答案,這在推演和預測中尤其重要。Inkling的微調模型在這方面提升很快,已經超過了領先的LLM(大語言模型)。
Inkling在模型的“內生安全”與對齊方面,勝過了中國風頭最盛的GLM 5.2(參見文末附表)。它對一些危險功能——例如核生化防護、網絡安全和失控——進行了內部評估并聘請了外部測試人員。還關注了人機交互威脅,包括阿諛奉承、惡意操縱和易受攻擊的用戶。在 FORTRESS 基準測試中,Inkling 在所有開放權重模型中表現出最強的內生安全保障。
訓練方面,Inkling對MoE的設計采納了DeepSeek-V3的框架。為了引導后訓練,Inkling用開放權重模型(包括 Kimi K2.5)生成的合成數據運行了初始的監督微調。引導過程僅占用少量計算資源,大部分資源用于在合成環境和人工創建的環境上進行大規模強化學習。
Inkling基于NVIDIA GB300 NVL72 系統進行了訓練將強化,學習規模擴大到超過3000萬次迭代,并在兩次長時間的連續運行中保持了穩定的訓練。在整個過程中,推理性能呈對數線性增長,最終實現了顯著的整體提升。未來的模型將進一步擴大預訓練、后訓練和強化學習的計算規模。
TML 認為,即使是最好的通用模型也無法很好地解決許多現實世界的問題,而通過利用組織專業知識進行微調可以彌補這一差距。
參考文獻及數據:
https://thinkingmachines.ai/news/introducing-inkling/
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.