![]()
近日,加拿大初創(chuàng)公司Taalas 推出了一款 AI 推理芯片 HC1,這家成立尚不足三年的企業(yè),憑借將 8B 輕量化大模型直接 “刻” 在芯片上的創(chuàng)新設(shè)計(jì),讓 HC1 的運(yùn)行速度在行業(yè)中脫穎而出,在輸出速度和極致的成本和功耗控制上直接甩開了英偉達(dá)的GPU產(chǎn)品。
![]()
很多人對Taalas 或許并不熟悉,這家公司成立于 2023 年,創(chuàng)始人 Ljubisa Bajic 同時(shí)也是加拿大知名AI芯片公司 Tenstorrent 的創(chuàng)始人,他曾先后在英偉達(dá)、AMD 擔(dān)任高級架構(gòu)師,一手打造過 CPU-GPU 混合芯片。
而Taalas的核心團(tuán)隊(duì)更是堪稱芯片圈的 “夢之隊(duì)”,25 名員工大多來自 AMD、蘋果、谷歌等科技大廠,擁有從芯片設(shè)計(jì)到系統(tǒng)落地的全流程實(shí)戰(zhàn)經(jīng)驗(yàn)。背靠這樣的技術(shù)團(tuán)隊(duì),Taalas 僅投入 3000 萬美元研發(fā)成本,耗時(shí) 60 天就完成了 HC1 的生產(chǎn)落地,推出了這款足以挑戰(zhàn)行業(yè)現(xiàn)有規(guī)則的產(chǎn)品。
截至目前,Taalas 累計(jì)融資已超 2 億美元,賬上仍有 1.7 億美元現(xiàn)金儲備,為后續(xù)發(fā)展奠定了充足的資金基礎(chǔ)
最快AI芯片?
HC1 最令人驚嘆的,莫過于其極致的推理速度。
這款采用臺積電6nm 工藝的芯片,在單用戶場景下推理速度高達(dá) 17000 token/秒。作為對比,英偉達(dá) H200 芯片推理速度為 230 token/秒,其最新 Blackwell 架構(gòu)的 B200 也不過 2000 token/秒。有測試者在 Taalas 的體驗(yàn)網(wǎng)站 chatjimmy.ai 實(shí)際操作后表示,該模型的回復(fù)速度極快,基本在敲下回車的瞬間,答案就能出現(xiàn)在對話框中。
![]()
HC1 能實(shí)現(xiàn)如此快的推理反應(yīng),核心源于 Taalas 獨(dú)樹一幟的技術(shù)思路。
研發(fā)團(tuán)隊(duì)拋棄了傳統(tǒng) GPU “計(jì)算與存儲分離” 的經(jīng)典架構(gòu),采用了存算一體式的設(shè)計(jì)方案,通過 Mask ROM 工藝將 Llama 3.1 8B 的模型權(quán)重直接編碼在芯片的金屬互連層中,讓模型權(quán)重與計(jì)算邏輯共存于同一塊硅片。這種設(shè)計(jì)徹底消除了數(shù)據(jù)搬運(yùn)過程中的延遲與能耗損耗,芯片也無需搭配外部 DRAM 或 HBM,僅保留一小塊 SRAM 以提供最基礎(chǔ)的靈活性。
傳統(tǒng)GPU 進(jìn)行運(yùn)算時(shí),需要從 HBM 顯存中反復(fù)搬運(yùn)數(shù)據(jù),這一過程會(huì)消耗大量能耗和時(shí)間,也是行業(yè)普遍面臨的 “內(nèi)存墻” 問題;而 HC1 無需數(shù)據(jù)搬運(yùn),只需讓數(shù)據(jù)流過電路就能完成推理,運(yùn)算效率自然實(shí)現(xiàn)了質(zhì)的飛躍。
為了實(shí)現(xiàn)芯片的快速定制,Taalas 還借鑒了 2000 年代結(jié)構(gòu)化 ASIC 的設(shè)計(jì)思路,將芯片定制周期從原本的六個(gè)月壓縮至兩個(gè)月。
在針對新模型進(jìn)行芯片定制時(shí),僅需更換兩層掩模,從拿到新模型到生成描述文件僅需一周的工程工作量,這種高效的定制能力,是Taalas 未來更新節(jié)奏的核心支撐。
除了速度優(yōu)勢,HC1 的成本和功耗表現(xiàn)同樣亮眼:單片芯片的制造成本僅 300-400 美元,量產(chǎn)后的零售價(jià)預(yù)估在 600-700 美元,采用該芯片的推理綜合成本僅為傳統(tǒng) GPU 方案的 1/20;芯片功耗僅 2.5 千瓦,十顆芯片組成的服務(wù)器僅需普通風(fēng)冷就能實(shí)現(xiàn)散熱,無需搭建復(fù)雜的液冷系統(tǒng),相較 GPU 方案功耗降低了 90%,而未來的量產(chǎn)款芯片,速度還將進(jìn)一步提升。
發(fā)布即落后?
為了追求極致效率放棄了硬件通用性,HC1的設(shè)計(jì)也帶來了致命缺陷:一顆 HC1 芯片只能運(yùn)行一個(gè)特定模型,若要更換模型,就必須重新設(shè)計(jì)并制造芯片。在 AI 模型以月為單位快速迭代的當(dāng)下,這種 “專芯專模” 的模式面臨著極高的技術(shù)過時(shí)風(fēng)險(xiǎn)。
值得注意的是,HC1 正式公布時(shí),Llama 3.1 模型已經(jīng)發(fā)布了近兩年,而同期 OpenAI、Anthropic 等頭部企業(yè)的大模型已迭代至 GPT-5.2、Claude 4.6 版本。盡管 Taalas 承諾從拿到新模型到完成芯片定制僅需兩個(gè)月周期,但市場仍對其提出質(zhì)疑,為何不選擇更前沿的 DeepSeek R1 模型進(jìn)行產(chǎn)品演示。
除了難以跟上大模型的更新速度,HC1 自身還存在諸多局限性。為了將 8B 參數(shù)的模型完整塞進(jìn)單顆芯片,HC1 采用了自定義的 3-bit 基礎(chǔ)數(shù)據(jù)類型,并結(jié)合 3-bit 和 6-bit 的混合精度量化技術(shù)。
Taalas 官方也承認(rèn),這種技術(shù)方案會(huì)導(dǎo)致模型在質(zhì)量基準(zhǔn)測試中出現(xiàn)性能退化,在復(fù)雜數(shù)學(xué)運(yùn)算、專業(yè)論文解讀等需要深層邏輯推理的場景中,HC1 的表現(xiàn)明顯遜于英偉達(dá) GPU。
盡管公司已計(jì)劃在第二代產(chǎn)品 HC2 中,改用標(biāo)準(zhǔn) 4-bit 浮點(diǎn)格式來改善這一問題,但第一代 HC1 在推理正確率上的短板已是既定事實(shí)。
不少用戶在測試時(shí)發(fā)現(xiàn),這款芯片不僅連簡單的運(yùn)算都會(huì)出現(xiàn)錯(cuò)誤,面對一些復(fù)雜問題時(shí),更是會(huì)出現(xiàn)胡編亂造的情況。
此外,受硅片面積的限制,單顆HC1 能容納的模型參數(shù)規(guī)模有限,面對萬億參數(shù)級的前沿大模型,必須采用多芯片協(xié)同的方案才能運(yùn)行。
以DeepSeek R1 671B 模型為例,想要實(shí)現(xiàn)其推理運(yùn)算,需要 30 顆 HC1 協(xié)同工作,這不僅會(huì)帶來一系列互聯(lián)上的設(shè)計(jì)難題,流片的成本和時(shí)間也會(huì)同時(shí)增加。對于追求技術(shù)快速迭代的互聯(lián)網(wǎng)企業(yè)和 AI 創(chuàng)業(yè)公司而言,這樣的效率反倒不如多加一塊 GPU來得靠譜。
最后就是Taalas的商業(yè)模式的不確定性,目前 Taalas 探索了三種商業(yè)落地路徑,分別是“自建 API”、“直接出售芯片”、“與模型開發(fā)者合作定制芯片”,但這三種路徑均依賴于客戶對特定模型的需求。
而在當(dāng)前快速變化的AI 市場中,即便是科技大廠,也不敢輕易做出這樣的長期承諾。歷史上比特幣挖礦 ASIC 的軍備競賽早已證明,在技術(shù)快速迭代的領(lǐng)域,專用硬件極易陷入 “發(fā)布即過時(shí)” 的發(fā)展困境。
結(jié)語
從行業(yè)發(fā)展格局來看,HC1 的出現(xiàn)并非為了取代 GPU,而是填補(bǔ)了通用算力與極致效率之間的市場空白,也為大模型的落地提供一個(gè)全新思路。
Taalas 產(chǎn)品副總裁 Paresh Kharya 曾明確表示:“為模型定制的最優(yōu)硅片不會(huì)取代滿是 GPU 的大型數(shù)據(jù)中心,但它會(huì)適配特定的應(yīng)用場景。” 在智能客服、人形機(jī)器人等對響應(yīng)延遲敏感、模型版本相對穩(wěn)定的場景中,HC1 的性能與成本優(yōu)勢就會(huì)體現(xiàn)出來。
目前,Taalas 已制定了明確的產(chǎn)品規(guī)劃,計(jì)劃在 2026 年推出支持 70B 大模型的芯片,同時(shí)還在探索通過 LoRA 微調(diào)技術(shù)優(yōu)化固化在芯片中的模型。
若能在后續(xù)發(fā)展中突破現(xiàn)有架構(gòu)的限制,Taalas 或許真的能推動(dòng)行業(yè)進(jìn)入新的發(fā)展階段。
記得星標(biāo)微信公眾號:鎂客網(wǎng)(im2maker),更多干貨在等你
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.