記者在2026世界人工智能大會(huì)暨人工智能全球治理高級(jí)別會(huì)議(WAIC 2026)上采訪發(fā)現(xiàn),隨著智能體讓詞元消耗大幅攀升,降本增效成為眾多企業(yè)的發(fā)力點(diǎn)。從芯片到算電協(xié)同,從大模型到智能模型路由,每個(gè)環(huán)節(jié)都在為降低詞元成本而發(fā)力。
當(dāng)前,國內(nèi)算力芯片創(chuàng)業(yè)市場(chǎng)上,張量處理單元(TPU)是熱門賽道。在大規(guī)模純張量AI訓(xùn)練或推理的場(chǎng)景下,最新代際TPU的能效、單位詞元成本優(yōu)于主流GPU產(chǎn)品。
TPU芯片企業(yè)中昊芯英創(chuàng)始人楊龔軼凡表示,百萬詞元成本降到最低是當(dāng)前優(yōu)化的方向,因?yàn)楦哳~算力成本已經(jīng)制約AI商業(yè)化落地。公司新一代芯片的目標(biāo)就是大幅壓低單位詞元成本,比上一代成本直接減半,后續(xù)迭代有望降到原有的十分之一。只有成本下探,各類AI應(yīng)用才能規(guī)模化普及。
算力中心的成本從源頭決定詞元成本。2026年政府工作報(bào)告中首次提及“算電協(xié)同”,對(duì)此,中科類腦董事長(zhǎng)劉海峰告訴記者,算力基礎(chǔ)設(shè)施全生命周期成本中,電力支出占比超20%,是決定算力產(chǎn)業(yè)核心競(jìng)爭(zhēng)力的關(guān)鍵變量。以1000P標(biāo)準(zhǔn)算力集群為例,年度總耗電量約2000萬度,依托平臺(tái)優(yōu)化可節(jié)約20%用電量,即每年減少400萬度電力開支,節(jié)約成本直接轉(zhuǎn)化為經(jīng)營(yíng)毛利,大幅提升價(jià)格競(jìng)爭(zhēng)力。
對(duì)于算電協(xié)同降本增效的路徑,劉海峰表示,目前算電協(xié)同更多依靠物理空間靠近,未來重點(diǎn)是實(shí)現(xiàn)算力、電力雙向柔性聯(lián)動(dòng)調(diào)度。例如通過統(tǒng)籌風(fēng)電、光伏、儲(chǔ)能多類型供電來源,動(dòng)態(tài)測(cè)算不同時(shí)段最優(yōu)供電成本結(jié)構(gòu),最大化綠電使用比例;同時(shí)基于分時(shí)電價(jià)、風(fēng)光發(fā)電實(shí)時(shí)波動(dòng),靈活遷移算力任務(wù)負(fù)載,主動(dòng)錯(cuò)峰使用低價(jià)清潔能源,從源頭壓縮算力用電成本。
不少國產(chǎn)大模型在追求性能的同時(shí),也在著力改善詞元性價(jià)比。騰訊副總裁林松濤表示,混元HY3大模型以相對(duì)小的參數(shù)實(shí)現(xiàn)了比肩更大尺寸旗艦?zāi)P偷哪芰�,使用成本只有頂尖模型的百分之幾,為企業(yè)的規(guī)模化應(yīng)用提供了更加經(jīng)濟(jì)的選擇。
美團(tuán)LongCat-2.0(龍貓)大模型在業(yè)內(nèi)首次提出輸入命中緩存不收費(fèi)的模式。對(duì)此,美團(tuán)相關(guān)負(fù)責(zé)人透露,典型智能體使用場(chǎng)景中,用戶輸入和輸出比例約為150比1。經(jīng)測(cè)算,針對(duì)輸入部分的緩存詞元采用不計(jì)費(fèi)規(guī)則,用戶的綜合成本有望降低一個(gè)數(shù)量級(jí)。
剛上線即引發(fā)關(guān)注的萬億參數(shù)旗艦?zāi)P蚄imi K3,雖然單價(jià)不菲,卻表現(xiàn)出了頗為不錯(cuò)的性價(jià)比。
大模型評(píng)測(cè)機(jī)構(gòu)SuperCLUE發(fā)現(xiàn),通過測(cè)算完成同樣任務(wù)的成本開支,Kimi K3在任務(wù)得分比第二名高出18%的前提下,任務(wù)平均成本卻低約16%。這意味著,國產(chǎn)旗艦?zāi)P偷男詢r(jià)比在持續(xù)優(yōu)化。
對(duì)此,SuperCLUE創(chuàng)始人徐亮認(rèn)為,Kimi K3在處理多輪交互復(fù)雜任務(wù)時(shí),依托更強(qiáng)底層能力減少迭代輪次,疊加優(yōu)異的上下文緩存命中率,綜合調(diào)用開銷優(yōu)于預(yù)期。
由于不同大模型的能力和價(jià)格差別較大,“智能模型路由”也成為WAIC的熱點(diǎn)。
派歐云創(chuàng)始人姚欣介紹稱,此前智能模型路線僅做簡(jiǎn)單“請(qǐng)求轉(zhuǎn)發(fā)”,新的智能模型路由在處理高價(jià)值、高風(fēng)險(xiǎn)或結(jié)果不確定的關(guān)鍵步驟時(shí),不是只問一個(gè)模型,而是將問題同時(shí)分發(fā)給多個(gè)擅長(zhǎng)此道的專家模型,通過交叉驗(yàn)證和融合生成最終答案。同時(shí)智能路由會(huì)根據(jù)任務(wù)類型進(jìn)行選擇,比如簡(jiǎn)單問答用輕量模型,復(fù)雜推理用強(qiáng)模型,并壓縮冗余上下文,復(fù)用之前的計(jì)算結(jié)果,設(shè)置預(yù)算護(hù)欄和失敗回退機(jī)制。最終目標(biāo)是用更經(jīng)濟(jì)的詞元成本,完成同樣質(zhì)量的任務(wù)。
派歐云綜合測(cè)算發(fā)現(xiàn),其智能模型網(wǎng)關(guān)可以將智能水平提升20%,同時(shí)將成本降低50%到60%。
|