
摘要:
當3D生成也「卷」成風口,誰在真正做基建?
鳳凰網科技《浪潮》出品
作者|董雨晴
2026年,AI生成賽道正經歷一場新的狂歡。視頻生成捲到幾秒,世界模型成為每家公司的標配故事,3D生成作為「構造虛擬世界的基礎代碼」被推上風口。孖展消息鋪天蓋地,估值數字令人眩暈,幾乎所有人都急着證明自己能構建那個「最終世界」。
但在賽道的喧囂裏,一家成立於2020年的公司顯得有點另類。
影眸科技,從上海科技大學實驗室走出來的3D生成團隊,以核心產品Hyper3D為基礎,以3D生成大模型Rodin為引擎,定位於面向真實工業流程的高質量、可控、生產級(Production-Ready)3D資產生成。
在世界模型孖展火熱的當下,他們選擇死磕的是一個更底層、更難、也更「不性感」的問題:如何讓AI生成的3D模型,真正能被工業級場景所使用——無論是3A遊戲的雕刻級模型,還是手遊的Low Poly佈線,抑或是工業級3D打印千萬面的硬表面精度。

他們拿過多次SIGGRAPH最佳論文及提名,首創了3D原生的技術框架CLAY,如今全球有大幾百萬用戶,七八成收入來自海外。當同行們爭先恐後往「世界模型」的概念上貼時,Hyper3D選擇扎進遊戲、3D打印、工業設計這些垂直場景裏做「髒活累活」——比如為了讓3D打印用戶更方便,在模型生成時悄悄優化重心,讓它傾向於「站在平面上」。
他們最新推出的全球首個千萬面級模型3D生成模型Rodin Gen-2.5,開創性地將類大語言模型的運行邏輯引入3D生成領域,為用戶提供五檔可調生成模式,實現4秒到80秒的生成時間控制,針對不同場景展現出極強的適配性,並同步推出全球首個12K精度的原生3D貼圖模型。
更特別的是這個團隊的底色:四個創始人全是忠實的Blender用戶,自己建模、自己渲染、自己做產品的直接用戶。用他們自己的話說,「我們可能是學術圈裏少數真正理解工業流水線上那些需求的人。」
影眸科技目前有60人,技術佔三分之二,平均年齡只有25歲。
鳳凰網科技了解到,影眸科技在近期完成了新一輪數億元人民幣孖展。這輪孖展由凱輝基金、上海國投先導領投,老股東持續跟投。
當3D生成賽道從「能生成」捲到「能可用」,這群經歷過元宇宙泡沫的年輕創業者,選擇了一條更慢、更穩的路。
以下是鳳凰網科技和影眸科技CEO吳迪、CTO張啓煊的對話實錄,經編輯發布:

「3D大部分實際是工業型工作」
鳳凰網科技:世界模型現在這麼火,這是不是讓你們更忙了?
吳迪:一直都挺忙的。創業該到哪個階段該忙就得忙。
張啓煊:但這兩天變空了,新模型上線之後這一周確實比之前輕鬆了一些。
鳳凰網科技:從2025年開始看起來你們節奏突然快了,今年初CES上黃仁勳的KeyNote使用了你們的產品,大家對你們的認知度又破了圈。
張啓煊:我覺得是因為3D生成質量提升之後,用途越來越廣了。其他模態發展得好,也反向帶動了3D演進。最早很多國內遊戲公司願意嘗試3D生成,就是因為他們看到了圖片生成帶來的價值,覺得3D也是成本大頭,那會也有人開始接觸我們,即使當時我們還不ready。
鳳凰網科技:關鍵是什麼時候發現這事兒「ready」了?可控了,就覺得可以商業化應用了?
吳迪:我覺得從一開始就可以商業化應用,但很大程度取決於用戶對這件事的接受度有多高。原來大家不管做遊戲還是手搓模型,一整條pipeline已經非常完整了。怎麼樣讓大家接受「先用AI生成,後面再人工處理」這個邏輯?大家花了一年的時間,接觸包括我們在內的各種3D生成工具,慢慢開始接受這個邏輯。或者說,不得不接受。
張啓煊:圖像和文字領域大部分是創作型工作,但3D大部分是工業型工作。工業型工作有個問題——你得交付,有明確的工程和檔期。它不像圖片有80%概率半小時出來,剩下40%三天內出不來。3D對確定性要求更高,比如我建模三天後必須交付,不能接受一個60%概率靠譜、40%可能卡住的東西。
鳳凰網科技:去年大家開始喊「快能工業化應用了」,今年算是明顯的轉折點嗎?
張啓煊:接受度提升,模型質量只是次要因素。最主要的是環境變了——已經有好的C端產品集成了3D生成能力,很多大公司完成了跟我們這樣的公司的磨合,把我們集成到他們的流水線和創作管線裏。其他公司看到,就得跟着走。
鳳凰網科技:往前面倒一些,之前做數字人的時候聲量沒現在這麼大?
吳迪:那時候聲量也不大,只是做數字人的公司太少了。最開始做的也是3D,只是3D的數字形象。先搭了個穹頂光場設備,採了很多數字角色,先做了3D數字角色生成。那時候大家都想着元宇宙,進去得有個3D形象,不可能讓每個人都到我們球裏來掃。所以我們用球掃了很多影視級數字資產,再訓練一個生成網絡,讓用戶直接通過照片生成。那是第一次用diffusion做3D生成。
後來元宇宙賽道逐步萎縮,客戶迴歸到傳統圖形學行業,比如遊戲、電影特效。要服務好這些客戶,就不能只生成人像,必須什麼都能生成,所以才選了3D生成這個方向。
中間也糾結過,3D生成特別難做。那時候市面上主要用「2D升3D」的技術路徑,但我們早年在遊戲、影視領域撞了很多南牆,知道那種方法滿足不了使用需求。所以全新做了一個3D原生的技術框架,就是拿了SIGGRAPH最佳論文提名的CLAY。之後3D原生的技術路徑也成了現在主流的研發方向。我們的產品不是第一個上線的,就是因為中間做了很多原創性研發。
鳳凰網科技:現階段各家技術沒有太大差異嗎?只是工程更強一些?
張啓煊:分層面看。架構級的東西,大家都是Diffusion Transformer、Flow Matching,這種底層架構上3D跟圖像、音頻之間都沒區別,就兩條路——文本的GPT路線(next token predict)和其他模態的diffusion或flow matching路線。但決定模型好壞的不是這些,是細節設計,比如通過什麼結構設計去enable編輯能力和控制能力。大架構上我們在等下一個GPT出現,但真正拉開差距的是底層設計。
鳳凰網科技:大廠買單時看重什麼?你們覺得賽道已經ready了嗎?
張啓煊:還差遠了。3D相比其他模態有個很大區別——其他是消費級,大家要求比較一致。3D是工業,不同下游場景要的內容差異巨大。啱啱吳迪也提了,3D打印、遊戲、工業生產要的是三種完全不同的模型,包括表面風格和輸出制式的不同,都需要去適配。
現在能滿足的情景還比較少。以遊戲為例,我們的Rodin Gen-2.5的Extreme High模式慢慢能滿足雕刻級的模型需求,但最後放到手遊裏的不是雕刻級模型,是Low Poly模型,你得專門設定網絡結構讓輸出佈線合理的Low Poly(低精度)。所以一線3D生成公司都不止做一條路線,我們既有生成高質量表面的flow matching模型,也有輸出Low Poly(低精度)的next token predict模型。3D行業結構太複雜了,不是說到了臨界點所有行業就能用。
鳳凰網科技:再具體說說,遊戲和3D打印分別看重什麼?
張啓煊:遊戲裏不同階段、不同工序看重的不一樣。3A遊戲在原型概念階段看你模型的絕對質量,因為他們會自己去做後面的減面優化、拓撲、佈線,看的是雕塑級的絕對質量。但手遊或非3A遊戲,他很注重拓撲和Low Poly模型的質量,要考慮下游應用的性能,看簡面後佈線是否合理、是否適合做動畫。
3D打印只把模型打印出來,絕對表面質量很重要。還有一類是打產品原型,表面的平整度很關鍵——如果是個高細節模型但杯子表面打出來坑坑窪窪,那不行。

首次把思考模式引入3D領域
鳳凰網科技:Rodin Gen-2.5比較重大的進展是什麼?
吳迪:我們第一次把「思考深度」(thinking effort)的模式引入3D,Rodin Gen-2.5提供五檔可調的思考深度,可以滿足快速草稿設計到高保真成品資產製作的不同場景需求。就像大家用豆包時,複雜任務用專家模型,簡單任務用快速模型。在3D裏我們是第一次引入這個概念。因為3D在不同場景裏有不同評價指標,網上任意一個簡單的3D測評其實都不公允,沒有限定場景的測評標準。
3D用在打印、工業、遊戲裏,評價標準都不一樣。3D打印要更多細節,可以直接打出來呈現在面前;遊戲裏反而需要更低的面數、更好的拓撲結構、更加可用的材質;工業裏需要把硬表面、轉角、倒角表達得特別正確。
這些不同領域對模型需求都不一樣。以前用戶沒法選擇自己要什麼偏好的模型,這個版本里用戶可以通過一個選項來控制最終輸出結果,適配使用場景。以前做3D打印可能更多用A家,做遊戲更多用B家,現在可以在一個模型裏把需求全部完成。
鳳凰網科技:做這種更加精細化的分類,需要突破哪些問題?
張啓煊:Gen-2.5 的核心架構創新,是把「表徵長度」從一個固定參數變成了一個可學習、可伸縮的變量。模型不再為所有物體分配等量算力,而是像 LLM 做推理時擴展那樣,按對象複雜度自適應分配計算預算。這也為未來我們與LLM的深度結合提供了可能性。這一策略最早在我們的CLAY框架中被提出。
比如UGC場景,國外有些UGC遊戲,國內也有項目,他們傾向於用我們的快速模式。去年跟《蛋仔派對》一起做了個有標杆意義的項目,當時生成一個模型要70秒,對C端用戶來說太久了——圖片最快三四秒就能搞定,3D模型70秒實在難等。
現在這個版本里,最快4秒就能完成生成,這是質變,UGC環節從只能在關卡編輯器裏用,變成甚至能實時使用。當然4秒生成的模型質量相對差一些,但如果是手遊裏可能只佔幾千個像素的小東西,那就足夠了。
對專業創作型用戶,要用於雕刻甚至高精細度工業級3D打印的,我們支持80秒的幾何生成,出來是千萬面的模型,能直接用。Rodin Gen- 1.5的時候,我們想的是給每個行業做一個分支風格,推出了focal高細節、zero低細節、turbo快速、標準版。到Gen-2.5發現大部分需求最後映射到時間上,所以用時間控制來調節,用不同的思考深度來自適應不同場景。這些設計很大程度來自圖像生成和文本生成模型的工程化經驗,我們現在整個方法論跟其他模態越來越像。
鳳凰網科技:你們服務不同類型公司,是跟着他們做適配,還是希望他們開箱即用?
張啓煊:我們給他們提供足夠選項,指向他們要的那種風格。這件事據我觀察只有我們做了。但這不只是產品問題,還是模型能力問題。
鳳凰網科技:但我們聽起來會覺得像工程問題,不是模型問題?
張啓煊:你覺得純文本模型怎麼生成圖像?你需要訓一個專門的圖像讓它能解碼成圖像。所以這是由產品需求產生的、在模型側要重新設計和訓練才能實現的事。
鳳凰網科技:只有你們在這麼做?
張啓煊:大家都聰明,應該都能看到這個機會,但不是所有模型團隊都有這個底層能力。
鳳凰網科技:需要什麼交叉能力?
張啓煊:3D原生的技術框架基本就是CLAY那時候提出來的,現在有很多變體和創新,開源社區也有不錯的工作。但我們對這套框架的理解比大家早至少半年。
鳳凰網科技:半年時間算是你們的技術窗口期。
張啓煊:有些feature大家很想要,花了半年也沒做出來;有些半年就能做出來。
鳳凰網科技:你們那個「分件」功能是怎麼磕出來的?
張啓煊:傳統方法是給三維模型每個點分配類別,比如杯底、杯身、杯沿。但以零件為單位的數據量少,邊界分不清楚,做出來邊緣坑坑窪窪,中間可能突然有個孤島,因為高光或表面起伏就覺得不屬於這個類了。這其實是非生成式的思路,先聚類再人工塗邊緣。
我們搞了快一年效果都不滿意。有天跟另一個聯創張文龍閒聊,說3D生成下一步是什麼?有人說是4D,是時間。我說會不會不是時間,是由時間引發的物理狀態和動態變化?比如「爆炸」?能不能用爆炸做3D生成?
第二天他就給了我一個demo。我們用已經訓好的3D生成大模型,給它加了個特殊的ControlNet,讓它在給定三維模型基礎上直接生成「爆炸」後的狀態。這個思路借鑑自語言模型——大語言模型時代用生成的方式做理解,而不是顯式聚類劃線。從決定做到做出來就一個半月,是至今最快的項目,效果也是最好的。
這篇文章至今仍能看到不少類似思路的跟進工作,何愷明老師團隊最近那篇用圖像編輯模型做分割的文章(Vision Banana),底層思想跟我們一脈相承。
鳳凰網科技:那3D原生貼圖呢,這裏面有哪些技術突破?
張啓煊:傳統方法是拍多角度圖像投影回去,總有投不到的地方,文字生成不了,顏色有斷層,遮擋地方不精準。我們做的是讓顏色直接從三維模型上「長」出來——每個點長出一個顏色值。用幾乎等於訓了一個圖像生成模型的資源,讓這個模型同時具備圖像生成和三維貼圖生成能力。給它一個平面的三維模型能生成圖像,給一個三維模型能長出貼圖。它能生成文字級圖案,精度能到12K,人臉的話眼角細紋都清清楚楚。

做大廠做不了的髒活累活
鳳凰網科技:如果字節等大廠突然決定做這塊,對你們有什麼影響?
吳迪:一直有大廠在。3D生成分兩步,一部分是生成3D模型,第二步是怎麼解決這個模型在不同場景裏用的問題。大廠一般只做第一步,證明自己有各種模態的能力。但跟工業適配、跟遊戲適配、做3D打印下沉,大廠很難每個場景都做好。這裏面有很多髒活累活,不只是研發問題。
鳳凰網科技:舉個「髒活累活」的例子?
張啓煊:比如這代模型有個潛在優化——生成的東西重心傾向於站在平面上。因為我們發現很多3D打印用戶有這個需求。如果是個通用產品,大廠很可能不會對這個點優化。對這類人群來說,我們就是更好的選擇。
吳迪:2021年做數字人的時候就發現了。電影特效、遊戲內容製作對模型質量要求特別高。這是我們很重要的壁壘,從那時起就有這個思維,產品會更可應用。所以我們的B端大客戶比其他同類公司多。
鳳凰網科技:你們現在發力做專業C端了,這是怎麼思考的。
吳迪:專業C端市場現在跑的很好,這裏面是有機會的。對我們來說其實沒區別,B端和C端提供的產品形態很一致,可能就是運營角度偏C端一點。而且很多B端用戶也是從C端轉過來的。
鳳凰網科技:你們現在燒錢嗎?
吳迪:投放可控,產品能力強天然留存更高,投放不是快速消耗的狀態。
鳳凰網科技:接下來側重增長還是技術?
吳迪:並行。產品到了可以做好增長和投放的階段,接下來還是會聚焦遊戲、3D打印、工業設計、具身智能、空間計算這些垂直領域,從各個角度積累模型能力,deliver出更好的產品。
張啓煊:3D不是消費級模態,普通用戶很難直接使用,得通過3D打印、Vision Pro、遊戲間接消費。我們直接對接的不是大衆用戶,是大衆用戶上層的應用產品。
吳迪:我們也看好未來C端,你會發現當年元宇宙那批公司很多沒聲音了,只有我們還堅定走在通往元宇宙的路上。元宇宙沒成主要是顯示介質沒更新,還有content創建成本太高,要解決的就是這兩個問題。
張啓煊:熱點過去後,做熱點的公司會退化回真實做的事情。元宇宙退化回虛擬場景、數字角色、社交應用。現在講世界模型,最後會退化回機器人控制策略、實時視頻生成、場景生成。只是在熱點下被包裝成統一概念。
鳳凰網科技:為什麼不講「世界模型」的故事?沒被投資人罵過嗎?
吳迪:好問題,是有投資人替我們着急,畢竟"世界模型"是當下最熱的敘事。
張啓煊:揭開「世界模型」這層紗,最後做的還是場景生成、實時視頻生成那幾件事。
鳳凰網科技:幾乎所有做生成的公司突然都在說自己在做世界模型。
張啓煊:3D生成肯定是各種模態生成裏很重要的一部分,但我們不會因為市場概念熱而去做。
鳳凰網科技:你們看起來不像95後,像上一代創業者,穩紮穩打。
張啓煊:創業6年了,經歷過周期。
鳳凰網科技:你們覺得自己和其他生成公司的最大區別是什麼?
張啓煊:我們四個創始人全是忠實的Blender用戶,自己會建模、會渲染、會做宣傳片。
吳迪:都是被逼的,以前在實驗室發論文要做宣傳片,又沒錢找別人。
張啓煊:我們是自己產品的直接用戶,對需求和產品定義有更深的理解。
鳳凰網科技:你們用自然語言編輯3D模型,難在哪?
張啓煊:跟圖像編輯一樣的困難——怎麼確保編輯以外的結構保持不變。需要從圖生3D、文生3D拓展到3D生3D,難度像GPT-4到GPT-4V,要對原來的3D模型有理解。
鳳凰網科技:你們接下來最想拓什麼客戶?
張啓煊:工業領域,汽車設計、充電寶設計這種外觀類。現在行業裏,其實我們是為數不多還在死磕3D的。3D的盤子,工業比娛樂更大。
鳳凰網科技:你們公司現在多少人?
吳迪:60,技術佔三分之二。