
Loading summary
A
大家好,我是小駿。 今天我在上海談話的對象是英美達的研究副總裁劉明玉。 我們的談話時間是黃仁勳剛訪華之後的一個月。 铭玉给我的印象一直是穿着很朴素背着一个有点旧的鞋挎包态度很谦和不过英伟达内部的人告诉我他不像是一个典型的研究者更像是一个工程上的领导者黄仁勋给他一个评价是GSDGettingshitdone不久前刘明玉带领团队刚刚发布了英伟达的世界模型Cosmos3所以在这次访谈中我们聊了聊Cosmos3世界模型同时也聊到一名研究者长达20年的求索而这名研究员的身份很特殊他身处在英伟达这样一个基础设施型的巨大的系统之中这改变了他的很多的研究思路当然我们也很不自觉地聊了一些关于英伟达和黄仁勋的内部的故事明玉说做模型就要lowego模型竞争不应该是一场游戏那接下来就是我对英伟达研究副总裁刘明玉的访谈Jason常常在講就是他喜歡這種ZEROBILLIONDOLLARBUSINESS你可以是不賺錢但當這個生意成功的時候必須是很INFLUENTIAL的是很巨大的經濟的茂盛程度是根據錢多快從一個人的口袋流到另外一個口袋那研究的茂盛程度應該是根據idea的多塊從一個人的腦袋流到另外一個人的腦袋去我們做完Cosmos1的時候問Jensen要不要繼續往下做然後Jensen跟我說你就做到Cosmos97因為他是一個很有紀律的人有些東西即使很重要他會叫你PacePaceyoursteps就是讓你不要急他擅長打馬拉松戰他每天都覺得公司只剩下三十天的現金流三十天後就要破產你剛好加入英偉達十年了這十年你變化大嗎你在英偉達的股票漲了多少倍了一共哈喽明玉要不跟观众朋友们先打个招呼线上的朋友大家好我是刘明玉嗯因为刚才我们也聊到你到美国了20年然后在英伟达了10年你现在讲中文还多吗在公司里面就是有时候会讲中文但大部分的时候还是讲英文因为大部分的时候团队里还是很多人不会讲中文所以沟通上就是以英文为主但如果说在一个小组会议里面参与的都是讲中文的那很自然而然就会切换到中文模式这次你来中国的行程是什么样的你多久会来一次中国我現在大概是每一年會來二到三次中國因為我主要的公司給我的任務我個人的興趣在PhysicalAI在中國這裡PhysicalAI的發展是非常的茂盛很多公司很多研究員在做出重大的突破我們在這裡跟大家交流也理解一下我們如何可以幫到他們這次來感覺到有什麼不一樣嗎跟之前這次來我看到的是越來越多的關於手靈巧手在這個關鍵的科技上面做出突破然後去去追求下一個CGI可以達到的一些重點能力就是跟上次來發覺就是速度非常的快進展非常的快然後每次都學到很多東西这应该是你第一次做一个中文的podcast我想能帮助观众或者听众朋友们建立一个印象你现在在英伟达的title是研究副总裁能不能介绍一下这个职位然后以及你们团队的一些构造和人数我现在是研究副总裁另外也是cosmoslab的副总裁好那我们的团队呢就是研究员加工程师只属于我这里的大约有八九十人那另外公司還有其他的團隊也是在做Cosmos,英文叫DottedLine,雖然他不直接report給我,但是我是整個mission的overallpick,就是發號施令的人,然後決定方向的人,所以這些人也是遵循我的指示,跟這個團隊一起合作把目標給推出去。 做Cosmos应该有两到三百人之间这是一个在英伟达里面很重大的一个专案我们花很多资源这样的人员投入是我们觉得需要的做出好的成果我看到你之前还管一个团队叫DeepImaginationResearchGroupCosmos是它演化来的吗?
他们是什么关系? 是的嗯我大概是10年前的時候加入英偉達那呃我在加入英偉達的時候呃我的目標就是呃我那時候給jobtalk啊在跟英偉達推銷我自己的時候我的jobtalk講的是那是4年前我講的是說有一天最主要生成視頻的運算將會是DeepLearning而不會是傳統的ComputerGraphics在那時期電腦特效、電影特效用這種Graphics傳統的GraphicPipeline去生成漂亮的Graphics是主流我是在領域裡面早期認為DeepLearning是未來的趨勢那我记得那时候我跟我的shipscientistbilldaddy在那时候的presentation我的presentation里面就是讲deeplearning因为它是datadriven然后它可以做到很多传统graphics可以做不到的事情比如说我有一天可以把就是小說當成是input放進這個deeplearning就會產出電影然後你可以做很多現在quantumgraphics需要大量人力才能做出來的這些控制那時候我公司對這個東西很有興趣我就很榮幸的加入了NVIDIA進去之後呢我就一直朝著這方向努力在那時期最主要的這個模型呢是GenerativeAdversaryNetwork就是對抗生存網路那我是只是靈蘊裡早期去從事這個對抗生存網路研究的人那我就在裡面一直做這方面的研究我做了幾個我自己很感到驕傲的這個工作其中一個就是我是最早提出這個可以做這種我們叫做unsupervised或是unpairedimagetranslation在AI裡面學習很多時候都靠supervision你要對應的input跟output你才可以學出這個inputoutputrelationship那onsupervised就是說你並沒有對應的inputoutput你並不知道這個人笑的時候是怎麼樣你不知道這個碼變成斑馬會是怎麼樣然後我們那時候是早期利用一些informationbottleneck可以去做出這個我們叫onsupervisedimagetoimagetranslation那時候我加入英偉達的時候英偉達並不是一個大家認同的AI公司那時候deeplearning還沒有像現在那麼的火熱那英偉達傳統也都是做這種computerarchitecture去設計這個GPU沒有人在做這種比較應用端的科研那我等於是早期在英偉達把這個方向做起來的我在做了許多東西其中一個work叫Gaugen我將中文把它翻成馬良省筆像是小畫家一樣塗幾個顏色每個顏色代表不同的語意你塗一塗之後就可以變成漂亮的山水畫那個work讓我在等於是幫NVIDIA把就是建立起一個形象不只是可以做出很好的CPU也可以做出很好的這個AI模型那時候我還有一些同事在一起做那個StyleGame方向的研究那我們就是這群人把這個NVIDIA從第一批就是等於是第一個把這種生成式網路來做這種Media生成把它帶起來那做了一段時間之後就那個公司就覺得我可以了然後我就可以開始成立自己的團隊那我那時候成立的團隊就叫TheImaginationResearch就是跟我當初給JobTalk的目標是一致這是哪一年因為19到20年之間那時候我變成一個ResearchDirector啊但就是那時候知道自己要成立團隊就跟著幾個一起工作的夥伴然後就開始建立這個deepimaginationresearch那接著deepimaginationresearch啊之後就一次啊就是在解相關的問題就一步一步像從這個啊就是朝著把小說放進去產生定這個目標前進嗯就是啊一步一步往下走我們做了幾個有趣的這種demo就是有一年詹森我們的CEO他想要用一個數字人來取代他來給這個keynote然後那時候我們就幫他做這個假的詹森的這個keynote的demo然後還有陸續那時候是疫情期間嘛然後在那段時間裡面數字人的發展非常的快然後我們也供了現了一些我們自己覺得很驕傲的Technology我十年前在給JobTalk的時候我就想要解這個小說變成電影這個題目但那時候我覺得這個題目可能需要很久的時間才能解應該是說我那時候並沒有意識到我們其實有已經有這個條件了當你的算力當你的數據足夠的時候就可以做出這樣的一個大的突破那但是那時候我就忙著做數字人忙著做各種有趣的應用到後來某一天,OpenAI出了這個DALI這個work,最早的一個texttoimagemodel,我才理解到我的野心不夠大,我不夠勇敢,沒有決心去把這東西做出來。 在算力最多的地方。 在算力最多的地方。 那時候NVIDIA是這樣運作的,你要Johnson投資你算力,你要講出來這為什麼對公司重要。
我記得那時候達力出來的時候我寫了一封信給詹森跟他講說這個未來已經很明確了就是靠DeepLearning來做這個影像生成那NVIDIA很多客戶都是用NVIDIAGPU用傳統的Graphics來做影像生成我們不能在用DeepLearning來做影像生成下落後我們必須投資GPU給我們這個團隊去幫助這個領域成長那段時間裡面我跟GettyImages也有很多合作因為我一直在做這個方向這些傳統的Content公司他們也對這個AI很感興趣但他們也就是就是試看看但沒有沒有足夠多的決心看了大力之後我寫一封信跟學生要GPU寫了一封信給GettyImages說我們應該合作你們這樣未來才有比較保障然後我們就談成了這個合作方案就是他們提供數據然後我們有算力然後我們去Build這個呃大模型来做这个呃testimage这就是我踏入大模型的的时间点那那时候我们成立了一个呃专案叫picasso我们目标是做aifoundry就是呃有些公司有数据但他并没有这种AI的人才沒有這種AI的Infrastructure但他們有數據他們有客戶那我們就是等於幫他做一個GenAI的模型然後再把模型給他們讓他們去部署他們的客戶然後彼此就是這樣一起獲利那時候就是跟GettyImage還有跟Shutterstock去做這件事情嗯那這是戰術那時候還是在deepimaginationresearch這個團隊的事情我們在做這件事情那從這裡就是慢慢的我的research不只是產生一個模型不只是產生一個論文我們也產生了一個可以幫助客戶成功的產品那就是這樣啊逐步的發展我當初以為我現在已經決心充足然後就是願意挑戰最困難的問題因為已經跟詹森要了GPU當時要了多少GPU啊? 那時候我是要了10個A10GPU當時的一千張很多嗎? 是,非常的多,那時候還在MPL的時代,一千張已經很多。 那要把一千張的這個GPU串在一起做一個高效的訓練也不容易。 這是我們那時候嘗試就是,當然遇到很多瓶頸,就是逐一克服。
因為我是最早EP去做這個GenAI的這個,在ComputerVision裡面做GenAI的人,我也很榮幸跟很多很優秀的夥伴一起合作因為我比較資深,當時很多有為的年輕人還在學生的時代,他們會來我這裡做實習然後包含現在在Meta的余家輝做出這個Solar的TeamBooks都在我這裡實習我還記得TeamBooks剛加入我團隊做實習的時候他就一直想做這個Video生成想做他想做的Solar的東西但那時候我們並沒有這個Technology我們是用Game一起去做合作那時候就看到他充滿了決心,充滿了熱情,然後當然是人非常的聰明,然後手腳也非常的快。 那我跟他一起合作裡面學到很多東西,我們也寫了一個蠻不錯的論文。 那後來畢業之後,想留住他,但他去了OpenAI,也很開心他在OpenAI那邊獲得很好的發展然後後來就做出這個Solar這個work那Solar這個work出來之後對就我的我是感到非常的開心但我又覺得我的決心實在是不夠還是不夠還是不夠我們那時候就幾位就是都在做這個領域的人就一起寫了一封信給全程說我們必須要更多的猴子這就是CosmosProject的由來我們這一群學者我那時候還有SanyaFidel然後還有我們公司帶這個Nemo床團隊的BrianCanellaroJunFan那時候也在這個meeting裡面我們就一起討論我們就決定要去做這個worldmodel我們覺得這對公司像是對人類像是一個重要的一個科技然後那時候俊誠就叫我還有賽亞菲德兩個一起來帶這個Cosmo這個Apple那時候不叫Cosmos那時候就是我們知道要做WarSimulator然後Jason呢就叫我們每個人去想要叫什麼這個Project叫什麼名字我們就每個人就回去去想就是要叫什麼叫什麼我已經忘記那時候有幾個名字在那邊選但最後Jason就說叫Cosmos然後我們覺得Cosmos這個名字非常的好然後所以這個Cosmos這個Project就這樣產生了然後我這還是在TheImaginationLab的時期那在那個時期就是我原本是在做Picasso然後就是這個AIFoundryforMediaGeneration然後但是同時又負責Cosmos我後來覺得就是Cosmos這個Project不管是對公司對整個領域發展更加重要然後也沒辦法分身乏力啊沒辦法同時拋兩個重大的project然後慢慢就把這個皮卡托這個project給收起來那幫這些客戶找到了其他可以繼續支援他們的科技公司那我就前進開始做cosmos那Cosmo做一段時間從一做到二做到三這段時間裡面使用它的客戶越來越多需要一定的規模才能去把這個Cosmo這個project做好你可以想像我在research時期可能就是像一個萌芽階段當現在這個Cosmo已經被這麼多人給依賴不管是外面的客戶或者是公司內部的團隊到一個不能死就是一定要成功的一個階段那所需要的資源更加的龐大就是在今年年初的時候我就從MediaResearch離開了我現在是Report給我們的SeniorVPofSoftware我們公司最大的一個Leader之前是匯報給比爾達的對帶著DeepImagination的團隊我現在匯報給Dwight這是他公司的第一個SoftwareEngineer在Jensen的專輯裡都有他的故事對那我現在匯報給他然後我離開Research之後我們就換了一個名字然後我就不叫自己的團隊DeepImaginationResearchTeam我們就叫自己CosmosLab這是整個這樣的一個變化我聽說SORA沒有出自你的團隊讓你很遺憾是嗎也不是遺憾就是我自己感到很開心就是自己曾經一起共事過的人可以做出這麼大的一個貢獻感到非常的開心遺憾的是說每個研究員都想做出貢獻那看到這個SORA產生的貢獻這麼大當然自己會覺得很開心但一方面也覺得說到底是什麼地方呃在我的决策过程当中在我的判断的过程当中是哪些地方我没有看对而导致我没有在正确的时期做出正确的事情嗯一定就是呃我自己一个很喜欢自我反省的人那我就是往往都会去试图理解怎么样让自己更好因为说到sara还是会想多说一句你觉得为什么open后来把这条产品线基本上算是关掉了Soar它是一個重大的研究工作它當然本身也有許多應用OpenAI是一個很有野心的公司然後他們有大量的人才那SanAlman一直是從他早期在YCombinator他就是一個投資者那他當然是希望就是有這種投資者的心態然後希望公司內部有各式各樣的project有些project非常的成功就是有各式各樣的portfolio對那我覺得在過去一年當中他們受到這個Anthropic巨大的競爭壓力他們看到Anthropic在CodingAgent上面產生了巨大的經濟效應你在跟確疾BT聊天的時候你產生的Token數就是可能最多一分鐘就生成完了那你做這個CodingAgent就是可以工作24小時、48小時這個Token量非常的大那他們就是我覺得就是覺得這是一個很好的方向那就集中公司的精力往這個Coding的方向走孫子兵法講的貝多則利寡大家的資源都是有限的那他們就是重新調整資源然後去往Coding這邊發展我不覺得他們認為收R不是一個好的work只是我覺得在這個時間點他們公司有更重要的事情必須要去做那就要做出一個不容易的決定我很好奇啊,因為像Antropik,OpenEye這種前沿實驗室,他們做研究天經地義,因為這就是他們的產品,但是對於英偉達這樣的一個基礎設施公司或者說是一個平台公司,我賣token給這些前沿實驗室就好了,我為什麼還要自己做自己的研究呢? 就是研究這件事情本身對於英偉達的意義是什麼? 你的基礎設施要做得好。
做得好的定義就是適合這些應用公司來用那如果你自己不做這些應用你根本不能理解他們所需要的東西所以就是要去走他們可能會走的路從中間去理解到而且設計晶片設計這個電腦的架構它的週期是很長的你不能說我現在馬上改需要很長的一段時間來做這個規劃所以你要做這方面的研究做他們的投資去理解到什麼可能是重要的問題要解設計出更好的晶片更好的Infrastructure來滿足這些就是AI大公司我總覺得這世界上如果每個想有抱負、有理想的人都有這個工具可以做出他們想做的事情這世界是會是一個更好的世界一方面看到OpenAI、Astrobic還有中國幾家大公司做出的突破我覺得非常開心但我們這個社會有源源不絕的有抱負的年輕人我們也希望他們有他們的機會就是我們可以做出這些模型然後分享給他們他們可以做出很好的應用很好的衍生模型或是從裡面獲得靈感做出他們更好的模型然後就是大家不同的想法都可以落地然後我覺得让这么多多元的这些idea都有机会被实现,然后可以呈现给这些用户。 我觉得大家选择更多,我觉得社会进步会更好。 这方面为什么因为大家做开源模型的原因。 那你们的研究成果会跟客户区有一些竞争关系吗? 而且我們做這種開源的模型我們基本上就是無價放在網路上面讓大家都可以去運用這事實上真正要落地真正要滿足客戶的需求還很多東西要做尤其在巨聲領域好多硬體的問題啊好多這個商業的問題都必須要解我覺得我們給Community一個訊號是說我們會幫助你在這方面那當你看到這個趨勢看到我們的Commitment我們從一代做到二代做到2.5代做到三代這樣一代做下去你看到我們一步一步就是想把這個地方做得更好讓你大家都可以更加預期到說英偉達在上面會一直投資一直進步那大家有這個認知有這個信心那他就可以把他的就是他資源投在更重要的導果上面去做出重大的貢獻因為每家公司再有錢公司資源都是有限的那你不找到痛點找到這個關鍵點去做投資做進步的話你是不容易脫穎而出的那巨神這麼的難這麼東西要解我覺得我們他做出這些模型幫助他們分擔部分的壓力我不覺得是在競爭我覺得是在幫助大家成功对为什么你们当时要立一个非常重要的项目没有选择当时最火的大圆模型也没有选择像sora这样的模型而是选择了巨身的一个世界模型大圆模型它在当时就是发展的已经非常的好了然后再就是我的背景不是大圆模型我是computervision出生的CV出生的对CV出生的那呃自然而然就是一直在这个media这边徘徊啊这imagevideo徘徊那這大概是過去的背景就是把自己走向這個道路因為我的背景關係所以跟著我一起合作的夥伴也都是類似的背景所以我們就是往這方向走這是為什麼沒有走大圓模型那另外就是NVIDIA也有很強大的大圓模型團隊在那裡我覺得我沒有太多的貢獻我覺得逆模創越做越好那我這邊就是主要就是想去解一些更適合我來解的問題那SOAR當初出來的時候它也是一個wordsimulator但那時候主要的應用比較像是這種創作方面的應用創作非常有趣每個人都希望可以用更好的方式來去講故事去呈現自己想的東西就是具象化幫助大家去理解你看到的世界這是一個很好的應用但那時候也看到了就是我們在這種DigitalAI發展極大的、非常的快同時間社會很多問題需要這些PhysicalTool真正能改變這個物理世界狀態的這些PhysicalTool來滿足的比如說就是當人年紀大的時候就沒有辦法開車當然沒辦法開車,整個人的生活品質就降低很多但如果有自動車,年紀大的人還是可以有他的mobility再來就是有很多工作,非常勞力密集的,也非常的危險如果有這種physicalAI的這種robot可以幫忙做也可以就是改善人的生活然後再來就是家裡面總是一堆瑣事要收碗筷啊要整理這些不見得是你在家裡面最想做的事情那有機器人可以幫忙去做這件事情提升人的生活品質我們就是看到這個就是worldmodel可以對physicaleye所產生的貢獻所以那時候就往這個physicaleye方向走而不是走這種contentcreation的路線傑森對於這個團隊提過什麼要求嗎?
傑森對團隊的要求非常的嚴格,目標高。 當然第一目標就是可以幫助到客戶,這不是一件容易的事情。 NVIDIA是一個運算公司,是一個AIInfrastructure的公司。 我們最厲害的就是整個computerstack從這個底層info到cuda到一路往上但是我們並不是一個solution的公司就是給一個機器人的solution或者是一些其他應用的Solution但我們的目標是幫助這些建Solution的公司成功有時候會覺得有點像隔靴搔癢因為你不太了解痛點在哪裡你設計一個產品如果你不了解你的客戶的話你就沒辦法最佳化那這也就是為什麼我會常來中國的原因就是想理解一下大家遇到的問題是什麼怎麼去幫助他們就是一個難處一個捐贈的要求然後做東西是需要makeimpact捐贈常常在講就是他喜歡這種zerobilliondollarbusiness你可以是不賺錢但當這個生意成功的時候必須是很influential的是很巨大的你不能说就是满足在就是每年赚个10个million这种scale这对很多公司而言都很大但对一个对英伟达这家公司而言这并不是一个distraction是个分心分心对是个分心就是你要去解最重要的问题产生最大的贡献然后我们觉得physicalize是一个够大的问题可以产生最大的贡献所以在帶這個方向的時候要很小心就是要去解最重要的問題而不是去解一些短暫可以產生成果但它的影響並不是很大這是其中一個問題當然就是要做到最好這也是很難的聽起來過去十年的名譽在英偉達變得越來越具有野心了是那接下來我也想探索一下就是你個人的一個作為研究員的劉明玉你是怎麼一步一步探索你的研究之路的再回答你這問題我先講一下想回答之前的問題我覺得我是一直很有野心的因為我那時候就認為可以用小說直接生成電影只是我覺得我的執行力不夠我的看時間點不夠然後我不太會去理解在那時候還是剛進業界不久還不太理解怎麼樣做才是可以在公司中獲取支持然後獲得巨大的資源去從事方向那我覺得過去十年歷練裡面讓我更加理解怎麼樣看清楚在對的時機然後怎樣怎樣就是幫助公司理解這是對公司重要的決定然後去影響公司怎麼去投資這是我覺得一個變化是一直很有野心只是不知道怎麼執行我最早因為那時候成長背景嘛我在台北長大然後在我讀高中的時期最熱門的科技是無線通訊那時候那個手機剛出來是巨大的手機然後還是Nokia的時代那時候對這個科技感到非常的好奇,在台北長大,那總想離開台北,我這時候就去了台灣的交通大學在新竹,那邊去學習這個無線通訊。 那無線通訊在那邊學了一段時間之後就比較理解他是怎麼做的在我的同學那時候一起在那個新竹交通大學求學學無線通訊的同學很多人就留在台灣去比如說在聯發科或者是有些人去台積電去做這些就是台灣本身就很擅長的工作那我在那時候就有點懷疑是不是這就是我要選擇的道路因為我從小到大其實沒有想過說會去美國留學沒有想過所以我其實一直不是很重視我的英文就是覺得數學、物理學得好就夠了那個時期我就開始有點懷疑到底什麼路是對的在大三那一年我就好奇去看看美國的研究所博士班在做什麼東西然後我看看我自己現在那時候在台灣的交通大學做什麼東西然後那時候我就發覺就是做東西很不一樣然後我覺得我那時候在算怎麼樣設計一個protocol可以讓傳輸更加快那我覺得這是一種提升但不是一個零到一的變化那我看到在美國這些高等學府做東西我就覺得嗯這個看起來每個成功都是一個零到一的變化所以那時候我就覺得我應該出去闖一闖我才記得我跟我爸媽說我要去美國留學的時候他們就嚇了一跳因为他们认识我二十几年没有听过我讲说我要去美国留学这件事情这是大几啊?
大三的时候所以他们听到就是还蛮震惊的那时候我想去美国学习的是量子通讯因为我觉得这东西很神奇就是靠着量子可以直接把信息从A传到B去但後來我到那個去美國之前我在在台灣的Intel在那邊待了一年然後認識了一個朋友我們都在那裡實習他在那裡做這個影像辨識那我就這是我第一次接觸到AI因為之前都是學通信然後我看到他在做影像辨識我覺得這很神奇他就是可以從這些pixel裡面去判斷裡面是什麼東西是誰是什麼物件然後我就對AIcomputervision有些印象我那時候申請到了美國馬里蘭大學在那邊開始我的博士最早期的computervision都不是不work那最主要的那個經費研究都是國防那馬里蘭離那個華盛頓特區很近所以那時候聚集了一些非常厲害的就是早期的做computervisionAI方向的大佬在那裡那我到那個學校之後原本是要研究量子通訊的然後後來發現那裡有做這種ComputerVision跟我那時候在Intel實習看到的東西很接近的這個題目我就覺得說嗯這看起來更有趣那我就找了我的指導教授RamachalRapa他在這個領域裡面就等於是先鋒然後我就開始跟他學習AIComputerVision最早我做的第一個題目是從影片裡面去看這個人走路的姿態去判斷是誰那時候也是蠻有趣的問題我就是這樣逐漸逐漸轉換跑道去做AI最早期去做这些影像辨识视频辨识然后我后来在博士期间还学习怎么用叫ShapeMatchingSegmentation这些常见的这个Understanding方向的这个AIComputerVision的研究这样逐渐踏进这个AI的那时期并没有DeepLearning是一个传统计算机视觉的时期傳統的計算機是學那時候什麼都不work所以什麼都要學我們那時候做SupportVectorMachine那是一個很傳統的用MachineLearning的方式SupportVectorMachine跟優化有很大的關係然後就是一種不管是連續啊離散的優化都不需要學然後也要去學習一些GraphicalModel,EnergyMinimization,還有各式各樣的就是3DCalibration這些東西,就學了蠻多,我覺得算是很扎實但就是在畢業的那一年,ImageNet這個AliceNet出來,然後改變了整個世界PhD的后期就到一家叫MitsubishiElectricResearchLab的一家公司三菱电机研究院这是你后来的一个工作对吧对这是我的第一份工作在美国的第一份工作对在美国第一份工作它是在Cambridge在Massachusetts在MIT的旁边这家公司在90年代是非常强大的一个研究单位那時候跟微軟研究院是一針刺胸,在graphics上面都是非常領先的一個研究機構,那MIT裡面有許多教授以前都是在那個山林電機研究院裡面當研究員,包含BillFriedman、RameshRaskar都在那邊做,那我加入的時候已經過那個時期,但是還是很多優秀的研究員留下來那我記得那個公司之後幾件事情嘛那一年AliceNet出來所以我過去學的東西就是跟未來的世界開始有些divergence那一刻會失落嗎? 不會我其實在我是對這些新的科技一直很感興趣因為computervision因為什麼都不work所以我已經養成這個習慣什麼都學什麼都不work那時候什麼都不work然後後來DeepLearning出來之後就覺得很有趣我還記得我那時候是博士班的最後一年了嘛等於是實驗室裡的大師兄然後我就組織學弟妹們弟妹們積極去要研究DeepLearning這次去研究那我還記得那時候有一位師弟跟我講說這東西只有幾個人會沒有必要去研究然後我還是沒有理他就是繼續辦這個研討會然後後來我的第一份工作是在這個三菱電機研究院嘛那研究院通常就是研究風氣就是工作比較自由,讓我有很多時間去學習所以我在那裡就學DeepLearning910Model是我的資料教授RamaChalaba他很相信910Model他相信Bayesian就是相信你要把深層放在Understanding的一部分所以我在那時候學DeepLearning的時候也在留意深層的這一塊那後來有一年去了紐約看到IanGoodfellow的這個那個生存對抗網路的工作就對這東西感到非常有興趣我後來就開始在這方向裡面就開始做大量的投資然後越學越多這樣對你好像很早就開始做生存了我是最早做生成的一批研究員那時候還在只要能生成32x32pixel的臉然後看起來不像鬼然後就覺得自己很成功所以為什麼生成是理解的一部分RichardFeynman他講的IfIcannotcreate,Icannotunderstand就是當你可以去生成它的時候你真的去徹底的理解它這個人的學習有點像對是是是那你可以講的時候意味著你已經理解了還有早期就是computervision也分這種discriminativemodel跟generativemodeldiscriminativemodel是它其實沒有生成能力但它可以判斷這是A還是B判別式判別式那生成模型就是一樣可以被用來做判別但是它還是包含可以去重建這個訊號就可以去描述它當你可以描述清楚的時候大家是可能認為你更加理解這個東西的那就是Discriminative跟Generative所以像最早期的AliceNet可以做ImageNetClassification我們就把它看成是一個判別式網路其實你最早做了一年的工程師你覺得這個經歷對你後來做Research有影響嗎哦你说我在在那个Intel做工程师吧对以及你觉得做engineering和做researcher的本质的差异是什么呀哪个更适合你自己这是一个好问题嗯做research呃最重要一部分就是问对问题嗯问对问题当你问到对的问题你就你总大概就是找对一个方向那engineering等于是帮助你去去跟大家讲对这是对的问题就是要把東西做出來,研究的一個實現能力讓你去做這件事情那Engineering當做大scale的時候還有很多東西是很重要的在去美國之前的那一年做Engineering對我的影響我可能最大的影響就是認知了這個有這個領域叫AIComputerVision然後從中間我記得那時候在巨大的softwarestack裡面幫公司去找問題那這也是很磨練耐心的一個過程我覺得都是很好的訓練所以AI對你來說也是一場意外它本來不在既定的軌跡之中不算我不是那種從小就是說我要去理解為什麼人類為什麼可以有這個智能的發聲我等於是就是一步一步看到這東西覺得非常有趣想去理解然後就一步一步往那個方向前進他最初打動你的是什麼呢為什麼打動我嗎最初後來當然很可以有很多原因了因為不懂因為不懂哦對不懂那又比較容易去理解它的重要性就是有些科技領域像這樣子通訊你可能要很懂才知道它到底是為什麼重要啊這個AI就很容易可以理解就是你可以重造這個智力那它有些表現會跟人非常的像那這就很好奇了因為還有就是自然而然每個人都對自己的就是存在會產生這個困惑整個群體就是到底什麼是人我們跟其他生物有什麼不同那這就是一個很自然你會問的問題那我覺得也是因為這個原因這個領域會吸引這麼多人在上面做出口誤嗯如果要找到一個早期對你研究生涯都非常重要的一個時刻你會怎麼描述它它是哪個時刻它是你在做工程師的階段還是你到美國之後太多了對那哪個是最重要的或者最重要的三個呢我覺得第一個時刻就是在早期我喜歡漂亮的數學在computervision早期階段什麼東西都不work那computervision運用大量的優化的算法那優化呢就是要去找最佳解如果是連續性能呢常常會遇到這種nonconvex的問題就是你沒辦法找到最佳解那如果是離散呢就這種NPhard的問題就是你也沒有足夠多的算力去找到最佳解你還是研究出算法去找一個答案但你不知道答案離最佳解多遠那為了去確保你的答案離最佳解不是太遠就是有一定的保證就會去證明這叫棒的也許這個最佳解雖然找到答案不是最佳解,但它離最佳解可能就是差4%或是差20%這比隨便一個答案好為了去證明這個Bound很多時候在早期的研究就會開始做些假設假設讓你的數學變得比較乾淨,可以找到答案但假設也讓你離現實比較遠然後那時候早期會有點偏向於去找這個追求數學的美而去忽略了跟真實世界的距離然後後來一段時間之後我自己知道這不是一個正確因為AI本身就是一個應用就是智力就是拿來被應用的然後我是越來越喜歡接近這個問題的本質而不會被這些花俏的數學給迷惑然後後來還有一個階段就是可能就是從小成長的背景有關就是總是專注在把事情做出來而不專注在讓別人懂你做出什麼東西然後我開始做英偉達之後就是我覺得我做的research不錯蠻不錯的然後在那個別人看到這些這種imagetranslation之前我就把這東西做出來但我不太理解怎麼去不太會去表現我做出來的東西一般人可以懂然後我常常講說我自己做10分但是我的解釋只有10分所以別人看到只有10分然後那時候我就更加重視如何讓我做東西讓別人理解它的重要性然後讓他去理解這個過程那這是我覺得可能一個很重要的一個lesson那當時我早期做game的時候然後第三個是我後來理解到尤其是開始做大模型的時候我開始理解到團結合作是非常重要的一件事情人跟人的溝通呢,其實是一個高複雜度的問題比如說你,我不知道,就是叫n²假設你有n個人,你跟這些另外n個人溝通是n²那n²在那個複雜度來講是一個不好的複雜度,就是不容易scale就是當你很多人的時候就是每個都要點對溝通就不容易比較好的就是這種N或者是Linear或Sublinear我開始知道說要做出一些巨大貢獻需要大家一起團結合作的時候必須要把事情講得非常的明確讓大家都能懂然後大家目標能一致就是自己能把東西說出來然後也希望就是大家都能懂是在做什麼東西然後可以朝同一個方向前進那這地方就還需要很多就是幫助大家去理解為什麼這個重要這也是後來我做科研尤其是做到大的scale的科研裡面覺得很重要的一件事情你要做应用,然后你要销售你的工作,你要团队协作。 对,是。 这其实也是你的成长的路线,对吧? 是,对。
当我做出了第一个,那时候我有一个很popular,我叫高跟。 然後說大家都在用它就我剛講的馬良森比我看到用戶的反饋讓我充滿了就是成就感然後覺得說我能影響的不只是DuoPaper的研究員而是一些就是更大的一個族群然後可能就覺得自己的生命更有價值然後就從那方向前進高幹是取自高更嗎對這個名字是這樣那時候我是跟一個我們那時候的實習生叫那個TesonPark他我們一直在研究這個方向當然還有還有一起合作還有朱君彥然後還有那個王鼎俊我們這四個就是一起在研究這個題目那時候我們開發出一個算法,我們叫做SpadeAdaptiveModulationDemodulation,這是一個算法那時候做出來之後,很開心,我在公司內部做個Demo然後Justin看到非常的興奮然後他問我叫什麼名字,我就叫Spade,他就不喜歡這東西就是不容易懂他不是一個用過語言不是用物語言那時候就是paper已經寫完了投了CVPR但還沒有放在archive上面然後公司看到之後就叫我不要放在archive上面讓Jensen在GTC那是2019年的GTC的時候可以在他的大會裡面跟大家宣布然後我覺得很興奮很好的機會那他們就在想這叫什麼我們公司有一個Marketing的Genius就想說這叫因為那時候算法都是什麼Gain什麼Gain什麼Gain對那是Gain的時代對Gain的時代然後那個Market他叫做那個GregEstates然後他他就提出叫高Gain高棍他是法國人就把這個名字取出來然後大家一聽到名字很合理畫家著名畫家然後那時候做應用也是這個畫件事情然後就就出來了那時候本來是在GTC他的就是捐贈大會上面要去宣布的結果那一年他太多產品要介紹了他最后一刻就呃我记得我在礼拜天晚上还跟他在那边排练就是要在台上给个demo然后当天晚上就接收到通知说太多产品要要讲了他决定把这个高跟就不放在他的keynote上面就一样是做的新闻稿一样做demo给这个媒体啊朋友去看但就没有放在这个他的大会上面哦很多媒體朋友看到它之後反而是GTC裡面最受矚目的一個work然後就那一年就有這樣的就是有很多種事然後我們做一個online的app讓大家都去測試然後從裡面就是大家使用裡面獲得很多就是很好的版困然後就就是越做越往應用方向前進其實高Gan是不是跟你之前的研究軌跡是一步一步遞進的它不是第一天就做到那裡了因為你從博士畢業以後加入了三菱電機研究所ComputerVision就進入了Gan的時代然後你其實圍繞Gan做了一系列的工作包括CoGan、MoCoGan再是到了英偉達之後的比如說高Gan這一系列的工作對嗎它它是怎麼延展的呀我最早的一個Gan的工作叫那個Couple的Gancoupledgame就是把兩個game的生存網路把它coupled在一起然後coupled在一起產生了一個informationbottleneck然後所有的deeplearning就是在學什麼壓縮資訊然後bottleneck是幫助你就是給這個network一個機會可以去找到本質就是你一個gain是在model一個distribution然後你有兩個gain是model兩個distribution一個是碼一個是斑馬當你couple在一起以後它有一個限制就會少了一些共同性然後就可以讓你做這個轉換從碼變斑馬從這個方向走的整個深層次網路就是在做這個distributionmodeling那的確modeling就是你可以sample就產生一個image一個山一個海或一個video但是人不只是想要去生成他要去能控制自己去生成的東西那控制呢就是要有訊號那訊號有很多種那一種常見的訊號就是拿image當訊號就是我這有一匹馬這會變白馬對這是一個訊號另外一種方法就是那種edge就是你素描然後還有一個就是segmentation就是這個像小畫家一樣什麼顏色代表這山什麼顏色代表這水這是一個訊號然後再來呢就是呃比如說class內部就是說這是山這是車這是機車那就生成然後最最sophisticated的最接近人的naturelanguage就是text就是texttoimagetexttovideo啊這是最就是最自然的一種形式但他text跟這種segmentation最不同一樣最不同的地方是segmentation是給你很具體這個pixel是什麼它幫你對位對好然後text呢它是一個比較不一樣它的structure跟imagestructure是很不一樣跟videostructure是很不一樣因為structure很不一樣所以它是比較難學的需要更多的數據所以我做愛人的過程當中我是理解到這個問題所以我是從比較容易的方向一步一步往上走然后容易的最最早是这种segmentation啊这种edge或者image嗯那这也是为什么我之前讲说呃搭理让我觉得我自己的决心不够哦因为我那时候总觉得testimage是很困难一件问题好然后觉得这个领域还没有足够多的资讯的data跟算力来做这件事情哦好那其实是有的然后就就是因为没有去做所以做不出来哦所以你是沿著image然後到test的這個路徑一點一點的延伸的對就其實在早期我有幾個朋友我們每年一起參加newrips我們就在討論我們在討論說那時候還沒有GBT那時候都是早期我們就在討論說,如果真正有AI,就是真正會產生突破,第一個會產生突破的領域是哪一個? 那時候我跟大家講說,是text,是language。 是哪一年? 應該是167吧。
我自然自己不做text,但我知道就是影像的序號太多雜訊了。 很多東西就是它離知識的本質是比較遠的它是比較世界的,就是observationtext已經是很純淨的,比較接近symbol所以要產生一些類似智力的表現,最早就是language我雖然知道最早的AI會是在language發生後來也是真的是這樣但那時候我就是比較喜歡這種視覺訊號所以就一直留在視覺訊號的深層這邊嗯後面這幾個GAN的工作你要不要講一下那時候就是ImageTranslation嘛從A就是那種馬變斑嘛那個風景化變真實的這個風景然後後來又開始做Video然後我們那時候做一個叫呃叫VitVit那時候是把一個車子的Simulator產生了這種很簡單的這種卡通的圖片然後把它變成一個真實的開車場景就是很接近現在的worldmodel這些東西對這已經到NVIDIA了對都到NVIDIA了嗯我只有couplegame不是在NVIDIA做的剩下的game都在NVIDIA做的嗯那時候呃早期做這些工作然後呃也因為這樣子跟IanGoodfellow就game的那個發明的人成為好朋友然後我們就那個就很多討論然後也很幸運就是在英偉大呃就是很多優秀的研究員余家輝TimBrooks還有很多來我這裡實習然後跟他們學習然後做了很多一些work都是圍繞著就是imagetranslation啊videotranslation啊嗯啊這方向走對然後後來有一年我在讀PhD的時期學的都是傳統的這個computervision的東西那PhD畢業之後deeplearning是帶來了那時候就是想說你不應該做handcraft的algorithmdesign不應該做handcraft的featureengineering就是應該datadriven然後那時候也理解到就是這種更加scalable的approach簡單scalableapproach是更容易成功的所以就常常跟自己講就是說你在做選擇的時候要找這種更加scalable的就是後來大家講的bitterlesson那我在做game的時候很開心但我一直在思考GAME到底是不是SKILLABLE因為GAME大家都知道說它很難去訓練所以我擔心這東西就是可能最後不SKILLABLE那一年瑜伽會來我這邊實習的時候我跟他研究的題目就是要去SKILLGAME那時候還很早那時候我就看到瑜伽會他的才華洋溢然後就是做出很多就是雖然我們那時候沒有寫出一個配合但那時候做的實驗量非常的驚人他的想法我看到哇還可以這樣想啊然後就是呃比如說那時候game是一個generator跟discriminator嘛然後那時候我有幸的是有很大量的GPU一個class來存硬件他就想到說每一個GPU都放一個discriminator但是他的weight都不一樣所以好像很多人同時跟這個深層次網路做對抗在那個時代能去實現的東西是很不容易的一件事情然後那時候還有另外一個實習生他叫JeremyBurstyn他就是後來發明這個MuonOptimizer現在大家都在用的MuonOptimizer他那時候來我這邊實習我跟他研究的方向是如何在在這種R5位程上面更好的算法來去把這個Gantt給做得穩定當然這兩個最後就是方向最後都沒有成功但他們各自都開發出了非常驚人的很有成就的工作Jeremy就是從那時候開始我們寫了一系列的paper就是如何用密網早期的算法來去穩定來去就是讓這訓練更穩定他就一路一路往下走在開發這個密網的算法嗯就是很開心的一段時光,學會很多東西。 到某一年,很努力啊,然後跟著這麼多聰明的人在研究這個怎麼讓Game更加Scalable,但每個結果都是走向,都是得到一個結論,就是Game不Scalable。 然後,呃我建立這個團隊,就是那時候就是大家加入原因就是想做Game。 然后那一年我就跟大家讲不能做gain了要往就是这个方向不scalable我们那时候看到diffusion嗯啊觉得哇这个这个方法极其稳定然后这应该是17年不是不是以前应该是201吧20那时期17年是transformer发明出来了對ECMTransformerTransformer發明出來之後呃我必須講呃我不是早期去接觸Transformer的當時英文還是LLM對這是LLM那一款嗯我我一直在專注在GAN然後早期的GAN呢比較好訓練的都是用那個ConvolutionNetwork呃到Sanning他把這個DiffusionTransformer帶進來之後才做Diffusion那邊的人才慢慢的往這個哦Transformer這邊走所以那時候就是從算法層面來看就是覺得這個Game不Scalable然後就跟團隊講說就是不Scalable的東西最後做不遠然後走Diffusion然後就開始做Diffusion然後往下走對這是一個一個重大的轉變時期那做Diffusion一開始是做Image嘛然後後來做MultiViewImage然後MultiViewImage呢就做變成3Dgeneration那我們就做一系列這方面的work就是Edify系列的EdifyimagegeneratorEdify3DEdifyvideo然後做各式各樣用Diffusion來做的生成我听这个我会想到两个点就是你在CV这么漫长探索过程中其实计算范时发生好几次变化从传统的然后到了GAN然后又到了Diffusion现在每次转变的时候作为一个研究员在其中应该是一个什么样的心态我发觉越变越简单了会不会觉得哎呀我之前的工作都白做了傑森常常講就是sufferingleadtogreatness然後在這麼多就是經歷當中我覺得我現在越來越能掌握這個事情的本質然後我覺得有點像是就像傳統的科研一樣就是把事情就找到真的找到本質找到最簡單的方式去描述這個世界是怎麼運作的然後我覺得現在的方法就是把事情越變越簡單嗯然後在Cosmo這邊我們也是從數個模型就變成了現在這個Cosmo3的一個模型也統一了對,就是漸理解到原來這就是事情的本質然後每一個方向我都是花了5到10年在投入我覺得未來的決定呃我所承受這些過去的那個經歷影響然後我也不能說那是錯誤的那時候不能說它是錯誤就是呃那時候的條件那時候的算力那時候的數據在那時候做那些事情是合理的對那那時候那時候學的東西對我呃現在做很多事情理解很有幫助還有我發現你好幾次提到你的實習生在AI的Lab裡是不是就是通過實習生來湧現一些idea是一件很常見的事情怎麼看待年輕人比如說經濟的茂盛程度是根據錢多快從一個人的口袋流到另外一個口袋那研究的茂盛程度應該是根據idea多快從一個人的腦袋流到另外一個腦袋去你聽了我的idea你有些想法把它變更好我聽了你新的idea不錯但這個地方也更好你就一直流動流動流動然後就idea越來越好那所以呃因為我走向業界這條路就不是去學校做教授那呃如果你只是在業界整天交流的只有你的同事idea的diversity就低一點那英偉達這邊我們找很多實習生就是跟這些很有想法不同背景的人一起合作研究然後互相學習所以我覺得這東西是幫助我成長也幫助他們成長一個很重要的發展嗯你12年加入了三菱博士畢業加入了三菱研究所然後16年加入英偉大你後面這個職業的變化是怎麼發生的你怎麼加入英偉大的自從開始做deeplearning之後我很相信算力在三菱電機呢不是一個重視算力的公司是一個它是重視算法然後那時候為了能做出研究做出好的研究我就常常跟我那時候的manager要求要買GPU喔對然後開會就是說我們需要GPU要做這件事情在那個三菱電器有一個LongTerm的Mentor他叫安卓執照他是也是一個很有名的研究員然後他那時候就決定離職加入蘋果做自動車然後然後我突然間覺得說就是當初把我留在三菱電器的主要原因沒有了然後我就開始思考說我是不是也要換工作那很自然而然的換工作就是到微股跟這些大公司聊一圈那時候大家都看到就是Google阿Apple阿Amazon阿這些Meta這些大公司然後後來他們的Recruiter找到我然後我看到欸NVIDIA對每次我都想要買他們的GPU那我這麼缺GPU這麼想要GPU那為什麼我不加入一個就是生產GPU的公司所以那時候我之後就決定就是加入那個英偉達那我那時候父親不太能理解因為英偉達是他們沒聽過的公司那時候沒聽過的公司他說你蘋果不錯啊谷歌不錯啊你為什麼要加入這個英偉達然後我那時候人說英偉我覺得GPU是最重要的尤其是那時候我在開始做CoupleGame的時候那是用Unsupervisedapproach所以Unsupervisedapproach代表數據取得比較容易一點你不需要標註那我就覺得那最重要的就是算力跟數據嘛那我既然數據不需要標註那我就去有算力的地方然後一件事情很有趣的是我後來發覺就是我那時候在三菱電機的manager我每次跟他argueGPU只要我吵贏了他給我一些那個經費去買GPU同時間他還會買NVIDIA的股票然後後來他就退休了他沒有告訴你什麼當時他後來跟我說了當時沒有告訴你當時沒有告訴你不然你也可以買了是的嗯我看到你在30電機的工作的時候就已經和NVIDIA的人有一些合作了什麼在一些論文上面嗯不是我多半是那時期就是寫的那個paper啊因為那個學術的那個論文啊就是審核啊有時候你不是第一次投就會上然後可能是多投了幾次後才上那呃在三菱做的研究啊可能后来到了那个啊英伟达之后又继续在上面做一些提升然后所以这个才会一些paper的作者同时有三菱的作者跟跟英伟达的作者哦对并不是在那时候有合作这公司跟公司间合作没那么容易哦我以为是之前有一些合作基础所以你加入了英伟达其实不是的还是正常的一个求职的过程對就是我那時候並不知道那個英偉達有一個研究機構喔對我那時候覺得主要是賣GPU喔然後那時候面試我的幾位同仁我後來跟他聊之後才知道欸他們真的是在做研究才過去的那時候英偉達的研究機構沒有什麼名氣多少人啊那時候去的時候不到一百個人吧而且不是純粹做AI研究大部分人都是做Graphics那時候做StyleGame那一幫人啊那時候也不是在做那個也不在做Game他們在做別的東西我印象很深刻就是在MediaResearch每一年都會有一個叫Offsite就是把世界各地的NVIDIAResearch的同學飛到加州在矽谷南邊有一個小鎮Monterey下面的一個小鎮然後那邊就有一個地區我們就在那邊做了兩三天的研討然後是我第一次見到TaroKeras就是發明StyleGame的人還有一個TimoEila、Samuli這幾個重要的Game的研究員那時候他們都沒有做game然後我已經做一段時間了那我遇到他們的時候他就跟我講說他要把game的問題給解然後我跟他們說,OK,你可能不知道有多難我當然希望他們成功,但是覺得他們有點低估他們的難度後來他們就是真的一直投入在做stylegame從1啊、2啊、3啊,然後就不斷地突破我跟他們合作當中學到很多東西他們一直在做這種unconditioned的,不是我做的那種控制性的但是他们就是对这个细节的追求对这个结果的那个追求就是影响我这个这个研究的发展很多进入英伟达做研究有像你预期那样可以有很多的GPU吗對這世界上沒有任何一個地方GPU是夠的然後你總是看到不夠的地方對那我是很幸運就是我是最早在英偉達裡面做大模型的那個就是用大量GPU來做這個深層次網路的一個研究員那因為我早期幫公司做了一些就是visibility很高的work那所以公司很多人都認識我然後那個老黃也對我蠻有信任的所以我就很有幸有很多GPU資源可以去做這些研究但每次都是看到別人的GPU更多覺得自己總是不夠怎麼在一個像英偉達這樣的公司獲得更多的GPU你需要學會什麼你要懂公司要解的問題是什麼然後你要想辦法就是跟公司解釋為什麼你做的東西會對公司產生影響每個研究員都自己有自己的想法都想解事情然後研究員某方面來講都是veryhighego文人鄉親自古皆然每個人都覺得自己的想法比別人好但公司的本質跟還是不太一樣就是公司是為了為就是股東獲利那當然對傑森來講他是希望可以takecareoffamily就是整個公司這麼多人一起打拼吧因為他堅持出來他希望可以幫大家照顧好family就是公司要賺錢所以我學到一件事情就是就是我深信我做東西是對世界很重要的那这东西会产生改变,产生改变会帮助公司,那我要怎么去把这事情讲清楚,让这个leadership,让这些不懂的AI的这些leader,就是理解到这东西对公司重要,这就是一个重大的变化。
这是你刚才分享的三个时刻里的第二个时刻,这具体是在哪个项目里发生的转变? 我那時候講第二個時刻是如何讓其他的研究員更加理解自己做的東西就是最重要的事嘛我覺得是一個一直不斷變化的過程我很難講是具體在什麼時候發生但我想講三菱電機的那個案例對我影響很大因為三菱電機在90年代非常的重要因為它是早期這種就是沒有任何限制的地方來做研究包含領域裡面很多著名的人像BillFreeman那時候在三菱電機研究院然後BillFreeman吸引了一堆現在比如說AlushaEfra就是一些著名的教授都在那邊實習過然後那邊就是做出很多重大的research所以那時候可以跟微軟研究院可以一起競爭嘛但某一時期公司的方向改變了他們開始懷疑這些這種BlueSkyResearch對公司的影響是什麼就越來越難去justify為什麼要去pay這些researcher然後就產生了一個很著名的這都是現在年輕人大家都沒有接觸到的事情那時候就開始就是一堆重要的學者在30第一學者就陸續被fire了離開公司有些就加入微軟有些加入學校當教授那個MIT那個LightsHarbor然後有些人去那個Disney就是人就陸續的走那留下來的一些人就是他們還是做的類似的Research但是比較難跟公司的發展方向相關你說三菱電機對做相機啊做這種工業用的相機很感興趣做機器手臂很感興趣所以你幫那邊研究就是就是就可以獲得公司的支持繼續往下走那我加入的時候已經是這東西都結束了那但是我那時候得到訓練就是說BlueSkyResearch跟公司的興趣也是可以Align的然後我就常常看到因為在這業界很久常看到這種週期啊就是很多公司都會一開始的時候就是給很多自由度然後很多很有趣的idea都出來了但某段時間會開始緊縮然後就是留下來一批跟公司這個興趣比較相關的人那就是你可以看到不管是Google啊不管是Meta都是有這樣一個過程那我可能是很有幸的在我的職場的早期我就看到這個過程的發生所以我在英伟大的时候我就知道我那时候就就是一直认为就是首先我知道我做东西跟这个用deeplearning来生成影像对公司绝对是正相关的更加花心思去理解怎么跟公司的决策层解释为什么我做东西重要哦这个特别重要因为可能是公司在上行期或者是膨胀期的时候他允许你做很多bluesky探索但是他只要是下沉的阶段他就会收缩对他一定要你回答為什麼你做這個事情重要你跟我有什麼關係是而且去做deeplearning非常花錢對所以你更加要注重解釋為什麼這對公司是一個重要的投資那大家也会注意到你的研究其实很多时候的理念就是研究这些产品这跟那段经历有很大的关系是不是这后面影响你在英伟达的很多的做的研究和产品因为比如说你的高GAN你刚刚提的那个项目就是SPADE的那个算法其实也是做成了一个实时绘图的一个产品然后包括后面的也做了视频会议增强AI增强的一个产品就是所有的研究都会变成一个产品去发布是我是算很運氣的人我是一個我是一個隨著我年紀越來越大我越重視效率的人所以我很精準的把自己的research變成了一個產品我不能說高端是個產品我還有一件事情是一個學習一個重要的學習就是AI單獨存在並沒辦法改變一切怎麼說在做AI的時候大家都追求越來越好的模型但你慢慢會發覺就是模型的的那個就是慢慢收斂大家都差不多啊當然我有些人會說不斷進步但你看到就是那個這月那個安刷比比較好下個月那個GBT比較好然後可能下下個月那個Gemini就追上來了然後中國這些強大的公司GLM、Kimi、SEED、Ali、本源、DeepSeek、MiniMax這些公司都不斷的在做突破那慢慢的就是大家的模型能力都會差不多當你模型能力都差不多的時候你就會理解到說你純粹靠模型是不夠的然後我可能是比較運氣比較好就是早期就就認為這個模型會收斂然後我一直重視就是不能只靠模型要跟公司的其他的egosystem結合在一起你看Gemini做那麼好就是GeminiGoogle有一整套的這種GoogleDocGoogleSearchMail一整套的平台合在一起那就是當越多人使用你的模型的時候你都要反饋越多那然後越方便那你就更容易就是對公司產生貢獻對公司產生貢獻公司願意給你更多的投資你就可以做出更好的模型然後就一路可以把這個呃長期的這個就是發展馬一路一路做下去嗯所以呃那我在早期做AI的時候就是跟其他的研究員差不多就是你知道研究員呃PHD學生畢業的方式就是寫出呃高質量的論文什麼叫高質量的論文呢往往就是你在Benchmark結果比別人好嗯就是你就是要一個killer把別人的方法給擊敗嗯然後再來就是文人鄉親嘛總覺得自己比較行然後就是一路往下做所以很多時候早期做研究的時候講說比別人好然後到晚期的時候我後來漸理解就是那種比別人好只是其中一個就是證明你的東西有價值的方式那另外一個方式是你可以幫助到別人讓大家都變更好嗯然後你會發覺就是我我我現在的想法越來越接近就是我做什麼東西可以幫助整個領域變好而不是追求的就是我比別人好這是一種嗨一個還是一種low一個我不知道是HighEgo還是LowEgo我是有幸的在過去20年當中遇到好多聰明人物總覺得就是這世界上能人非常的多然後我很多實習生都比我優秀然後我覺得這是非常開心的一件事情那我覺得我自己能做出東西來可以服務這個社會但我也不會覺得說我一定是比大家都還要優秀然後所以我不是說HighEgo也不是說LowEgo我就覺得我是有辦法產生貢獻嗯你刚才其实说到一个你做模型的思路就是你觉得模型最终会收敛它的能力可能会同质化但是我理解那些frontierlab他们的认知是说智能现在还没有到顶智能还要继续高速的提升你不认可他们这个观点吗就他bet智能的skill我當然一方面很好奇嘛我自己也在用這些模型我也看到它不斷的都在提升嘛但是有些人總是會講說接下來會有exponentialgrowth如果你不趕快投資這間公司或加入這間公司的話你就會missouttheopportunity對然後我覺得歷史上看過去歷史從來沒有這樣發生過就是一家公司就是掌握所有的科技其他其他的公司都沒有辦法去追上這從來沒有在世界上發生過然後我不覺得AI會是一個例外對我覺得大家都很聰明對就是人員會流動總是在A公司做一段時間總覺得我自己的才華沒有受到肯定我可能就跳到B公司去對那呃這些knowhow這些東西就自然會在這領域裡面擴散嗯對然後我總覺得不會有一個公司會比其他公司都做一個巨大的超前我覺得這本身就不是一個穩定的社會狀態如果推演一下如果模型的智能大家达到了一个差不多的水平接下来大家竞争的是什么呀就是整合跟跟自己的这个生态跟自己的产品的整合嗯对这是大公司创业公司呢創意公司的優勢是可以走那個大公司不能走的問題比如說對NVIDIA來講任何生意只要是小於一個Billion就沒有興趣去做但那些本身就是有一些很值得做的東西然後有一本著名的書叫InnovativeDilemma,就是往往這些小公司在走向那些當初不是很被看好的領域看到有一些東西可以慢慢逐漸起來很多公司都是這樣起來的英偉達也是這樣的對英偉達也是這樣起來的所以我覺得還是充滿機會對我不覺得一定要做你如果現在開一間公司要跟那種OpenEye和Soap做一樣的事情很危險對你的資金絕對沒有他們雄厚然後你沒有客戶你要怎麼去累積然後他們這麼大的資源可以把東西做便宜然後你不容易摧傷所以你要去解一些痛點是他們沒辦法去解的不是他們不想解是他們沒辦法去解他們不能justify為什麼要去解這件事情所以哪怕是你要做大模型這件事情本身最後你也要找到你自己獨特的生態位不管是OpenAI還是Anthropic我們可以看到Anthropic它早期是被認為是落後OpenAI的但它是最早相信Coding的當OpenAI在做分散式投資把雞蛋不放在同一個籃子裡的時候那個Answabi是做集中式投資然後最早去做出這個coding這個東西的所以他那時候就看到了一些那個就是機會然後他又堅信就決心把它做出來所以我觉得对创业者而言应该就是要决心要去看到一个机会然后去看到一个就是你独特的机会运用你的资源把事情做成但是今天不管是硅谷还是中国大家又开始全部同质化的都在做coding你怎么看这个现象你觉得这是对的吗每個公司做這件事情背後都有不同的目的那我不是站在他們的立場我無法去講但從我角度來看就是這其實是很辛苦的一件事情你說的是同質化競爭同質化競爭是很辛苦的一件事情我覺得他們做這件事情可能是被迫的因為這是本身是一個重要的一個technology任何人都不希望自己核心科技是被掌握在别人的手里对吧那但我不觉得这个是他们计划的全部他们一定有其他的计划去做出一些差异化你没有差异化就没办法做出差别性的产品最终还是要差异化我觉得是刚才我们其实回溯了你的很长的一段经历那你觉得你作为就是刚到美国时候的那个第一份工作的研究员刘明玉然后到后来变成了一个在英伟达变成了一个techlead然后再到现在是一个VP研究的VP你觉得你在不同时期解的题是一样的吗嗯scale是越来越大嗯然后那个这个scale指的不只是管理的scale对吧對,不只是管理的scale,不管是運算、人員的scale,然後這跟整個AI發展也有關係嘛,AI從探索到可以落地,那就是一個變化,然後這些不同的時期都有不同的經歷,有時候還是會懷念以前那些各種方式都各種東西都不work,整天想什麼東西會work的時光。 為什麼? 有多種可能性的時候也蠻開心的就是多個選擇多選擇會給你一種開心的方式現在的狀態就是也有很多選擇只是就是我覺得愈來愈缺勁我自己蠻喜歡就是回到事情的最核心然後現在發現就是很像是現在的寫法都是重劍無鋒打巧不攻就是很扎实的一步一步把这个贝塔音法做好然后就把东西写出来在这个知性过程当中我也觉得是一个很不错的历练从里面学到很多东西怎么让这个幫助團隊看到最核心的本質然後去提升這個執行力但同時間又在可以創新的地方讓團隊做出重大的創新來去跟上這個時代的變遷我覺得各種時期有不同的挑戰都很有趣從一個研究員到英偉達的VP這個多見嗎我可能是第一個吧你是第一個對你覺得為什麼呢這是我想問你的我在英偉達前幾年是每一年跳一節然後就一直跳跳跳就到VP了然後我覺得是因為我早期在NVIDIA還沒有AI人才的時候我就在那裡就是幫助公司然後提升不管是AIResearch的知名度或者是解釋AI怎麼影響公司然後我自己又很喜歡落地就是一步一步就是獲得公司的信任公司就願意把這個越來越大規模的專案給我做像現在想想看就是整個團隊這麼多人運用這麼多運算資源每天都是几百万美金就是的运算成本啊储存成本我觉得就是纪念雷月啊就是公司有一定的信任才有这个机会去带这么大的project嗯所以你跟公司align非常重要对吧对一个纯粹的研究员的天性和一个管理者可能是有某种程度上是相悖的對,研究員要創新,研究員需要recognition,然後recognition有時候recognition跟公司要的recognition可能不太一樣。 嗯,那你在成為管理者的道路上有沒有可能就是抑制一部分研究員的天性呢?
有沒有可能是在戴著鐐銬跳舞? 我覺得我還是一個研究員我還是常常讀論文然後我有時候會做一些實現然後去理解我最擔心在成為這個一路成為管理者的歷程當中我最擔心一件事情就是我跟底層脫鉤我不理解就是問題的核心所在然後我會強迫自己就是呃review大家的code然後呃去讀paper然後去challenge每個人的idea然後跟大家做一些就是等於就是debate來確保這個方向是對的我很呃跟我公司的人大家都知道就是呃我可能是少數還繼續在看扣的VP然後還是繼續會就細節但我我覺得我如果不這樣做我我當然我我知道我的任務不是一個不是成為一個很能很能去實現的人但我是覺得我如果不做這些東西的話呃我自己会不理解痛点在哪里我将就更不能去理解大家每个每个人对这个专案的贡献在哪里就是我是希望自己一直staygrounded看清楚一切然后这样可以帮助团队成长然后也可以看清楚谁对谁谁的贡献在哪里如果说过去20年就是你到了美国之后的这20年对你影响很大的几个人你会说谁啊但第一個就是我的製造教授RamaChalapa他把我帶進這個DeepLearning這一行他非常厲害就是然後他也是非常善於溝通然後他可以讓任何場面都是充滿了歡笑其實是這種很嚴肅的這個ReviewMeeting然後他對人都非常的尊重然後就是跟他那邊學到很多東西然後再來就是我在我實習生的我做實習的第一個MentorAnselDuzal啊他就是手把手教會我很多那個門訓能力的東西啊他對我影響非常非常大到英偉達之後就是多半跟這個同儕學習就是那個stylegame的一作我也受他影響非常大對是哪方面影響他對東西追求到機制你如果讀過他的論文你看他做的實驗分析去把這個本質套出來這個過程這個堅持啊我跟很多不同的研究員合作嘛在那個時期然後那時期很多研究員就是一個想法寫一篇paper同時間一個區域大家可以寫20篇paper或是40一年可以寫個40篇paperTarot就是每年只想寫一篇paper那就是把他所有的他也工作也非常努力那就是把所有的就是人生的精力啊就投注在同一個idea越賺越細然後問題的本質然後產生重大的貢獻這樣壓強更大就是這個stayfocus這件事情是我可能是從這裡面從這些人共識當中學到很多東西嗯那老黃呢他對你有影響嗎非常大的影響嗯他是一個工作非常認真的人我在早期加入英偉達的時候他常常會傳論文叫我看傳論文對叫我看然後我就要寫一些summary給他幫他講是什麼事情他是一個非常熱愛學習一直去學習一直去理解他當初也不懂computergraphics他敢踏入做GPU他去把computergraphics學起來他也不懂deeplearning也踏進AI只懂deeplearning對然後就是他強大的學習能力強大的興趣一直往下走他不懂他為什麼敢投入呢他有一套自己的那個決策法則他就是叫firstprinciple他就是他會把事情的本質把它理清清楚不會受到外界的訊號的干擾他就是看得很清楚就是說這方向最makesense然後就往那邊走他在早期就敢allindeepmoney,讓公司獲得巨大的領先,在早期就敢allin庫打,讓公司產生這個很好的foundation。 我在認識娟臣之前,我覺得我的決策就是都是偏比較短期的,然後我看到他怎麼去做這種長期的決策,然後堅持,然後我覺得影響非常的驚人。 那他還有一些很驚人的地方就是他的他的每天的信都非常的多郵件是嗎對郵件郵件都非常多但他都是很仔細的去讀然後去找一些別人看不到的訊號然後做出一些那個重大的決定而且他是一個很理性的人你當你事情很多的時候你如果沒辦法去做partization就是把重要的事情去做的話就是你把時間放在不重要的事情上面你就不會變成做出重要的事情所以你決定哪些事情很重要是很重要的一件事情thepolarization然後我我自己是這樣推想的他強迫自己每天讀大量的email強迫自己快速的就決定什麼是重要的什麼是不重要的在每天不斷練習之下看的事情看得非常清楚嗯好當你看清楚事情什麼是重要什麼是不重要的時候接下來都是執行那很多人執行的時候會把自己的個人情感放在裡面就說這雖然不重要但是我跟那個人不錯然後我是不是應該讓他去做他不會這樣做他就是就是他就是覺得說我真的目標就是takecare整個公司我只要一直對我做對公司最重要的決定你只要留在公司裡面我就會takecareofyou嗯對然後然後我就從裡面去學習他怎麼去做polarization然後我覺得這件事情讓我印象非常的大就是我現在當researcher的一年的時候可能同時處理兩三個project我覺得好累啊每天要換兩三個topic然後我現在幾乎就是每半個小時換一個topic然後呃我覺得以前是沒辦法想像我自己做這件事情但是在這種不斷的一直做contextswitch的狀態裡面也幫助我去更加的理解什麼東西是比較重要對然後這是很重要一件事情然後還有一件事情就是如果你學過computersciencecomputerscience最重要的一件事情就是藍洛就是不用算的東西不要算可以晚點算的東西晚點算可以直接就是一個no就全部一個no那你人生就是這麼多時間你經歷了這麼多如果你能知道什麼東西不要算就把它移除的話你的人生運用就更有效率所以我覺得還是很值得去學習computerscience不要因為AI就不去做computerscience老黃又把什麼排入了他的計算範圍之外每個時期不一樣每個時間點不一樣對這不是永遠固定的嗯比如說現在呢他要處理的事情實在是太多也很難說現在什麼東西不是重要我我自己看到的東西跟他看到的東西完全不同的等級嘛他看到的是他等於是全球AI重要的一個推手對吧那他看到東西遠超過我看多的東西那我不好評論他覺得現在什麼東西覺得不重要嗯,你是怎麼保持自己的精力的? 你有什麼一些技巧啊?
我是很喜歡運動的人,我以前喜歡做這種團體運動,打籃球啊,打網球,那我後來就是,我還有一個很大的興趣就是,我是一個呃投入中国功夫很多年好几个10年就是从18岁开始就一直在练习中国功夫的人嗯对我听说你练功夫是吧对有功夫老师有功夫老师我的我的武术老师是徐记他是一个很有名的武术老师他的老师是刘云桥刘云桥老师是李舒文当初是神槍李樹文是滄州的武術家的代表他的八極拳屁股掌對整個武術是一個重大的貢獻他所整理出來的八極拳屁股掌那我真的很有幸就是在台灣那時候因為蔣介石的關係有一群武術家到了台灣那我的老師徐濟在那邊跟劉雲橋學那我跟徐濟學才去學會這些生物武術那武術就是一個很好的身體的鍛鍊不管是心智啊然後磨練啊對體力啊對心智磨練都很好武術還有一個好處就是它是只要一個人就可以做運動所以我早上起來就是做這個武術的鍛鍊最近在那邊做訓練啊蹲撞啊打打拳啊然後我最近還有一個新的嗜好就是叫icepunch就是你用一個冰桶然後把像運動員一樣做完激烈運動之後跳進一個冰冷的水池裡面然後就是幫助身體的修復我覺得這東西也幫助我保持著勁力可以面對每天高強度的挑戰這都是你上班之前要做的事情對和我對你的印象還蠻不一樣的因為我每次看你都是一個非常謙和的人但是你還是做一些相對有一點激烈的運動對吧哦冰水啊武術呀是但我學武術的目標不是為了打架是一開始是受到金庸小說的影響那樣就是對這些中國武術充滿了興趣學了之後發現是對自身的一種磨練中國武術最重要的就是控制全身、控制自己因為你要發揮要打出一拳的時候最大的力量會來自於全身協調可以把力量從腳一路灌到了手這麼長的路徑你要控制到全身協調這個力量傳導是循序就是一步一步到位是很難的因為都一瞬間發生所以你要經由不斷的練習不斷的自我修改然後我覺得這個跟我喜歡一直自我檢討一直追求都有很深的影響然後我並不是就是為了展現我就是強大的破壞能力啊我是啊就是我覺得後來變成一種對自己的追求嗯你的性格这种比较温和你能算温和吗你的公司应该不这样吧当然不是这样做久之后都有点恨蝶不成钢然后看到呃年轻的研究员就是差那么一点火候就可以把事情做更好就会忍不住就会呃提出来啊所以还是会凶的对吧在公司里面我是我觉得是一种呃是一种直接指出这些问题所在嗯取决于听的人聽的人如果是覺得我是正面的他就會很開心因為這世界上不是每個人都願意跟你講出什麼地方可以做進一步的提升對然後他們可能會感激我跟他講說這個地方你可以做得更好但如果你聽者是覺得說我就在挑剔的話那你就會覺得我很窮嗯你這個希望能夠一擊之勝的課題是不是Cosmos就是我们整个组只有一个project就是cosmos对然后我是非常专注在做cosmos我也就是就是我们就是希望透过cosmos来对这个世界产生巨大的贡献嗯这也是你接下来也许长达十年最重要的一个课题吗是的呃我们做完我们做完cosmos一的时候问那个杰森要不要继续往下做嗯然后杰森跟我说你就做到cosmos97對我現在做到三而已所以還有94代可以往下走為什麼不是10是97他是隨口說的就是他數字是隨口說但他的決心是展現在他這個數字上面他是認為這是一個重要的方向然後希望我們可以繼續專注去做這個物理AI的foundation來幫助整個領域往下走嗯我们接下来重点来聊聊cosmos和世界模型吧也是你当下最重要的一个议题我看你在你的个人主页上说你一直被这样的一个愿景所驱动就是为机器人构建一个黑客帝国你们尝试一下这个愿景我認為事件模型可以幫助這些啊巨聲智能啊有來做到這個泛化效果嗯那我覺得任何AI的問題要解的問題就是這個泛化的問題你能不能在你看過的訓練數據之外也能表現的非常的好泛化對不對就是在這個coding啊在這個chat裡面都是去解去訓練模型讓他可以去解在他訓練沒看到的東西的問題很就是變得像人一樣對吧那物理世界的AI也不例外就是要解放化的問題那解放化的問題在Cosmo這邊我們是想這樣幫忙三個點第一個提供更好的數據第二個是提供更好的啟示點然後第三個是提供更好的環境數據是你可以用生成數據是幫助AI模型更加泛化的關鍵就是你可以想像這個世界上你看到的數據就是這麼多的點你可不可以去生成一些你需要看到但是你真實世界你沒有採集到的數據我把它叫BetterData那再來就是如果你可以訓練出一個好的世界模型這個世界模型理解世界怎麼運作可以去預測未來會發生什麼事情這樣的一個模型它本身的這個Representation是不錯的其實是可以提供一個物理世界AI不管是PolicyModel還是什麼Model一個更好的一個Backbone從裡面可以去就是衍生出你想要做的Policy這是更好的啟示點更好的數據更好的啟示點那第三個人是怎麼學習在這個物理世界學習呢就經由實驗經由跟這個環境做交互跟真實環境做交互往往是比較昂貴的然後你能獲得經驗累積的時間是短暫的就是一個機器人嗯如果說你可以用這種像黑客帝國這種學生的方式可以同時產生多個環境真實無比的環境你可以跟他交互然後給你訊號你是可以學習的非常快的那就是更好的環境更好的數據更好的起始點更好的環境那裡面最具有挑戰性的就是更好的環境我不想在我的網頁裡面把它寫的非常的長像一個essay一樣就提出了像黑客帝國這樣是一個比較好的一個就是幫助大家理解我們想怎麼做怎麼幫助這個physicaleye的communityCosmos這個在內部具體是怎麼立像的這是24年還是25年嗯24年吧应该24年开始做的大概24年3月份左右我们决定要做然后就是在sora之后对在sora之后就是完全是那个时间点啊对对然后大家都在想说啊这个啊是充满了决心一定要做然后很荣幸的Jensen就是信任我啊那我去带这个project說服他的過程難嗎? 在這件事情上那時候已經不難了之前要說服比較難但看到SOA之後就不難了他是很聰明的人他一看就知道這東西對公司的影響而且他是一個很有紀律的人有些東西即使很重要他會叫你PacePaceyoursteps就是讓你不要急他擅長打馬拉松戰嗯對所以他是很有紀律就是就是慢慢的一步一步往目標前進為什麼之前這個時機還沒到在solar之前這說到這就是嗯firstmover有firstmover的advantage對不對好然後每家公司有不同的定位對吧嗯取決於你想要解什麼樣的問題要怎麼樣活力我沒有足夠多的資訊來判斷啊但我不覺得你看像現在很多家公司都做的很好啊現在做video生成最赚钱的应该是字节吧对cdance对吧所以呃这个轨迹是很难说的嗯好到骚扰的时候觉得时机到了对嗯是你又跟他写了封邮件吗是我们这一群在做这个生成式模型的做这种mediageneration的咨询人一起决定跟真正写邮件我猜每个人都会写吧对我们每个人都会写不是一起写一封呃我们会讨论然后一起写一封然后让大家都会加意见然后就是就变成一个公司的共识就是我们必须要把这东西做出来哦这次回复这份邮件了吗对就是把我们聚集在一起开会哦然后在那个会议上达成了共识对其实会议之前大家都达成共识嗯然后那个会议只是是更具象化到底要怎么做然后谁负责这样子你對那會有什麼記憶深刻的事情嗎有什麼場景嗎就是他叫我們去想名字嘛然後我那時候其實已經知道最後他會提出更好的名字有點拒絕不想浪費我的力氣想個名字之後他想出更好的名字但我還猜我就跟他講說你就直接跟我們講吧你覺得什麼名字好他說不行你要去思考去想我覺得有道理啊因為這個名字跟產品的定位會非常的相關嗯你看我們叫Cosmos是一個就是那種宇宙我们目标就不是产生这个content,不是为了要做创作,就是为了要解物理世界的问题,才慢慢往物理AI这边前进。 因为SORA其实是一个服务创作者的一个事儿。 他早期的demo是这样讲。 为什么你们当时选择就是physicalAI呢,就是面向的这个市场?
那時候已經陸續可以看出來就是那個PhysicalAI它會是下一個Revolution因為這個是個鋼鬚嘛就每個人都會老花每個地方都缺乏勞動力每個人都想提升更好的生活品質还一方面来讲就是NVIDIA是走这个developermarket就是帮助这些开发者就是做出更好的产品我们自己不会经营一个社群网站也不会去建一个创作工具这有点太tosee了对于英伟达来说所以你们定了我要做一个世界模型然后这个世界模型是为了physicalAI的为服务physicalAI的community嗯對今天大家對於世界模型的定義還是非常不清晰你跟我們講你的世界模型的定義吧我是個很講究實用性的人嘛那人為什麼會去設計一個模型呢就是它可以用那用法有很多種對不對比如說你設計一個模型設計一個模型來描述這個世界經由這個模型你可以去預測接下來會發生什麼事情所以它的目的是為了預測對不對這是一種世界模型的為什麼去設計世界模型的原因用處預測那另外一種是你想去理解為什麼這事情發生了你某方面來講整個物理學就是去建世界模型去了解這世界是怎麼運作從這個牛頓力學一路到這個量子力學就是去了解這世界怎麼運作也是建一個模型嘛然後去幫助我們理解怎麼運作那當然從deeplearning裡面我們把這個understanding就是經由一些標準的數據去去教這個模型這個東西會這樣是因為發生這件事情然後然後經由大量的數據泛化然後幫助未來新的事件發生的時候你經由這個開到的視訊號然後去解釋幫助人去理解發生什麼事情比如說這工廠在工廠裡面為什麼這個地方突然間產線卡住然後可能是之前某工人忘記把什麼東西打開也是一個這世界模型建的也是一個目的性就是為了去理解發生什麼事情找到問題對還有另外一種世界模型就是為了要去重建這三維的世界重建這三維世界有很大的用處你可以去規劃你東西路線要怎麼走然後你可以就是讓人去體驗一下你人雖然生不在這個真實世界但你可以在虛擬的狀態下去在這世界裡面做遊歷就是模型fortheworld然後因為你的用處不同所以它的模型的型態長的不一樣終究我們是在同一個世界裡面這些模型就是不同的就是經由不同的觀察來去描述同一件事情那種重建是重建是一個很重要的學問那我自己本身就是以前做過重建那我現在已經不再在做重建了我現在就是主要是做物理世界的理解跟物理世界的生成對不對就是prediction這些事情就是大家都會對世界模型有不同的解釋現在定義什麼叫worldmodel在幾年前呢同一件事情發生就是大家定義什麼叫AGI對不對然後經過這麼多年還是沒有一個共同的定義對然後我認為去定義worldmodel很可能會走向同樣的道路我覺得沒有可能不是很重要的一件事情這是因為這個詞太大了嗎過於籠統对,是过于笼统,那就是定义出来后对人类有什么影响? 那为什么LLM就是一个相对精确的词? LLM就是LargeLanguageModel,它的模型很大,然后做language,对。 就这个词为什么大家都是一个有共识的一个精确的定义,但是世界模型大家一直在争论不休? LOM就是LargeLanguageModelLanguageModel就是可以predict接下來會發生什麼詞彙嗯對吧Large代表說它的模型很大對這很明確嗯對吧就是世界模型就是一個可以幫助你去model這個世界的一個工具嗯那你model這個世界的一個工具你要做什麼用途呢那因為用途不同所以你model的世界方式不一樣所以當只要你對這個世界這個模型有不同的用途之後就有不同的定義所以你覺得世界模型能夠描述cosmos呢還是應該用另外一個詞來描述你在做的事情哦是我们一开始的时候我们是把Cosmo叫做那个WallFoundationModel嗯我们目标是建立一个Foundation让大家都可以建出适合他们要用的世界模型所以我们把自己叫FoundationModel是因为我们希望我们是一个更底层更底层的东西来满足大家嗯所以我我所以我是这样我是这样我们是这样定义的就哪怕他是一个要做世界模型的人他也可以基于你的FoundationModel来做是的你是希望提供那个基座是的我們要提供這個基礎對就是我們認為世界模型將是在PhysicalAI裡面重要的一個環節但不是每一個想從事PhysicalAI的公司都有足夠多的資源去做自己要的世界模型從零開始做但他們有需要為了幫助他們我們就做這個Cosmos這個我仿的漩漫因为你们也同时投资了LeCun的AMILabs和菲菲老师的WorldLabs,你们做的世界模型有差异吗?
就是NVIDIA是站在一个Enabled的角度,我们希望就是凡在我們的這個GPU的ecosys上建立的公司我們希望幫助他們成功我們希望大家可以一起走向成功winwin然後每個公司看到的點都不太一樣想解的問題也不一樣說會有各式各樣的啊就飛的我lab啊楊磊坤的這個MI都是不一樣走不一樣的路線那我們都幫助他們然後也希望他們成功我們投資他們我們跟他們也有合作那如果說他們對我們的Cosmo東西有興趣他們可以利用那其他家公司他們需要我model但他們可能沒辦法不像飛或是楊磊坤資金雄厚對他們可能更需要幫助他們可以leverage我們的Cosmo我們目標是幫助整個領域成功那這幾家重要公司我們當然希望成功但我們還有很多需要去幫助的人所以你們有競爭對手嗎我覺得NVIDIA競爭對手就是跟NVIDIA做同樣的事情的共識嘛就是去做這個整套AI的這個Ecosystem那你說沒有競爭對手那有些公司也做出算力嘛我在做Cosmo的時候我是不想競爭對手的我想的就是怎麼去幫助這個Ecosystem在我的Ecosystem裡面在NVIDIA的Ecosystem裡面的這些用我們GPU用我們運算平台用我們軟體的公司他們如果都有成功的話那leader就會成功對吧因為他們然後會幫一些還沒在我們ecosystem會產生信心那我覺得這是幫助防止我不再想競爭了我已經過那個時期就是為了要畢業把論文發出去是我的算法要比別人好是我現在目標就是要幫助這個領域可以一起往下走嗯,因為從第一代到第三代的Cosmos其實也經歷了很多的變化。 是。 嗯,你們在第一代到第二代的過程中有沒有什麼,積累什麼能耗? 是的,就是第一代。 覺得是去年的工作。
對,這個步調很快,那那時候開始做那個Cosmos的時候,我強調一個點就是我們要迭代快速,那時候深受DeepSeek的影響。 哦。 因為,DeepSeek是很驚人的公司它可以一年內迭代三次產生DeepSeekv3所以我一直強調我們要迭代的速度快迭代的速度快代表我們可以一直不斷的進步嘛一代比一代好然後但是我們那時候挑戰的題目是這個物理世界模型然後在那時候尤其是20年不是很清楚就大家都還在摸索嗯怎麼樣的世界模型對大家有幫助那我剛講就是不外就是用世界模型是怎麼用它prediction或是understanding那就是做這個種videomodel來幫助predictfuture然後或是做這種listeningmodel來解釋發生什麼事情嗯然後所以就是一開始的時候就是跟一些夥伴合作去理解他們的需求然後自己本身有一些想法然後就做出這些模型然後跟這些夥伴迭代之後才慢慢收斂就是在過程當中就是慢慢的收斂從我們那時候做了predict之後可以預測未來然後想說仿真環境是大家常用的環境但它的生成的這個video就是跟這個真實世界的訊號一定有差距可不可以就是用這個模型來幫助它跟逼真那就做了Transfer那為了解釋發生什麼事情就做了Reason當然是三個對然後後來理解到說我如果可以去描述這個Pixel是被這個Pixel是怎麼變化的那我這個Pixel變化跟我這個Action的變化其實很接近的所以我們要做一個叫Cosmopolicy給一個PolicyMarble然後後來陸續的發覺就是就像剛講的一樣這是同一個世界不管你從哪角度來看你model是同一個世界你模型就是在學一個internalrepresentationoftheworld就是這個世界你在做壓縮過程當中學到怎麼樣的一個表示方式那既然是同一個東西那還有一個東西就是FoundationModel它的核心概念就是一個可以納百穿就是可以從各式各樣的數據裡面去學會這個模式的一個模型所以如果你可以把你TrendRecent用的DataTrendPredict用的DataTrendTransport用的DataTrendPolicy用的Data全部合在一起的話你是模型的上限更高第一個你是描述同一個世界然後第二個FoundationModel就是就是納百川把東西合在一起好那所以就慢慢的往這個單一模型走它中間還有一個是一種執行上的問題我記得我當初去建了這個第一版的Cosmo的時候我自己算一算就是因為我是希望真的模型可以幫助到其他人然後跟這些partner合作一下我可能需要這個模型ABCDEFG我自己算一算那時候可能需要2個模型然後那時候我就有個會議跟Jensen一起開會我就跟Jensen講說我預計需要2個模型傑森聽到就覺得我工作非常認真,他就說,verygood,wereveryhot,然後他就說,但是你知道嗎? LouisVuittonLV這家店呢,當他減少他的成列的貨品數之後,反而銷售是提升的你不希望太多的東西困惑你的那個消費者讓他沒辦法做出決定那個對我影響很大就是我理解到說嗯對我自己也遇到問題因為我自己都分不清楚要用A還是用B了那其他人更加不清楚然後再來就是執行上的困難第一個每個模型你出來我們不是發paper就結束走下一個paper我們要去幫助使用者去用那只要每個模型出來我們就要維護要解決問題然後當你有數個模型的時候就是很辛苦倍多則力寡然後影響到你迭代的速度所以在做1的時候是在低血的過程當中然後後來快速做2然後在做2的同時就低血到不行就是這樣做不長久所以就決定要做這個OMNIMODEL的WARMODEL就是COSMO3那就15個方向第一個是描述同一個世界嗯所以其實是可以合在一起的然後第二個foundationmodel就是吸收各式各樣的data合在一起然後在開發上也簡單很多所以就是走向了cosmos3這條道路所以二到三其實是一個大的變化是的一到二的變化是等於是數據的提升還有一些那時候在二的時候把帕拉奇帶進來是有些變化但我覺得二到三是一個很大的一個gap三做了多久三從去年十月開始做就是剛好發了2之後2月發10月份發的2對其實其實那時候在呃大概是更早的時期就知道說必須要做3然後但那時候已經開始2.5然後把2.5收尾嗯然後把2.5收尾之後大概做3所以可能3可能就是大概是9月的時候開始知道說要做3然後真正執行可能就是10月1月然後做了將近半年對超過半年一个中国做世界模型的创业者他说他看cosmos3论文看了一周而且是每天看里面有很多的细节嗯我觉得他们的观点是说就是觉得cosmos3他在技术的大的创新上不多但是他把很多的细节都工程验证出来了你觉得他们这个评价中肯吗MutualTransformer之前也有人提出,然後PolicyModel之前也有人提出我們是第一個把MutualTransformerScale到這麼大的模型把Audio、Video、Action都合在一起然後這些東西從概念上來講就是東西合在一起但你真正要把它做出來不是那麼容易那真正做出來就是這些細節所有的這些大語言模型都是順時鋒的架構你可以講大家都沒有創新但是它的那些細節會讓這個某些模型比另外一些模型好很多我認為就是這麼多年之後我就更加重視那個呃這東西能產生的效果我就往往越來越不重視這些東西是不是革命性的一個原創對我來講它有用產生impact解掉大家能想解掉問題是它的重點對那這個Paper我們是希望幫助整個開源社區就是做開源模型幫助到整個PhysicalAI那我們這幾年看到的現象就是這些FrontierLab很多都走向B源然後即使寫Paper也不願意講出那些關鍵的環節那我們決定走不一樣的道路我們把能講的東西都講得起能就是把就是盡量把東西講的非常的清楚然後能就是我們開源這個模型也開源我們怎麼去訓練這個模型的框架然後部分的這個信息的data我們都開源了我們是希望保持透明讓大家看到怎麼做也希望別人可以利用我們開源東西做出跟cosmo類似的東西如果他沒有這個興趣的話我們目標就是enable這整個community对我不担心别人可以说出一模一样的东西嗯我想到你刚刚提到DeepSeek你选择开源跟它有关系吗嗯也不算是有关系就是DeepSeek它的工作对整个AI的影响非常的深远第一个把Mitchell和Asper这个开源的一个公司然后你看到最近的模型它的用心把这个把这个逼到极致这些对整个领域都產生了深遠的影響,我覺得這很重要。 從這影響的角度來看,我覺得是相通的,我們是想產生影響,把這些細節都講出來。
NVIDIA有很多這個建在NVIDIAECOSYSTEM上面的PhysicalIoT公司,那我們希望幫助他們成功,我們的目標可能跟DeepSea是不一樣的,我們是希望幫助我們的使用者成功。 你們天然就是這個生態了。 對,我們就是希望可以幫助這個PhysicalEye降臨世界快一點嗯你們在這次為什麼選擇首先在輸入層同時能夠輸入語言videoaudio和action這是一個重要的決策嗎是是我覺得就是這個世界不是只有視覺對吧然後也有聽覺但我也想加入觸覺但觸覺的訊號還不好這個touchsensor這些東西還覺得還在快速迭代當中這個需要靈巧手對需要靈巧手需要數據那我覺得大模型啊基本上思路有兩個一個是讓language當成firstclasscitizen像coding啊像chat另外一種是讓那種視覺訊號video當成是firstclasscitizen像seedance像view我們認為物理世界的模型跟這個數字世界的模型最不一樣的地方就是物理世界的agent會takeaction會改變這個世界的狀態我們認為一個好的物理世界的foundationmodel也要把action當成firstclasscitizen這是為什麼我們把language、video跟action合在一起建這個cosmos上嗯我記得以前楊志玲跟我說他們做語言模型他就是把語言當做最重要的智能提升的工具對他會很擔心Vision加入進來就是影響他的智商變成一個傻的多麼態但是謝燦寧今年又跟我說他說他擔心語言對於視覺的污染他覺得語言才是人類的腳手架並不本質這是他的觀點所以你怎麼看待他們這兩種觀念以及你把他們這些信號都訊到一起的時候會出現問題嗎就互相的污染這些訊號他們帶進來都有他們的目的就是language可以把這些人類的knowledge帶進來然後也幫助人類跟這個物理AI做溝通對吧然後video是大量的視覺資訊或audio大量的聽覺資訊去描述這個世界怎麼運作那這個更用這個video更驚人的去capture這個世界的物理運作用language反而很難對吧但是人跟這個模型這個模型之後建出來是要服務人的嘛嗯那你他不懂language你是沒辦法跟他溝通的啊然後這個模型就是要幫助這些machine去takeaction的所以他不懂action他是沒辦法去改變這個世界的嗯應該這樣講吧就是呃我們的目的不同嗯我的我的目的是希望這成為一個好的foundationmodel來forphysicalAI他需要懂language需要知道這個東西怎麼變動然後action然後藉由這個constraint把它合在一起去做那我的目標不是去追求AGI對然後AGI本身也很難去定義嘛嗯當你定義的AGI就是純粹要去剪這個瞭解那個人類的本質的時候或者什麼啊據說coding的時候可能這些視覺訊號會影響到你啊那是必然的對吧遙遠的古代是沒有任何語言的然後這些人類的文明的發展就是經由這個看這個世界怎麼變動而產生的那你可以覺得因為呃畢竟這個這個語言是發展適合人類的但你不知道機器是不是接受這一套也許你就從這個視覺訊號裡面直接去學這個世界的怎麼運作得到一個intelligence然後發展出另外一個文明那你從角度看也許語言訊號是一種干擾對那我覺得是看你要的是什麼嗯我很明確的知道我要是什麼所以我覺得我需要language讓人可以跟這個物理來溝通我需要videoaudio去去描述去去從這個物理世界的變化啊就是去學會這個物理啊本質需要action因為我希望他最後是可以forphysical去改變這個世界嗯對所有魔態融合到一起這些魔態是相互benefit的還是相互制約的在過去一年甚至超過一年之間我們都一直在研究把這些模態的融合那我們從各個不同的研究裡面得到一些線索在Cosmos3的時候把它結合在一起比如說在CosmosPolicy那篇work裡面我們就發覺把Video跟Action合在一起是幫助Action的对就是当你在呃直接predictaction的时候就是当我们在做我actionmodel的时候我们发觉就是除了predict你要做什么action你也predict接下来takeaction之后会产生的state就是observation是帮助你做性训练或者收敛所以我们知道就是predict那个video是帮助action的就是我actionmodel的這套系列那聲音也可以幫助audio呃聲音也可以幫助videogeneration當你知道咔一聲碰到一個點你就知道接觸的時間是那個點所以知道這個是有互相這個互輔的然後一般做video的人都知道從文字到video這是一個訊息量變大的過程訊息量變大代表說有很多種可能性很多種可能性的function是比較難去學習的就是你一種東西可能有10種可能那這東西就沒有固定target不好學所以在做video或image大家都會發覺就是當你的那個文字描述非常詳盡的時候這是比較容易產生好的一個video所以你可以知道文字的詳細描述也可以放這個影片我們做這個Cosmos3就是想把之前這些CosmosReason,CosmosPredict,CosmosTransfer,CosmosPolicy這些東西合在一起合在一起本身就有它的好處了整個東西都簡化了那這些訊號怎麼合在一起讓它產生互補的作用而不是互相抗拒的作用這是可以經由實驗的設計經由這個data的比例的調整來達到的所以我們那時候是堅信著這些訊號都是描述同一個世界這些訊號都含有這個世界怎麼運作的資訊是應該有一種方式讓它們合在一起會互相幫助嗯更多訊息幫助你了解這個背後的運作的原理是什麼對所以有這樣的believe然後從這方向出發所以這裡面有什麼secretsauce嗎在互相benefit上其實做大模型沒有什麼secretsauce做嚴格的實驗假設實驗看到結果累積知識再做下個實驗就一步一步一步往下走走紮實的做就對了沒有什麼我不覺得有什麼就是不可告人的秘密就是你要追求的東西耐心做實驗證對了下一步就這樣走因爲你們這次采取的是一個雙塔的設計,一個塔在處理離散信息,一個塔在處理連續信息,爲什麽采取這個設計? 有很多個原因一開始的時候CustomerReason就是離散的從那個VisionLanguageModel出發那PredictTransferPass其實是連續的所以就是我們知道離散的WorkforUnderstanding我們知道連續的WorkforGeneration那把它們放在一起就是一個現階段很合理的一個選擇然后再就是有很多种用cosmon的方法但常用的是做posttraining就是也许用你的videoaction的pair来去traingenerator或者是你只想用reasoner只是用你当初自己domain的这些understandingdata来train当你有两个这样可以合在一起可以把gradient的影响切开的是帮助客户去使用的如果我們全部連在一起好那就是generation跟understanding在一起了我現在要換這個generation的distribution在換的過程中因為全部都連在一起你的data也會改變你understanding那邊的表現如果你沒有兩個套而你是一個的話那Understanding那邊既然要改變那你的Data又沒有Understanding的Data同意這個Understanding的部分就流失了那就不方便客戶使用所以分成兩個是對使用上是有一定的幫助的雖然它相對起來還是不夠Elegant因為你還是要事先決定它的架構在整個DeepLearning就是讓Data來決定這是怎麼說而不是你人為去做區分但是在這個階段我覺得這個東西是比較合理比較適合它使用那講到這個東西也可以大家可以猜出來就是我們下一步目標是更加簡單一點為什麼要兩個套一個套就夠了但是我們在往一個套的動作的目標前進的時候我們要考慮到這些使用者是不是容易用上它因為我們不是我們的目標是幫助大家贏而不是自己就是產生一個就是可以做很多事情的模型我們相信機器人每個都不太一樣有個相機的數量相機的位置然後自動車每個都不太一樣我們需要我們覺得需要克制那我們要機制合在一起去追求這個工程的這個簡約完美我也要考慮到使用者是不是有辦法去利用它那這是我們必須要研究的課題但是相对来说离散的信号更好处理把融合进了连续的变量之后它的处理难度会变高你们怎么合在一起并且能够把它scale上去呢对现在有一系列的work像transfusion它是可以同时处理这个离散跟连续的在做nettokenprediction的时候它是做离散的然后在做defusion是连续的是通用同一个套路然后这段时间有很多种不同的然後就是變異大家在研究這個大家都關切的問題這些訊號可以用離散表示也可以用連續表示然後我是希望也許是不是開發這種架構是全部離散或是全部連續讓事情相對變得更簡單一點那當然這是一個理想也不確定能不能成功也要做一步一步的實驗證往下走直接來看離散更容易還是連續更容易嗯各有各的好處離散比較好做訓練然後連續他有他的漂亮的地方就是在做influence的時候他們兩個是很不一樣的一個shade然後最後最關鍵的就是做客戶還是要部署啊部署的時候一些成本的考量都很重要所以我覺得最後就是會根據部署是最適合啊什麼樣的怎樣的模型最適合部署啊就我覺得是最容易獲得成功所以有很多的方向要要記得聚集在一起考慮有一个研究员问你,因为你现在是把所有的模材都训到一个模型里去,那理论上就是它也可以coding做得很好,也可以让机器人能够运作,然后也能够生成我们现在这种创作者的内容,那它有可能在就是单一维度,比如说coding上比cloud还要强吗? 我还是喜欢讲这个孙子兵法讲的被堕者立狂。
對就是如果你什麼都要好的話呃你當就是在訓練過程當中你要博學多聞你要觸碰很多不同的的列別讓你提升你知識水平當你確定你只需要用這個單一的application的時候是不是有些調整是因為你你不care其他東西了有沒有東西是你願意放棄然後就是做比較好因為如果你什麼都不願意放棄的話你就會打得很辛苦我覺得策略往往就是關乎著你決定你可以放棄什麼東西這雙塔之間會互相的提升嗎我们知道就是我们在这个paper里面有个实验就是说当你用更接近physicalAI的reasoner的话可以帮助你做更好的physicalAI的generation然后我们也知道就是说如果你可以把generator的轨点传回这个reasoner的话理论上是可以帮助你的reasoner做更好的representation学习在這個paper裡面受限於時間我們並沒有做成完整我們想做的實驗已經很多實驗了但是就是這件事情這個foundationmodel開發本身就是一個很好事一個決定就是都是兩三個月前就做了很難快速的去做一些就是調整我們是我們不把這個三看成是一個終極就是我們會繼續做3.12一步一步往下提升把一些我們想做進去的能力想做的一些研究這是沒有機會把它給呈現的繼續補下去除了可能會更簡單雙塔有可能會變成一個塔還會有什麼在未來模型中可能大家會看到的一些變化我們很關注的就是這個模型怎麼去幫助那個physicalAI的builder然後這個模型推出去之後據我所知就是大家都在討論然後有些partner有些同學都給了蠻不錯的feedback泛化是一個核心的問題任何AI的核心的問題那在物理世界的AI裡面我覺得一種我們需要達到的泛化就是假設我今天呃教機器人說我的衣服我喜歡這樣折然後喜歡這樣放我就給這個機器人看一兩次我怎麼做他是不是就可以快速學會在在現實生活中就快速學會這個東西然後是不是給這個physicalAI讀了說明書他就知道怎麼去操作這個儀器怎麼在這個工廠裡面做那個檢測那我觉得这些东西是很重要的能力是PhysicalIsland达到的那当然这些在落地的时候有很多考量我是想说在这个FoundationModel部分是有什么东西是我们能做的然后可以来帮助这些PhysicalIsland的Developer所以我们中间的提升可能都是会朝着这些提升这些放话能力的角度来去把这些东西加进Cosmos模型里面比如说你们为这个有哪些具体的优化呀優化是像加速那些是一定會發生的我們當然是希望這個模型可以越跑越快然後另外一些優化就是能力的優化、繁化的優化對那這個東西就是可能會改一些架構上或是一些training的objective的改變或是用一些特殊的就是curate的data來做這個訓練不是很清楚所以要測試喔它還是一個實驗科學對,是實驗科學齁就是我常常覺得那個deeplearning就很像中醫一樣喔就是試出來的試出來的對然後那個在試的過程當中你做詳細的實驗紀錄從裡面去理解那個中間的法則嗯然後我覺得這是是很有趣这两个东西我觉得很像然后我觉得做严格的实验然后控制变数然后得到一些关键的结果是自模型迭代的重要的那个一步也有研究员提出这个模型的语言渲染是不是可以把它的比重加的更大一些因为他们还是认为LLOM是提升智能的关键你认可吗我覺得在早期的這個ImageGeneration的研究包含ImagineGoogle的Imagine裡面就提出了當你的Language的Understanding越強你用更大的T5Model你的ImageGeneration能力更強我是相信的你用更大的SemanticRepresentation應該會幫助我是同意的畢竟PhysicalAI的應用跟大家常講的Coding或是Chat還是不太一樣所以還是需要做一些實驗的驗證我想做的事情是了解真正的痛點然後從這痛點裡面去找到合適的方式來把這個模型能力補強有些大家得到的訊號那更好的這個模型那麼當你沒有資源的限制的時候你當然是會放進去好但呃比較有挑戰的就是當你資源有限的時候你怎麼做取捨嗯所以也許對於場景來說智能可能不是那個最關鍵的變量你需要你的機器人會解奧數問題嗎你需要你的機器人會解這個扣定的問題嗎嗯我覺得你可能更關注他能不能把你的那個工廠要組裝的東西做好我家庭的衛生呃就是把它這些操作把它做好對吧所以我覺得呃這個你要解的問題似乎是跟這些大元呃模型公司這種agent公司要解東西是有點不太一樣嗯然後所以呃既然是不一樣的題目然後最後這個解這個題目的這個成本都是一個重要的因為如果要商業化最後成本都是一個重要的考量那在這些條件之下它的架構真的會跟現有的這些foragent的模型是一樣的嗎這是我一直在思考的問題你現在有初步的答案沒有有沒有一些直覺過去的就是綜觀人類的歷史答案就是應該是不一樣對吧然後你你要做耕田的工具跟你要做紡織的工具是不一樣的所以職業產是不一樣最後就是貝多者利果老祖宗的智慧還是蠻管用的Cosmos你們未來會投入多少卡和資源這個我們一直在卡一直在提升當中我不知道我這邊方不方便講這個卡的數量但就是我們希望我們已經在萬級了然後希望可以再更多更多嗯這會是英偉達最重要的一個模型的項目嗎英伟达有数个模型项目然后我们主要是把它分成两类一个叫AgenticAI就是要做这个CodingChat然后去Agentic这种DigitalIntelligence的这套这些客户的需求在这里面我们有这个Nemotron的Model就是他们这个团队最近release了这个Nemotron3Ultra得到蛮不错的效果那在PhysicalEye這邊主要就是Cosmo這個模型Cosmo是一個BaseModel是一個BabelModel那NVIDIA也很關注自動車也很關注機器人然後也關注工廠對我們而言這些都是PhysicalEye的運用那在自動車上面我們就有叫做AlphaMario的Apple它呢是在Cosmo上面做的Specialization就是外面做自动车所需要做的这些优化那Goods是在Cosmo上面做对机器人相关的用法然后还包含这些holdbodycontrol的这些东西我是把這些做自動車內部做自動車做機器人這些看成是也是我的客戶然後也希望幫助他們成功然後在physicaleye這邊就是cosmo為核心來去輔助這些主要的downstream的這個開發者可以獲得成功所以主要是兩個你說是不是最重要呢這兩個都很重要digitalAI這個怎麼用agent怎麼做coding很重要那physicalAI也很重要很難講誰比較重要對但現在打得最火熱的就是這些agentAI的東西那physicalAI是下一步physicalAI在你們看來會是一個多大的市場這個應該是一個巨大的市場我不確定估這個市值不是我的專業然後我也不方便代表公司講多大但是隨著人口的老化隨著製造業的自主的需求然後還有各式各樣的應用我們覺得這像是一個巨大的市場嗯,因為世界模型現在缺乏有效的評估方法,你們有一些好的探索嗎? 世界模型,大圓模型,大家都在追求更好的評估檢測的方法。 嗯然後呃就是一般來講呃模型的評測有三步第一步呢就是benchmark啊就是有一些呃固定的dataset你去量上面量測它的quality然後第二種是arenastyle就是a跟b比看誰比較好那第三種呢就是呃跟著aspir去真正有這痛點的人然後去去解這個問題那我覺得這三個都很重要在physicaleye裡面第三個特別重要因為每個就codingagent大家都在解coding的問題digitaluse是問題但physicaleye每個要解的問題不太一樣對然後所以我更加強調就是跟這個客戶跟這些願意一起合作的夥伴一起去了解怎麼樣去評估一個模型真正有用還是沒有用那这不是一件容易的事情,这个是给模型发展指引方向的重要一步,我觉得在未来的发展当中这一步会越来越重要。 数据也是一个难点,你们这次是怎么做的呀? 数据是一个难点,尤其是在physicalAI更是困难,因为physicalAI每个形体都不太一样,然后收集数据你没有那个physical的setup就没有办法去收集这个数据。
然後在英文的角度更加的困難,因為我們是要服務各個FishGuide的這個開發者,每個的機器人都不一樣,所以我們能做就是找最容易共通的,覺得就是FishGuideData主要有兩種,一種是Navigation的Data,從A到B。 另外一種是manipulation的data怎麼用那個手或是tool去操作完成既定目標那navigationdata比較容易做就是你camera怎麼動車怎麼動機器人怎麼動這些都可以收集那機器人A跟B即使他們不一樣但他動起來就是在空間中位移有時候可能加一些旋轉所以是比較相同的那操作這邊就比較複雜我們發現一個趨勢就是大家越來越追求接近人手的這種機器手臂然後論點就是說這世界人類的世界是建出來給人類用的所以大部分的工具都是適合人手去操作的那整個AI呢需要大量的數據然後如果你的數據越好取得你就容易更快的要突破所以大部分的收集數據者是人人就是手所以两个环境两个条件啊就是人手适合收集数据然后第二这世界是大部分建给人手的所以就今天看到大家往人手的方向啊前进那所以我们在这cosmos3的时候啊也就是啊特地把这个egocentury的data给加进去又包含了这个人眼怎么看这个东西从第一人称然后还有人手怎么去操作这个物件所以因为因为我们的目标不是不是去做出一个机器人,我目标是帮助大家可以做出很好的机器人,所以我们要找最容易可以互通的东西,那我觉得egocentric对大家是非常重要的。 在刚才说的那些现在的限制和局限之下,英伟达有显著的一些优势吗? 在英伟达获得GPU运算的成本比较比较便宜毕竟我们生产GPU嘛然后再来就是我们在PhysicalEye这边已经深耕多年了我们有这个Solr这个chip然后也有这种ISAC的simulator然后就是所以我觉得这些东西合在一起我们提供更多的工具來滿足各式各樣physicalAI開發者所需要的需求那還有這點是我們是真心想幫助其他家公司成功的因為我們就是我們清楚自己能提供的服務在哪裡然後比較不會有這種一直就是比較我覺得客戶往往比較願意跟我們一起合作因為我們是我们不会说就是跟你做一样一模一样的东西然后帮你啊就是灭了对不是这不是我们的目标对哦嗯这个模型让你非常满意的一点是什么然后让你有点遗憾的可能是什么滿意的一點就是我當初跟大家講說可以把過去的所有模型合在一起還會做比全部之前的模型都要好這件事情發生了我們現在的模型比過去單獨立的模型效果都要好那時候很多人不相信那我覺得很開心然後第二個就是這個是我們第一次就是把整個團隊原本是建造數個模型現在合在一起建一個模型這樣把這麼大的一個組織大家凝聚在一起去建這個模型我本身也很驕傲就是這件事情可以順利的發生遺憾的是什麼我覺得我們的模型就是因為時間的限制其實我覺得模型還可以繼續提升但是因為時間限制我們沒有讓它完全收斂就必須要那個退出了然後還有很多想要改的地方在之前都沒有時間改那所以就是覺得這地方是畢竟就是想要追求更好的結果那時間有限但好處就是我們繼續會做3.12會把之前沒做好東西再把它補進去你有想過像老黃說的做到97代會是什麼樣子嗎那時候聽到97代我的理解就是我們有決心就是一路把它做下去把它做好然後這是一個很大的commitment因為這個作者模型是很耗費資源的然後呃他展現出他的決心就是往下走我得到的信心就是這個東西會一直往下走那世界模型最後就是接近這個世界對接近這個世界接近這個世界從透過那模型你可以去呃學習你想在真實世界裡面學習呃的東西好那我覺得就是是往那方向走那其實最接近的就是你有能力隨時可以做出一個黑客立國的舉證我覺得就是這種樣子那我我不確定是不是需要到97代你看我們如果呃就是每半年一代的話還要四十幾年對吧四十几年。 对,然后我觉得现在AI的发展速度极快,也许不需要到四十几年。
因为你们团队又有做数字世界的模型,也有做physicalAI的模型,你觉得训练两种模型的差别是什么,差别大吗? 这个目前的状态是这样,就是在Nemotron那边他们有一个叫做那个HybridArchitecture,就是某些層是這個傳統的Transformer但某些層是這種MambaStyle的這個接近RN的這種架構那這樣的架構有它的好處因為那這種RN的運算是比在Influence的運算是比這個種Transformer是便宜的然後Agent有一堆Token要產生有時候你要Token要Agent做很久的事情所以這個是運算成本的需求那PhysicalEye这边我们的架构就不再走这个路线我们是还是走比较传统的Transformer但是我们走到这个MutualTransformer然后把这个Action加进去所以这两边的模型的发展是就是渐渐有点不太一样当我们两个团队之间紧密合作你可以在Cosmo3的这个paper里面发觉很多作者是从Nemo创来的然后我们就是跟他们合作吸取他们的经验然后一起去建一些模型对在未来这两个模型有可能统一成一个更大的模型吗这都是有可能就是我们的决策很简单怎么样可以帮助客户最好我们就这么说我们是很lowego的刚才你也提到就是Cosmos是一个非常大的团队你觉得驱动这么大的一个团队一起工作难点是什么我印象中论文好像有290多人不到30人对吧對就是呃這團隊非常的大然後呃我是這樣看的啊這是一個組織架構的難題你希望所有人目標一致但你又希望所有人可以自主做決定當全部人的目標一致但每個人都不能做決定的時候進展會很緩慢因為只有少部分的決策者可以做決定那這些決策者假設只有我能做決定只有我能決定這個data的比例怎麼調只有我能決定這個架構怎麼做那我們這個模型就不會成功因為我的知識有限然後我的時間有限然後我們需要的就是每個人都可以做出對這個組織模型發展重要的決定那第二個事情就是如果大家都可以做決定但大家目標不一致我就是想把action做好我完全不管video怎麼樣然後我就是想understanding做好完全不管其他的這樣就會發散然後可能就會產生不同的架構然後可能就進一步有賽馬的行為那我覺得跑這麼大的一個project重要就是讓大家的目標一致但每個人又可以做出決定然後這在組織架構上面我花了很多心思去設計一些團隊運作的合作的方式讓資訊透明化讓每個人都有足夠的資訊去做出對主正確的決定那當然我們也提供了容錯的空間因為當一個人害怕他決定錯誤的時候他是不會做決定的嗯所以你要讓他們可以做決定但也要接受有些決定會錯誤但是錯誤的時候要能快速修正這些都是需要一些時間啊跟一些啊訓練才能讓整個團隊可以朝這個方向前進怎麼讓20多個人都同時做決定啊這個好難啊大家都清楚整個關鍵整個project之後要達到目標是什麼你要一直去把未來給畫清楚跟每個人講在Cosmo3paper出來之前或做完之前我就跟主要的幾個leader還有各大部分的團隊都已經講過說我們做出來的模型會是這樣子嗯那是不是完全這樣子呢可能90%相似10%不相似但是當大家都看到同一個願景的時候就比較容易集中就像你在呃在一個籃球選手你在罰球之前你都會想像這個球空心落網就先把那個目標給定出來然後大家在朝那個方向前進那當然每個人扮演的角色不一樣然後但大家看到同一個picture的時候就比較容易在他的崗位上做出對這個團隊正確的決定你設計了什麼樣的管理方法讓大家的信息能更透明能更好的協作有什麼樣的管理的技巧多用點心思了解這個怎麼樣講大家會懂注重溝通注重溝通會開例會這樣的會議嗎我是一個就是我很講究團結合作所以我們的會很多但是不是每週一次我每週可能十次有吧每週應該超過10次超過10次所有人還是多少人跟主要的例子每個比如說我們做video的就是定期開會的一週兩三次吧然後做understanding也是定期就一週兩三次然後還有各個環節的就是兩三次就是嗯就是會蠻多的然後會議上可以做一些溝通啊那當然會議大家會覺得就是開會啊有時候很沒有效率盡量做一件事情就是讓每個會議都更加engaging然後讓每個人都能參與啊這都是需要一些一些訓練好那讓這個團隊樣那永遠不會最高效你可以你可以大家都不開會各做各的那不见得会成功,你可以一直开会,什么都不做,只是讲也不会成功,你就要选一个均衡,在不同的时间点会有不同的一种调配方式,那这个东西都是因任务因时而定,而没有说一定的公式,哪个一定会是最好。 你看硅谷现在大家说OpenEye的企业文化是自上而上,Andropic是自上而下,你们属于哪一种? 我們是都有一個都會走向極端嘛天下分久必合合久必分就是東西就是物極必反就是我覺得都是要掌握這個就是在那個時間點了解什麼是對這個團隊最正確的事情而不是就是一味的順著一個方向一個模式而操作嗯我理解Cosmos的爆發的時間點和PhysicalAI和機器人的爆發可能會是正相關的,對嗎? 你覺得這個市場會在什麼時候迎來一個所謂的chargeBTmoment?
大家都在追求這個PhysicalAI的TrueGPTMomentTrueGPTMoment什麼叫TrueGPTMoment呢TrueGPTMoment跟GPTMoment有什麼不一樣GPTMoment是跟我們講說東西可以ScaleScale之後模型能力會更強TrueGPTMoment是讓大家清楚看到了這樣的一個Scaling這樣一個好的模型對人的生活會產生什麼樣的變化大家發覺這是一個有智能體可以跟他溝通可以問一個知識廣播的朋友那什麼叫確GPTmomentforphysicalAI應該是指說大家看到一個就是以AI為主的enablephysicalAI的應用讓大家清楚看到說這東西是真的有用那這東西什麼時候會發生真的很難去預測但我看到的是整個領域對這個PhysicalAI的興趣越來越大流入的資金越來越多越來越多的有志者創立公司想要去解決這個問題PhysicalAI可以利用在DigitalAI上面的成功所以我覺得各項條件都逐漸在收斂當中嗯啊我是希望盡快看到去gptmoment尤其今年尤其明年我不知道但是我覺得他必然會發生你覺得人性機器人會在這個賽道裡面成為主流嗎我覺得人型機器人他的優勢就是可以利用大量的這個人的數據來獲得就是就是學習的素材來提升這些效果但人型機器人他本身就是越像人有腿啊有手啊然後這些東西就是呃相對的啊複雜度也比較高一點然後很多人都來做人形的啊只有上半身是人但下半身是一種這移動平臺那這樣的平臺也可以解掉很多問題那你說這樣的是人形機器人嗎我覺得也是吧就是半身像人對吧也不是全人形啊然後這樣全人形的某些人形也更接近人形那有些人形比較不接近人形那我覺得人型機器人終究會是一個重要的關鍵但是多項人型這件事情大家都在嘗試當中我覺得最終最終可能就是全人型是最適合各式各樣的操作因為人類這個環境就是設計給全人型的但最後還是要關鍵還是營運成本到底怎样是最最这个最经济效率最高啊那这就超乎我的专长我其实不知道那我的目标是满足帮助这些各式各样的飞机改变的我也不需要做选择啊我就是聆听他们的声音看我们的模型怎么做可以更加帮助他们嗯deepmind谭杰老师他有一个预测他是觉得2035年到2036年可能是人形机器人成为主流的一个拐点哦是嗎嗯嗯ok嗯對我我希望早一點但我不確定嗯你覺得世界模型可能會有一個所謂的拐點嗎我覺得世界模型並不是新的就是早就有世界模型了那我覺得世界模型會一直在做就是性能的提升那我們在大圓模型上面看到的模型越來越好對不對然後我覺得在世界模型上也會看到越來越好我們這次在Cosmos3也做出這個一個呃比較不一樣的世界模型這種onlymodel的worldmodel對所以我覺得還是有一些變化然後我會覺得需要一點時間去讓大家去吸收消化一下啊因為啊畢竟這東西不是這個模型出來後直接可以使用是必須要看怎麼調配可以在這個啊就是機器人場景弱點那我覺得是需要一點時間那我覺得這會也會繼續變化啊對會一直進步會一直變化因為你說你要為機器人構建一個黑客帝國嘛那黑客帝國講的本身就是一個人類淪為了機器的活體電池然後活在一個虛擬世界matrix中然後一個覺醒的人試圖掙脫這個系統的宿命然後來終結這個循環那你現在為機器人打造這個matrix如果有一天機器人要覺醒了想要掙脫這個虛擬世界怎麼辦我用黑科技我的地方是幫大家具象就是有一個世界模型這麼快去加速學習很多人擔心就是AI當它能力太強的時候會takeovertheworld對就會把我們給eliminate那我覺得這個社會是人去建立的這些科技是人在背後操作我覺得只要大家是有共識我覺得就是這件事情是不會發生然後再就是我呃這個就比較哲學一點了我覺得pain跟suffering是一種驅動人啊去進步的一個重要的關鍵不是很確定這些西里康做成的intelligence是不是有同樣的pain跟suffering然後我心裡是產生存疑的狀態那我當然知道就是我們希望這個科技可以大幅度的改善人類的生活那我們也需要做出這些相對應的就是guardrail來確保它就是不會去影響這個正常世界的發展说到世界模型其他做世界模型的团队会把你当当作竞争对手因为大家觉得你也是做世界模型的但是你一直在说我我不是你的竞争对手对吧你有什么想对他们说的吗世界模型這個工具對然後工具是解決問題有好多種不同問題要解最終要解的問題只有世界模型是不夠的對吧那取決於你要解的問題如果如果說呃因為我們要滿我們要去服務這個整個physicalecosystem我們要建置世界模型讓大家模型可以用然後Fishy可愛的問題本身又特別的難有好多其他問題要解那如果你可以跟我們一起合作利用我們做的東西那你可以走得更快更遠這不是很好的一件事情嗎對不對那讓我們都是踩開源的狀態那如果說呃你用我們就是做出比我們更好的模型那這模型也是開源的讓大家可以用那我們也是幫助整個飛來系統所以你就比我們好我们也觉得这是一件好事对吧我觉得搭起团结合作去解掉困难的问题也是一件呃很值得去做的事情那当然彼此之间啊就是呃就是互相抵触就是saythehighbar然后越来越往上爬那也是很重要的一环对他们肯定会说哦因为打游戏来卖我卡了對那你需要做運算嘛那我們這個呃現在這個英偉達的生態在這裡有很多東西可以讓你去利用的啊whynot對吧你要做一個生意都是要做投資的嗯最重要的是你的獲利是多少而不是呃像這些cloudcompany他買了大量的GPU但他賺了更多的錢對吧你们内部会讨论什么是下一个CUDA吗有可能是Cosmos吗过去的软体是建于逻辑然后CUDA是帮助把这些application所需要逻辑转换成GPU的运算未来的软体是AI为核心的那AI是beontopofotherAI然后所以我们觉得做的Nemotron跟这个Cosmos都可能是未来的CUDA因为外部会对CUDA有非常多的复盘但作为你的视角你觉得CUDA是怎么做成功的还需要具备哪些要素像比如说现在Cosmos它具备了哪些不具备的是哪些它是一个可复制的路径吗我不確定這是不是一個可呃我覺得CUDA當初提出的時候是很前瞻性的想法是一個很冒險的想法對在那個呃當都不確定這個AuthorityComputing會不會是abigthing的時候我們公司就做出了這樣呃勇敢的投資那呃我們做的大模型都得惠於CUDA然後可以往下走我不會把這個Cosmo或Nemotron跟CUDA做同等的連結因為我覺得現在的整個發展已經相對複雜很多有很多個不同的整個產業是很多個Stack的合在一起的我覺得合在一起可能是新的CUDA而不會說這個模型單一就是一個CUDA對你还需要做Serving啊你还是要去做这些Infrastructure有很多东西要合在一起那CUDA你们觉得是哪些要素共同促成了它的成功CUDA一開始的時候就是在尋找Application一開始是ScientificComputing然後後來在DeepLearning出來之後找到CUDA最重要的Application往下走那CUDA還是一直在提供不同各式各樣的Application我覺得複製CUDA是一個很好的想法但我不覺得你按照原來的路線就會走一樣的路我覺得這個環境是不一樣的我覺得是要Adaptive看清楚那哪个时间可以做出哪些重要的贡献嗯所以你们不会拿着这个锤子去找钉子对吧拿着我要做出下一个cuda就是当年是一个非常成功的决定然后我来做今天的决定就像老黄常讲的他的decision是basedonfirstprinciple嗯他是觉得什么合理然后再往那个方向走而不是找着拿着锤子去找钉子嗯因为你刚好加入英伟达十年了是呃這10年你變化大嗎你在英偉達的這個股票漲了多少倍了一共對那個呃這些一切都是沒有預期到的呃這段時間裡面我們見證到一個沒有人把AI跟英偉達連結在一起變到一個全世界都把英偉達跟AI連結在一起到一個我父母親不知道什麼叫英偉達到全世界都不知道什麼叫英偉達的這個事件這是很巨大的變化那中間的歷程也不是那麼容易公司你從股價來看就有七起復活我記得那一年就是TPU剛出來的時候公司股價掉了很大一截然後有些同學們在那時就對公司的未來產生了就是不同的想法也就離職了但後來NVIDIA每年在Lperf裡面都擊敗TPU然後產生出更好的那個性價比那後來就是只有我們參賽了這東西都都很難去預測這些變化實在是很大那我覺得就是在這長期間我更加理解到什麼叫就是慢慢經營慢慢去經營然後就是找到一個你相信的目標basedonfirstprinciple一步一步往下走你就看著老黃帶著整個公司這麼大一個團隊然後就是一步一步走向今天這個成績嗯與有榮焉就是大致上是这样你当时加入的时候没有想到这一切对吧你当时还有其他的offer但没去对嗯对但不可预期的我我当初加入原因就是因为我想要有GPU可以为这个支持我的学术研究是很简单一个原因我某方面来讲我也是非常firstprinciple我觉得GPU是啊这个做科研重要的工具我要去一个GPU众多的地方那不如去一个生产GPU的地方嗯另外一个offer是谁啊当时我有數個offer啦對其中有一個投資公司他跟我講說不管我去哪裡不管對方給我多少錢我都給你4倍然後希望你可以加入他們的我們的公司可以一起去研究怎麼去用deeplearning來做投資嗯那我本身對這個東西並不是很感興趣我還是想做科研然後還是選擇了media當時NVIDIA是可能是更不知名的那個是嗎是啊對你覺得你看16年的老黃和現在的老黃變化大不大頭髮都白了我覺得他承擔的壓力大了很多但他還是就是關心員工然後很仔細的去閱讀公司的員工學的Top5Email然後去找到一些訊號來幫助整個公司往前進步有很大的變化公司的規模很大的變化我們都加入的時候公司可能不到2万人吧然后现在已经两倍以上可能更多那那个呃就是那时候GPU都还是桌机啊然后现在都是datacenter对然后那时候没有physicalAI现在physicalAI都成为了一个重点对变化是很大的你在过程中有见证英伟达的哪些painandsuffering没有先生常常在嘴邊講他說當然不是真的他每次都講說他每天都覺得公司只剩下30天的現金流30天後就要破產現在還這麼說他每天都這樣講每天都這樣講每次開會都是這樣提醒自己嚇唬高管嗎就是要求自己做出對公司最正確的決定然後有一年pandemic的時候那個整個整個就是經濟狀況不好然後那個時間點就是很多公司就開始裁員那我記得那次公司大會的時候我們就決定要裁什麼我們要裁的就是呃Travel就是員工就不用去Travel了全部都是Online這樣就省下一筆錢然後我們在研究哪些工具可以不要比如說在矽谷很多公司都用Zack来做这个通联我们来考虑是不是就不要slack反正我们有email然后我们有两个两三个cloud比如说我们有时候用用microsoft有时候用google是不是可以就取消一个可以省钱可以看到公司就是在一些困难的时期做出一些相对不平凡的决定有些公司會把裁員來降低這個就是人事開銷NVIDIA想的是什麼可以節省掉一些不必要的開銷照顧員工一起度過困難的事情為什麼NVIDIA一直堅持不裁員他真的沒有裁過員工嗎我在英偉達的時間裡面就是我沒有聽到任何裁員的消息也沒有末尾淘汰對吧我們沒有所謂的末尾淘汰然後就是我們只有給performancereview那當然就是有些人會因為對performance的不滿而離開然後有些人是就是真的有其他因素就就離開但我們不會因為我們改變了產品的方向然後或者是因為就是這段時間內你就是performance不好而就讓你走我們覺得人跟人之間的信任很重要當一個員工對這個公司有認同感有安全感他願意講出一些可能在一般擔心被淘汰的地方不願意講的事情當沒有所謂的末尾淘汰的時候大家也不會就是真的這麼的就是這麼擔心被淘汰而搶出頭那在一個全部都搶出頭的地方反而不容易促成團結合作我覺得這樣的一個管理模式會促成一種公知文化是跟那些會做末尾淘汰的公知文化是蠻不一樣的它的優點和缺點是什麼呢我覺得就是公司員工想敢講真話願意團結合作缺點就是當一項科技就是逐漸變得成熟的時候這些員工需要一點時間學習新的東西做轉型嗯那重新学习新的东西是需要多一点时间的那如果你直接layoff再hire新的一批人那你可能可以直接hire到一些已经会这些东西的人所以这些啊经由转型啊做起来是会比较慢一点但是你得到就是员工的信任然后也可以寻可以团结合作的员工嗯组织效率怎么提升呢这对你们来说是个问题吗就是大家只要充满热情然后觉得自己做东西是很有意义的然后整个整个效率就会提升嗯每個人都有選擇嗯對那呃都會想做自己呃有成就的事情那如果公司可以提供這個環境讓大家可以去發揮的話那那這樣效率就會提升就讓每個人可以做出他們最喜歡最擅長的事情但同時這些事情對公司又是有極大的利益的只要能做到這點我覺得就是一個很好的狀態嗯听上去不裁员有很多好处但是大部分公司都不是这么做的对吧是这是为什么然后以及老黄为什么从一开始就觉得不应该裁员我觉得NVIDIA是一个想长久经营下去的公司然后我觉得就是这么多年他在老黄在这个硅谷待了这么多年也看到这么多风风雨雨他选择这个东西一定有他的道理也就是我觉得不是一个随机的选择是一个深思熟虑后觉得这东西是他想要的企业文化他想要的公司的运作模式那是不是意味着当新技术来的时候英伟达不会是最快的那个但是它是依赖于你早十年或者早五年的提前布局这样他对快就要求不高NBA就是跑馬拉松嘛然後看的遠在你看Kula就是這樣一個案例佈局了10年嗯對吧好所以就是你要有很強的眼光然後長期投資嗯對你們也不賽馬對嗎我們不喜歡賽馬,因為我們通常都是這樣做就是你去take這個mission,我們就相信你當我們一起給你很高的bar希望你完成就是用老黃話講就是一直讓你接受painandsufferingtortureyoutogreatness相信你然後給你考驗然後不斷的磨練你讓你一路一步一步往下成長這是我們喜歡的模式你在英偉達受過最慘烈的suffering是哪個階段做這些大模型就是這幾年都是這麼辛苦的在往下走我剛跟你講那些東西很多都是從錯誤中學習很多東西就是一開始也沒有理解到這些東西最重要的東西那為了把東西做好然後當你做不對的時候要怎麼慢慢把東西給改進我覺得這一段就是自從GPD起來之後整個這個AI的從業人員大家都感受到莫名的壓力對然後這段時間裡面呃就是這個迭代的速度啊然後大家都飽受的壓力的那我覺得都是painandsuffering啊尤其是當你每天呃揮灑這些GPU資源揮灑這些年輕人的時間然後做出的成果沒有達到你最喜歡的啊結果我覺得這東西是無形上都是一個呃压力压力对嗯你的生活状态发生变化了吗在这过去几年高效高效嗯对早起晚解我大概是四点到五点起来我这么早对哦早上起来的时候呃运动啊那些就是时间比较连续一到公司后就一直开会吗然后十点到公司大概大概是九點到十點左右嗯對因為整個整個產業的迭代速度所以生活步調都變快然後還是要學東西還是很多但處理的事情又變更多然後找讓自己更加高效嗯你幾點睡啊我大概大概十點左右吧十點左右十點到十一點左右四點五點起對哦對不是每天都固定但但是基本上是我的常態嗯英伟达的呃书也好或者老黄的传记也好都讲了很多他的管理方式能不能从更一线的视角来讲一讲就是英伟达的一些不一样的管理方式我们刚刚可能涉及到一个是不裁员呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOP5呃第二就是TOPNVIDIA是一個相對很透明的一個組織架構蘋果可能是反例就是我們追求的資訊透明這也是一個很不一樣的culture那那那那些腦簧專輯有些是比較戲劇性的但很多都是你可以在英偉達工作的時候就可以感受到他認識很多員工我們常常講Missionistheboost然後因為就英偉達有時候像是一個有機體沒有那麼強的框架當我們公司今天要走向這個方向的時候在各種不同組織的團隊但有相對的技能就會自動align就往那個方向前進就是像一個活的組織不是一個固定框架就是說你在這個裡面你就不能做這個東西嗯沒有關係你在這公司哪裡都沒關係但是你要往這個方向前進的時候你的你的這個團隊的呃的是可以產生貢獻的就全部人就align就變成一個新的方向往這邊走cosmo就是這樣子一個案例嗯就是很多人他可能不属于这个团队但是他都可以来支持这个团队的工作对missionistheboss而不是你的boss是你的bossmissionistheboss这几个是最具有特色的啊就是这几个让这个公司的这就是很很活啊你看我刚刚讲的这个mission的boss就不是一个很硬的框架是个有机体那這個Top5讓公司各個地方的微小訊號都可以傳到擴散出去對吧那不願意讓就是不輕易layoff員工就是講究轉型講究torture讓員工對這個公司強信任然後可以彼此互相合作我覺得這幾個都是英偉達很獨特的地方嗯一群S級的人一起工作和一群Aplus或A級的人一起工作哪個可能取得的成功更大呀你覺得大家在追求的就是一加一大於二然後是不是大家可以團結合作產生更大的效應是很重要一件事情然後當人多的時候就有一個溝通的成本然後溝通成本就是負面的你等於就是要人跟人合作可以產生正相關但是又要降低這個溝通的成本那一群很聰明的人一起合作當然大家都很聰明很快就理解然後手腳又快但是如果人跟人之間無法互信的話也很難到一家一大宇而大家都防備著對方不願意把最好的一面呃展現出來或者是就是要展現出我就是比你聰明那這樣子也不見得是一個好的狀態那我覺得反而就是呃就像打遊戲一樣你不要整個團隊全部都是弓箭手可能有些人是負責防禦有些人是會是做補血的各項不同的屬性合在一起我覺得這樣多元是一個比較好的狀態你看你今天說了很多你沒有競爭對手然後你不和任何人競爭都是客戶然後大家都是合作夥伴這種lowego的狀態是在英偉大發生的變化嗎是就是這真的lowego還是只是一種隱藏我覺得是一種confidence是一種自信嗯呃是覺得呃我們做出來的東西是可以幫助到大家那我的目標是幫助大家做好當然我對我自己做東西我要求很高我希望它變好但我的目標並不是擊敗對手我的目標是那個做出好成績提出更好的foundation讓大家可以動得更快嗯這是跟老黃學的嗎哦對我受到影響非常的深嗯這是什麼時候學的如果你是一個研究員你就是畢業的方法就是讓你的論文在頂級的會議上被接受然後reviewer都會question你的東西是不是stateoftheart那你要stateoftheart代表說你要擊敗所有的人所以研究員都有這種心態就是我的東西要比你強然後所以循著這個軌跡我也就是一開始就是一個highlycompetitive的individual就是我東西要做的比你好嗯那這對自我要求當然好就希望東西越來越好但久了之後就是你知道就是你總是stillbeup一段時間就下一個出去吧對就是這東西是一直不斷進步我今天站的位置也不一樣了就是成為這個管理者之後呃希望就是培養新一代的人才幫他們成長然後站在這個NVIDIA這個ecosystem的角色也希望這個公司逐漸感受到這個好處有時候看到我這些夥伴們跟我講說用你的模型之後我姐這個效率提升了很多然後我就很開心我覺得呃我的我的付出啊整個團隊的辛苦付出啊獲得的一些回響那不是这种肯定也是很好的一件事情啊不见得只要击败啊其他才是一定能产生贡献就你不需要击败你的对手我不喜欢把他们当成是对手喜欢把他当成是伙伴嗯你看因为大家包括你然后包括jason他出来经常会说takecareofothers就不管是员工还是外外部的合作伙伴这种takecare是一种真实的吗就是他真是这么想的吗因為一開始的時候我們就是我們就是生產這個就是DesignHouse然後最後我們也沒有什麼ConsumerProduct都是靠著其他家公司幫我們做GPU卡我們就是一直有這個習慣就是要跟著整個Ecosystem一起成長大家一起賺錢總不能說錢只有我們賺嘛這些幫忙做這個顯卡啊伺服器這些都要一起能往下走因為早期的顯卡都是拿來做遊戲我們也不做個遊戲我們就是一直開發這些好的library幫助遊戲公司做遊戲我們開始走向deeplearning的時候那時候好幾個框架比如說PyTorch、TensorFlow還有一些MSNet這些東西我們全部都支持對然後後來我本來有這個TritonCompiler我們是支持那個Triton那VLN出來之後我們支持VLN對就是我覺得是真心的就是呃就是想幫助這些建在我們的GPU平台上面的客戶能更加成功他們更加成功代表他們可以服務更多的客戶那他們就有大量的機會使用我們的GPU是一種真的是共力一起走向成功的一條路線那我覺得是這樣也是他經營了這麼多年才把這個公司放在這麼一個好的位置讓幫助別人也可以獲得獲利啊這我覺得這是不容易嗯你近距離觀察過老黃很多年如果只用幾個詞來形容他你會怎麼形容啊我們叫他六邊形戰士嗯就是不管是你我們有時候開會他可以走到很深去研究這個register這個computerarchitecture的register這個非常細的細節同時間又可以找到想到可以就可以教大家怎么做marketing怎么说这些非常高級的東西然後在處理這個不管是產品定價然後跟客戶的關係他面面俱到然後就是他是極大的熱情這是一個很令人佩服的一個的操作各個方面都可以產生貢獻然後各方向都盡力做到最好他是一个很厉害的一个人他对你鼓励比较多还是批评比较多一般来说鼓勵批評都有當我還沒有完全理解他要怎麼去跑這個公司的時候批評是比較多的但批評總是帶著鼓勵希望你可以變好他的目標就是tortureeverybodytogreatness經由這些磨練讓你更加理解就是怎麼樣做才能做出不平凡的事情這很耗精力的你願意花時間去torture別人這是件不容易的事情所以偷修別人你自己心裡要產生很大的負擔對吧嗯而且你人生就這麼多時間你可以不管你可以也許還真的還真的拿到你要的東西但是他願意花時間去偷修別人讓大家不斷的進步這是不容易的一件事情他對你讓你印象很深的一句話是什麼呢我覺得有一次我們在一個會上我們在比較兩個Solutions兩個東西然後我是做其中一個東西的那另外一個是其他人做的東西然後我記得那時候我講了一句話說我覺得他們用的Setting是一個不Fair的Setting所以導致這個那個所以我們在這方面表現就沒有達到我們的預期而落後這個競品嗯那他那時候給我一句話說Areyouacrybaby? 這世界上沒有什麼是公平的你在寫論文的時候常常講說欸我的setting就是跟你的setting不一樣所以不能同時比較但你的目標如果是要解決一個問題那你當然是是做這個要解決的問題所需要的條件沒有這條件你就想辦法拿到但是我那句話讓我印象很深刻就是我更加嚴格的要求自己就是找理由是沒有用的就是這個就應該giveeverythingyouhave然後我以前也聽過這句話西點軍校有一些著名的的那個書也是講的就是沒有理由noexcuse但但他跟我講讓我的印象就更加深刻畢竟他是一個著名的人物那我覺得這句話對我的影響也蠻大我回去不再找理由了對如果當你作為一個研究員想成為numberone和英偉達的本身的業務因為他不想成為強勁的競爭對手如果發生了衝突的話你會選擇哪個我覺得那個就是科學的發展本身就是incremental的就是一直在進步一直在進步一直在進步你隨時地都可以提出improvement就是要往上再走一步嗯然後我覺得就是betheabsolutenumberone嗯什麼叫那我這很難去定義什麼叫numberone然後我我比較喜歡看去一個frontier的模型吧但Frontier的模型做出來那時間是No.1很有成就感但之後就會有其他的模型可以做上去我是希望就是你具備的就是做No.1模型的能力但是就是做出就是對這個社會影響最大最有貢獻的事情對因為你可以做出那麼樣的模型但你就是只給少部分人用然後或者是就等於讓權力過度集中在少部分的手裡然後產生一些不平衡的狀態我覺得不見得是一件對的事情對那我我是希望就是呃具备numberone的能力但是做出对这个世界贡献最大的事情具备numberone的能力但是做出对这个世界贡献最大的事情是啊所以最重要的是后面后面那个贡献对吧不是那个能力对对人在那边就走一遭嘛对吧然后你留下来就是影响所以要活的久呃我的酒鸡会大一些吗呃就是希望能产生一些呃做一些呃贡献然后呃就证明自己啊就是没有白来走一遭嗯那就这样子嗯你还有什么在研究生涯上觉得遗憾的吗你还有什么特别想得到的呃我觉得飞机关还没有成功吗對,還沒有到那個時間點是談論這些我覺得我很開心那時候,十年前我在講這個DeepLearning會取代ComputerGraphics成為一個最重要的這種影像生成的模式這件事情發生了覺得還蠻開心的這事情真的發生了那我覺得這種世界模型會是推動FishyQuiet成功的重要推手然後這是我下一個重大目標我希望這個東西也能成功你要比就是你有一個BestPaperAward你就會想說我要拿兩個然後我就知道有些人拿了十幾個你總是拿不完嘛對不對比論文數總是有更多的論文那你比Citation數總是有更多的Citation你比錢總是有人更能有錢對不對那重點是我覺得你對自己的東西是不是很驕傲我覺得過去很多東西我覺得我做的不夠好但目前有些東西我覺得我做的不錯那我接受然後我覺得就是在我的能力範圍內我覺得我做出了我自己滿意的東西就是這個部分所以外部的很多衡量指標現在慢慢都變得沒有那麼重要了對年輕的時候都覺得他們很重要為什麼這個人的facepaper比我多對然後獎比我多那現在覺得就是漸的這個不在意就是我重心漸轉移幫助別人也許我現在care的幫助的人夠不夠多嗯你覺得你最近一年幫助了誰呃这些使用飞机可爱的使用cosmo的user我觉得我都有那默默之中替他们提出了帮助然后当然还有自己的团队还有一些就是呃就是跟我交谈过的人我觉得或多或少我对他们生命都产生了一些影响嗯嗯你也经常来中国吗是你怎么看中国的这一批模型的发展呀非常的印象深刻,非常印象深刻這些從Deepsea開始啊,千問啊,豆包啊,就我都把它全部講一次吧MiniMass就有M,然後Kimi啊,然後這些Memo對,然後委員就是這些制服,對都做得很好那還有一件事情就是在美國啊,尤其是這些FrontierLab現在的狀態就是他們很少去招收實習生很多那個knowhow很多這些科研的結果都只有在他們自己本身內部的實驗室有那在中國這邊我看到就是他們像這些公司都招收很多實習生然後幫助把這些就是knowhow傳遞出去,然後我覺得對人類整個就是知識擴增,就是diffusion,我覺得是一件好事。 看到這些快速發展,我覺得很impressive,然後還同時注重到這些diffusion。 大家對AI都充滿了熱情,就是願意去嘗試,我覺得這都是看到的一些現象。 現在你跟我說矽谷已經被LM催眠了你怎麼看他這句話我不覺得是純粹被LM催眠不能否認的就是現在在AI裡面最領先的公司就是模型上最領先的公司不管是OpenAIAndroid都是從大語言模型出發的嘛那這件模型也確切我現在已經不知道沒有CodingAgent我要怎麼過下去我也不知道這件事實在是太方便了我覺得產生很巨大的變化我覺得也不是一件壞事嘛就是LM真的產生了很大的用處然後幫助提升我們的生活我覺得很自然而然的就是大家會我也想這東西既然都已經在這裡了然後下一步是什麼我覺得人自然會想要做哪件事情我知道領域裡面有些人是把學術變成信仰但我覺得大部分人都還是從知求真的角度出發當一個東西被充分理解之後大家會找到新的東西來進行做突破你很难很难想象一个人就这么聪明的人一辈子就只做LOM对吧我觉得自然而然会发生我并不觉得有这种催眠的事情只是对那些人而言对现在时间而言也许做LOM是一件很正确的事情昨天上市然后马上也要上市今年这些公司大模型公司的上市会对这个行业发生什么样的影响吗206年会是巨变的一年這上這邊上市大家都看到新聞了嗎?
就是會產生很多富翁對吧? 然後我知道舊金山的房價在快速飆漲早期相信deeplearning啊早期相信這個spacemission這些人啊就是這些等於是對他們的遠見、對他們的勇氣、對他們的決心這一個認同,我覺得都很合理這些公司真的對世界產生巨大的貢獻,我覺得完全值得但這個我覺得科技不會停在這裡嗯然后陆陆续续都会有新的事情发生一百年前强盛的公司跟现在强盛的公司是完全不一样嗯五十年前不一样二十年前不一样对我觉得呃这个社会啊只要组织架构还是一个有好的良心的状态就会不断有创新发生嗯就摩擎这场竞赛的终局可能是什么样短短几年已经发生这么大的变化再往远看呢我想這就很controversial我覺得模型的能力慢慢就會統一靠模型自己不會是區分一定要靠一些其他的東西組織在一起那領先的模型有更充裕的時間去找到這個區分的方式然後強大的這個公司也可以加大自己強大的ecosystem去做出一些變化對然後我不會覺得像software剛出來的時候會寫software公司很少現在大家都會寫software然後每家software都有一個自己的區分方式那些我們活下來的software公司都有自己的區分方式然後我覺得沒有理由模型會是不一樣我覺得會是一樣所以沒有必要神話模型或者模型公司是嗎我把它當成中醫啦就是一個blackbox這麼多人不同常識最後就是一個一套學問嘛然後很多人都會中醫嘛對吧關鍵是你要拿它幹什麼對關鍵要看幹什麼那有些人解讀比較深一點那有些人就是需要多一點時間這都是我的臆測我是覺得這些東西慢慢就會diffuse现在假设一个新公司说我要训练一个模型他还有很大概率赶上来吗就他可能比前面的公司落后两三年的时间像呃kimi或是memo这些app都是算比较晚期出来的吧秘密還行Nemo比較吧對嗯對還是有機會的嘛我是覺得就是嗯會有一段時間大家會覺得算力不夠然後我覺得算力慢慢就會起來都有辦法去參加競爭我覺得這世界上有抱負有決心有辦法去呃去挪動資源去建一個大模型團隊的人很多啊然後還會有更多是嗎我覺得如果說大模型是一個絕對的區分那當然就會更多但如果不是絕對的區分應該會很多人就是想到呃對他們的必須更有利的方式哦對我就是一種自然的平衡狀態自然的平衡狀態嗯端測模型覺得會多久之後爆發嗎这东西跟那个physicalAI会很相近嘛哦刚也讲了嘛就是我觉得资金渐渐投入然后科技迭代很快也许这段时间我说不准但我觉得希望它快速爆发嗯对于今年和明年的模型竞赛你有哪些预测在physicaleye上是很難的創作還是很快我還是堅信這個對world的model能力是幫助這些物理世界模型強化、繁華的一個重要關鍵那怎麼落地用怎麼樣的modality這些事情大家都還在探索當中SharedGPTmomentforphysicaleyeiscoming這是我可能可以做的預測對那大語言coding模型這些東西我自己本身在在follow但我自己不做我也很難去講我是用的很開心但是我也很難講接下來會怎麼樣刚才你说了就是中国的这些模型公司,那中国的机器人公司呢,你应该也见到很多,你觉得美国有什么不一样吗? 两边美国在做本体的公司很少,就Tesla跟FigureAI,然后这种好多家公司在做这个本体,做本体它可以控制的東西更多可以控制這個模型跟軟硬體的整合的操作空間更大然後我覺得因為中國強大的製造業產生一個很優勢的條件可以讓這些公司做一些在美國不容易做到的事情我覺得這些都是很值得去關注這樣的垂直整合會產生什麼樣的一個突破對我覺得還蠻有趣的你覺得美國現在會不會有一點就是不那麼重視硬件可能是錯的也很難說但是就是在這個如果說這種軟硬體整合是一個機器人的一個趨勢那沒有硬件當然是處於被動狀態有點難講,好多東西要考慮啊,包含這個金融模式啊,中國明顯就是有這個條件可以讓大家做快速的硬體迭代,軟硬體的整合。 Hashptmoment在physicalAI,你覺得有可能在哪裡爆發? 呃看到一个应用嗯呃是大家很明显知道就是呃是不是产生巨大的经济价值嗯好然后也许在那个时间点那个应用并没有产生经济价值当去gp刚出来的时候是赔钱的对吧但是是当看到这个趋势然后觉得就会发生那我個人覺得這種就是簡單的人示範一下怎麼要的操作這個機械人就可以就地學會這東西我覺得這是一個如果這東西出現我看到這樣的一個這樣的一個產品我就覺得說Yeah,thatsatrickymomentforphysicalAI所以它的核心是繁華我覺得是繁華就是AI的核心問題就是解繁華的問題對於繁華來說現在最重要的一個問題是什麼如果只說一個泛化的問題在PhysicalAI裡面就是怎樣從這個有線的訊號裡面學到需要的操作然後應用在一個沒有看過的一個的場景裡面這個是PhysicalAI裡面要解的一個主要的泛化問題Observation對Action這個Pair的泛化讓你看到一些你看到這個Action跟Observation是完整的事情怎麼樣快速泛化到一個新的Observation那類似的Action我在想就是如果他在Cosmos这套系统里学习了大家走向现实世界之后他还是会有CMTrealgap对不对怎么解决这个问题呢呃這也是一個泛化的問題哦對就是呃新的realgap通常是呃就我們cosmo想幫助呃這個physicalbuilder是透過三個方式嗎之前有講的就是betterdatabetterstartingpoint跟這個betterenvironment那我覺得betterenvironment這些東西是還沒發生是大家都希望能做出這個矩陣哦但還沒發生就陸續有些突破我們看到一些work都很不錯那現在比較管用的可能就是betadata跟betastartingpoint你拿一個懂這個比較懂這個世界的physics怎麼去預測physics就是懂physics可以去也不能說真的懂physics但抓到那個模式可以去predict接下來發生什麼事情这东西也许可以帮你产生更好的,做出更好的policy。
那这东西,因为它本身的prior是比较适合放话的,那它也许就可以帮你建出一个更容易放话的一个policymodel。 对,我觉得这个是我看到可能短期内Cosmosmodel可以对这个physicalappbuilder的一个贡献。 如果五年后我再来采访你,你希望Cosmos发展到什么阶段? 哦我希望五年后如果我们再有这样的一个采访我们可以清楚地讲出来这些时刻是什么时候发生的然后是在哪里发生我希望这个事情是可以明确地讲出来纪念七月七日那时候就有一个具体的时间了对对对在人工智能的历史上你希望别人怎么来记录你啊是不要讲我吧我觉得就是呃讲cosmos吧然后像cosmo可能是一个重要的推手然后帮助呃这些几个重要的physicalbuilder然后达到这个确切比例的moment我觉得这个可能是我会很开心的一件事情嗯嗯我还有一些快问快答嗯全球范围内一个你最喜欢的食物牛肉面全球范围内一个你最喜欢的地点好我喜欢玩游戏天气实在太舒服了你有什么喜欢的音乐书电影或者游戏吗书蛮多的嗯然后呃音乐我不怎么听哦游戏我已经不怎么打我上次打游戏可能都是二十几年前的事情了能分享一本真正改变你或者影响过你的书杰森推荐的书,它是讲positioning的一件事情。 嗯。
然后我忘记那个书名叫什么,很有趣的一个心理学的书,然后让你更加理解问题的本质是什么。 嗯。 当年轻的时候读了很多不同的书,对,我特别喜欢金庸小说,那是其中一环。 金庸小说有帮助到你后面的科研或者是写管理吗? 倒是沒有就是裡面的這些可以體會這個金庸的各式各樣的幻想然後很美的一些意境那當然是把我推向了學中國武術的道路然後從中國武術裡面得到一些歷練我覺得那都是蠻不錯的一些過程對於年輕的研究員你會有什麼建議就是不要緊張為什麼不要緊張有些年輕人研究員都往往覺得就是會不會明年這個AI就就結束了就AI資訊鏈了然後不要緊張對自己有信心然後冷靜下來那個看清楚什麼地方是值得你投入精力不要不要被這些呃大家的這個宣傳覺得好像自己路越走越窄現在研究員進入PhysicalAI是一個好時機好時機是一個男孩嗎這是一個好時機嗎就是各種機會然後還有很多地方我當然做PhysicalAI我比較懂但這些AI的進步讓我們可以做出更好的這些Material更好的藥這些生物方面的突破我覺得在各行各業裡面都可以漸看到這個AI的影響我覺得很多地方都可以去投入嗯我们工作室叫语言及世界工作室当你第一次听到这个名字的时候你在想什么用语言来啊描述这世界上发生有趣的事嗯你觉得是大模型竞争不是鱿鱼游戏还是世界模型竞争不是游戏还是说对于你来说不是游戏对别人可能是吧我不清楚你你你如果你如果大家想解的东西一模一样嗯那就是鱿鱼游戏嗯对吧所以模型竞争不应该是鱿鱼游戏对因为这世界上要被解的问题这么多啊对啊然后可以提供价值的东西这么多嗯每个人喜欢的东西又不太一样啊对啊我觉得不应该是啊看的是鱿鱼游戏你有过那种特别嗨一个的时候吗年轻的时候社會的是吧對就是我總覺得我的呃算法最好然後對我寫的paper最漂亮總是會這麼覺得算法重要你需要很好的數據很好的infrastructure讓你可以做快速的算法迭代啊因為你即使你有兩種可能嗎一種是你一開始算法很好ok那很好但是即使你一開始算法不好你有很好的data有很好的infrastructure你可以迭代然後迭代只要你遵循著這個就是很嚴格啊紀律然後這種控制實驗法則你算法就越編越好所以我反而覺得迭代速度是重要的那迭代速度就是要靠強大的noinfrastructure來支持data很重要因为呃如果一个问题可以用data解你就用data解就好不用开发算法嗯因为data简单多了嗯对然后所以不喜欢浪费力气这个问题只要是data能解就就收集data就照data嗯然后真正不能解的这样算法来解是每一个公司都需要训一个自己的大模型吗你觉得没有必要是吗如果是commodity你你需要建自己的电厂吗你每家公司要建自己的电厂吗ok就是看合不合乎經濟效用效應對吧哦嗯在早期你要做汽車工廠的時候當電廠不充裕的時候你蓋個電廠你可能可以確保你工資是24小時運行的但是現在這時代你可能不需要了對吧嗯對你可能跟太多這個AI的那個呃就是開發者聊他們每個人都是覺得我的AI模型是最好我覺得這東西在歷史上從來沒發生過喔我不覺得這…因為能跟人相處沒那麼容易的你看當初那個DarylAmade跟那個StanAllman就是合不來喔對吧?
喔他就走了喔對然後你最近在那個Anthropy裡面每個人都是一模一樣我不覺得都是就是堅信的就是會不會哪天就是你升了A不升了B然後B就覺得說嗯對吧然後然後他會不會就帶一群人走去做個類似的東西嗯對然後那數據大家都有嗯數據有算力找你們買算力你只要有錢還是買的到嗯對吧嗯所以大家都能做你有決心然後你有支援你是可以做的嗯所以沒有那個必要耶Cosmos對你們來說是一場不能輸的戰爭嗎如果說有其他公司也做開源模型的話那就不是那就不是對什麼叫戰爭呢就是我沒有打算把別人殺死我必須要on這個賽道哦不是就是你们都得长到我的生态上面NVIDIA要继续成长PhysicalAI是一个重大的一个市场现在家家户户都没有机器人但如果有机器人的话我家可能会买两三个那每个机器人都需要算力那等于整个世界最需要最算力的需求会大幅的成长这个事情如果发生的话对Media是巨大好处我们的心态不是说想把别人给杀死我们的心态是我们要怎么去造市场你懂我意思吗CUDA就是造市场嗯造出了现在的AI的市场我们想着怎么造出下一个大的市场嗯那你说呃是不能输的战场吗我觉得也不是也不是因为是全新的东西对啊我没有跟任何人竞争是吧就是公益嘛帶著大家一起把那個市場建出來然後你賣這個機器人賺錢你做這個卡司買券賺錢那這個東西會需要一些算力賺錢那當然會有公司研發自己的晶片他也會賺錢那整個市場就起來原本是nothing老黄会分享类似的观点吗经常说经常说要造市场啊而不是在存量竞争对你读他的书就会发现他讲说我们就是要做这种一周billiondollarbusiness什么叫一周billiondollarbusiness就是现在不是个business但以后成功后会变billion嗯嗯如果现在已经有人在做可能就不值得做这是一种拥抱风险还是一种抵抗风险还是一个低risk吗這是一個低Risk我們做事情的話是很Risky的全部就是CUDA那時候是很Risky的一件事情等於是賠本在賣對吧我們因為撞CUDA我們整個GPU的價格都比別人高同樣的Flops我們就是比別人高因為我們要支援這個Programmability對吧你不這麼做你做這件事情很Risky你不做這件事情更加Risky对你不做那件事情别人做了的话对于你们来说就对就是有风险呃不不做这件事情的话就是你的东西就渐渐变commodity嗯你还要从老黄身上学到什么没有我都尽量很用心在学习他怎么去呃跑其他东西然后从里面去应用在跑cosmo为什么其他公司都说ceo不应该是最努力的人但是你们公司ceo是最努力的人对是這我也不懂但他ItworksIcannot對吧世界沒有絕對他現在的驅動力是什麼呀驅動力就是takeyourfamilies對做AI者真的是很有趣的一件事情你尤其是站在他的角度裡面看到他的貢獻改變世界我覺得是很有成就感一件事情不愧是教主是的
张小珺Jùn|商业访谈录 第150期详细总结 对英伟达研究副总裁刘洺堉的4小时深度访谈:Cosmos 3、世界模型、武术、黄仁勋影响我的,和你不需要击败所有对手
—— 节目主题概述 本期节目,张小珺对英伟达(NVIDIA)研究副总裁、Cosmos Lab负责人刘洺堉进行了长达4小时的深度对话。这是一场围绕AI世界模型(Cosmos)、生成式AI、物理智能(Physical AI)、职业成长、创新管理与团队领导、个人武术修养以及黄仁勋(Jensen Huang)影响的长谈。节目深刻展现了前沿研究者在巨头科技公司内部的思考,以及平台型公司如何影响AI创新的走向。
—— 访谈精彩要点回顾
一、刘洺堉与英伟达:角色、团队与背景
二、职业路径与AI行业洞见
三、Cosmos与世界模型的战略抉择
四、科学研究、技术迭代与团队管理成长
五、黄仁勋(老黄)对刘洺堉个人深远影响
六、武术、身心修炼与科研哲学
七、Cosmos 3技术进展与世界模型
八、开源哲学与合作竞合观
九、未来展望与行业判断
—— 部分精彩原文摘录
—— 重要时间节点(Timestamps)一览
—— 结语
本期是AI研究员与大型基础设施企业高管的自述,也是对AI世界模型赛道、开源战略、中美产业比较、管理哲学、个人成长与社会责任的深刻探讨。刘洺堉以极具“低ego但高自信”的姿态分享了AI浪潮20年的技术笔记,也揭示了行业领军人物们“造市场、共生共赢”的更高维度竞争观。无论在“做number one”还是“贡献最大”的取舍间,这种坚持“build together not against each other”的信仰,为中国和全球AI业界提供了重要启发。
如需查阅更多细节或原声引用,建议参考相关时间戳回听对应音频。