NVIDIA在4月24日在深圳舉行RTX AI 媒體品鑑會,邀請了眾多合作伙伴與媒體來體驗最新的AI應用,包括NVIDIA ACE、ChatRTX、Stable Diffusion、DLSS 3.5、NVIDIA app等現場演示Demo,還有來自土豆人tudou_man、Simon阿文、海辛、言蕭等AI藝術家展示如何利用GeForce RTX 40系列AI PC創作AIGC作品,在會上NVIDIA與火星時代教育聯合發佈《NVIDIA TensorRT Stable Diffusion創作加速指南》,與吐司/Tensor.Art聯合發佈《個人用户玩轉Stable Diffusion 的GPU配置推薦》。

可能還有人覺得現在AI還沒什麼用,但實際上AI已經在各個地方發揮了巨大的作用,在大家較為熟悉的遊戲方面就有DLSS 3幀生成技術和光線重建技術,以及目前還在推進中的數字人技術——NVIDIA ACE技術Demo。在生產與創作領域AI更是發揮着更重要的作用,視頻和照片編輯、圖片素材生成、視頻超分辨率、添加字幕以及翻譯、視頻會議、起草文檔和PPT、數據分析和解讀甚至編程等應用在AI助力下都可大幅提升效率。

其實在去年台北電腦展上NVIDIA就推出了NVIDIA ACE遊戲開發版Demo,利用混合AI驅動的自然語言交互技術,為遊戲中的NPC帶來改變,變得更為智能,從而提高了遊戲的體驗。

該技術應用到遊戲上其實是運用到本地以及雲端相結合的混合AI模式,先是本地利用NVIDIA Riva把玩家輸入的語音轉化為文字,然後上傳至雲端的大語言模型給出對應的對話回覆,接着在雲端把這答覆轉換為語音回傳本地,在本地利用NVIDIA Audio2Face為遊戲角色創建臉部表情動畫,讓嘴型對得上聲音,最後通過遊戲引擎輸出畫面。

現場展示的Covert Protocol是Inworld AI公司與NVIDIA合作開發的一項全新NVIDIA ACE技術Demo,它突破了遊戲中NPC角色互動的界限,採用多模態方法來展示NPC,將認知、感知和行為系統集成在一起,以實現身臨其境的敍事效果。

在活動現場NVIDIA也展示了新版本的Chat RTX,增加了更多的功能,在新版本中它加入了對智譜AI的ChatGLM3-6B這個中文LLM的支持,同時還支持語音輸入和圖像搜索功能。用户用它可快速、輕鬆地將本地文件作為數據庫連接到開放式大語言模型,快速查詢與上下文相關的答案。

在本次活動上火星時代教育發佈了《 NVIDIA TensorRT Stable Diffusion創作加速指南 》,它是為AI設計愛好者和創作者基於RTX 40系GPU提升Stable Diffusion創作效率的實操性教程。指南包括:安裝與設置,加速引擎構建,加速效果對比以及NVIDIA TensorRT在實際商業創作場景的應用(海報設計、電商設計、室內效果圖設計、插畫設計),幫助使用者在創作過程中藉助詳細教程和加速工具實現商業創意落地,提升創作效率。指南由火星時代教育AI設計教研團隊主要研發,NVIDIA 技術團隊提供技術支持,未來將根據應用軟件版本優化並迭代升級。
火星時代教育創始人王琦表示:“火星時代是NVIDIA Studio中國區生態合作伙伴,雙方共同探索AI軟件在設計流程中的輔助作用,並在火星影視學院部分專業引入NVIDIA Studio AI應用做教學試點,在2023年共同開發AI設計方向創作加速的公開課,此次聯合發佈《NVIDIA TensorRT加速Stable Diffusion創作加速指南》是火星時代和NVIDIA聚焦‘科技+教育’在設計領域的積極實踐,充分激發學習者對於科技發展的關注,擁抱AI前沿技術,為個人效率加速,為商業創作賦能。”

吐司/Tensor.Art在本次活動上也發佈《個人用户玩轉Stable Diffusion 的GPU配置推薦》,使用第三方測試軟件UL Procyon AI基準測試完整測試RTX 40系列多款型號的顯卡、筆記本電腦GPU在Stable Diffusion的推理性能表現,其中在UL Benchmark SD1.5 TRT vs. OpenVINO的對比測試中RTX 4090筆記本電腦GPU相對於Arc核顯有超過27倍的性能提升。
使用吐司基準測試完整LoRA模型在Stable Diffusion的訓練性能,還對不同型號RTX 40系顯卡和筆記本電腦GPU在Stable Diffusion任務中的性能進行全面評估,旨在為AIGC愛好者在後期LoRA模型訓練和設備選擇時給予參考。

AI模型平台吐司/Tensor.Art 創始人沈振宇表示:“目前吐司和Tensor.Art上已經有超過16w+的模型數量。此次與英偉達聯合發佈《個人用户玩轉Stable Diffusion 的GPU配置推薦》旨在讓關注AIGC領域的入門用户以及不同垂類場景的用户在選擇RTX AI PC設備進行模型訓練和應用時提供客觀、公正的配置參考,提升用户使用AIGC的生產效率。”

Stable Diffusion是目前最常用的AI作圖工具,在現場演示Demo中,我們看到了SD專業工作流實時Demo裏,在TensorRT的加持下GeForce RTX 4090 D桌面GPU可提供高達每秒8張圖的生成速度。Tensor RT是當前速度最快的Stable Diffusion加速方法;目前GeForce RTX 4090 D最高能實現每秒超過百張圖的生成速度,因此Stable Diffusion用户也能像遊戲玩家一樣通過高幀率享受絲滑的創作體驗。

此外通過人像生成控制模型InstantID,用户可足不出户就能快速通過攝像頭的自拍照生成高質量影棚級別的肖像照。RTX 4090筆記本電腦能為Stable Diffusion用户帶來生產力級別的體驗。

在建築設計領域,即致AI基於擴散模型和蒸餾技術,通過RTX 4090 D GPU的加速,實現了秒級的AI實時繪畫。結合即致AI自研的全網下載量超50W國內建築行業大模型,幫助建築設計師享受AI實時渲染劃時代的快捷、便利的同時,依然可以保證極高的出圖效果。
活動現場還有來自土豆人tudou_man、Simon阿文、海辛、言蕭等AI藝術家展示如何利用RTX 40系列AI PC創作AIGC作品,由於篇幅關係這裏就不一一展開了。
看完了NVIDIA展示的內容我們也想知道當前各款RTX 40系顯卡在Stable Diffusion裏的性能表現,回來後就跑了RTX 40系的UL Procyon AI圖像生成基準測試,它使用Stable Diffusion 1.5和Stable Diffusion XL,使用一致和準確的工作負載來考驗每張顯卡在使用Stable Diffusion製圖時的性能。
軟件支持NVIDIA TensorRT、Intel OpenVINO和ONNX(含DirectML)這三個AI推理引擎,當中NVIDIA顯卡可支持TensorRT和ONNX,AMD顯卡支持ONNX,Intel顯卡只支持OpenVINO。

該測試對顯卡的顯存是有需求的,Stable Diffusion 1.5測試需要獨顯至少要有8GB顯存,而核顯系統則需要32GB內存,Stable Diffusion XL測試使用TensorRT至少需要10GB顯存,使用OpenVINO和ONNX則至少要16GB顯存。

AI圖像生成測試會批量生成16張100迭代步數的圖片,當中Stable Diffusion 1.5測試生成的圖片是512*512的,批量大小是4,而Stable Diffusion XL測試測試生成的圖片則是1024*1024,批量大小是1,測完成後你可以看到這16張生成的圖片,還可以點擊放大。
接下來我們就用全系列NVIDIA RTX 40 GPU來跑這個AI圖像生成測試,測試完成後是會給出得分、總體消耗時間以及圖片的平均生成速度,根據我們觀察得分和總體消耗時間是呈反比的。
先來看Stable Diffusion 1.5測試的測試結果,使用的推理引擎自然是TensorRT,得分最高的自然是性能最強的RTX 4090,為4693,而RTX 4090 D比它低5%左右,下面的卡性能落差還蠻大的,最低的RTX 4060只有1130分。
如果對得分沒概念的話請看圖片生成時間,RTX 4090生成一張圖片只需要1.331秒,而RTX 4090/4080系列GPU生成圖片時間都在2秒內,整個RTX 4070系列GPU的單張圖片生成時間在2.1~3.1秒之間,到了RTX 4060 Ti生成一張圖片就要4.3秒以上了,而RTX 4060更是需要5.5秒,用時是RTX 4090的四倍多。
接下來是Stable Diffusion XL的測試,這測試至少得有10GB以上的顯存,所以只能從RTX 4060 Ti 16GB開始跑,得分和1.5的相比大部分都要低一些,我們直接看圖片生成時間好了,圖片分辨率上去後對顯卡的壓力大了許多,生成時間也長了許多,RTX 4090的圖片生成速度是7.987秒,到了RTX 4080 SUPER就已經突破10秒一張了,RTX 4070單張耗時超過20秒,用時最長的RTX 4060 Ti達到了27.972秒。
為了讓大家更好的瞭解這些測試結果,我們還加入了AMD RX 7900 XTX的成績,由於它只能使用ONNX推理引擎,所以性能表現比RTX 4070還要低一點,可見兩邊的性能有巨大的差距。在生成式AI這方面,NVIDIA GeForce RTX 40系GPU在TensorRT的加速下性能優勢還是很大的,是目前生成式AI最佳的選擇,再加上NVIDIA在AI軟硬件生態有相當完善的佈局,所以現在數字藝術家和行業用户會選擇RTX AI PC,畢竟誰不喜歡開箱即用的強勁算力呢?