三句指令做出可以走進去的 3D 場景:特洛伊木馬實測全流程
去年這種東西要一個 3D 美術做好幾天。現在你只要會描述你想看到什麼。
我花了一個晚上做出一座特洛伊木馬的場景,城牆、城門、營帳、士兵、地上的蹄印都在裡面,而且可以用鍵盤走進去繞一圈。這篇把做法拆開來講,你照著做也做得出來。
成品長什麼樣

上面那張就是線上版的實際畫面。成品是一個網頁,打開之後你就站在木馬旁邊,可以用鍵盤前後左右走,滑鼠看四周,走到牆邊會被擋住,走近衛兵他會看著你。
想先看看的話:troy-walk.pages.dev。電腦開比較好走,手機也開得起來。
這個場景由四個部分組成
搞懂這四塊,你就知道每一句指令在做什麼。
一、場景骨架
這一步其實分兩半。
先弄一張整體的概念圖,把氣氛、比例、時間、光線先定下來。網路上找得到現成的參考圖就用現成的,找不到好的再讓生圖模型生一張。接著 AI 照著那張圖的大概,用程式在 Blender 裡把地形、城牆、城門、地面起伏一塊一塊蓋出來。
這一步很值得做。概念圖幾秒鐘就有,而且你一眼就知道方向對不對,比等 AI 蓋完一整版才發現整個氣氛不是你要的省太多時間。概念圖不用很精確,它的功用是「定調」,不是「照著描」。
至於為什麼骨架是用程式蓋、不是用模型:因為這類東西的規則很單純,石塊是一排一排交錯堆上去的,地面是幾個正弦波疊起來的起伏。AI 寫幾十行程式就能生成,而且之後要改尺寸、要加一座塔、要把牆拉高,改一個數字就好。用模型反而綁手綁腳。
二、物件
木馬、士兵、營帳、岩石、盾牌,這些是模型。
做法分兩步。先弄一張乾淨背景的正面照,只有那個物件、沒有其他東西、背景是灰色。一樣是找得到現成的就用現成的,沒有就生一張。再把那張圖丟進 image-to-3D 服務,它會吐出一個帶紋理的 3D 模型檔。
用網路上找的圖要留意授權。自己玩沒問題,要公開發布的話就挑標了可自由使用的,或是乾脆自己生。

左邊那張是生圖模型畫的平面圖,右邊是轉完的 3D 模型。中間沒有人手動建模。
三、材質
木板、沙地、石牆這些表面的紋理,要求跟前面不一樣:必須是四方連續,也就是上下左右接起來看不出接縫,才能鋪滿一整面牆或一整片地。
網路上有很多免費的四方連續材質庫,找得到合用的就直接用。找不到再讓生圖模型生,記得在指令裡寫明「四方連續」。

貼上去之後,整個場景就從一堆灰色方塊變成前面那張圖的樣子。
四、走進去
最後把整個場景匯出成一個檔案,丟進網頁,再寫一段程式控制鏡頭:怎麼走、怎麼看、撞到牆要停下來。這段對 AI 來說是標準功課,不用你操心。
你需要準備什麼
四類東西,每一類都有不只一種選擇。我列我自己用的,也列其他能用的,你手上有什麼就用什麼。
一個會寫程式、又看得懂圖的 AI
這是唯一不能省的一項。它要能寫程式、能執行、還要能看自己算出來的圖再判斷該改哪裡。
我用的是 Claude Code,模型掛 Fable 5.1。GPT-6 Astra 也很強,最近網路上那些讓人驚訝的 3D 作品,很多都是它做出來的。這兩個能力都夠,你已經在用哪一個就用哪一個,不用為了這件事再多開一個訂閱。
3D 軟體
Blender。免費、開源、社群夠大,新手拿來試完全沒有負擔,做壞了也不心疼。
而且你不用學它怎麼操作。AI 是用命令列在驅動它,你從頭到尾只會看到算出來的圖,介面連打開都不用打開。
生圖
我用 OpenAI 的 gpt-image-2,按張計費、很便宜。Nano Banana、Seedream 這類的也可以。材質貼圖跟乾淨背景的物件圖對現在的生圖模型來說都不難,差別多半在細節密度,不影響你先做出第一版。
圖片轉 3D 模型
我用 Tripo。Meshy 也是常見的選擇,兩家官網都有免費月額度,夠你先試出感覺再決定要不要付費。
品質有差,但都能用。真的要照片級的模型,那是另一條路,我在後面「想做到照片級擬真」那段會講。
一句話總結:這四樣裡面只有 AI 是訂閱制,其他三樣都可以先用免費的玩過一輪再說。
三句指令
重點來了。你不需要寫落落長的規格,也不需要事先想清楚每個細節。
先講一個心法:你的指令只要交代「你想看到什麼」,剩下的讓 AI 反問你。它問什麼你就答什麼,這比你自己憋一份完美的需求書快十倍,而且結果更接近你要的。
第一句:先把場景蓋出來
我想用 Blender 做一個可以走進去的 3D 場景。
先問我想做什麼場景、什麼氣氛,然後找一張參考圖給我看
(網路上找得到合適的就用現成的,沒有好的再生一張)。
我確認圖之後,再用程式照著那張圖把地面、牆面這些大結構蓋出來。
這一句不用填任何東西,直接貼過去就好。它會反問你要做什麼場景,你再回答。
概念圖那一步不要省。你看到圖才知道自己想的跟 AI 想的是不是同一件事,不對就換一張,很快。
第二句:把物件跟材質補上
這個場景需要哪些物件,你先列給我確認。
每一個都先弄一張乾淨灰底的正面圖(找得到現成的就用,沒有就生),
再用 image-to-3D 轉成模型匯進場景。
表面的材質也一樣處理,記得要四方連續的。
這句是整個流程裡最關鍵的一句。它同時交代了物件跟材質兩件事,而且指定了「乾淨灰底的正面圖」這個關鍵條件,image-to-3D 才轉得準。
物件清單讓它先列出來給你確認,比你自己想快,也不會漏掉像岩石、雜草這種你不會主動想到、但少了就很空的東西。
第三句:變成可以走進去的網頁
把整個場景匯出成 GLB,做一個網頁版,
我可以用鍵盤走動、滑鼠看四周,走到牆會被擋住。
到這裡就有一個可以打開來走的網頁了。
想做到照片級擬真,該往哪走
如果你不怕燒 token 也願意付費,方向不是「多迭代幾輪」。這是我這次最大的體悟。
我一開始的想法是讓 AI 在 Blender 裡不斷調參數、算圖、看圖、再改,修個幾十輪應該就會很真。實際上不會。渲染器本身是照片級的,光影、材質、景深、霧氣交給它都會真。真正卡住的是形狀跟貼圖:木馬要有幾千片木板、繩結、鉚釘,這些用程式一筆一筆堆,修幾百輪還是「像樣的模型」,很難變成「像照片」。
所以要更真,走這三個方向:
- 主體物件換成照片級素材。掃描模型、Megascans 這類資源庫、或是更高階的 image-to-3D。這一步一次到位,比迭代一百輪有效。
- 讓 AI 只負責打光、鏡頭、氛圍、擺放。這四件事迭代幾輪就有明顯進步,而且是照片感的真正來源。
- 算圖等級拉高。取樣數調高、開啟降噪、算 4K。這只是時間問題,不是能力問題。
反過來說,讓 AI 從零雕細節這條路,只留給小東西。一個門把、一塊石頭可以,一整隻怪獸不行。
還有一個要有心理準備的:迭代很燒。每一輪都要算一張圖、AI 看圖、判斷、改程式、再算,一張圖進 AI 的上下文就是一筆成本,十幾輪下來比生一張圖貴很多倍。而且越接近真實,每一輪的進步越小,會有一種「花了三輪只換到陰影軟一點」的感覺。所以請把預算花在素材,不要花在迭代。
常見問題
完全不會 Blender 可以做嗎
可以。我從頭到尾沒有打開過 Blender 的介面。AI 是用命令列驅動它,你看到的只有算出來的圖。
一定要付費嗎
生圖跟 image-to-3D 都有免費額度可以先試。Blender 完全免費。真正的成本在那個會寫程式的 AI,那是訂閱制。
要花多久
我這次是一個晚上,包含來回修改。如果你的場景比較單純,例如一個房間、一間店面,會快很多。
可以拿來做什麼
室內設計師可以做線上的 3D 展示間,藝術家可以做線上展覽館,寫小說的人可以把場景蓋出來讓讀者走進去,房仲可以把房源做成可以逛的空間。你自己的行業裡,只要有「我想讓對方親眼看看那個空間」的需求,這條路都用得上。
做出來的東西可以放在網路上嗎
可以,就是一個普通網頁,丟到任何靜態網站服務都能跑。
最後
這件事最有趣的地方不是技術,是門檻真的不見了。以前你要嘛會建模、要嘛付錢找人,現在你只要說得出你想看到什麼。
我還在繼續玩這個,之後會把更擬真的版本、還有怎麼把角色做成可以動的,都記錄下來。
想看用 AI 讓生活跟工作更輕省,追蹤 AI 生活實驗室 👉 @life.coach.mtcity,我們一起玩 AI。你做出什麼場景,也歡迎留言或私訊給我看,我真的會看。