GenEvolve是什麼
GenEvolve 是香港科技大學(廣州)、美團與新加坡國立大學聯合推出的自演進圖像生成 Agent。GenEvolve 將開放式圖像生成形式化爲工具編排的視覺軌跡,Agent 通過搜索文本證據、檢索視覺參考、調用生成知識,最終合成 prompt-reference program,交由任意參考條件生成器渲染。

GenEvolve的主要功能
-
文本搜索(search):收集外部事實證據,補充真實建築、公衆人物、商品結構等世界知識。
-
圖像搜索(image_search):檢索視覺參考圖,獲取地標、人物、材質等視覺參考。
-
生成知識查詢(query_knowledge):激活內部生成技能,處理文字渲染、空間佈局、材質一致性等複雜需求。
-
Prompt-Reference Program 合成:將工具結果整合爲可執行的生成程序,支持任意參考條件生成器渲染。
GenEvolve的技術原理
- 訓練分爲兩階段:
-
SFT 冷啓動:在高質量 Teacher 軌跡上對 Qwen3-VL-8B-Instruct 做監督微調,學習基本工具調用和程序寫法。
-
自我進化(Rollout):對同一請求採樣多條軌跡,渲染成圖像後由視覺判分器和文本判分器共同打分,使用 GRPO 優化軌跡級獎勵。
-
- 視覺經驗自蒸餾(Visual Experience Distillation): 比較同一請求下的最優與最差軌跡,將差異總結爲結構化 Decision Guide,通過 token 級反向 KL 將教師分支的偏好蒸餾給學生模型,使模型學會”在類似請求時如何搜索、選參考、組織約束”的決策習慣。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用GenEvolve
-
克隆倉庫:從 GitHub 下載 GenEvolve 代碼到本地環境。
-
安裝依賴:運行
pip install -r requirements.txt安裝所需 Python 包。 -
下載模型:從 HuggingFace 下載
MeiGen-AI/GenEvolve的 Qwen3-VL-8B Agent 策略權重。 -
配置搜索工具:設置搜索引擎 API 密鑰,啓用
search和image_search工具調用。 -
加載生成知識:將八項技能 Markdown 文件放入指定目錄,供
query_knowledge工具讀取。 -
選擇生成器:在 Qwen-Image-Edit或 Nano Banana Pro中選定後端並配置密鑰。
-
初始化 Agent:實例化
GenEvolveAgent,傳入模型路徑、生成器名稱和工具列表。 -
輸入請求:調用
agent.run()方法,傳入自然語言圖像生成描述。 -
執行軌跡:Agent 自動搜索文本證據、檢索視覺參考、調用生成知識併合成 prompt-reference program。
-
渲染圖像:將 Agent 輸出的程序傳入配置好的生成器後端,得到最終生成圖像。
GenEvolve的核心優勢
-
生成器可遷移性:同一套 Agent 策略可搭配開源 Qwen-Image-Edit 或強生成器 Nano Banana Pro,策略不綁定特定生成器。
-
自我進化閉環:GRPO + 視覺經驗自蒸餾形成”更強策略 → 更好軌跡 → 更豐富經驗 → 未來改進”的閉環。
-
細粒度信用分配:相比純 RL 的標量獎勵,SDL 提供 token 級指導,明確好軌跡好在工具計劃、參考選擇還是約束寫法。
-
跨基準泛化:在 WISE 知識密集型基準上不做 in-domain 微調,8B 開源策略超過 GPT-4o。
GenEvolve的項目地址
- 項目官網:https://ephemeral182.github.io/GenEvolve/
- GitHub倉庫:https://github.com/MeiGen-AI/GenEvolve
- HuggingFace模型庫:https://huggingface.co/MeiGen-AI/GenEvolve
GenEvolve的同類競品對比
| 對比維度 | GenEvolve | Gen-Searcher |
|---|---|---|
| 核心機制 | 工具編排視覺軌跡 → prompt-reference program → 跨生成器渲染 | 搜索增強 → 直接生成 |
| Agent 架構 | 三工具閉環:search + image_search + query_knowledge | primarily 搜索工具調用 |
| 訓練方法 | SFT 冷啓動 + GRPO 軌跡優化 + 視覺經驗自蒸餾(SDL) | 未公開明確的多階段訓練機制 |
| 自我進化 | ✅ 支持:通過 GRPO 和 SDL 形成”更強策略→更好軌跡→更豐富經驗”的閉環 | ❌ 不支持:無持續優化機制 |
| 生成器可遷移性 | ✅ 核心設計:同一 Agent 輸出可適配 Qwen-Image-Edit 或 Nano Banana Pro | ❌ 綁定特定生成器後端 |
| 開源程度 | 全棧開源:模型權重、運行時、工具、數據集、評測基準 | 開源程度有限 |
| KScore | 0.3663 | 0.3493 |
GenEvolve的應用場景
- 知識密集型圖像生成:需要外部世界知識的場景,如真實地標建築(埃菲爾鐵塔、故宮)、公衆人物肖像、特定商品結構、歷史事件還原。Agent 通過搜索工具補充事實,避免生成器”幻覺”錯誤細節。
- 質量約束型圖像生成:對文字渲染、精確計數、空間佈局、屬性綁定、解剖結構準確性、材質真實感、美學風格有硬性要求的商業設計、廣告海報、教育插圖。
- 參考一致性圖像生成:要求輸出與參考圖保持身份一致(角色設計)、材質特殊(金屬/絲綢質感)或風格統一(特定畫家風格)的系列化內容生產、IP 衍生創作。
- 模糊需求澄清與程序化:將用戶模糊描述轉化爲可執行的生成程序,明確搜索什麼、參考什麼、約束什麼,降低 prompt engineering 門檻。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...