GenEvolve – 美團等推出的自演進圖像生成 Agent

AI工具2周前發佈新公告 AI管理員
0 0

GenEvolve是什麼

GenEvolve 是香港科技大學(廣州)、美團與新加坡國立大學聯合推出的自演進圖像生成 Agent。GenEvolve 將開放式圖像生成形式化爲工具編排的視覺軌跡,Agent 通過搜索文本證據、檢索視覺參考、調用生成知識,最終合成 prompt-reference program,交由任意參考條件生成器渲染。

GenEvolve – 美團等推出的自演進圖像生成 Agent

GenEvolve的主要功能

  • 文本搜索(search):收集外部事實證據,補充真實建築、公衆人物、商品結構等世界知識。
  • 圖像搜索(image_search):檢索視覺參考圖,獲取地標、人物、材質等視覺參考。
  • 生成知識查詢(query_knowledge):激活內部生成技能,處理文字渲染、空間佈局、材質一致性等複雜需求。
  • Prompt-Reference Program 合成:將工具結果整合爲可執行的生成程序,支持任意參考條件生成器渲染。

GenEvolve的技術原理

  • 訓練分爲兩階段
    • SFT 冷啓動:在高質量 Teacher 軌跡上對 Qwen3-VL-8B-Instruct 做監督微調,學習基本工具調用和程序寫法。
    • 自我進化(Rollout):對同一請求採樣多條軌跡,渲染成圖像後由視覺判分器和文本判分器共同打分,使用 GRPO 優化軌跡級獎勵。
  • 視覺經驗自蒸餾(Visual Experience Distillation): 比較同一請求下的最優與最差軌跡,將差異總結爲結構化 Decision Guide,通過 token 級反向 KL 將教師分支的偏好蒸餾給學生模型,使模型學會”在類似請求時如何搜索、選參考、組織約束”的決策習慣。

GenEvolve – 美團等推出的自演進圖像生成 Agent

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用GenEvolve

  • 克隆倉庫:從 GitHub 下載 GenEvolve 代碼到本地環境。
  • 安裝依賴:運行 pip install -r requirements.txt 安裝所需 Python 包。
  • 下載模型:從 HuggingFace 下載 MeiGen-AI/GenEvolve 的 Qwen3-VL-8B Agent 策略權重。
  • 配置搜索工具:設置搜索引擎 API 密鑰,啓用 searchimage_search 工具調用。
  • 加載生成知識:將八項技能 Markdown 文件放入指定目錄,供 query_knowledge 工具讀取。
  • 選擇生成器:在 Qwen-Image-Edit或 Nano Banana Pro中選定後端並配置密鑰。
  • 初始化 Agent:實例化 GenEvolveAgent,傳入模型路徑、生成器名稱和工具列表。
  • 輸入請求:調用 agent.run() 方法,傳入自然語言圖像生成描述。
  • 執行軌跡:Agent 自動搜索文本證據、檢索視覺參考、調用生成知識併合成 prompt-reference program。
  • 渲染圖像:將 Agent 輸出的程序傳入配置好的生成器後端,得到最終生成圖像。

GenEvolve的核心優勢

  • 生成器可遷移性:同一套 Agent 策略可搭配開源 Qwen-Image-Edit 或強生成器 Nano Banana Pro,策略不綁定特定生成器。
  • 自我進化閉環:GRPO + 視覺經驗自蒸餾形成”更強策略 → 更好軌跡 → 更豐富經驗 → 未來改進”的閉環。
  • 細粒度信用分配:相比純 RL 的標量獎勵,SDL 提供 token 級指導,明確好軌跡好在工具計劃、參考選擇還是約束寫法。
  • 跨基準泛化:在 WISE 知識密集型基準上不做 in-domain 微調,8B 開源策略超過 GPT-4o。

GenEvolve的項目地址

  • 項目官網:https://ephemeral182.github.io/GenEvolve/
  • GitHub倉庫:https://github.com/MeiGen-AI/GenEvolve
  • HuggingFace模型庫:https://huggingface.co/MeiGen-AI/GenEvolve

GenEvolve的同類競品對比

對比維度 GenEvolve Gen-Searcher
核心機制 工具編排視覺軌跡 → prompt-reference program → 跨生成器渲染 搜索增強 → 直接生成
Agent 架構 三工具閉環:search + image_search + query_knowledge primarily 搜索工具調用
訓練方法 SFT 冷啓動 + GRPO 軌跡優化 + 視覺經驗自蒸餾(SDL) 未公開明確的多階段訓練機制
自我進化 ✅ 支持:通過 GRPO 和 SDL 形成”更強策略→更好軌跡→更豐富經驗”的閉環 ❌ 不支持:無持續優化機制
生成器可遷移性 ✅ 核心設計:同一 Agent 輸出可適配 Qwen-Image-Edit 或 Nano Banana Pro ❌ 綁定特定生成器後端
開源程度 全棧開源:模型權重、運行時、工具、數據集、評測基準 開源程度有限
KScore 0.3663 0.3493

GenEvolve的應用場景

  • 知識密集型圖像生成:需要外部世界知識的場景,如真實地標建築(埃菲爾鐵塔、故宮)、公衆人物肖像、特定商品結構、歷史事件還原。Agent 通過搜索工具補充事實,避免生成器”幻覺”錯誤細節。
  • 質量約束型圖像生成:對文字渲染、精確計數、空間佈局、屬性綁定、解剖結構準確性、材質真實感、美學風格有硬性要求的商業設計、廣告海報、教育插圖。
  • 參考一致性圖像生成:要求輸出與參考圖保持身份一致(角色設計)、材質特殊(金屬/絲綢質感)或風格統一(特定畫家風格)的系列化內容生產、IP 衍生創作。
  • 模糊需求澄清與程序化:將用戶模糊描述轉化爲可執行的生成程序,明確搜索什麼、參考什麼、約束什麼,降低 prompt engineering 門檻。
© 版權聲明

相關文章

暫無評論

暫無評論...