Lyra – SmartMore聯合多所高校推出的增強多模態交互能力

AI工具2年前 (2024)發佈新公告 AI管理員
0 0

Lyra是什麼

Lyra是香港中文大學、SmartMore和香港科技大學推出的高效多模態大型語言模型(MLLM),專注於提升語音、視覺和語言模態的交互能力。Lyra基於開源大型模型、多模態LoRA模塊和潛在的多模態正則化器,減少訓練成本和數據需求。Lyra構建大規模的多模態數據集,包括長語音樣本,處理複雜的長語音輸入,實現強大的全模態認知能力。在多種模態理解和推理任務中,Lyra達到最先進的性能,同時在計算資源和訓練數據的使用上更爲高效。

Lyra – SmartMore聯合多所高校推出的增強多模態交互能力

Lyra的主要功能

  • 多模態理解與推理:Lyra能理解和處理圖像、視頻、音頻和文本等多種模態的數據,執行復雜的理解和推理任務。
  • 語音中心能力:模型特別強化對語音的理解,包括長語音的識別和處理,在語音交互方面表現出色。
  • 高效處理:Lyra在訓練和推理時更加高效,用更少的數據和計算資源,適合實時和長上下文的多模態應用。
  • 流式生成:支持同時生成文本和語音輸出,在對話和交互中實時響應。
  • 跨模態交互:基於潛在的多模態正則化器和提取器,加強不同模態之間的信息交互,提升模型性能。

Lyra的技術原理

  • 多模態LoRA(Low-Rank Adaptation):基於了LoRA技術適配多模態輸入,模型在保留原有視覺能力的同時,發展在語音模態中的能力,減少訓練數據的需求。
  • 潛在跨模態正則化器:基於動態時間彎曲(Dynamic Time Warping, DTW)算法,將語音令牌與對應的文本令牌對齊,讓語音模態的輸入在語義上與文本模態保持一致。
  • 潛在多模態提取器:基於評估不同模態令牌與文本查詢的相關性,動態選擇和保留與任務最相關的令牌,提高訓練和推理的效率。
  • 長語音能力集成:構建專門的長語音SFT數據集,基於壓縮技術處理長語音令牌,讓模型處理長達數小時的音頻輸入。
  • 流式文本-語音生成:集成流式生成機制,支持模型在生成文本的同時輸出對應的語音,實現無縫的多模態交互體驗。
  • 數據集構建:爲訓練和優化Lyra,研究者構建包含150萬多個多模態樣本和1.2萬多個長語音樣本的高質量數據集,數據覆蓋豐富的場景和領域。

Lyra的項目地址

  • 項目官網:lyra-omni
  • GitHub倉庫:https://github.com/dvlab-research/Lyra
  • HuggingFace模型庫:https://huggingface.co/collections/zszhong/lyra-data
  • arXiv技術論文:https://arxiv.org/pdf/2412.09501

Lyra的應用場景

  • 智能助手:作爲智能助手,理解和響應用戶的語音指令,提供信息查詢、日程管理、提醒設置等服務。
  • 客戶服務:在客戶服務領域,基於語音和文本交互,處理客戶諮詢、投訴和技術支持等問題。
  • 教育和培訓:作爲教育輔助工具,提供語音講解、課程內容理解和問答,以及語言學習中的發音和聽力訓練。
  • 健康醫療:在醫療領域,幫助患者通過語音諮詢健康問題,或作爲醫生的輔助工具,理解和總結患者的醫療記錄。
  • 內容審覈:分析圖像、視頻和文本內容,進行內容審覈,識別和過濾不當內容。
© 版權聲明

相關文章

暫無評論

暫無評論...