AI工具

Open Deep Research – Deep Research開源復現版智能體,支持切換多種語言模型

Open Deep Research是什麼 Open Deep Research 是開源的 AI 智能體,是Deep Research開源復現項目,基於推理大量網絡數據完成複雜的多步驟研究任務。Open Dee...

X-Prompt – 用於多模態視頻目標分割的通用框架

X-Prompt是什麼 X-Prompt是用於多模態視頻目標分割的通用框架,解決傳統方法在極端光照、快速運動和背景干擾等複雜場景下的侷限性。通過預訓練一個基於 RGB ...

NewsBang – AI新聞應用,提供實時問答、生成新聞摘要

NewsBang是什麼 NewsBang是AI驅動的新聞應用,專注於爲用戶提供無偏見、深度的新聞洞察。通過AI技術整合多元新聞來源,生成簡潔的新聞摘要,幫助用戶快速瞭解...

Fast3R – Meta 聯合密歇根大學推出的多視圖3D重建方法

Fast3R是什麼 Fast3R是Meta和密歇根大學的研究人員提出的新型的多視圖3D重建方法,基於Transformer架構,能在一個前向傳播過程中處理1000多張圖像,實現高效...

Whisper Input – 開源AI語音輸入工具,支持多語言實時轉錄和翻譯

Whisper Input是什麼 Whisper Input 是開源的語音輸入工具,基於 Python 和 OpenAI 的 Whisper 模型開發。通過簡單的快捷鍵操作(如按下 Option 鍵開始錄音,...

Cosmos – 英偉達推出的生成式世界基礎模型平台

Cosmos是什麼 Cosmos是英偉達推出的生成式世界基礎模型平台,加速物理人工智能(AI)系統的發展,特別是在自動駕駛和機器人領域。Cosmos能接受文本、圖像或視...

Step-1o Vision – 階躍星辰推出的原生端到端視覺理解模型

Step-1o Vision是什麼 Step-1o Vision 是階躍星辰最新研發的原生端到端多模態生成與理解一體化模型中的視覺版本。專注於視覺任務,具備強大的圖像識別、感知...

MinMo – 阿里通義實驗室推出的多模態語音交互大模型

MinMo是什麼 MinMo是阿里巴巴通義實驗室FunAudioLLM團隊推出的多模態大模型,專注於實現無縫語音交互。MinMo擁有約80億參數,基於多階段訓練,在140萬小時多...

3MinTop – AI閱讀助手,將書籍內容精煉總結爲 3 分鐘精華摘要

3MinTop是什麼 3MinTop 是 AI 驅動的閱讀助手,能將書籍內容精煉總結爲 3 分鐘的精華摘要,幫助用戶快速掌握書籍核心要點,降低閱讀門檻,培養閱讀習慣。用戶...

ArtCrafter – 清華聯合鵬城實驗室和聯想共同推出的文本到圖像風格遷移框架

ArtCrafter是什麼 ArtCrafter是清華大學、鵬城實驗室和聯想研究院共同推出的文本到圖像風格遷移框架,基於擴散模型,解決傳統方法在風格表達、內容一致性和輸...
1 ... 67 68 69 70 71 ... 149