AI工具
Open Deep Research – Deep Research開源復現版智能體,支持切換多種語言模型
Open Deep Research是什麼 Open Deep Research 是開源的 AI 智能體,是Deep Research開源復現項目,基於推理大量網絡數據完成複雜的多步驟研究任務。Open Dee...
TÜLU 3 – Ai2 推出的系列開源指令遵循模型
TÜLU 3是什麼 TÜLU 3是艾倫人工智能研究所(Ai2)推出的一系列開源指令遵循模型,包括8B和70B兩個版本,未來計劃推出405B版本。模型在性能上超越Llama 3.1 In...
X-Prompt – 用於多模態視頻目標分割的通用框架
X-Prompt是什麼 X-Prompt是用於多模態視頻目標分割的通用框架,解決傳統方法在極端光照、快速運動和背景干擾等複雜場景下的侷限性。通過預訓練一個基於 RGB ...
NewsBang – AI新聞應用,提供實時問答、生成新聞摘要
NewsBang是什麼 NewsBang是AI驅動的新聞應用,專注於爲用戶提供無偏見、深度的新聞洞察。通過AI技術整合多元新聞來源,生成簡潔的新聞摘要,幫助用戶快速瞭解...
Fast3R – Meta 聯合密歇根大學推出的多視圖3D重建方法
Fast3R是什麼 Fast3R是Meta和密歇根大學的研究人員提出的新型的多視圖3D重建方法,基於Transformer架構,能在一個前向傳播過程中處理1000多張圖像,實現高效...
Whisper Input – 開源AI語音輸入工具,支持多語言實時轉錄和翻譯
Whisper Input是什麼 Whisper Input 是開源的語音輸入工具,基於 Python 和 OpenAI 的 Whisper 模型開發。通過簡單的快捷鍵操作(如按下 Option 鍵開始錄音,...
Cosmos – 英偉達推出的生成式世界基礎模型平台
Cosmos是什麼 Cosmos是英偉達推出的生成式世界基礎模型平台,加速物理人工智能(AI)系統的發展,特別是在自動駕駛和機器人領域。Cosmos能接受文本、圖像或視...
RAIN – 視頻流製作實時動畫生成和真人表情移植解決方案
RAIN是什麼 RAIN(Real-time Animation Of Infinite Video Stream)是創新的實時動畫解決方案,基於消費級硬件,如單個RTX 4090 GPU,實現無限視頻流的實時動...
Step-1o Vision – 階躍星辰推出的原生端到端視覺理解模型
Step-1o Vision是什麼 Step-1o Vision 是階躍星辰最新研發的原生端到端多模態生成與理解一體化模型中的視覺版本。專注於視覺任務,具備強大的圖像識別、感知...
MinMo – 阿里通義實驗室推出的多模態語音交互大模型
MinMo是什麼 MinMo是阿里巴巴通義實驗室FunAudioLLM團隊推出的多模態大模型,專注於實現無縫語音交互。MinMo擁有約80億參數,基於多階段訓練,在140萬小時多...