Phi-baidu094-baidu09Multimodal – 微软最新推出的多模态语言模型

baidu09_com 2025-08-30 38 0

Phi-4-Multimodal 是微软最新推出的多模态语言模型，拥有 56 亿参数，能将语音、视觉和文本处理集成到一个统一架构中。模型在多个基准测试中表现优异，在自动语音识别（ASR）和语音翻译（ST）任务中，以 6.14% 的单词错误率位居 Hugging Face OpenASR 排行榜首位，超越了 WhisperV3 和 SeamlessM4T-v2-Large 等专业模型。在视觉任务方面，Phi-4-Multimodal 在文档理解、图表分析和 OCR 等任务中表现出色，超越了 Gemini-2-Flash-lite-preview 和 Claude-3.5-Sonnet 等模型。Phi-4-Multimodal 支持 22 种语言的文本和语音输入，具备 128K 令牌的上下文处理能力，适用于多语言和长文本任务。模型基于多模态 Transformer 架构，训练数据包括 5 万亿个文本令牌、230 万小时的语音数据和 11 亿个图像-文本配对。微软通过内部和外部安全专家的测试，确保安全性和可靠性。