今日,AI 开发领域迎来两项重要更新:前端部署平台 Vercel 正式发布 AI SDK 5,首次将语音交互能力以原生 API 形式开放;与此同时,本地大模型运行工具 Ollama 推出新版,全面支持多模态交互,让开发者能够在个人设备上轻松处理图像、文字与语音的融合任务。这两则消息分别从云端和本地两大方向,进一步降低了 AI 应用的开发门槛。

Vercel AI SDK 5:语音能力成为“一等公民”

Vercel 的 AI SDK 自推出以来,一直是前端开发者快速集成大语言模型的首选工具。此次 5.0 版本的核心升级,在于将语音 API 提升为 SDK 的原生模块。开发者现在可以直接通过 ai/speech 调用实时语音识别(ASR)与文本转语音(TTS)功能,无需额外对接第三方服务。

具体来看,新语音 API 支持流式传输,能够实现低延迟的双向对话。前端只需几行代码即可为应用添加“语音输入→AI 理解→语音回复”的完整闭环。例如,一个电商客服场景中,用户说“帮我查一下订单”,SDK 会自动完成语音转文本、调用 LLM 生成回复、再合成语音返回。Vercel 还特别优化了 Edge 运行时的兼容性,使语音处理可以在全球边缘节点就近执行,延迟控制在 200 毫秒以内。

除了语音,AI SDK 5 还改进了模型路由策略,允许开发者为不同任务指定不同模型(如用 GPT-4o 处理复杂推理,用 Claude 3.5 处理创意写作),并通过统一的 streamText 接口管理输出。同时,新增的“工具调用”调试面板让开发者能直观追踪 AI 每一步的决策过程。Vercel CEO Guillermo Rauch 在公告中强调:“语音不是可选项,而是下一代人机交互的默认方式。AI SDK 5 让每个前端都能轻松拥有对话式 AI。”

Ollama 新版本:本地多模态推理触手可及

如果说 Vercel 代表云端的便捷,那么 Ollama 则持续降低本地运行大模型的门槛。最新版本(v0.3.0)最大的亮点是正式支持多模态交互——用户现在可以直接向模型输入图片、PDF 或音频文件,并获得智能分析结果。这意味着,在完全离线的环境下,开发者也能实现“拍一张照片,让 AI 描述场景”或“上传扫描件,提取表格数据”等操作。

Ollama 本次更新基于 llama.cpp 底层的多模态扩展,兼容了 LLaVA、BakLLaVA、Pixtral 等多个视觉语言模型。以 LLaVA 为例,一个 7B 参数的模型在 M 系列 Mac 上推理一张 1080p 图片仅需 3-4 秒,显存占用约 8GB。同时,新版引入了“模型别名”热切换功能,开发者可以在同一个会话中快速切换不同多模态模型,方便对比效果。

在易用性方面,Ollama 新版提供了全新的 REST API 端点 /v1/chat/completions-with-images,兼容 OpenAI 格式,让现有 ChatGPT 客户端可以零修改接入本地多模态模型。此外,支持的硬件范围也扩展到 AMD ROCm 和 Intel Arc 显卡,进一步降低了 GPU 门槛。社区测试显示,在 24GB VRAM 的 RTX 4090 上,甚至可以直接运行 13B 参数的图文理解模型,达到每秒 30 的 token 生成速度。

云端与本地协同,AI 生态加速分化

两则新闻看似独立,实则反映了 AI 基础设施发展的两条主线:Vercel 将复杂服务封装为“一键集成”,适合需要弹性扩展的在线应用;Ollama 则坚持“数据不出本机”,满足企业对隐私和成本的严苛要求。值得注意的是,本次更新中两者都强调了“多模态”与“语音”的融合——Vercel 用 API 覆盖输入输出,Ollama 则让本地模型也能理解图像音频。这种趋势预示着,未来 AI 应用将从纯文本对话转向更自然的“多通道”交互。

对于开发者而言,这意味着可以更灵活地选择部署路径:小团队用 Vercel 快速验证语音 UI 原型,合规性要求高的项目则用 Ollama 搭建私有知识库。随着 AI SDK 5 和 Ollama 新版的同时推出,我们有理由相信,2024 年将是多模态应用从实验走向规模化落地的关键转折点。