泰达数据推出新460亿参数视觉模型,将人工智能推离云端

CN
2小时前

关键要点

  • Tether 的 QVAC 单元于 2026 年 7 月 29 日开源了一个 4.6 亿参数的视觉模型。
  • 该模型在 17 项基准测试中的 16 项中超过了 Liquid AI 和 Hugging Face 的竞争对手。
  • 它的闪电版本在 iPhone 15 上运行速度比 SmolVLM2-500M 快了多达 36 倍。

该模型由公司的 AI 研究部门 QVAC 于星期三发布,VisionPsy-Nano 可以检查图像、文档和图表,然后在不将源材料发送到远程系统的情况下回答问题。手机处理输入和响应,使软件能够离线操作并将数据保留在设备中。

QVAC 表示,Tether AI Research 的模型在参数少于 5 亿的视觉语言系统中记录了最高的整体得分。在 17 项基准测试中,它在 16 项中超过了竞争模型。

该模型的标准化得分为 62.3,而 Liquid AI 的 LFM2.5-VL-450M 为 59.6,Hugging Face 的 SmolVLM2-500M 为 52.5。QVAC 之前的 nanoVLM-460M-8k 基础模型得分为 54.9。

Tether 数据发布有两个版本。标准版本优先考虑准确性,而闪电版本则在保持较快响应的同时稍微牺牲一些质量。QVAC 表示,闪电版本保留了完整模型约 99% 的性能,同时在 Android 手机上产生首个输出的速度比 SmolVLM2-500M 快多达 23 倍,在 iPhone 15 上快多达 36 倍。

响应时间在移动硬件上很重要。一个紧凑的模型在测试中可以得分良好,但如果用户必须等待设备处理图像,那么它仍然显得不够实用。闪电版本旨在减少这种初始延迟。

该人工智能(AI)系统还支持文档分析和光学字符识别,从财务报告、流程图和信息图中提取文本和结构。

QVAC 表示,该模型在视觉推理测试中比同样规模的竞争对手平均超出 7.4%。它还在 MM-IFEval 和 POPE 上超越了体积超过自己两倍的模型,包括来自 Qwen 和 InternVL 的发布。

将图像处理从数据中心移到手机上引入了对于内存、热量、电池使用和计算能力的严格限制。紧凑型模型通常能够处理纯文本,但在读取密集的图表、表格或扫描文档时准确性会下降。

QVAC 的基准结果表明,该模型在保持消费者设备所需的小巧的同时,保留了大部分能力。本地处理还意味着文档不需要上传,软件可以在没有网络连接的情况下继续工作。

开发者可以通过 Hugging Face Transformers、用于 llama.cpp 的量化 GGUF 版本或用于高流量服务器使用的 vLLM 后端访问该模型。

QVAC 还通过 VLMEvalKit 发布了其基准配置,允许外部研究人员重复测试。这两个版本均使用 Apache 2.0 许可证,允许商业使用、修改和再分发。

Tether 首席执行官 Paolo Ardoino 表示,此次发布支持公司向本地高效 AI 系统的推进。

“在仅 4.6 亿参数的情况下,在通用视觉任务上实现业内最佳质量和性能证明了本地优先的高效 AI 是一条可行的道路,”Ardoino 说。

该模型继承了多个自 2025 年 10 月以来的 QVAC 发布,包括合成训练数据集、跨平台软件开发工具包和为手机及可穿戴设备设计的医疗模型。

对于开发者来说,此次发布提供了离线图像分析,而无需基于使用的 API 成本。企业可以将敏感文档保留在设备上,而消费者可以在没有信号的情况下使用 AI 功能。研究人员可以使用发布的配置独立测试公司的性能声明。

Tether 已通过其 USDT 稳定币业务的利润为其 AI 扩张提供资金。它还投资于 AI 基础设施、生物科技和机器人,包括对 NEURA Robotics 的 C 轮投资,价值高达 14 亿美元。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接