#模型推理
共 7 篇相关文章

·4 分钟
全球金融科技如何用专属模型推理扩展编码智能体
一家全球金融科技企业通过 Together 的专属模型推理(DMI)扩展编码智能体流量,让工程团队直接掌控推理扩展、模型选型与测试验证。本文解析其转型动因与企业 AI 落地启示。
阅读全文 →

·4 分钟
Qwen Flash Next 恢复 MTP 支持:llama.cpp 本地部署再进一步
Qwen Flash Next 的 MTP(多 token 预测)支持在 llama.cpp 中重新启动,提供 GGUF 量化模型与对应 PR。本文解读 MTP 技术价值、使用方法及注意事项。
阅读全文 →

·4 分钟
vLLM v0.31.0rc3发布:Model Runner V2引入随机化虚拟输入
vLLM 发布 v0.31.0rc3 候选版本,核心更新为 Model Runner V2 支持随机化虚拟输入,提升显存剖析与推理预热精度。本文解析该特性原理及对部署者的实际影响。
阅读全文 →

·5 分钟
TensorRT多设备推理:简化Dynamo-Triton的多GPU模型部署
NVIDIA在Dynamo-Triton中引入TensorRT多设备推理能力,简化跨多GPU的大模型部署,解决单卡显存与算力不足问题,为生成式AI生产环境提供更高效的推理服务方案。
阅读全文 →
教程攻略·8 分钟
Ollama教程:本地运行大模型的完整指南(2025最新)
详解Ollama本地部署大语言模型的完整教程,支持DeepSeek、Qwen、Kimi-K2.5等主流模型。17万Star开源项目,一键安装即可在本地运行LLM,保护数据隐私,零API成本。
阅读全文 →
教程攻略·8 分钟
Ollama教程:本地运行DeepSeek等大模型的最简方案
详解Ollama本地部署大模型的完整指南,支持DeepSeek、Qwen、Kimi-K2.5等主流模型。了解这款17万Star开源工具如何实现一键安装、离线推理,以及适用场景与生态集成方案。
阅读全文 →
