输入关键词搜索 AI 工具、分类,或直接跳转页面
hqjiang.com
MInference 1.0 是面向长上下文大型语言模型优化的稀疏计算方案,核心定位为提升长序列处理预填充阶段的运行效率。其核心功能包括长上下文注意力模式识别、动态稀疏注意力计算、百万级Token提示加速、检索能力保留适配、多模型框架兼容。目标用户覆盖大模型研发人员、自然语言处理研究者、长文本应用开发者、AI系统优化工程师等群体,可应用于百万Token级长文档解析、多轮对话上下文预处理、长文档检索增强生成、大模型推理成本优化等场景,在不降低模型输出效果的前提下缩减长序列预填充的耗时与算力消耗。

anyscale.com
Anyscale是基于Ray开源项目打造的云原生AI开发平台,面向开发人员与AI研究人员提供从原型开发到生产部署的全流程支撑,可助力用户构建、运行和扩展AI应用与大语言模型工作负载。平台核心功能包含Ray集群一键部署、大语言模型推理优化、分布式训练调度、工作流可视化编排、计算成本智能管控等,适配不同规模的分布式计算需求。其目标用户覆盖AI应用开发团队、大模型研究人员、机器学习工程师、AI创业团队、高校AI科研群体等,可应用于大语言模型微调、大规模多模态数据预处理、生成式AI应用生产部署、AI科研可复现实验、推荐系统分布式训练等多元场景。

machinelearning.apple.com
ReDrafter是苹果机器学习研究团队联合NVIDIA推出的大语言模型推理加速技术公开页面,核心定位是为机器学习开发者提供基于推测性解码的LLM推理提速方案。核心功能包括RNN草稿模型与动态树注意力机制的技术落地、NVIDIA TensorRT-LLM框架原生集成支持、不同GPU环境下的推理性能实测数据展示。目标用户覆盖从事大语言模型部署的算法工程师、AI应用开发人员、机器学习框架优化从业者,可用于云端LLM服务降本、端侧LLM推理提速、GPU资源密集型AI项目能耗优化等场景,帮助开发者在不损失生成质量的前提下提升LLM运行效率。