本专题服务重点
本地大模型、多模态、RAG与设备工具调用
评估、开发和验收围绕该任务组织;涉及相邻模型、系统、硬件或量产工作时,按对应专题边界组合实施。
演示可运行、业务可用和长期稳定运行是三个阶段。模型压缩不能替代知识更新、权限控制、失败处理和人工兜底。
本地大模型、多模态、RAG与设备工具调用
评估、开发和验收围绕该任务组织;涉及相邻模型、系统、硬件或量产工作时,按对应专题边界组合实施。
各项服务可按项目单独实施,也可与相关专题组合;任务书将逐项明确输入、输出、第三方依赖、样机和测试责任。
拆分问答、摘要、分类、视觉理解、语音交互和工具调用需求。
评估权重、KV Cache、上下文、算子、CPU/GPU/NPU分配和内存映射。
处理文档解析、切分、索引、检索、引用、权限和版本更新。
限定工具、参数、身份、日志、超时、确认和失败回退。
先确认项目基线和关键前置条件,再进入详细开发与验证;各阶段结论均对应具体版本与记录。
用真实问题、文档和工具动作建立验收样本。
比较质量、内存、速度、功耗和运行时支持。
实现检索、引用、权限、工具描述和回退。
接入语音、视觉、UI、设备服务和本地存储。
覆盖幻觉、越权、超时、断网、资源不足和升级。
最终交付范围由双方在任务书或合同中确认,文件均对应具体硬件、软件、工具链和测试版本。
环境适应性、可靠性、认证和批量生产如需纳入验收,应在任务书中另行约定范围、样本与标准。
资料暂不完整时,可先开展基线检查和可行性评估;正式范围与技术结论在关键输入确认后形成。
取决于任务质量、模型规模、上下文、更新频率和设备资源。可采用完全离线或云边分工路线。
先用任务集确定质量底线,再比较量化后内存、首token、生成速度、功耗和许可,不按参数量单独决定。
不会自动消除。仍需评估检索召回、引用一致性、模型回答、拒答和过期文档处理。
可以按VLM输入、图像预处理、上下文、帧策略和设备资源评估,实时视频与单图问答需要分开设计。
采用工具白名单、参数校验、最小权限、关键动作确认、超时、回滚和审计日志。
使用冻结任务集、知识库和工具场景,分别检查正确性、引用、拒答、越权、延迟、资源和持续运行。
提交目标、现有资料、版本、问题、样机条件和必须达到的指标,可先进行资料审查或可行性评估。