本專題服務重點
本地大模型、多模態、RAG與裝置工具呼叫
評估、開發和驗收圍繞該任務組織;涉及相鄰模型、系統、硬體或量產工作時,按對應專題邊界組合實施。
演示可執行、業務可用和長期穩定執行是三個階段。模型壓縮不能替代知識更新、許可權控制、失敗處理和人工兜底。
本地大模型、多模態、RAG與裝置工具呼叫
評估、開發和驗收圍繞該任務組織;涉及相鄰模型、系統、硬體或量產工作時,按對應專題邊界組合實施。
各項服務可按專案單獨實施,也可與相關專題組合;任務書將逐項明確輸入、輸出、第三方依賴、樣機和測試責任。
拆分問答、摘要、分類、視覺理解、語音互動和工具呼叫需求。
評估權重、KV Cache、上下文、運算元、CPU/GPU/NPU分配和記憶體對映。
處理文件解析、切分、索引、檢索、引用、許可權和版本更新。
限定工具、引數、身份、日誌、超時、確認和失敗回退。
先確認專案基線和關鍵前置條件,再進入詳細開發與驗證;各階段結論均對應具體版本與記錄。
用真實問題、文件和工具動作建立驗收樣本。
比較質量、記憶體、速度、功耗和執行時支援。
實現檢索、引用、許可權、工具描述和回退。
接入語音、視覺、UI、裝置服務和本地儲存。
覆蓋幻覺、越權、超時、斷網、資源不足和升級。
最終交付範圍由雙方在任務書或合同中確認,檔案均對應具體硬體、軟體、工具鏈和測試版本。
環境適應性、可靠性、認證和批次生產如需納入驗收,應在任務書中另行約定範圍、樣本與標準。
資料暫不完整時,可先開展基線檢查和可行性評估;正式範圍與技術結論在關鍵輸入確認後形成。
取決於任務質量、模型規模、上下文、更新頻率和裝置資源。可採用完全離線或雲邊分工路線。
先用任務集確定質量底線,再比較量化後記憶體、首token、生成速度、功耗和許可,不按引數量單獨決定。
不會自動消除。仍需評估檢索召回、引用一致性、模型回答、拒答和過期文件處理。
可以按VLM輸入、影象預處理、上下文、幀策略和裝置資源評估,實時影片與單圖問答需要分開設計。
採用工具白名單、引數校驗、最小許可權、關鍵動作確認、超時、回滾和審計日誌。
使用凍結任務集、知識庫和工具場景,分別檢查正確性、引用、拒答、越權、延遲、資源和持續執行。
提交目標、現有資料、版本、問題、樣機條件和必須達到的指標,可先進行資料審查或可行性評估。