WebGPU 实验特性

浏览器端 LLM 实验场

在浏览器内直接加载 WebLLM 模型,评估延迟、缓存与流式输出,无需依赖服务端接口。

WebGPUOpenAI API Schema模型未加载
模型设置
选择预构建的权重包,首次加载会缓存到本地,体积较大的模型可能需要数分钟。
对话控制台
模型加载完成后发送提问,观察延迟、流式输出与指令遵循程度。
当前尚无会话。模型准备就绪后,可以询问延迟体验、本地隐私场景或多轮指令,观察推理表现。
请先加载模型再提问。