MNN Chat是一款采用MNN引擎开发的Android端多模态AI软件,支持文本输入、图像识别与语音交互,还可在本地离线运行大语言模型,无需依赖云端服务器,有效保护用户数据隐私。同时MNN Chat集成了DeepSeek、Qwen、Llama、Gemma、ReaderLM等多种主流模型,用户可自由切换,并且所有模型独立运行,无需额外下载,库文件精简至约12MB,适配armv7与arm64架构。还支持文本生成、图像识别、视频制作等多种任务,运行流畅,很适合希望在移动设备上体验本地AI推理、注重隐私与离线使用的用户。
1、打开软件进入首页用户可以在模型市场界面中浏览所有可支持的模型

2、然后自由选择需要的ai大模型进行下载

3、完成后就可以直接在应用内与模型交互

4、此外,您可以通过侧边栏访问聊天历史,轻松查看和管理之前的对话记录

1、【多模态支持】
提供多种任务功能,包括文本生成文本、图像生成文本、音频转文本及文本生成图像(基于扩散模型)。
2、【CPU推理优化】
在安卓平台上,MNN-LLM展现了卓越的CPU性能,预填充速度相较于llama.cpp提高了8.6倍,相较于fastllm提升了20.5倍,解码速度分别快了2.3倍和8.9倍。下图为 llama.cpp 与 MNN-LLM 的比较。
3、【广泛的模型兼容性】
支持多种领先的模型提供商,包括Qwen、Gemma、Llama(涵盖TinyLlama与MobileLLM)、Baichuan、Yi、DeepSeek、InternLM、Phi、ReaderLM和Smolm。
4、【本地运行】
完全在设备本地运行,确保数据隐私,无需将信息上传至外部服务器。
1、无需网络连接:所有计算均在本地完成,节省流量消耗,同时保护用户隐私,避免潜在的网络攻击。
2、独立无依赖,代码结构精简:实现高度独立化,代码结构精简,适合部署至移动设备及嵌入式系统,提升部署效率和灵活性。
3、支持多种模型:提供多种大型模型选择,满足不同场景和需求,适合研究人员、开发者和普通用户。
4、高效资源利用:优化资源使用,确保设备性能得到充分释放,适合多设备用户同时运行多个模型。
5、适合多设备部署:支持不同机型选择不同模型,灵活适应各种设备需求,提升使用便利性。
6、易用性和扩展性:精简的代码结构和本地运行模式,确保软件使用简单,同时具备良好的扩展性,适合各类应用场景。
v0.8.2.2版本
1、更新亮点:
刷新内置 MNN runtime,带入最新的 CPU LinearAttention 与 Arm82 fp16 优化路径。
提升思考模式提示词和数组拼接场景下的 tokenizer 与模板渲染兼容性。
为 OpenCL 和 Metal 执行路径补充 TopKV2 后端支持。
2、问题修复:
修复 Android 点击 Add Local Model 时的崩溃问题。
避免模型加载时因 mmap 权重部分初始化而导致的死锁问题。
对同模型启动 API 服务时复用已加载 runtime session,避免额外重载导致的卡死或崩溃。