TFLite 相关文章

深入 Android 端侧 AI 推理的可观测性全链路:从推理链路追踪到线上性能退化监控的工程实践

本文介绍了一套端侧 AI 推理可观测性方案,通过 Trace 结构化记录推理全链路、构建多维性能画像,并基于画像漂移的三层递进规则引擎实现线上性能退化自动发现,解决了设备碎片化场景下模型推理劣化难以感知和定位的工程难题。

深入 Android 端侧 AI 推理的模型格式转换全链路:从 PyTorch 导出到 TFLite/MediaPipe 部署的格式桥梁工程实践

记录 PyTorch 模型导出到 ONNX、转换至 TFLite 并接入 MediaPipe 的完整端侧部署链路,涵盖动态 shape 处理、算子兼容、INT8 量化及工程化实战经验。

深入 Android 端侧 AI 推理的声明式管道:用 Kotlin Flow 构建可组合的推理工作流

本文介绍如何用 Kotlin Flow 将端侧 AI 推理抽象为可组合的声明式管道,通过 Preprocess/Inference/Postprocess 三层架构实现预处理、推理、后处理的解耦,并结合背压控制与分层测试策略构建健壮的推理工作流。

深入 Android 端侧 AI 推理的初始化与预热优化

系统性拆解端侧AI推理冷启动的三大延迟来源——模型加载、GPU Delegate初始化和KV Cache预填充,通过并行化、预热推理和长生命周期复用将首次推理从3.2秒优化至80ms。

端侧大模型推理调度层设计:优先级队列与背压控制实战

本文介绍如何在端侧推理引擎之上构建调度中间层,通过优先级队列、抢占机制和背压控制,解决多请求并发导致的内存溢出、延迟不可控和结果乱序问题。

深入 Android 端侧 AI 图像预处理全链路:从 Bitmap 像素操作到 Tensor 输入的高性能数据管道

端侧 AI 推理中,数据预处理常占 30%-50% 耗时。本文梳理从 Bitmap 像素到 Tensor 输入的完整链路,涵盖内存模型、像素格式转换、Resize 策略、标准化及零拷贝优化,帮助开发者将预处理延迟压到毫秒级。