阿里视觉AI开放之路:从公共云走向端云协同-31页_17mb
报告摘要
阿里视觉AI开放之路总结
核心内容
阿里视觉AI开放平台致力于通过平台化、工具化的方式,让更多的开发者和企业能够便捷、高效地使用先进的视觉AI技术,实现AI能力的普惠化。平台从公共云走向端云协同,提供全生命周期的AI能力体验,涵盖从模型训练到部署的完整流程,满足多样化、碎片化的市场需求。
主要观点
- AI平台化:通过提供核心AI能力和工具,缩短供需之间的差距,使AI技术更易用、更高效。
- 端云协同:结合云端训练与端侧推理,实现低延时、高效率的AI应用,支持多种设备和平台。
- 普惠与低成本:通过定额免费和高性价比的商用能力,降低中小企业的AI使用门槛。
- 全生命周期支持:提供从能力体验、使用流程到平台基础设施的全方位支持,提升开发者效率。
- 生态建设:构建AI流量入口和开发者阵地,推动中长尾用户的发展与创新。
关键信息
平台定位
- 视觉AI能力开放中心:提供多样化、标准化的视觉AI能力。
- 视觉AI能力再生产中心:支持能力的迭代优化与再生产。
- 场景应用和孵化中心:推动AI能力在实际场景中的应用与落地。
平台发展历程
| 时间 | 版本 | 主要成果 |
|---|---|---|
| 2019.4 | 1.0 | Mind能力清单梳理,视觉小组年度治理 |
| 2019.8 | 1.0 | 12个大类,110个API能力,开通用户数百,调用百万级 |
| 2019.12 | 1.0 | 14个大类,140个API能力,开通用户上万,调用千万级,收入第一笔400 |
| 2020.10 | 1.0 | 200个API能力,20个SDK,开通用户4万,调用亿级,收入数万/日 |
| 2021.5 | 3.0 | 官网升级3.0,能力中心重构,SDK能力上线,场景实验室和行业能力中心上线 |
平台能力
- 能力大类:15个
- API能力:200+
- 日均调用:亿级
- 支持平台:包括Android、iOS、RK/海思系列等
- 核心能力:文字识别、内容安全、图像理解、分割抠图、视觉生产、视频理解、视觉搜索、3D视觉、行业视觉能力等
OpenSDK 1.0
- 端云协同框架:支持云端训练与端侧推理,实现高效、低延时的AI应用。
- 技术架构:包括端侧任务框架、端侧训练框架、可信执行环境、任务沙箱等。
- 核心特征:30FPS实时处理效率、1080p高清视频增强、云上大模型增强效果、低功耗长续航保障、云端一体全场景适配。
应用示例
- 智能修图:支持全自动、高品质、低成本的图像处理,包括面部/身体液化、肤质优化等。
- 智能存储:支持TB级数据的准实时处理,兼容隐私合规措施。
- AI体育:基于关键点和人体姿态估计,实现体育动作自动计数和姿态匹配打分,精度高,鲁棒性强,支持千元级机型。
- 老片修复:核心技术开源,支持视频修复与增强。
未来展望
- AI平台演进:从单一能力到全栈能力,从工具到生态,持续优化和扩展平台功能。
- AI生态构建:打造AI流量入口,推动开发者和中长尾用户的发展。
- AI机制创新:探索市场驱动的AI研发与使用模式,推动AI能力的在线进化与迭代。
结论
阿里视觉AI开放平台通过不断的技术创新与生态建设,正逐步实现从公共云到端云协同的转变,为开发者和企业提供高效、易用、低成本的视觉AI能力,推动AI技术的广泛应用与持续发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载