王召德
|
580ac4da8b
|
[Test:Speed]Add GEMM performance benchmarks for FP32, INT8, and Block32–INT4 (#4516)
GitOrigin-RevId: c5fad6c80af0c4c29c50b658d8784221dcc654a4
|
2026-06-05 17:11:12 +08:00 |
|
王召德
|
8d9f6131ac
|
[CPU:Feature] Support low-bit ARM quant kernels (#4487)
- Add 2-bit and 3-bit ARMV86 SMMLA kernels for FP16/FP32 paths
- Add 2-bit and 3-bit ARMV82 SDOT kernels for FP16/FP32 paths
- Improve 4-bit and low-bit decode performance paths
- Add LinearRoofline benchmark coverage
- Update ARM CPU optimization skill documentation
- Document MNN_CUDA_NATIVE_ARCH cmake option
- Trim weightBits in lowMemory tests to fix CI timeout
Discussed-in: Merge-Request 27549430 , URL: https://code.alibaba-inc.com/AliNN/AliNNPrivate/codereview/27549430
GitOrigin-RevId: a42c74d902cfdeff92a3b23eb3b4324395944ba7
|
2026-05-28 21:04:34 +08:00 |
|
Artyom Katolikov
|
39be21c56f
|
[Infra:Feature] Add test_ci.sh and fix Vulkan/OpenCL op bugs (#4422)
Co-authored-by: Claude Opus 4.6 <noreply@anthropic.com>
|
2026-05-25 20:46:04 +08:00 |
|
MNNSyncBot
|
a68e1e3e68
|
[LLM:Perf] skip fp32 round-trip for fp16 alpha in lowMemory conv init
Discussed-in: Merge-Request 27442194 , URL: https://code.alibaba-inc.com/AliNN/AliNNPrivate/codereview/27442194
GitOrigin-RevId: 5d45dac0dc14488a2b53e81ae0811caf02d65606
|
2026-05-18 15:14:44 +08:00 |
|
MNNSyncBot
|
23d05cc24f
|
[LLM:Feature] support fp16 storage for weight-quant scale/zero-point
Discussed-in: Merge-Request 27334066 , URL: https://code.alibaba-inc.com/AliNN/AliNNPrivate/codereview/27334066
GitOrigin-RevId: abf0cc65cd38ea1dc346142eb6c91a9775c4e207
|
2026-05-18 14:21:37 +08:00 |
|
MNNSyncBot
|
2e0ac31978
|
[LLM:Feature] add mmap_size in config.
GitOrigin-RevId: 31bfc11cecb7d56a47b3084b5be9a83f39754e3c
|
2026-03-31 17:59:30 +08:00 |
|
xiaying
|
7fde7c7079
|
MNN:Sync: Sync Internal 3.2.4
|
2025-09-22 23:05:26 +08:00 |
|
zhaode.wzd
|
55a59a7ebc
|
[MNN:Sync] Sync Internal reranker, gpt-oss.
|
2025-08-08 12:24:23 +08:00 |
|
zhaode.wzd
|
a019d971ad
|
[MNN:Sync] Sync Internal 3.1.4.
|
2025-05-08 12:39:44 +08:00 |
|
xiaying
|
0769b81b58
|
MNN:Sync: Sync Internal 3.1.3
|
2025-04-28 11:50:24 +08:00 |
|
xiaying
|
c0247c6998
|
MNN:Sync: Sync Internal 3.1.1
|
2025-03-12 11:35:16 +08:00 |
|
xiaying
|
3b6ddc0341
|
MNN:Sync: Sync Internal 3.0.5
|
2025-02-12 11:14:19 +08:00 |
|
xiaying
|
27da5e7d48
|
MNN:Sync: sync internal 3.0.3
|
2024-12-31 15:34:41 +08:00 |
|
xiaying
|
5b901d9d87
|
MNN:Sync: Sync Internal 3.0.0
|
2024-11-18 14:40:27 +08:00 |
|
xiaying
|
ae6253fb46
|
MNN:Sync: Sync Internal 2.9.4
|
2024-08-24 15:46:21 +08:00 |
|
xiaying
|
c6f25cafc6
|
MNN:Sync: Sync Internal 2.9.3
|
2024-07-22 20:51:06 +08:00 |
|
xiaying
|
65ec0ea406
|
MNN:Sync: Fix bug for llama2/llama3 attention fuse, refract llm usage
|
2024-06-15 15:39:59 +08:00 |
|
xiaying
|
7cad2ee83f
|
MNN:Sync Sync Internal 2.9.0
|
2024-05-11 19:17:02 +08:00 |
|
xiaying
|
5895243607
|
[MNN:Sync] Sync Internal 2.8.4
|
2024-04-19 11:58:21 +08:00 |
|
zhaode.wzd
|
2972fe71dc
|
[MNN:Sync] Sync Internal 2.8.3
|
2024-03-13 14:55:54 +08:00 |
|
zhaode.wzd
|
970b63f3b4
|
[MNN:Sync] Sync Internal 2.8.2
|
2024-02-29 16:21:40 +08:00 |
|
zhaode.wzd
|
bdf15442f4
|
[MNN:Sync] Sync Internal 2.7.1
|
2023-09-21 09:01:35 +08:00 |
|
xiaying
|
98ba00c2f3
|
[MNN:Sync] Sync Internal 2.6.3
|
2023-08-21 14:53:27 +08:00 |
|
zhaode.wzd
|
67eceb8abb
|
[MNN:Sync] Sync Internal code, support low_memory for conv.
|
2023-06-27 10:33:16 +08:00 |
|
xiaying
|
c70ecef660
|
[MNN:Sync] Sync Internal Gitlab: 2.5.1
|
2023-05-18 19:11:50 +08:00 |
|
xiaying
|
4a609006eb
|
[MNN:Sync] Sync Internal 2.3.1
|
2023-02-15 10:30:27 +08:00 |
|
xiaying
|
d46b6b998d
|
[MNN:Sync] Sync Internal 2.3.0
|
2022-12-30 15:18:58 +08:00 |
|
xiaying
|
68708c5d66
|
Sync Internal 2.0.4
|
2022-08-12 10:30:48 +08:00 |
|
xiaying
|
3a0fb480d2
|
Fix crash bug for origin quan model
|
2021-09-06 17:18:29 +08:00 |
|
tianhang.yth
|
4eb1096b9c
|
fix alpha div by zero bug and arm server compile bug
|
2021-06-24 10:38:55 +08:00 |
|
hush-alibaba
|
58545d6ca1
|
Synchronize internal github for version 1.2.0 (#1518)
|
2021-06-11 17:17:13 +08:00 |
|
tianhang.yth
|
d85952d826
|
sync from internal repo
|
2021-04-28 18:02:10 +08:00 |
|
雁行
|
453264cb5e
|
[PATCH 6/7] [QAUNT:Bugfix] Bugfix for IDST encode when weight value = 1.
|
2021-04-22 13:51:14 +08:00 |
|
弗人
|
9621a1f8ad
|
[PATCH 14/36] bug fix for old type 4 models
|
2021-04-16 14:29:36 +08:00 |
|
弗人
|
a3bbcd01b9
|
[PATCH 12/36] [Train:Featue] support full quant for train quant, encode when save
|
2021-04-16 14:29:36 +08:00 |
|
弗人
|
95bcb842a0
|
[PATCH 08/36] [Train:Feature:Bugfix] train quant support full quant
|
2021-04-16 14:29:36 +08:00 |
|
xiaying
|
d91fc63976
|
[MNN:Sync] Sync internal Gitlab
|
2021-04-08 15:34:23 +08:00 |
|
xiaying
|
2d1b129121
|
[MNN:Sync] Sync internal git
|
2021-01-06 16:29:37 +08:00 |
|
xiaying
|
29a39f1c10
|
[MNN:Sync] Sync internal gitlab
|
2020-11-25 19:03:07 +08:00 |
|
Hui Shu
|
d6795ad031
|
Github release 1.1.0
|
2020-11-05 16:49:17 +08:00 |
|
xiaying
|
dbd3267c09
|
[PATCH 114/160] [MNN:Refractor] Seperate the pad compute for convolution and deconvolution
|
2020-03-22 19:02:11 +08:00 |
|
xiaying
|
010913aaaa
|
[PATCH 070/160] [MNN:Refract] Seperate the load of quan and half to ConvolutionCommon
|
2020-03-22 19:02:06 +08:00 |
|