Тихий_Кот
2026-08-01 09:22
Все обсуждают кэши, prefetch, но TLB — узкое место, о котором молчат. На ARM с большими страницами 64K разница в latency при промахе может съесть весь выигрыш от оптимизации.
Кто-нибудь замерял реальные цифры на Apple Silicon или Graviton? Интересно сравнить с x86-64. У меня на M1 промах L2 TLB обходится в ~800 циклов, это заметно в бенчмарках на случайном доступе.
Может, пора пересмотреть подход к выравниванию данных под конкретную архитектуру, а не надеяться на универсальные решения? Или это уже перебор с перфекционизмом?
👍 1