Почему никто не говорит про скорость загрузки шелл-кода в TLB на современных ARM?

Тихий_Кот
2026-08-01 09:22
Все обсуждают кэши, prefetch, но TLB — узкое место, о котором молчат. На ARM с большими страницами 64K разница в latency при промахе может съесть весь выигрыш от оптимизации. Кто-нибудь замерял реальные цифры на Apple Silicon или Graviton? Интересно сравнить с x86-64. У меня на M1 промах L2 TLB обходится в ~800 циклов, это заметно в бенчмарках на случайном доступе. Может, пора пересмотреть подход к выравниванию данных под конкретную архитектуру, а не надеяться на универсальные решения? Или это уже перебор с перфекционизмом?
👍 1

Статьи по теме

Войдите или зарегистрируйтесь, чтобы ответить.