anomalyco / anomalyco/opencode

[FEATURE]:AUMENTAR LA VELOCIDAD CON MI TECNICA

Open
#45,816 2 comments 0 reactions 1 assignee View on GitHub

@neriousy is already working on this.

Since Aug 28, 2026.

Dominant language
TypeScript
Stars
209k
Forks
27.5k
Avg merge
7h 2m
Merged PRs (30d)
384

Description

Feature hasn't been suggested before.
  • I have verified this feature I'm about to request hasn't been suggested before.
Describe the enhancement you want to request

Hola:

Quería contaros esta idea porque, sinceramente, no sé a quién más contársela.

Se me ha ocurrido algo que creo que potencialmente podría acelerar de forma drástica la inferencia de modelos de IA de tamaño medio utilizando únicamente la RAM.

Por favor, no estoy bromeando y no creo que sea una idea absurda. Dadme dos minutos y dejadme explicarla.

Imaginemos que tenemos un modelo de 27B, como Qwen 3.8 27B, que ocupa aproximadamente 30 GB de almacenamiento.

Para los usuarios que no disponen de dos GPU de 16 GB ni de una GPU de 32 GB, pero que sí tienen 128 GB de RAM —o incluso 64 GB o más—, estaba pensando en lo siguiente:

¿Qué pasaría si cargáramos el mismo modelo en la RAM dos o cuatro veces?

Es decir, podríamos replicar los pesos del modelo varias veces en la RAM cuando hubiera memoria disponible y distribuir esas copias entre los diferentes canales de memoria del sistema.

Por ejemplo, un sistema con 64 GB de RAM podría tener dos canales de memoria, mientras que un sistema de 128 GB podría tener cuatro canales.

Entonces, los núcleos multihilo de la CPU podrían acceder en paralelo a determinadas capas que se leen con mucha frecuencia —por ejemplo, determinados expertos en un modelo Mixture-of-Experts (MoE), u otras capas a las que se accede frecuentemente—.

Esto no sería simplemente el interleaving de memoria tradicional.

La idea sería crear paralelismo a nivel de la información duplicando en la RAM las partes del modelo que se necesitan con mayor frecuencia, de forma que varios canales de memoria puedan atender esas lecturas simultáneamente.

Por ejemplo, con 128 GB de RAM, potencialmente podríamos tener cuatro copias de un modelo de aproximadamente 30 GB en memoria y utilizar diferentes hilos de la CPU para acceder en paralelo a las capas más importantes.

La idea es que, al estar el modelo replicado a través de los diferentes canales de RAM, el sistema podría potencialmente leer las partes más importantes del modelo mucho más rápido.

Por ejemplo, en un servidor con 8 ranuras DIMM, podríamos tener cuatro canales de memoria con dos DIMM por canal.

Creo que esto podría potencialmente multiplicar de forma significativa el rendimiento de inferencia de modelos de tamaño medio que se ejecutan principalmente desde la RAM.

Obviamente, esto solo tendría sentido para modelos de tamaño medio y sistemas con una gran cantidad de RAM. Pero, si funcionara, potencialmente permitiría obtener un rendimiento de inferencia mucho mayor sin necesidad de utilizar GPU caras.

No estoy afirmando que esto funcione necesariamente. Lo que os estoy pidiendo es que analicéis el concepto y comprobéis si existe algo técnicamente interesante en esta idea.

CON ESTE MÉTODO, LA INFERENCIA PODRÍA EVITAR LA COMPETENCIA ENTRE CPU, GPU Y RAM MEDIANTE UN INTERLEAVING DE MEMORIA DIFERENTE, PORQUE CADA HILO DE CADA NÚCLEO PODRÍA ACCEDER A LAS CAPAS DE EXPERTOS MÁS "CALIENTES", DONDE SE ENCUENTRA LA INFORMACIÓN NECESARIA, UTILIZANDO UNA COPIA DE LOS PESOS DEL MODELO EN CADA CANAL DE RAM.

Contributor guide

Open the contributing guide

First steps

  1. Read the whole issue, then the project's contributing guide.
  2. Comment on the issue to say you are picking it up — it saves two people doing the same work.
  3. Fork the repository and make your change on a branch.
  4. Open a pull request that references the issue number.

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.