IA al Día
Volver al archivo
Herramientas análisis 3 sept 2026 4 min de lectura

funes, de Hugging Face: una memoria para agentes de código que vive en un dataset del usuario

Hugging Face lanzó funes el 3 de septiembre, una memoria local para Claude Code, Codex, pi y Hermes. Adónde va esa memoria y qué mide su benchmark.

fuente primaria · huggingface.co — Give Your Coding Agents a Memory You Own

El anuncio parte de un problema conocido: cada agente de código, en cada máquina, empieza de cero. funes, que Hugging Face presentó el 3 de septiembre, indexa las sesiones de Claude Code, Codex, pi y Hermes que ya están en el ordenador del desarrollador y le da a cada agente una forma de buscar en ellas. Es software libre con licencia Apache 2.0 y versiones publicadas desde principios de julio; la 1.3.0 salió el 1 de septiembre.

Qué hace en una sola máquina

Un comando, como funes add claude, construye el índice de las sesiones anteriores, le da al agente dos herramientas, recall y get, e instala un hook que indexa cada turno terminado. recall devuelve el texto original, no un resumen, con el agente, la hora, la sesión y el turno de donde sale; get abre el turno completo.

Por defecto todo corre en local. Los embeddings y la reordenación de resultados usan un modelo local fijo, el índice es un dataset de Lance en el disco y no hace falta ninguna cuenta. funes no lleva un modelo generativo propio: razona el agente que lee los resultados. Como el historial de cada agente queda en el mismo formato, una tarea empezada en Claude Code puede seguir en Codex, que recupera el razonamiento del primero.

Adónde va la memoria cuando viaja

Para seguir al desarrollador entre máquinas o llegar a un equipo, funes publica la memoria como un dataset de Hugging Face que pertenece al usuario y es privado por defecto. Las notas de diseño del proyecto describen el Hub como simple almacenamiento de objetos, no como un servicio: la búsqueda sigue corriendo en local sobre una copia en caché, y nada en el Hub procesa los datos.

Aquí es donde se desplaza el coste de cambiar de herramienta. La memoria deja de pertenecer a Claude Code o a Codex, pero su versión compartida vive en el Hub de Hugging Face, detrás de un token de Hugging Face. Sólo la versión local funciona sin cuenta.

Las mismas notas dicen en qué es peor funes. Los servicios de memoria que destilan las sesiones con un modelo de lenguaje son, según el propio proyecto, mejores en la síntesis entre sesiones y en el razonamiento sobre entidades y relaciones. funes se presenta como una capa sobre la que podría apoyarse un sistema así.

Los riesgos que el proyecto nombra

La política de seguridad del proyecto llama a las transcripciones de sesiones uno de los datos más sensibles del ordenador. funes borra las credenciales al indexar y, antes de publicar, pasa cada fragmento por TruffleHog y retiene cualquier fila que todavía contenga un secreto. Si el escáner falta o falla, no se publica nada. La política también marca el límite: si una credencial llega pese a todo a una memoria remota, hay que rotarla de inmediato, porque el historial del repositorio la conserva.

Leer la memoria de otro tiene su propio riesgo. Los pasajes recuperados entran en el contexto del agente, así que una memoria publicada por un tercero es una entrada no fiable que puede llevar instrucciones dirigidas al agente. La política recomienda consultar esas memorias llamada a llamada en lugar de vincularlas.

Qué mide el benchmark

Según el anuncio, recall fue la forma más barata de llevar una investigación anterior a una sesión nueva: ocho veces más barata que una nota de traspaso escrita en una tarea y cuatro veces en la otra. Las cifras salen de un benchmark que publicó el propio autor de funes, David Corvoysier, con dos tareas y treinta ejecuciones de Claude Code. La unidad son tokens ponderados por tarea resuelta. recall necesitó 101.000 y 169.000 en las dos tareas, frente a 851.000 y 637.000 de la nota de traspaso. Una sesión nueva sin nada nunca llegó a la respuesta correcta, y compactar el contexto falló en una de las dos tareas.

El método es inusualmente abierto: se publican la transcripción y la calificación de cada ejecución. El titular deja fuera algunos límites que la propia página de resultados recoge:

  • Los dólares se dejan fuera a propósito, porque la facturación depende de la ventana de contexto configurada en cada sesión.
  • Una de las cifras de la nota de traspaso está reconstruida a partir de un resumen impreso, porque se perdió su registro.
  • El coste de la nota de traspaso incluye escribirla, mientras que construir el índice de recall no se cuenta.
  • La página no dice qué modelo usaron las ejecuciones.

En las fuentes revisadas no aparece ninguna réplica independiente.

Lecturas relacionadas