Repository logo
  • English
  • Čeština
  • Deutsch
  • Español
  • Français
  • Gàidhlig
  • Latviešu
  • Magyar
  • Nederlands
  • Português
  • Português do Brasil
  • Suomi
  • Svenska
  • Türkçe
  • Қазақ
  • বাংলা
  • हिंदी
  • Ελληνικά
  • Log In
    or
    New user? Click here to register.
Repository logo

Repositorio Institucional de la Universidad de Murcia

Repository logoRepository logo
  • Communities & Collections
  • All of DSpace
  • Statistics
  • menu.section.collectors
  • menu.section.acerca
  • English
  • Čeština
  • Deutsch
  • Español
  • Français
  • Gàidhlig
  • Latviešu
  • Magyar
  • Nederlands
  • Português
  • Português do Brasil
  • Suomi
  • Svenska
  • Türkçe
  • Қазақ
  • বাংলা
  • हिंदी
  • Ελληνικά
  • Log In
    or
    New user? Click here to register.
  1. Home
  2. Browse by Subject

Browsing by Subject "Hardware"

Now showing 1 - 4 of 4
Results Per Page
Sort Options
  • Loading...
    Thumbnail Image
    Publication
    Restricted
    Chaining transactions for effective concurrency management in hardware transactional memory
    (IEEE Computer Society, 2024-12-03) Nicolas Conesa, Víctor; Titos Gil, Rubén; Fernández Pascual, Ricardo; Acacio, Manuel E.; Ros Bardisa, Alberto; Ingeniería y Tecnología de Computadores
    Hardware Transactional Memory (HTM) offers the opportunity to ease parallel programming. However, driven by hardware limitations, commercial implementations eschew the complexity involved in early sophisticated proposals from academia, and, among other things, opt for simple conflict resolution policies that inevitably increase transaction aborts. To increase thread level parallelism, previous works propose conflict resolution schemes that, instead of aborting, add a second level of speculation consisting in using not-yet-committed data from another transaction. This policy, which we refer to as requester-speculates, has not yet been considered in the context of the kind of best-effort HTM support provided by commercial processors. This work proposes CHAining TransactionS (CHATS), a simple yet effective realization of the requester-speculates con-flict resolution policy in which cyclic dependencies between transactions are avoided and the commit ordering respects the dependencies that transactions make once speculative values are communicated. The ultimate result is a best-effort HTM implementation that forces a partial order between transactions in a way that ensures effective utilization of forwarded data and that gets away from the complexity of previous proposals. Simulations using gem5 demonstrate the effectiveness of CHATS in both commercial-like setups and academic state-of-the-art best-effort systems (22% and 16% reduction in execution time, on average, respectively). These improvements are achieved by requiring less than 280 bytes of extra storage.
  • Loading...
    Thumbnail Image
    Publication
    Open Access
    Fault injection vulnerabilities and countermeasures
    (2026) García Rodríguez, Jesús; Ingeniería de la Información y las Comunicaciones; Facultades de la UMU::Facultad de Informática
    Una actividad colaborativa para introducir las vulnerabilidades que introducen ataques de "fault injection" en software desarrollado, así como contramedidas que se pueden aplicar para obtener un software/firmware más robusto frente a estos ataques. Accesible desde https://canva.link/ys290iz317glbub
  • Loading...
    Thumbnail Image
    Publication
    Open Access
    Improving the Performance, Portability, and Productivity of Hardware Accelerators
    (Universidad de Murcia, 2023-06-23) Martínez Sánchez, Pablo Antonio; García Carrasco, José Manuel; Bernabé García, Gregorio; Escuela Internacional de Doctorado
    Después del fin de la ley de Moore y de la escala de Dennard, los arquitectos de computadores han de buscar nuevas formas de mejorar el rendimiento de los computadores. Mejorar el rendimiento de los microprocesadores se está volviendo cada vez más complejo, mientras que las demandas computacionales siguen creciendo tremendamente rápido. En los últimos años estamos presenciando un cambio de paradigma: en vez de usar un único chip, la CPU, para calcular todo, los ordenadores están evolucionando en organizaciones más heterogéneas. En esta nueva configuración, múltiples chips especializados calculan cargas de trabajo específicas mientras que la CPU los orquesta, y solo se usa cuando ningún otro chip puede usarse. A estos chips especializados se les llama a menudo aceleradores. Puesto que están muy especializados, las mejoras en la arquitectura tienen márgenes de mejora enormes, al contrario que las CPU. Los aceleradores son mucho más eficientes que las CPU en términos de rendimiento, consumo energético o ambos. Al igual que los procesadores multinúcleo, los aceleradores traen grandes beneficios al rendimiento de los computadores, pero también grandes retos al flujo de trabajo de los programadores. En entornos con múltiples aceleradores, escribir código para cada uno de ellos es muy ineficiente porque cada acelerador se programa con lenguajes diferentes. El rendimiento también es preocupante, porque los lenguajes de programación suelen tener problemas para explotar el hardware y ser capaz de aprovechar todo su potencial. Por último, la portabilidad también es complicada, porque cuando un programa se diseña para un acelerador en específico, no puede ejecutarse en otro acelerador distinto. Conseguir lenguajes de programación que proporcionen productividad, rendimiento y portabilidad se conoce como el problema de las tres P (P3). Para hacer frente a este problema, en esta tesis hemos estudiado cómo dos lenguajes de programación de código único funcionan en escenarios reales. Después de estudiar su desempeño en cada una de las tres categorías, nos dimos cuenta de que eran incapaces de conseguir un buen rendimiento, portabilidad y productividad al mismo tiempo. Por lo tanto, hemos propuesto un nuevo lenguaje de dominio específico especializado en redes neuronales profundas que soporta diferentes arquitecturas heterogéneos y consigue resultados superiores que los lenguajes estudiados en todos los puntos del problema P3. A pesar de que podemos desarrollar programas con una portabilidad, productividad y rendimiento decentes en entornos heterogéneos, hay mucho código que ya está escrito. Por lo tanto, si quisiéramos utilizar nuevo hardware, necesitaríamos reescribir todo este código con nuevos lenguajes para poder usar aceleradores. En esta tesis proponemos un compilador que detecta y reemplaza código existente con llamadas a librerías de forma automática. Ya que la librería objetivo puede ser reconfigurada fácilmente, nuestro compilador puede llamar a librerías optimizadas para CPU, que es mucho más eficiente que ejecutar el código escrito a mano, o puede llamar a una librería que descansa sobre un acelerador hardware. Nuestra propuesta está diseñada para C/C++ y reconoce programas de álgebra lineal y programas tensoriales. El principal punto fuerte de esta propuesta es su habilidad para reconocer códigos simples (por ejemplo, la estructura de triple bucle de la multiplicación de matrices) así como códigos complejos (como el algoritmo de Strassen, código vectorizado y optimizado a mano, etc). Además, una tendencia relevante en el diseño de los SoC, que está volviéndose cada vez más común, es incluir una gran cantidad de aceleradores diferentes dentro del chip. A pesar de que el hardware ya está ofreciendo mejoras de rendimiento nunca vistas hasta el momento, el software aún es incapaz de aprovecharse de ello. Por ejemplo, no hay ninguna forma evidente de manejar múltiples aceleradores para acelerar una carga de trabajo específica, o cómo asignar aceleradores a las tareas correctas de forma automática. Usar múltiples aceleradores concurrentemente, al igual que el ILP explota usa unidades funcionales, se llama Paralalelismo a Nivel de Acelerador (del inglés, Accelerator Level Parallelism, o ALP). En esta tesis mostramos una nueva propuesta para explotar el ALP en entornos heterogéneos. Presentamos un framework capaz de orquestar múltiples aceleradores para ejecutar una única tarea conjuntamente, mejorando el rendimiento significativamente. Aplicamos nuestro framework a casos de uso de multiplicación de matrices y convolución, demostrando que planifica las tareas entre los aceleradores automáticamente con un error de predicción bajo y con una distribución del trabajo muy cercana a la optima. Al igual que hicieron los procesadores multinúcleo, la computación heterogénea está incrementando la complejidad del desarrollo de software y haciendo la arquitectura de los computadores más y más compleja debido a la diversidad del hardware. Todos los avances en la arquitectura de computadores han venido acompañados de un incremento en la complejidad del hardware, la cual tenemos que domar para hacer los ordenadores prácticos y útiles. Nuevas arquitecturas, diferentes de la CPU, nos traen niveles de rendimiento y eficiencia energética nunca vistos. En esta tesis, hemos mostrado que la performance portability es posible con lenguajes de código único, así como novedosos lenguajes de dominio específico para redes neuronales profundad que consiguen un rendimiento, productividad y portabilidad excelentes en entornos heterogéneos. Además, hemos diseñado una novedosas metodología para detectar y reemplazar partes acelerables de códigos de CPU a aceleradores especializados de forma automática. Y por último, hemos propuesto un framework para explotar el Paralelismo a Nivel de Acelerador en entornos heterogéneos. Esperamos que las propuestas descritas en esta tesis ayuden a mejorar la usabilidad y el rendimiento de la computación heterogénea, que sin duda se convertirá en la norma para los sistemas de computación del futuro.
  • Loading...
    Thumbnail Image
    Publication
    Restricted
    Secure prefetching for secure cache systems
    (IEEE Computer Society, 2024-12-03) Nath, Sumon; Navarro Torres, Agustín; Ros Bardisa, Alberto; Panda, Biswabandan; Ingeniería y Tecnología de Computadores
    Transient execution attacks like Spectre and its vari-ants can cause information leakage through a cache hierarchy. There are two classes of techniques that mitigate speculative execution attacks: delay-based and invisible speculation. Invisible speculation-based techniques like GhostMinion are the high-performing yet secure techniques that mitigate all kinds of spec-ulative execution attacks. Similar to a cache system, hardware prefetchers can also cause speculative information leakage. To mitigate it, GhostMinion advocates on-commit prefetching on top of strictness ordering in the cache system. Our experiments show that the GhostMinion cache system interacts negatively with the hardware prefetchers leading to redundant traffic between different levels of cache. This traffic causes contention and increases the miss latency leading to performance loss. Next, we observe that on-commit prefetching enforced by GhostMinion leads to nerformance loss as it affects the prefetcher timeliness. We perform the first thorough analysis of the interaction between state-of-the-art prefetching techniques and the secure cache system. Based on this, we propose two microarchitectural solutions that ensure high performance while designing secure prefetchers on top of secure cache system. The first solution detects and filters redundant traffic when updating the cache hierarchy non-speculatively. The second solution ensures the timeliness of the prefetcher to compensate for the delayed triggering of prefetch requests at commit, resulting in a secure yet high-performing prefetcher. Overall, our enhancements are secure and provide synergistic interactions between hardware prefetchers and a secure cache system. Our experiments show that our filter consistently improves the performance of secure cache systems like GhostMinion in the presence of state-of-the-art prefetchers (by 1.9% for single-core and 19.0% for multi-core for the top-performing prefetcher). We see a synergistic behavior of the filter with our proposed secure prefetcher, which leads to a further increase in performance by 6.3% and 23.0% (over the top-performing prefetcher), for single-core and multi-core systems, respectively. Our enhancements are extremely lightweight incurring a storage overhead of 0.59 KB per core.

DSpace software copyright © 2002-2026 LYRASIS

  • Cookie settings
  • Accessibility
  • Send Feedback