diff_asm.asm 4.2 KB

12345678910111213141516171819202122232425262728293031323334353637383940414243444546474849505152535455565758596061626364656667686970717273747576777879808182838485868788
  1. ; asmsyntax=nasm
  2. default rel
  3. global _diff_asm
  4. global diff_asm
  5. ; Alias para no volverme loco con los registros
  6. %define src rdi
  7. %define src2 rsi
  8. %define dst rdx
  9. %define cont rcx
  10. %define size r8
  11. ; Algunos defines ultiles
  12. %define PIXEL_SIZE 4
  13. %define SHIFT_VALUE 8 ; Potencia de 2 para hacer el calculo del promedio en enteros.
  14. %define DIV_VALUE 85 ; Multiplico por el valor sobre 3 para hacer un shift de 8bits a la derecha. (DIV * P)>>8
  15. ; TODO: El valor SHIFT_VALUE NO PUEDE ser mayor a 8 o pierdo información en la multiplicacion
  16. ; Para ser mayor tengo que multiplicar y tener en cuenta la parte alta (pmulhw)
  17. ; Se que el valor máximo que va a haber que multiplicar es es (255*3), por eso puedo
  18. ; multiplicar hasta por 85 = (256/3), sin que supere 2^16, quedando en parte baja para pmullw.
  19. ; Mascaras y esas cosas
  20. section .data
  21. SHUFFLE_MASK: db 2,2,2,255,3,3,3,255,0,0,0,255,1,1,1,255 ; Mascara para realizar un shuffle para repetir los valores del diff
  22. DIVIDIR: dw DIV_VALUE,DIV_VALUE,DIV_VALUE,DIV_VALUE,0,0,0,0 ; Mascara para dividir con enteros usando shifts
  23. section .text
  24. ;void diff_asm (
  25. ;unsigned char *src, unsigned char *src2, unsigned char *dst, int filas, int cols)
  26. _diff_asm:
  27. diff_asm:
  28. push rbp
  29. mov rbp, rsp ; Stack frame
  30. .calc_size: ; Calculo el tamaño de la imagen en bytes
  31. mov r9, dst ; Muevo el destino un rato para hacer el calculo del tamaño de la imagen
  32. mov rax, cont ; Cargo filas
  33. mul size ; Multiplico por las columnas
  34. xor dst, dst ; Limpio temportal
  35. mov dst, PIXEL_SIZE ; Multiplico temporal
  36. mul dst ; Multiplico por el tamaño del pixel
  37. mov size, rax ; Guardo el tamaño
  38. mov dst, r9
  39. xor cont, cont ; Limpio el contador
  40. movdqu xmm3, [DIVIDIR] ; Cargo el valor para las divisiones para el promedio
  41. .loop:
  42. cmp cont, size ; Comparo tamaño con el contador
  43. jge .fin ; Si ya recorri la imagen voy al final
  44. pxor xmm1, xmm1
  45. movdqu xmm0, [src] ; Cargo la imagen 1 => xmm0 = |B(P1)|G(P1)|R(P1)|A(P1)|B(P2)|G(P2)|......|
  46. movdqu xmm1, [src2] ; Cargo la imagen 2 => xmm1 = |B(P1)|G(P1)|R(P1)|A(P1)|B(P2)|G(P2)|......|
  47. .cuentas: ; Resto componente a componente de 4 pixeles de cada imagen
  48. psubb xmm1, xmm0 ; xmm1 = |B(img1_P1) - R(img2_P1)|G(Img1_P1) - Img2_P2|....|
  49. pabsb xmm0, xmm1 ; Almaceno en xmm0 el valor absoluto de la resta anterior
  50. ; TODO: Arreglar los comentarios por que estan desordenados los pixeles
  51. pxor xmm2, xmm2
  52. movdqu xmm1, xmm0 ; Copio xmm0 a xmm1
  53. punpckhbw xmm0, xmm2 ; Desempaqueto la parte alta => xmm0 = |B(P1)|G(P1)|R(P1)|A(P1)|B(P2)|G(P2)|R(P2)|A(P2)|
  54. punpcklbw xmm1, xmm2 ; Desempaqueto la parte baja => xmm1 = |B(P3)|G(P3)|R(P3)|A(P3)|B(P4)|G(P4)|R(P4)|A(P4)|
  55. ; Sumo horizontalmente los pixeles:
  56. phaddw xmm0, xmm1 ; xmm0 = |B(P1)+G(P1)|R(P1)+A(P1)|B(P2)+G(P2)|R(P2)+A(P2)|....|
  57. phaddw xmm0, xmm2 ; xmm0 = |B+G+R+A (P1)| B+G+R+A(P2) | B+G+R+A(P3) | B+G+R+A(P4)| 0x0 | 0x0 | 0x0 | 0x0 |
  58. .dividir:
  59. pmullw xmm0, xmm3 ; Multiplico y almaceno parte baja, no llego a usar la parte alta si SHIFT_VALUE < 8
  60. psrlw xmm0, SHIFT_VALUE ; Divido por el valor
  61. .shuffle:
  62. packuswb xmm0, xmm2 ; xmm0 = |P1|P2|P3|P4|0x0|0x0|0x0|0x0|0x0|....|
  63. movdqu xmm2, [SHUFFLE_MASK] ; Cargo la mascara para shuffle
  64. pshufb xmm0, xmm2 ; Le hago un shuffle a xmm0 con los nuevos valores calculados
  65. .write:
  66. movdqu [dst], xmm0 ; Escribo en el destino
  67. .endLoop:
  68. ; TODO: Si el tamaño de la imagen no es multiplo de 4 acá va a sumar y tirar invalid read al leer los ultimos pixeles
  69. add src, PIXEL_SIZE * 4 ; Incremento 4 pixeles
  70. add src2, PIXEL_SIZE * 4
  71. add dst, PIXEL_SIZE * 4
  72. add cont, PIXEL_SIZE * 4
  73. jmp .loop
  74. .fin:
  75. pop rbp
  76. ret