blur_asm.asm 5.3 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237
  1. ; asmsyntax=nasm
  2. default rel global _blur_asm
  3. global blur_asm
  4. extern convulcion_matrix
  5. extern free
  6. ; Alias para no volverme loco con los registros
  7. %define src rdi
  8. %define dst rsi
  9. %define cols rdx
  10. %define filas r14
  11. %define sigma xmm0
  12. %define radius r8
  13. %define cont_c r9
  14. %define matriz r10
  15. %define filas_faltan r11
  16. %define col_faltan r12
  17. %define scratch r13
  18. %define tmp_src rbp
  19. ; Algunos defines ultiles
  20. %define PIXEL_SIZE 4
  21. ; Mascaras y esas cosas
  22. section .data
  23. cosa: db 0,4,8,12,255,255,255,255,255,255,255,255,255,255,255,255
  24. section .text
  25. ;void blur_asm (
  26. ;unsigned char *src,
  27. ;unsigned char *dst,
  28. ;int filas,
  29. ;int cols,
  30. ;float sigma,
  31. ;int radius)
  32. _blur_asm:
  33. blur_asm:
  34. push rbp
  35. mov rbp, rsp ; Stack frame
  36. push r9
  37. push r10
  38. push r11
  39. push r12
  40. push r13
  41. push r14
  42. push r15
  43. .init:
  44. mov filas, rcx ;filas
  45. push src
  46. push dst
  47. push cols
  48. push filas
  49. push radius
  50. sub rsp, 16
  51. movdqu [rsp],xmm0
  52. mov rdi, radius
  53. call convulcion_matrix
  54. mov matriz, rax
  55. mov r15, matriz ;copio puntero inicial
  56. movdqu xmm0, [rsp]
  57. add rsp, 16
  58. pop radius
  59. pop filas
  60. pop cols
  61. pop dst
  62. pop src
  63. mov r9, rdx ;salvo rdx por los mul
  64. mov rax, PIXEL_SIZE
  65. mul cols
  66. mul radius
  67. ; rax:=cols*pix_size*radius => cuantas filas debo saltear
  68. add src, rax
  69. add dst, rax ; Avanzo "radius" filas (col*pix_size*radius)
  70. sub filas, radius ;acomodo filas para ignorar los bordes
  71. sub filas, radius ;acomodo filas para ignorar los bordes
  72. mov cols, r9 ;recupero cols por el mul
  73. sub cols, radius ;resto radius columnas
  74. sub cols, radius ;resto radius columnas
  75. shl cols, 2 ;multiplico por 4 pixel->byte
  76. ; test offset
  77. ; mov basura, radius
  78. ; shl basura,4
  79. ; sub src, basura
  80. ; add src, 36
  81. .iniciarFila:
  82. lea src, [src+PIXEL_SIZE*radius] ;avanzo radius pixeles (borde)
  83. lea dst, [dst+PIXEL_SIZE*radius] ;avanzo radius pixeles (borde)
  84. xor cont_c,cont_c
  85. .loop:
  86. cmp cols, cont_c ; Comparo tamaño con el contador
  87. je .finFila ; Si ya recorri la imagen voy al final
  88. mov filas_faltan, radius
  89. shl filas_faltan, 1
  90. inc filas_faltan ; 2r+1 filas
  91. mov tmp_src, src ;salvo para avanzar despues
  92. pxor xmm10,xmm10
  93. .loopInterno: ;matriz convulsion
  94. mov col_faltan, radius
  95. shl col_faltan, 1
  96. inc col_faltan ; 2r+1 columnas
  97. shl col_faltan, 2 ; multiplico por 4 para hacer pixel->byte
  98. .loopFila:
  99. movdqu xmm2, [src] ;levanto 4px
  100. cmp col_faltan, 3*PIXEL_SIZE
  101. jg .normal ;no quiero shiftear
  102. je .tres ;quiero borrar 1 elem
  103. ;quiero borrar 3 elem
  104. psrldq xmm2, 3*PIXEL_SIZE;ok, borre los que no queria
  105. pslldq xmm2, 3*PIXEL_SIZE;ok, borre los que no queria
  106. jmp .normal
  107. .tres:
  108. psrldq xmm2, 1*PIXEL_SIZE ;ok, borre los que no queria
  109. pslldq xmm2, 1*PIXEL_SIZE ;ok, borre los que no queria
  110. .normal:
  111. ;desempaqueto cada pixel a un registro (cada elem como dword)
  112. pxor xmm3,xmm3
  113. pxor xmm4,xmm4
  114. pxor xmm5,xmm5
  115. pxor xmm6,xmm6
  116. pxor xmm7,xmm7
  117. pxor xmm8,xmm8
  118. punpcklbw xmm3, xmm2 ;pix a,b
  119. punpckhbw xmm4, xmm2 ;pix c,d
  120. punpcklwd xmm5, xmm3 ;pix a
  121. punpckhwd xmm6, xmm3 ;pix b
  122. punpcklwd xmm7, xmm4 ;pix c
  123. punpckhwd xmm8, xmm4 ;pix d
  124. ;cargo 4 elem de matriz como single
  125. movdqu xmm9, [matriz]
  126. pshufd xmm11, xmm9, 0x00 ;primer elem en las 4 pos
  127. pshufd xmm12, xmm9, 0x55 ;2do...
  128. pshufd xmm13, xmm9, 0xAA ;3ro..
  129. pshufd xmm14, xmm9, 0xFF ;4to..
  130. ;acomodo los registros (byte->dword)
  131. psrldq xmm5, 3
  132. psrldq xmm6, 3
  133. psrldq xmm7, 3
  134. psrldq xmm8, 3
  135. ;int2float
  136. CVTDQ2PS xmm5,xmm5
  137. CVTDQ2PS xmm6,xmm6
  138. CVTDQ2PS xmm7,xmm7
  139. CVTDQ2PS xmm8,xmm8
  140. ;multiplico cada pixel por su coeficiente de la matriz(float)
  141. mulps xmm5, xmm11
  142. mulps xmm6, xmm12
  143. mulps xmm7, xmm13
  144. mulps xmm8, xmm14
  145. ;acumulo
  146. addps xmm10, xmm5
  147. addps xmm10, xmm6
  148. addps xmm10, xmm7
  149. addps xmm10, xmm8
  150. ;actualizo cuantos faltan
  151. sub col_faltan, 4*PIXEL_SIZE
  152. add src, PIXEL_SIZE*4 ; Incremento 4 pixeles
  153. add matriz, PIXEL_SIZE*4 ; me faltan al menos 4 pixeles en esta fila
  154. cmp col_faltan, 0 ;termine
  155. jle .finFilaInterna
  156. cmp col_faltan, 4*PIXEL_SIZE ;me faltan entre 1 y 3 pixeles, retrocedo suficiente para que me falten 4 exactos
  157. jle .retroceder
  158. jmp .loopFila
  159. .retroceder:
  160. mov scratch, PIXEL_SIZE*4;cargo 4 pixeles por tanda
  161. sub scratch, col_faltan ;resto los que me faltan (1-3)
  162. sub src, scratch ;retrocedo(1-3) para que me falten 4
  163. sub matriz, scratch
  164. jmp .loopFila
  165. .finFilaInterna:
  166. dec filas_faltan
  167. cmp filas_faltan, 0
  168. je .write
  169. jmp .loopInterno
  170. .write:
  171. CVTPS2DQ xmm10,xmm10 ;me quedan 4 int (dword) <=255, necesito moverlos a 4byte en la parte baja
  172. movdqu xmm11, [cosa] ;uso xmm11 de tmp
  173. pshufb xmm10, xmm11 ;dejo 0000,0000,0000,rgba
  174. movd [dst], xmm10 ; Escribo en el destino
  175. .endLoop:
  176. mov src, tmp_src ;recupero la posicion a procesar
  177. mov matriz, r15 ;voy al inicio de la matriz
  178. add src, PIXEL_SIZE ; Incremento 1 pixel
  179. add dst, PIXEL_SIZE
  180. add cont_c, PIXEL_SIZE
  181. jmp .loop
  182. .finFila:
  183. dec filas
  184. cmp filas, qword 0
  185. je .fin
  186. lea src, [src+PIXEL_SIZE*radius] ;agrego radius a la columna (termino la fila)
  187. lea dst, [dst+PIXEL_SIZE*radius]
  188. jmp .iniciarFila
  189. .fin:
  190. mov rdi, r15 ;inicio de la matriz
  191. call free ;libero
  192. pop r15
  193. pop r14
  194. pop r13
  195. pop r12
  196. pop r11
  197. pop r10
  198. pop r9
  199. pop rbp
  200. ret